# (Claude) 벤치마크 점수 차이보다 먼저 봐야 할 것 | Anthropic이 직접 "점수는 믿을 수 없다"고 말하는 이유 | ao Lab. #44

> https://bookfactory.kr/board/news/18683
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-26T18:19:06.410Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/317810233/rectangle_large_type_2_1e2d511e4cf4298e59b0fc1aa3f802cc.png?width=1280)

> 
> 
> 🧪 이 글은 “Sonnet(effort=high)과 Opus 5.5(effort=medium·기본값)에 같은 소재와 같은 규칙을 주고 쓰게 하면 무엇이 달라지는가”라는 실험의 한쪽입니다. 다른 한쪽은 #45(Opus 5.5판)이며, 두 편을 비교한 칼럼은 #46입니다.
> 

새로운 AI 모델의 “○○% 저렴하다”는 말만 보고 그대로 갈아타기를 결정하고 있지는 않으신가요?

Claude로 일상 업무를 처리하고 있는 비엔지니어 분들을 위한 내용입니다.

다 읽고 나면, 발표된 숫자에 앞서 확인해야 할 한 가지를 스스로 찾을 수 있게 됩니다.

## 우리는 이렇게 하기로 했습니다: 숫자가 갱신되더라도 역할 분담은 바로 바꾸지 않습니다.

새로운 모델이 나와도 사내 역할 분담(어떤 작업을 어떤 AI에 맡길지)은 바로 바꾸지 않고, "실제로 곤란한 상황이 생긴 뒤에 움직이기로" 했습니다. 이번에 바꾼 것은 성능 중시 역할에 사용하는 모델을 새로운 것으로 교체한 것과, 정확도가 최우선인 작업에서는 설정을 명시적으로 지정하도록 한 것뿐입니다.

## 꼭 기억하고 돌아가셨으면 하는 점: 숫자가 좋아졌다는 것과 구분 사용을 바꿀 이유는 별개다

![画像](https://assets.st-note.com/img/1790421580-RCaYOngcsWxBv54JDKNToFMk.png?width=1200)

새로운 모델의 수치가 좋아졌다고 해서, 그것이 그대로 ‘현재의 운영을 바꿀 이유’가 되는 것은 아닙니다. 수치와 실제로 어려움을 겪고 있는 상황이 있는지는 별도로 확인해야 합니다.

## 무슨 일이 일어났는가

저희에게는 “계획이나 설계는 고성능 모델에, 실행이나 조사는 일상용 모델에, 최종 체크는 다시 고성능 모델에 맡긴다”라는 역할 분담 규칙이 있습니다.

Opus 5.5라는 새로운 모델이 공개되었고, 공식 페이지에는 “Opus 5에 비해 40% 저렴하게 운영할 수 있다”는 수치가 나와 있었습니다. 단가를 보면 입력·출력 토큰 모두 20% 인하입니다. “왜 20%의 인하가 40%가 되는지”를 확인해 보니 이유는 두 가지였습니다.

첫 번째는 단가 자체의 인하(20%)입니다. 두 번째는 같은 작업을 마치는 데 필요한 처리량 자체가 줄어들었다는 것입니다. 공식 측이 든 예에서는, 어떤 확인 작업이 구 모델로는 20시간 이상 걸리고 처리량도 2.5배가 들었던 것이 신 모델로는 3시간도 걸리지 않았다고 합니다. 단가 할인과 처리량 감소가 곱해져서 비로소 40%라는 숫자가 되었던 것입니다.

동시에 공식 페이지에는 또 하나의 중요한 문장이 있었습니다. “이 수준의 성능에 이르면 벤치마크 점수 차이는 실제 차이를 가늠하는 단서로서 이전만큼 믿을 만하지 않게 되었다”는 것입니다. 상위 모델과 Opus 5.5를 비교해도 “실제로 사용해 보면 점수가 보여주는 만큼의 차이는 느껴지지 않는다”고도 적혀 있었습니다.

## 왜 그렇게 되었을까

40%라는 숫자에는 간과하기 쉬운 조건이 있었습니다. 이 숫자는 "초기 설정 그대로 사용한 경우"의 평균입니다. 정확도가 중요한 작업을 위해 AI가 얼마나 깊이 생각하도록 할지에 대한 설정을 높이면, 생각하는 양이 늘어나는 만큼 할인 효과는 줄어듭니다. 저희는 실제로 금액을 읽어내는 것과 같이 정확성이 최우선인 작업에 대해서는 이 설정을 초기값보다 높게 운용하기로 했기 때문에, 40% 그대로의 혜택을 받을 수는 없습니다.

벤치마크 점수 차이에 대해서도 마찬가지입니다. 점수가 올랐다고 해서 그것이 실제 작업에서도 같은 만큼의 차이로 이어진다고는 할 수 없다고 모델 개발 측이 인정하고 있습니다. 개인이 느끼는 정도의 문제가 아니라, 성능을 측정하는 잣대 자체의 정밀도가 이 수준에서는 제대로 발휘되기 어려워지고 있다는 것입니다.

이 두 가지는 저희가 ‘역할 분담의 일부를 새 모델로 넓힌다’는 안을 보류한 판단을 뒷받침해 주었습니다. 보류한 이유 자체는 실제로 곤란을 겪은 구체적인 사례가 아직 없었던 점과, 평소에 쓰는 모델 쪽에도 곧 새 버전이 나올 예정이어서 지금의 비교가 금방 낡아질 것을 알고 있었기 때문입니다.

## 내일 당신이 할 수 있는 일

다음에 새로운 AI 모델이나 새 서비스 발표를 볼 때는 가격이나 벤치마크 숫자를 보기 전에, 다음 한 가지만 확인해 보세요.

- 발표 페이지에서 ‘초기 설정(기본값)이 이전 버전에서 바뀌지 않았는지’를 한 번 찾아본다.

초기 설정이 바뀌어 있다면, 그곳에 적혀 있는 할인이나 성능 향상의 수치는 그 새로운 초기 설정을 전제로 한 것입니다. 자신의 사용법(설정을 바꿔서 사용할지 여부)에 따라 실제로 받을 수 있는 혜택은 달라집니다.

그러면 어떻게 될까요. 숫자만 보고 갈아탈지 말지를 결정하는 단계에서, 자신의 사용 방식에서도 그 숫자가 그대로 들어맞는지를 확인한 뒤 결정하는 단계로 나아갈 수 있습니다.

## 같은 일이 일어나는 사람 / 일어나지 않는 사람

- 같은 일을 겪는 사람: 새로운 모델이 나올 때마다 가격이나 벤치마크 수치만 보고 갈아타기를 결정하는 사람
- 같은 일을 겪는 사람: “가격이 내려갔다”, “성능이 향상됐다”라는 제목만 보고 만족하고 본문의 조건은 읽지 않는 사람
- 문제가 일어나기 어려운 사람: 발표된 수치에 대해 “초기 설정에서는 어떤지”, “자신의 사용법에서는 무엇이 달라지는지”를 확인한 뒤 판단하는 사람

## 우리 환경과 시도한 조건

- 주제: Opus 5.5 공개에 따른 자사 AI 모델 용도별 활용 규칙 재검토 판단
- 체제: 소규모 법인
- 환경: Claude Code에서의 일상 업무 (정액 플랜 내, 추가 과금 없음)
- 시도한 시기: 2026년 9월 22일에 Opus 5.5 공개, 9월 24일에 사내에서 재검토 결정
- 소요 비용: 추가 지불 없음
- ⚠️ “40% 저렴”, “단가 20% 감소”는 Anthropic 공식 수치이며, 저희가 실제 청구 금액으로 측정한 값이 아닙니다. 벤치마크에 대해서도 저희가 직접 점수를 다시 측정한 것이 아니라, 공식 기재 내용을 읽고 내린 판단입니다.

## 조금 더 넓게 말하면

이번에는 AI 모델 이야기였지만, “새 버전이 나왔을 때 초기 설정이 바뀌지 않았는지 확인한다”는考え方は AI에 국한되지 않고 소프트웨어 전반에 적용됩니다. 앱이나 서비스가 업데이트됐을 때, 겉에 내세우는 숫자(더 빨라졌다·더 싸졌다)만 보고 초기 설정이 어떻게 바뀌었는지 확인하지 않은 채 계속 사용하면, 기대했던 것과 다른 결과가 나올 수 있습니다. 새로운 것으로 갈아탈 때는 겉에 내세운 숫자와 자신의 사용 방식을 함께 확인하는 습관을 들이면, 나중에 “생각했던 것과 다르다”는 일을 줄일 수 있습니다.

### 이어지는 내용이 필요하신 분께

이번에는 AI 모델 전환이라는 하나의 판단이었지만, 비엔지니어가 AI와 함께 경영 판단을 해 나가는 과정에서는 "이 숫자를 믿어도 되는지", "지금 바로 결정해야 하는지, 지켜봐야 하는지"를 판단해야 하는 순간이 그 외에도 여러 번 찾아옵니다.

유료 기사 “비엔지니어가 AI와 경영 판단을 내릴 때의 결정·기록·도출·점검 체크리스트(2026년 9월판)”에는 그 네 가지 상황별로 판단 과정을 정리하기 위한 항목이 담겨 있습니다.

읽고 나면 새로운 숫자나 정보가 나올 때마다 그것을 바로 판단에 사용해도 되는지 스스로 판별할 수 있게 됩니다. (매출이나 시간 단축을 보장하는 것은 아닙니다)

### 이 글에 대해

이 기사의 본문은 Sonnet 5(effort=high)가 작성했습니다. 같은 재료와 같은 규칙을 Opus 5.5(effort=medium·기본값)에게도 전달해 작성하게 했더니, 내용은 같아도 쓰는 방식이 상당히 달랐습니다. 다른 한 편의 글(#45)과 두 편을 비교한 칼럼(#46)도 함께 봐 주세요. 읽어 보시고 어느 쪽 설명이 자신에게 맞았는지 확인해 보세요.

ao Lab.는 ao.create가 자사에서 실제로 시도해 본 내용을 기록하는 무료 시리즈입니다. 궁금한 점이나 질문이 있으시면 댓글란이나 메시지로 편하게 남겨주세요.

**출처:** [note 원문](https://note.com/ao_lab/n/na14cb466a2bb)

*번역: Gemma 3(.44) 초벌 + 교정 29청크*

[원문 보기](https://note.com/ao_lab/n/na14cb466a2bb) | 출처: note.com