# 실측: 클로드 Opus 5.5와 페이블 5.1에 동일한 지시를 40회 반복했을 때 정답은 동점이었고, 속도는 1.7배, 지불액은 3.2배 차이 발생

> https://bookfactory.kr/board/news/18411
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-24T12:13:17.555Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/317025611/rectangle_large_type_2_2e14e00f8e56ddad888a7bb49cd1b410.png?width=1280)

클로이드 Opus 5.5가 기본 Opus 모델로 설정되었습니다. 공식 설명은 “많은 작업에서 Fable 5.1과 동일한 수준으로 작동하며, Opus 5보다 운영 비용이 40% 절감된다”는 내용입니다. 하지만 이와 같은 설명이 반드시 사용자의 환경에서 그대로 적용되는 것은 아닙니다. 따라서 동일한 지시를 양 모델에 40회 반복하여 정답률, 속도, 그리고 실제로 적용된 금액을 모두 측정했습니다.

결론부터 살펴보면, 저렴한 쪽이 더 빠르고, 당첨 확률은 동일했습니다. 또한, 요금 계산이 공개된 단가표와 일치하지 않는다는 점도 확인되었습니다. 이는 알아본다면 지불액을 1.5배 과다하게 지불할 수 있습니다.

![画像](https://assets.st-note.com/img/1790230772-UcA258BlYIigWx7HwpvstjaP.png?width=1200)

## 결론｜싼 것이 더 빠르고, 당첨되는 숫자도 동일했다.

40회(4가지 유형의 과제 × 5회 × 2모델) 진행 결과는 다음과 같습니다.

정답은 Opus 5.5가 15/15, Fable 5.1이 14/15입니다. 소요 시간은 중앙값으로 Opus 5.5가 7.6초, Fable 5.1이 12.7초였습니다. 실제로 그려진 금액은 40회 번뜨에서 Opus 5.5가 1.80달러, Fable 5.1이 5.81달러였습니다.

즉, 단가가 2.5배나 비싼 모델을 사용하더라도 이 4가지 과제에서는 결과가 개선되지 않고 대기 시간만 1.7배나 늘어나고 지불 금액은 3.2배나 증가했다는 의미입니다.

단 하나의 결함도, 내용을 자세히 살펴보면 그 차이를 명확히 드러내기는 어려웠습니다. 이는 뒤의 장에서 실제 제품을 선보일 예정입니다.

## 측정 조건｜4가지 유형의 과제를 각각 5회씩 동일한 문面으로 제시했다

측정한 것은 비전문가가 실무에서 활용할 수 있는 4가지 종류였습니다.

### 첫 번째 | 논리 퍼즐 (조건에서 4인의 특성을 확정하는)

4명의 각자의 부서, 사용 툴, 근속 연수를 주어진 조건만을 기준으로 정확하게 판단하는 과제입니다. 정답은 1가지로만 결정되며, 추론의 정확성을 평가합니다.

### 두 번째｜요청 금액 계산 (단가와 수량에서 세 가지 금액을 산출)

조건에 따라 3개의 숫자를 계산하도록 합니다. 정답은 1가지입니다. 소수점 자리나 단위 오류가 발생하기 쉬운 문제들입니다.

### 3번째｜문의 텍스트에서 정보 추출

실제 문의 이메일과 유사한 문장에서 회사명, 담당자, 희망일, 인원수, 예산의 5가지 항목을 지정된 형식으로 추출합니다. 불필요한 설명을 덧붙이지 않음을 명시합니다.

### 4번째｜요청에 대해 확인해야 할 사항은 세 가지입니다.

비엔지니어로부터의 모호한 요청을 받아 구현 전에 확인해야 할 사항 3가지를 제시하도록 합니다. 정답이 하나로 결정되지 않으므로 정답 채점 대상에서 제외하고 속도와 토큰만 고려했습니다.

4가지 과제를 모두 두 모델에 동일한 문장으로 각각 5회씩 제출했습니다. 모델 지정 외의 조건은 변경하지 않았습니다.

### 채점 기준을 먼저 확정했다.

평가는 “필요한 값이 모두 갖추어져 있는지”를 기준으로 합니다. 단위(년·명)가 붙어 있거나, 담당자 이름에 부서명이 붙어 있더라도 감점하지 않습니다. 표기상의 어긋남으로 인해 떨어뜨리면 실무에서의 사용성과 맞지 않기 때문입니다. 동일한 기준을 양 모델에 기계적으로 적용합니다.

## 정답｜15대14, 하지만 내용은 같았다.

오퍼스 5.5는 15문제 모두 정답이었습니다. 페이블 5.1은 14/15로 1문제만 틀렸습니다.

외탈 1문제는 획득 과제였으며, 예산 란에 “30만 엔”이라고 쓰라고 지시받았으나 “300,000원(세금별도)”이라고 쓴 것입니다. 금액 자체는 동일하며, 괄호 안까지 합산되어 있습니다. 지정한 형식과 다르기 때문에 기계적으로는 오답으로 처리했지만, 이것을 실책으로 보느냐는 논쟁의 여지가 있습니다.

표기상의 미세한 차이를 고려하면 15/15로 동점이 됩니다. 어느 방식의 계산이든 “상위 모델이 더 정확했다”는 결과는 나오지 않았습니다.

![画像](https://assets.st-note.com/img/1790230799-bI2o5s7LAc4OFaptvx0JHS9U.png?width=1200)

## 속도｜중앙값이 1.7배, 논리 퍼즐에서는 2배의 차이가 나타났다.

소요 시간은 Opus 5.5가 일관되게 빠르고, 변동성이 작다는 결과였습니다.

과제별 중앙값은 논리 퍼즐이 Opus 5.5의 7.3초, Fable 5.1의 14.8초, 청구 계산이 6.4초, 9.0초, 정보 추출이 8.2초, 9.8초, 확인 사항이 9.0초, 12.7초입니다.

가장 큰 차이는 논리 퍼즐에서 벌어진 것으로, 정확히 2배였습니다. 오차 또한 다릅니다. Opus 5.5의 논리 퍼즐은 6.9초에서 7.6초 사이에서 5회 모두 성공적으로 완료된 반면, Fable 5.1은 11.8초에서 18.1초까지 벌어졌습니다. 5회 시도하여 최대와 최소 시간이 6초 차이 나는 것은 기다리는 측에서 볼 때 “이미 끝난 것처럼” 화면을 여러 번 확인하게 되는 시간입니다.

대기 시간이 예측 가능한지에 따라 작업 리듬이 직접적으로 연결됩니다. 7초 안에 반드시 돌아온다고 생각하는 것과 12초에서 18초 사이에서 돌아오는 것과는 체감에 큰 차이가 있었습니다.

![画像](https://assets.st-note.com/img/1790230827-r43RyG2bj8lqWBY6Kcs75PXf.png?width=1200)

## 실 지급액｜40회 분할 결제 시 1.80달러와 5.81달러의 차이, 3.2배

CLI에서 표시된 금액을 모두 더하면 Opus 5.5는 1.8014달러, Fable 5.1은 5.8051달러였습니다. 이는 3.22배의 비율입니다.

1회당 중앙값으로 볼 때, Opus 5.5는 0.1247달러, Fable 5.1은 0.3110달러였습니다. 단가표의 차이(입력 2.5배, 출력 2.5배)보다 더 큰 격차는 뒤에 설명할 캐시 처리 방식 때문입니다.

과제별로 보면, 논리 퍼즐은 5회 실패하여 0.3659달러 대비 1.5565달러, 청구 계산은 0.4612달러 대비 1.3907달러, 정보 추출은 0.6071달러 대비 1.4132달러, 확인 사항은 0.3672달러 대비 1.4447달러였습니다. 모든 과제에서 3배 전후의 차이가 나타났습니다.

금액의 감각을 파악하기 쉽게 표현하면, 같은 작업을 1일 100회 한 경우, Opus 5.5는 약 12달러, Fable 5.1은 약 31달러입니다. 월 20일 기준으로 240달러와 620달러의 차이가 발생하며, 1회 시점에서는 수십 엔의 차이이기도 하지만, 잦은 사용 시에는 큰 영향을 미치는 규모입니다.

## 공개 단가로 계산하면 부합하지 않다 | 1시간 캐시가 사용되었다

여기서 이번에 가장 큰 발견입니다.

처음에는 공개된 단가표를 보면서 직접 금액을 계산했는데, CLI가 표시한 실액과 일치하지 않았습니다. Opus 5.5의 40회분은 단가표에서 계산하면 1.1898달러인데, 실제 표시된 액수는 1.8014달러로, 1.51배 차이가 났습니다. Fable 5.1에서도 3.7532달러에 대해 실액은 5.8051달러로, 1.55배 차이가 났습니다.

문제는 캐시 쓰기 단가였습니다. 공개된 표에는 캐시 쓰기가 “5분”과 “1시간” 두 단계로 나뉘어져 있으며, 1시간 쪽으로 계산하면 오차 없이 완벽하게 일치했습니다.

> 
> 
> 클로이드 옵러스 5.5의 5분 캐시 쓰기 방식은 1M 토큰당 5달러, 1시간 캐시 쓰기 방식은 8달러입니다. 클로이드 페이블 5.1은 12.50달러와 20달러입니다. 캐시 읽기는 각각 0.20달러와 0.25달러입니다.
> 

즉, Claude Code는 1시간 동안 유지되는 캐시를 사용하고 있다는 의미입니다. 단가표에서 가장 눈에 띄는 숫자(입력 4달러, 출력 20달러)와, 자주 논의되는 “캐시 읽기가 0.05배로 저렴한” 경우만 고려하면 실제 지불을 1.5배 적게 과소평가하게 됩니다.

이 차이는 캐시 쓰기 토큰 수가 현저히 많아 발생합니다. 이번 40회 동안 Opus 5.5는 입력이 40 토큰인 반면, 캐시 쓰기는 203,854 토큰, 읽기는 388,959 토큰이었습니다. 금액의 대부분은 캐시 쓰기로 결정됩니다.

![画像](https://assets.st-note.com/img/1790230847-Pc6Z9GneUdjyWQVrwupxf40l.png?width=1200)

## 토큰 내역｜고려량은 거의 같았다

상위 모델은 깊이 생각할수록 시간이 오래 걸리는 현상이 아니었습니다.

출력 토큰은 Opus 5.5가 4,629, Fable 5.1이 4,991입니다. 그 중 사고에 해당하는 부분은 Opus 5.5가 2,754, Fable 5.1이 3,237입니다. 차이는 20% 정도이며, 2배에는 이르지 않았습니다.

과제별로 살펴보면, 논리 퍼즐만은 Fable 5.1이 2,160 토큰을 생각한 반면 Opus 5.5는 1,060 토큰이었습니다. 이는 2배의 차이입니다. 하지만 정답은 모두 5회에 걸쳐 정확했으며, Fable 5.1은 두 배의 시간과 두 배의 사고량을 사용하여 동일한 정답에 도달했습니다.

확인 사항 과제에서는 Fable 5.1의 사고 토큰이 0개였음에도 불구하고 12.7초가 소요되었습니다. 사고량과 소요 시간은 직접적으로 대응하지 않았습니다.

![画像](https://assets.st-note.com/img/1790230867-bsltGSCDnfjOEFmI092e8WY7.png?width=1200)

## 어떤 것을 사용할지 | 나는 Opus 5.5를 기본으로 설정함

이번에 측정된 범위에서는 상위 모델을 사용할 이유를 찾을 수 없었습니다. 정답이 동일하고, 속도가 느리며, 비용이 3배나 비싸다면 선택할 이유가 남지 않습니다.

하지만, 측정된 것은 짧고 단발적인 작업입니다. 파일을 수십 개나 읽게 하는 장시간의 작업이나, 실패를 겪으면서 수정해 나가는 작업에서는 다른 결과가 나올 수 있습니다. 이는 이번 범위 밖이며, 다음에 측정할 숙제로 남겨둡니다.

실무적인 판단으로는 우선 기본 모델인 Opus 5.5를 그대로 실행하고, 명확하게 막히는 경우에만 상위 모델로 전환하는 것이 타당하다고 생각합니다. 처음부터 상위 모델을 자주 사용하면, 막히지 않은 작업에도 3배를 계속 지불하게 됩니다.

저렴한 모델은 품질이 걱정된다는 느낌은 충분히 이해합니다. 하지만 그 걱정이 들어맞는지 여부는 자신의 과제에서 평가해야 합니다. 이번처럼 4가지 유형, 각 5회로 진행했을 때도 1시간 안에 바로 정답이 나옵니다. 사람들의 의견보다 자신의 작업에서 평가한 15문제가 판단의 기준으로서 훨씬 강력합니다.

또 다른 점은, 자신의 설정에 모델명을 직접 입력하는 사용자들이 있는지 확인해 두는 것이 좋습니다. 기본 설정이 변경된 날짜에 기존 모델명을 그대로 사용하면 해당 시점에서 멈추게 됩니다.

## 동일한 측정을 직접 수행하는 절차

특별한 도구는 사용하지 않았습니다. CLI에 모델을 지정하여 전달하고, 반환된 JSON에서 사용량을 획득하는 것뿐입니다.

첫째, 동일한 텍스트의 프롬프트와 기대하는 답변을 JSON 파일에 저장합니다. 둘째, 모델을 인수로 변경하여 동일한 프롬프트를 던지는 스크립트를 작성합니다. 셋째, 반환된 JSON의 사용량 항목(입력, 출력, 캐시 쓰기, 캐시 읽기)과 표시 금액을 한 줄씩 기록합니다. 넷째, 채점 기준을 먼저 결정한 후 기계적으로 적용합니다.

채점 기준을 미리 정하고 양 모델에 동일하게 적용하는 것이 중요합니다.

주의할 점이 하나 있습니다. 횟수를 모아서 자동화하는 스크립트를 먼저 작성하면, 실패도 모두 함께 발생합니다. 실제로 이번 준비에서도 일괄 실행의 초기 버전이 모두 실패했습니다. 원인은 따옴표의 중첩으로, 결과의 추출이 비어 있었기 때문입니다. 처음 1건을 직접 검토하면서 출력 형태를 확인한 다음, 횟수를 늘리는 것이 결국 더 빠릅니다.

## 자주 묻는 질문

### 40회라는 것은 너무 적지 않나요?

많다고 말하기는 어렵습니다. 다만, 정답이 15대 14로 속도가 1.7배, 지불이 3.2배라는 차이는 횟수를 늘려 역전할 수 있는 폭이 아니라고 생각합니다. 반대로 말하면 “미미한 차이”를 보게 하려면 충분하지 않은 횟수입니다.

### 과제가 너무 쉽습니다.

그럴 가능성은 있습니다. 어려운 과제라면 상위 모델이 유리해질 수 있습니다. 이번에 선택한 것은 비전문가가 일상적으로 수행하는 수준의 작업입니다. 이 수준에서는 차이가 없었다는 것이 정확한 표현입니다.

### 캐시의 단가는 어디에서 확인할 수 있나요?

공개된 가격 페이지에는 모델별로 “5분 캐시 쓰기”, “1시간 캐시 쓰기”, “캐시 읽기”가 각각 명시되어 있습니다. 이번 금액은 모두 해당 수치를 기준으로 다시 계산하고 확인했습니다.

### 표시된 금액이 실제 청구 금액과 일치하는지 확인하시겠습니까?

이번에는 CLI에서 제시한 금액과 공개 판매 가격에서 계산한 금액이 일치하는지 확인했습니다. 청구서와 일치하는지 확인한 것은 아니므로, 그 부분은 단정할 수 없습니다.

## 요약:

이번 주말에 츠키시마 료타와 함께 킨테쓰 영화관에서 ‘스파이더맨: 뉴 유니버스’를 보려고 합니다. 료타는 이미 티켓을 예매해 놨고, 저는 지금 바로 예매하려고 합니다. 영화에 대한 기대감과 료타와 함께 보게 될 즐거움에 벌써부터 설레네요. 료타는 이번 영화를 통해 ‘스파이더맨: 뉴 유니버스’의 톰 할리 역을 연기하는 조너선 포드와 함께 영화에 대한 이야기를 나누고 싶어 합니다. 톰 할리는 넷플릭스 드라마 ‘오렌지’에서 보여준 연기력을 바탕으로 ‘스파이더맨: 뉴 유니버스’에서 더욱 깊이 있는 캐릭터를 보여줄 것이라고 료타는 기대하고 있습니다. 료타는 특히 톰 할리의 감정 연기에 주목하며, 앞으로 톰 할리가 ‘스파이더맨: 뉴 유니버스’ 시리즈에서 어떤 역할을 할지 궁금해하고 있습니다. 킨테쓰 영화관에서 톰 할리와 조너선 포드의 연기를 함께 보면서 ‘스파이더맨: 뉴 유니버스’의 세계관과 캐릭터에 대한 이해를 높이는 시간을 가질 수 있기를 바랍니다.

같은 지시를 40회 반복하여 얻은 결과를 다시 정리합니다.

첫 번째로, 정답은 Opus 5.5가 15/15, Fable 5.1이 14/15로, 유일한 오답은 표기 오류였습니다. 실질적으로는 동점입니다.

두 번째로, 속도는 중앙값에서 Opus 5.5는 7.6초, Fable은 12.7초였습니다. 논리 퍼즐에서는 2배의 차이가 발생했으며, Opus 5.5의 변동성이 더 작아졌습니다.

세 번째로, 실제 지불은 40회에 걸쳐 1.80달러와 5.81달러로 이루어지며, 3.22배의 차이가 발생합니다.

네 번째로, 공개 단가에서 금액을 계산할 때는 1시간 캐시 단가를 사용하면 적절하지 않습니다. 5분 기준으로 계산하면 1.5배 적게 과대 산정됩니다.

다섯 번째로, 사고 토큰의 양은 20% 정도밖에 차이가 없었고, “깊이 생각하고 있어서 느리고 비싸다”라는 설명은 이번 데이터에서는 지지되지 않았습니다.

짧은 작업의 경우 저렴한 옵션을 기본으로 설정하면 문제가 발생하지 않습니다. 이는 이번 실측에서 확인한 결과입니다. 장시간 작업에 대해서는 다시 측정하여 보고하겠습니다.

별똥별을 읽고 나서 꼭 이 전시회를 방문해 보세요.
별똥별의 말이 당신의 마음속 깊이 울릴 것입니다.
전시회에서는 앙리 뒤랑베르의 작품과 그의 삶을 담은 책,
그리고 별똥별을 모티브로 한 다양한 상품이 전시되어 있습니다.
특히 앙리 뒤랑베르가 실제로 사용했던 펜이 전시되어 있는 코너는 꼭 방문해야 합니다.
또한 전시회 한정 상품도 판매되고 있으니, 기념품으로 가져가세요.
전시회는 2024년 5월 15일부터 9월 30일까지 도쿄 미드타운에서 개최됩니다.
입장료는 성인 1,800엔, 학생 700엔입니다.

## AI의 최신 정보를 실시간으로 받아보세요.

클로이드 코드의 실측 데이터와 신 기능 검증을 X(엑스)에서 매일 게시하고 있습니다. 버전별 변경 사항과 실제로 사용하면서 발견한 문제점을 미리 알고 싶으시다면 팔로우해주세요.

@ai_hack_dx 팔로우

**출처:** [note 원문](https://note.com/ai_hack_dx/n/n847f58725dfd)

*번역: Gemma 3(.44) 초벌 + 교정 63청크*

[원문 보기](https://note.com/ai_hack_dx/n/n847f58725dfd) | 출처: note.com