# AI 실측 #7: AI 대가가 20%도 하락하지 않는 사람들도 있다 – Opus 5.5

> https://bookfactory.kr/board/news/18338
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-24T04:36:45.763Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/316621227/rectangle_large_type_2_38cd1b3a56eebe41dbd92fc6931004b1.png?width=1280)

어제 “AI 이용료가 4~5% 절감”한다는 내용이 한꺼번에 흘러왔습니다. 그렇다면 본인의 지불은 몇 퍼센트 절감될까요? 제가 손에 쥐고 있던 AI 이용 로그 10만 3,884건에, 신규 및 기존의 가격표를 그대로 적용하여 계산해 보았습니다.

내부 측정 결과 41.1% 할인 적용되었습니다. 공식 설명(Claude Opus 5.5는 일반 작업에서 40% 할인된다는 설명)과 거의 일치합니다. 다만, 짧은 질문을 개별적으로 던지는 방식으로는 동일 할인율(20%)로 멈추게 됩니다.

분기점은 딱 1개뿐입니다. 청구 금액 중 “같은 전제를 다시 읽게 하는 부분”이 몇 퍼센트나 되는지 그 비율에서 자신의 하락폭을 계산하는 공식을 한 가지로 줄여서 제시합니다.

## 결론부터 말씀드리겠습니다.

- 손안의 실소비에 신구의 가격표를 적용했을 때 41.1% 저렴합니다. 공식적으로 발표된 “40%”는 거의 그와 같았습니다.
- 단순히 하락 폭의 77.1%는 “캐시 읽기”라는 항목에서 비롯된 것이다. 하락 폭 = 20% + 40% × 캐시 읽기가 청구에 차지하는 비율
- 가격 인하 후, 가장 높은 비용 항목이 “재검토”에서 “암기 재지시”로 변경된다. 출력을 축소하여 절약하는 것은 실제 청구 감소액이 6.9%에 불과하다.

![画像](https://assets.st-note.com/img/1790139768-FmCj3x4qlBc6dGXI9RonYpKk.png?width=1200)

## 캐시 류는 무엇인가(요구 사항의 40%를 차지하는 항목)입니다.

AI와의 긴 대화나 코드 작업에서는 동일한 전제를 매번 다시 읽어주도록 합니다. 지시서, 열린 파일, 이전의 교환 내용 등 “이전과 동일한 부분”을 할인된 가격으로 다시 읽어주는 시스템이 바로 프로ンプ트 캐시입니다.

요금표에는 4가지 가격이 제시됩니다. 새로운 입력을 읽어들이고, 데이터를 출력하며, 전제를 익히도록 하는 “캐시 쓰기”와 익힌 전제를 다시 읽어들이는 “캐시 읽기”입니다.

공식 자료에서는 낭독은 입력을 1/10로 하고, 암기시키는 방식은 1.25배(5분간 유지할 경우) 또는 2배(1시간 유지할 경우)로 규정되어 있습니다. 낭독은 모델에 따라 더욱 저렴하며, 새로운 Opus는 1/20입니다.

> 
> 
> 캐시 읽기는 대부분의 에이전트 및 코딩 작업 비용을 차지하며, 1백만 토큰당 0.20달러로 Opus 5보다 60% 저렴합니다.
> 

> 
> 
> 캐시 읽기는 ─ 에이전트 작업과 코드 작업 비용의 대부분을 차지하지만 ─ 100만 토큰당 0.20달러로, Opus 5보다 60% 저렴합니다. 출처: Anthropic “Claude Opus 5.5”, 2026년 9월 22일
> 

할인율은 항목마다 다릅니다. 입력, 출력, 캐시 쓰기는 20% 할인이며, 캐시 읽기만 60% 할인됩니다. 따라서 “어떤 항목에 얼마를 지불하는지”에 따라 할인 폭이 결정됩니다.

## 무엇을 세었는지

내 현지 Mac에서 2026년 8월 18일부터 9월 22일까지 총 10만 3,884건의 AI 요청이 진행되었으며, 병렬로 실행된 요청도 포함됩니다. 작업 내용은 앱 구현 및 테스트, 조사, 자료 제작 등이었습니다.

수치 계산 방식은 기록에 남아있는 요청별 사용량을 그대로 합산한 결과입니다. 입력, 출력, 캐시 쓰기(5분 유지 및 1시간 유지 분리), 캐시 읽기 5가지 종류를 포함하며, 총 16억 8954만 953544 토큰, 즉 169억 토큰입니다.

먼저 말씀드리는 대로 실제 결제는 정액 요금제이기 때문에, 여기 나오는 금액은 청구서 금액이 아닙니다. 같은 양을 변동 요금의 기본 가격으로 구매했을 경우 나올 수 있는 상당한 금액입니다. 금액이 하락하는 것의 의미는 “같은 정액으로 얼마나 더 많이 사용 가능한가”에 영향을 미칩니다.

### 재독시는 토큰 기준 96.4%, 청구 기준 42.6%입니다.

![画像](https://assets.st-note.com/img/1790139813-bpuVWNaSCDLocw9KYnTsRxiA.png?width=1200)

토큰 수량을 기준으로 보면 96.4%가 캐시 읽기입니다. 1 요청당 15만 6,721 토큰을 읽어들이고 있었습니다. 새로 읽어들이도록 하는 입력은 같은 기간 동안 57만 9,755 토큰에 불과합니다.

그러나 청구서를 확인해 보면, 재검토는 42.6%에 그칠 뿐입니다. 단가가 10분의 1이기 때문입니다.

대안으로 토큰량으로는 3.2%에 불과한 “1시간 보관 캐시 쓰기”가 전체 청구액의 42.3%를 차지했습니다. 재읽기와 암기 재작성이 거의 동등한 비중을 나타냈습니다.

### 공식적인 설명과 약간의 어긋남

여기에는 공식 설명과 한 가지 차이가 있습니다. 발표문에서 캐시 읽기를 “비용의 대부분”이라고 표기하지만, 자체 측정 결과 42.6%로 과반수에 미치지 않습니다.

읽기와 쓰기를 합치면 84.8%이므로 “캐시 관련이 대다수”라는 표현이 맞습니다. 차이가 나는 것은 “읽기만으로 대다수”라는 방식입니다.

## 새롭고 구전 가격표를 기준으로 계산하면 41.1% 저렴합니다.

소비량을 그대로 유지하면서 Opus 5 가격표와 Opus 5.5 가격표를 대조합니다. 대상은 로그 중 Opus 5로 실행된 4만 1,418건입니다.

![画像](https://assets.st-note.com/img/1790139830-HzK1s0P24Ep3ejXY7TGd9Rf8.png?width=1200)

구 가격으로 6,817.13 달러, 신 가격으로 4,013.02 달러입니다. 가격 차이는 2,804.11 달러로 41.1% 하락했습니다. 공식적으로 “일반적인 작업에서 40% 할인”이라고 언급한 것은 적어도 가격표 효과 측면에서는 일리가 있었습니다.

이 글의 핵심은 하락폭의 내역입니다. 총 2,804달러 중 2,161달러(77.1%)가 캐시 읽기만으로 발생했으며, 다음으로 1시간 유지 기록으로 454달러(16.2%)가 발생하고, 출력은 189달러(6.7%)에 그쳤습니다.

## 당신의 손실 범위를 결정하는 방법

각 항목별 감액률은 현금 판독이 60%, 그 외 항목은 모두 20%입니다. 즉, 전체 감액폭은 현금 판독이 청구에 차지하는 비율에 따라 결정됩니다.

하락폭 = 20% + 40% × (현금 인식액 비율)

손에 든 자료에 따르면, 기존 가격 6,817달러 중 현금 결제 금액은 3,602달러로, 비율은 52.8%였습니다. 식에 대입하면 20 + 40 × 0.528 = 41.1%이며, 실제 측정값과 소수점까지 일치합니다.

![画像](https://assets.st-note.com/img/1790139844-yqvfZjkcO9dhxBF2LKPQYA5m.png?width=1200)

### 20% 수준에서 멈추는 방법과 60%까지 도달하는 방법

읽어 내려가면 이렇게 됩니다. 짧은 질문을 개별적으로 던지는 방식으로는 캐시는 거의 효과가 없으므로 하락폭은 20%로 멈추게 됩니다.

긴 지침서를 들고 있는 채로 수십 바퀴를 돌아다니는 코드 작업은 50~60% 정도에 그칩니다. “4~5割 감소”는 후자의 사용법을 하고 있는 사람들의 숫자입니다.

## 가격 인하 후 가장 높은 비용 항목이 대체됩니다.

새 가격으로 다시 계산한 결과, 비용 항목의 순위가 변경됩니다. 현금 읽기는 1,440.68달러까지 하락하지만, 1시간 보관 기록 작성은 1,816.77달러로 20%밖에 감소하지 않습니다. 가장 큰 비용 항목은 “읽어쓰기”에서 “기억시키기 다시 쓰기”로 변경됩니다.

![画像](https://assets.st-note.com/img/1790139857-XQz8yLsg4PRvWlj1c2CI7EtK.png?width=1200)

### 유지 시간을 5분으로 조정했을 때 12.5% 저렴해진다고 단정할 수 없습니다.

효과를 내는 것은 보관 기간의 선택 방식입니다. 같은 토큰량이라면 1시간 보관은 5분 보관의 1.6배 가격입니다. Opus 5로 실행된 것을 전부 5분 보관으로 바꾼다고 가정하면, 그것만으로도 12.5% 저렴해집니다.

하지만 이는 이론적인 이야기일 뿐이며, 그대로 적용하면 기대만큼의 효과를 보장하지 않습니다. 5분 안에 끊어진 폰은 다음 왕복에서 저렴한 재독습에 이어지지 않고, 오히려 높은 덧배움 복습으로 돌아갑니다.

간격을 두고 작업할 경우 오히려 효율이 저하될 수 있습니다. 판단 전환점을 확인하려면 다음 행동까지의 간격이 5분 이내인지 확인해야 합니다.

## 출력을 짧게 하더라도 청과는 줄어들지 않는다.

예상 밖의 부분은 바로 여기입니다. 출력량은 토큰량의 0.4%밖에 되지 않지만, 청구 금액의 15.2%를 차지하며, 단가가 가장 높기 때문입니다.

그러다 보니 “출력을 줄이면 효과가 있다”고 생각하게 됩니다.

### 절반으로 줄여도 6.9% 감소합니다.

실제로 계산해 보면, Opus 5의 실제 소비에서 출력을 절반으로 줄여도 청구는 6.9% 밖에 감소하지 않습니다. 할인에 대한 기여 또한 6.7%에 그쳤습니다. “더 간결하게 답변해 줘”라고 지시하여 절약할 수 있는 금액은 이 사용법으로는 10%에 미치지 않습니다.

줄여야 할 것은 왕복 횟수입니다. 1 요청마다 15만 6,721 토큰의 읽기 및 5,206 토큰의 쓰기가 누적되므로, 같은 결과에 10 왕복이 걸렸던 것을 5 왕복으로 끝내는 방식의 지시가 출력을 절반으로 줄이는 것보다 더 효과적입니다.

## 이해하지 못하는 분들을 위해, 이것을 처음 읽을 때 해야 할 일은 다음과 같습니다.

순서는 다음과 같습니다.

- 내 청구 내역을 확인합니다. 요량 과금 방식의 경우 관리 화면 이용 현황에 입력, 출력, 캐시 읽기, 캐시 쓰기 정보가 각각 분리되어 나타납니다.
- 캐시 읽기가 청구 금액의 몇 %를 차지하는지 계산하고, 그 숫자를 상기된 식에 대입하면 자신의 하향폭을 알 수 있습니다.
- 20%에 가까울 때마다 가격 인하를 기대해서는 안 됩니다. 대화를 길게 유지하면서 현금 흐름이 지속되는 방식으로 작업을 재구성하는 것이 더 큰 효과를 발휘합니다.
- 60%에 가까워지면 모델을 새로운 방향으로 전환하는 것만으로도 청구가 거의 절반 가까이 줄어듭니다. 할 일은 전환 하나뿐입니다.

정액 요금제를 이용한다면 금액이 아닌 “용량 제한 횟수”로 인해 동일한 문제가 발생합니다. 낭독 재검토 단가가 하락하는 만큼, 동일한 용량 제한으로 작동되는 왕복 횟수가 늘어납니다.

![画像](https://assets.st-note.com/img/1790139891-cOi7HkFao6PmgXtvGKpfjQ3d.png?width=1200)

## 자주 묻는 질문

### 모든 모델이 할인된 건가요?

아니요. 제가 보유한 로그는 6종류의 모델에 걸쳐 있으며, 이번 하락은 Opus 신제품 모델에만 해당합니다. 2,804달러의 하락폭을 전체 모델 합계 1만 3,271달러로 환산했을 때, 전체적으로 21.1%에 달합니다.

### 저가형 모델로 돌리는 것이 오히려 손해인지 궁금합니다.

1건당 청구 금액은 Opus 5가 0.1646달러, Sonnet 5가 0.0472달러, Haiku 4.5가 0.0110달러였습니다. 3.5배에서 약 15배까지의 차이가 있었습니다.

하지만 동일한 작업을 완료하는 데 왕복 거리가 늘어난다면 역전될 수 있습니다. 주목해야 할 숫자는 1건의 작업을 완료하는 데 소요된 총액입니다.

### 36일 분량으로는 짧다고 느껴지시진 않나요?

짧습니다. 손안의 터미널에 남아있던 기록은 5월에 257건뿐이었고, 6월과 7월에는 0건이었습니다.

누적된 양은 8월 18일 이후부터만 존재하며, 분기별 비교는 이 데이터에서는 불가능합니다.

## 측정할 수 없는 것들

이 측정은 “소비 토큰이 같다면”이라는 전제 하에 진행되었으며, 새로운 모델은 동일한 작업을 더 적은 횟수의 주고받기로 완료할 수 있다는 설명입니다.

발표문에는 약 절반의 터너 시간 및 출력 토큰으로 이전 세대의 품질에 버금가는 사례도 제시되어 있으며, 이로 인해 해당 작업의 비용을 40~50% 절감했다는 내용도 포함되어 있습니다. 다만, 이 숫자는 토큰 감소 효과를 포함한 것이므로, 여기서 제시된 41.1%와 합산할 수 없습니다.

실제로 신판을 실행한 소비는 아직 제 손에 들어오지 않았습니다. 이 글에서는 가격표 효과만을 분리했으며, 토큰 감소 효과는 별도로 측정해야 합니다. 출력 속도가 30% 이상 빨라진다는 설명 역시 같은 이유로 검증되지 않았습니다.

### 47%의 다른 조사와의 관계

또한 같은 9월 22일에는 “동일한 성능을 구매하는 데 드는 비용은 지난 3년간 분기별로 약 47% 감소세를 지속했다”는 조사 결과도 발표되었습니다. 세대가 한 단계 진행되면서 41%라는 이번 수치는 이러한 추세와 모순되지 않습니다.

## 왜 썼을까

가격 인하 발표를 읽었지만 “제 경우에는 얼마나”라는 문구가 적혀 있지 않았습니다. 분모를 가진 것은 발표 측이 아닌, 실제로 사용하고 있는 측입니다. 우연히 36일 분량의 로그가 손에 있어서 세어보았습니다.

한 가지 식에 닿는 것이 수확이었다. 하락폭은 20%에 40%를 곱한 캐시 읽기 비율을 더한 값이다. 이는 공개된 요금표에서 나오는 수치이므로 누구나 자신의 숫자로 확인할 수 있다.

같은 질문을 8월에 계산으로 풀어낸 이전 기사와, 오늘 아침의 가격표 초본 정보는 다음과 같습니다.

**출처:** [note 원문](https://note.com/generativeai_new/n/ndf2820f2529e)

*번역: Gemma 3(.44) 초벌 + 교정 49청크*

[원문 보기](https://note.com/generativeai_new/n/ndf2820f2529e) | 출처: note.com