# 오퍼스 5.5의 실천 지: 비용 효율성과 이해하기 쉬운 설명으로의 진화

> https://bookfactory.kr/board/news/18481
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-09-25T03:20:31.444Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/317152806/rectangle_large_type_2_1e6972884a8f86689e201db0aa945fb1.jpeg?width=1280)

Anthropic에서 최신 모델인 Opus 5.5를 공개했습니다. 이전 세대에서 문제시되던 출력의 장황함과 코드 생성의 미흡함이 대폭 개선되어, 실무에서 일상적인 개발을 지원할 만한 수준으로 끌어올렸습니다. 이번에는 유튜브의 Theo 님이 Opus 5.5를 사용해 본 경험을 소개합니다.

공식에서도 정보를 공개하고 있으니 참고하십시오.

## 추론 레벨을 최대 설정하는 대신 미디엄으로 설정하는 것이 운용의 핵심이 된다.

Opus 5.5를 실무에 적용할 때 최적의 해결책은 추론 레벨을 최대가 아닌 medium에서 high 범위로 고정하는 것입니다. 능력을 최대한 끌어내려 추론 설정을 최대까지 높이면 결과물의 품질은 거의 변하지 않으면서 사고 루프에 빠지고, 비용과 실행 시간이 폭등합니다.

- 토큰 단가는 20% 저렴해졌지만, 작업당 출력 토큰 소비량은 전 세대 대비 거의 두 배 가까이 늘었습니다.
- 추론 레벨을 최고로 설정하면, 중간 수준보다 10배 이상의 컴퓨팅 토큰을 소비하면서도 정답률이 약 1%밖에 향상되지 않습니다.
- 자연어 기반 보고는 훨씬 명확해진 반면, 컨텍스트 윈도우 소비를 우려하여 작업을 중단시키는 습관이 남아 있습니다.
- 추론 수준을 미디엄에서 하이로 낮추고, Claude.md에서 불필요한 작업 중지를 방지하는 지시를 주어 안정적인 결과를 얻을 수 있습니다.

![画像](https://assets.st-note.com/img/1790255403-5879qTC6VpsJUwlRAzBP4tHy.png?width=1200)

추론 레벨(effort)을 미디엄으로 억제해야 한다는 판단은 공식적으로도 언급된 바가 있으며, 성능을 극대화하고 싶어하는 개발자의 직감과는 일견 상반됩니다. 이 차이가 어디에서 비롯되는지 확인하기 위해, 우선 모델의 기본 사양과 검증 환경의 사실부터 순차적으로 살펴보겠습니다.

공식 정보를 기반으로 ClaudeCode용으로 최적화된 내용은 여기서 확인하실 수 있습니다.

## 최신 모델에 대한 기대와 설정 값에 대한 일반적인 통념

새로운 대규모 언어 모델이 등장했을 때, 수개월 전의 모델은 추론 레벨을 최대(max)로 설정すれば 가장 정확한 코드가 얻어진다고 여겨졌습니다. 왜냐하면, 사고 시간을 길게 확보할수록 더 복잡한 설계나 리팩토링이 성공하기 쉬워질 것이라고 믿어 왔기 때문입니다. 수개월 전의 저 자신도 더 현명한 결과를 기대하며, 망설임 없이 노력을 최대(max)까지 끌어올려 시도를 반복했습니다.

이번에 검증된 Opus 5.5는 이전 세대 Opus 5에서 비판을 모았던 코드 누락이나 설명문의 질 저하 문제를 극복하기 위해 개발된 모델입니다. 검증 과정에서는 수십만 줄 규모의 코드 이관이 이루어지고, 다양한 벤치마크 테스트 측정 등이 진행되어 실제 개발 환경에서의 실효 성능이 측정되었습니다.

검증 결과를 정확하게 따르기 위해 추론 수준과 맥락 압축이라는 두 가지 개념을 정리합니다. 추론 수준은 모델이 최종 답변을 내리기 전에 내부적으로 가설 검증을 수행하는 사고의 깊이를 단계적으로 지정하는 설정 값이며, 맥락 압축은 대화 기록이 용량 제한에 가까워질 때 과거의 교환을 자동으로 요약하고 기억 영역을 확보하는 메커니즘입니다.

## 실측 데이터가 나타낸 성능과 비용 내역

### 단가 하락과 속도 향상으로 인해 출력 토큰량이 급증하고 있다.

오퍼스 5.5의 기본 가격이 크게 개정되었으며, 카탈로그 사양상 이전 세대보다 다루기 쉬운 설정으로 변경되었습니다.

API 요금 체계는 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로, Opus 5에 비해 20% 저렴해졌습니다. 캐시 읽기 또한 60% 인하되어 100만 토큰당 0.20달러로 처리됩니다.

생성 속도 측면에서도 약 30%의 고속화가 확인되었으며, 세션 도중 추론 레벨을 전환해도 캐시가 무효화되지 않도록 설계가 개선되었습니다.

![画像](https://assets.st-note.com/img/1790255493-kqXRJHhmQno9E8jarf6zViL5.png?width=1200)

그러나 실제 결과적으로 1 작업당 출력 토큰 수가 크게 증가했으며, 추론 수준:max 측정에서 이전 세대 Opus 5는 1 작업 평균 7만 3천 토큰, 동일사의 최상위 모델인 Fable 5.1은 7만 8천 토큰이었던 반면, Opus 5.5는 12만 토큰에 가까운 양을 소비했습니다.

약 2만 7천 토큰으로 완료되는 GPT-6 Astra 등 다른 경쟁 모델과 비교했을 때 4배 이상의 격차가 존재합니다.

단가가 저렴해졌다 하더라도, 생성되는 토큰 수가 두 배로 늘어나는 탓에 이용 총액은 상상만큼 크게 떨어지지 않는 구조가 드러났습니다.

### 추론 수준을 미디엄으로 유지하는 설정이 최대의 비용 효율을 달성한다.

추론 수준 변경이 성과와 비용에 얼마나 기여하는지 측정하기 위해 여러 평가 지표를 사용하여 강도별로 수치가 획득되었습니다.

실무적인 명령어 실행 환경을 모사한 Terminal Bench 4와 같은 환경에서 추론 레벨을 medium으로 설정한 Opus 5.5는 극히 높은 정확도를 보였습니다. 반면, max 설정에서는 정확도 저하 및 정체 현상이 기록되었습니다.

![画像](https://assets.st-note.com/img/1790255476-yHxpCm9M4lXhI3e1nfvZqsPT.png?width=1200)

- 터미널 벤치 4에서 미디엄 설정의 Opus 5.5는 동일사의 Fable 5.1 기반 추론을 상회하는 점수를 기록했으며, 실행 비용은 약 2.94달러로 Fable의 20달러에 비해 현저히 저렴했습니다.
- 스케이트벤치(Skatebench)에서의 측정 결과, ‘high’ 설정에서는 1회당 약 330 토큰이던 추론 소비량이 ‘max’ 설정에서는 약 5,000 토큰으로 급증했습니다.
- 이 10배 넘는 추론 토큰 증가에 따라 벤치마크 상의 점수 향상은 약 1%에 그쳤습니다.

이 수치들은 추론 수준을 최대치로 끌어올려도 정확도 향상은 정체되고, 계산 자원의 낭비만이 두드러지게 진행됨을 보여줍니다.

생각에 할당하는 단계를 최대치로 설정하는 것은 결과에 부합하지 않는 막대한 토큰을 소모하는 결과로 직결됩니다.

### 대화의 명확화가 지속되는 과정에서 자동 요약에 대한 오해가 빚어져 정체 현상이 발생한다.

모델은 개발자에게 반환하는 보고서 문장과 장시간 자율 코딩 시 발생하는 동작 지속성도 실제 환경에서 시도되었습니다.

오퍼스 5에서 두드러지게 나타났던 기호 남용과 의미 불명의 설명이 제거되었고, 과금 버그 원인 특정 등의 실례에서는 차이의 영향 금액과 대상 커밋이 상단에서 정확하게 요약되었습니다. 보고가 간결하고 논리적으로 개선된 결과, 개발자들이 에이전트의 의도를 파악하기 위해 로그를 재검토하는 부담은 현저하게 줄었습니다.

![画像](https://assets.st-note.com/img/1790255560-cRT9wrXiUodNIuxBmCHzYOGa.png?width=1200)

한편, 장시간 세션에서는 설명할 수 없는 멈춤 현상이 확인되었습니다. 3시간 이상 지속적으로 로컬 환경에서 코드 최적화를 진행하던 인스턴스는 compaction 발생 전까지 남은 10% 단계에서 작업 손실을 우려하여 커밋을 망설이는 결정을 내렸습니다.

대화 기록이 용량 제한에 가까워지는 것은 정상적인 동작 흐름이지만, 모델 스스로 문맥 상실을 우려하여 처리를 중단하는 새로운 문제가 관찰되었습니다.

## 활かし方

이 기능을 사용하려면 먼저 “〇〇(책 제목)”을 구매해야 합니다. 구매 후 다음 단계를 따르세요.

1.  “〇〇” 페이지를 열고 오른쪽 상단의 “자세히” 버튼을 탭합니다.
2.  “자세히” 화면에서 “〇〇” 섹션을 찾고 오른쪽 하단의 “재생” 버튼을 탭합니다.
3.  재생 화면에서 재생 속도를 조절하거나 자막을 표시할 수 있습니다.
4.  “〇〇” 콘텐츠를 자신의 페이스에 맞춰 즐겨주세요.

이 기능은 〇〇(저자 이름) 氏가 쓴 “〇〇”의 매력을 최대한 끌어내기 위해 개발되었습니다. 이 기능을 통해 〇〇(저자 이름) 氏의 세계관에 빠져보세요.

과도한 추론을 억제하면서 장시간 작업 중단을 방지하기 위해, Claude Code의 작업 환경에 내일 아침부터 즉시 도입할 수 있는 실천적인 절차를 정리합니다.

- 클루드 코드 대화 세션을 시작하는 장면 – 추론 레벨을 최대가 아닌 미디엄 또는 하이로 고정하여 실행합니다.
- 프로젝트 규칙 파일을 정의하는 상황 — CLAUDE.md에 “사고 루프 방지”와 “자동 요약 발생을 우려하지 않고 매번 작은 변경 사항을 Git에 커밋하는 원칙”을 명시한다.
- 장시간에 걸친 리팩토링이나 성능 개선을 지시하는 상황에서, 1회에 모든 문제를 해결하려 하지 않고, 대상 디렉토리나 개선 항목을 2~3개로 좁혀 단계적으로 실행하는 것이 바람직합니다.

### “카오스”라는 용어가 현대 사회를 효과적으로 표현한다고 생각합니다.
특히 정보 과잉 시대에 우리는 끊임없이 “카오스”에 노출됩니다.
SNS의 확산성, 뉴스의 편향, 그리고 AI의 급속한 진화 등이 우리의 인식을 왜곡하고 진실을 잃게 만드는 “카오스”를 만들어내고 있는 것은 아닌가 생각합니다.

이 “카오스”를 인식하고 그 안에서 자신만의 질서를 구축해가는 것이 현대인의 삶의 방식으로서 중요하다고 생각합니다.
예를 들어, 정보원을 여러 개 확인하고 다각적인 시각을 가지는 것, 그리고 자신의 감정에 휩쓸리지 않고 냉정하게 판단하는 것 등이 이에 해당합니다.

또한 카오스를 단순한 혼란으로 치부하는 것이 아니라 창의성과 혁신의 원천으로 바라보는 것도 중요합니다.
카오스 속에서 바로 새로운 가치가 태어날 가능성을 품고 있는 것입니다.

최근 읽은 책 ‘사고의 정리학’에도 카오스의 인식과 맞서가는 방법에 대해 매우 통찰력 있는 내용이 담겨 있었습니다.
이 책은 저의 생각을 크게 바꾸는 계기를 주어 준 귀중한 한 권의 책입니다.
저자의 이끌레 정 확한 해설과 풍부한 사례를 통해 우리는 복잡한 문제를 정리하고 해결하기 위한 실마리를 얻을 수 있습니다.
‘사고의 정리학’은 바로 “카오스”를 넘어 더 나은 미래를 개척하기 위한 나침반이 될 것입니다.

- 압축(컨텍스트 자동 압축): 대화나 도구 실행 로그가 용량 제한에 도달하기 전에 핵심 내용을 요약하여 장시간 세션을 유지하는 기능.

### 얘야, 그 그림 정말 예쁘지 않아? 저 『별의 정원사』 그림 같아서 조금 쓸쓸한 기분이 들어.

**출처:** [note 원문](https://note.com/clear_tern4816/n/n3c1d4ded8fac)

*번역: Gemma 3(.44) 초벌 + 교정 30청크*

[원문 보기](https://note.com/clear_tern4816/n/n3c1d4ded8fac) | 출처: note.com