해커 뉴스에서 “모든 예산에 맞는 최적의 LLM, 매일 업데이트”라는 사이트가 155 포인트(점수)를 모았습니다.
420개의 모델을 “지능”과 “API 가격” 두 축으로 배열하고, 그보다 저렴하면서도 더 지능적인 모델이 없는 모델들만 선으로 연결한 표입니다. 예산을 설정하면, 해당 가격으로 가장 지능적인 모델이 한 줄로 표시되며, 매일 자동으로 업데이트됩니다.
이것은 제가 실제로 구매한 것입니다. 이것은 제가 실제로 구매한 것입니다. 이것은 제가 실제로 구매한 것입니다. 이것은 제가 실제로 구매한 것입니다. 이것은 제가 실제로 구매한 것입니다.
편리하게 사용할 수 있어서, 제 Claude Code의 사용법에 맞춰 적용해 보았습니다. 그 결과, 표에 제시된 가격과 제 실제 가격 사이에 10배 정도 차이가 나고, 모델 간의 차이 폭도 달라지는 것을 알 수 있었습니다.
이 기획은 2023년 11월 16일 개최된 “독서메터” 이벤트 “독서메터×강담사”에서 발표된 내용을 바탕으로 하고 있습니다.
이 기획의 목적은 독서메터 사용자가 강담사의 책을 더욱 깊이 이해하고 즐기는 데 도움이 되는 정보를 제공하는 것입니다. 구체적으로 강담사의 편집자나 작가가 책의 배경, 제작 비화, 독서메터 사용자에게 묻는 질문에 답변하는 형식으로 온라인 이벤트를 개최했습니다.
이벤트에서는 다양한 장르의 책에 대한 소개가 이루어졌으며, 독서메터 사용자에게 질문에 답변하는 과정에서 책에 대한 깊이 있는 이해와 독서메터 커뮤니티 내 활발한 의견 교환이 이루어지는 등 많은 배움이 있었습니다.
이 기획을 통해 독서메터와 강담사는 독서에 대한 관심을 높이고 독서 커뮤니티 활성화에 기여하는 것을 목표로 합니다. 앞으로도 양사는 협력을 강화하여 독서 경험의 향상에 노력할 것입니다.
- 표의 읽는 방법과 9월 24일 기준으로 각 예산대에 상위 랭킹에 있는 모델
- 표의 가격이 Claude Code와 같이 부자연스러운 이유로 달라지는 이유
- 내 로그에 “실제 1M 토큰 가격”을 표시하는 스크립트
표의 내용 (2024년 9월 6일 기준)
지능은 인공 분석의 지능 지수이며, 가격은 “입력 3: 출력 1”으로 혼합된 100만 토큰당 단가입니다. 점수가 30 이상으로 제한될 경우, 다음 6가지로 선 위에 남게 됩니다.
- 0.20: GPT-6 루나(최대) 점수 37.3
- 0.23: Qwen-3.8-Flash-Next 점수 39.8
- 0.237: GLM 5.3 Flash 점수 41.8
- 0.544: MiMo-V2.6-Pro 점수 46.3
- Muse Spark 1.3 (최대) 점수 48.1
- 클로이드 옵스 5.5 (맥스) 점수 57.6
8점 이상의 모델은 더 이상 현저하게 뛰어난 모델이 없습니다. Fable 5.1은 20달러에 점수가 53.4점으로, Opus 5.5보다 높고 낮은 위치에 있습니다.
제가 평소에 사용하는 클로드의 위치는 다음과 같습니다.
- 오퍼스 5.5: 8달러 / 57.6 (선 위)
- 오퍼스 5: 10달러 / 50.8
- 소네트 5: 4 / 38.2
- 하이크 4.5: 2달러 / 16.9
소네트 5보다 약간 더 지능적인 Qwen3.8-Flash-Next가 1/17 가격으로 선상에 있습니다. 표만 놓고 보면 “소네트 5를 사용하는 이유가 없다”고 보일 수 있습니다.
내 로그에 실제 단가를 표시합니다.
Claude Code의 로그는 `~/.claude/projects/` 디렉토리에 JSONL 형식으로 저장되어 있으며, 각 응답마다 사용된 토큰 수가 기록되어 있습니다. 이를 입력, 출력, 캐시 읽기, 캐시 쓰기라는 4가지 항목으로 나누어 집계했습니다.
제 3개월(6월 25일 ~ 9월 25일) 동안의 결과입니다.
- 캐시 읽기: 34억 2,270만 토큰
- 캐시 기록: 2억 6,190만 토큰
- 1,620만 토큰
- 40만 토큰
총합은 약 37억 토큰입니다. 입력 측면(캐시 포함)은 출력을 약 226배로 하며, 입력의 93%는 캐시 읽기였습니다. 표의 전제는 “입력 3: 출력 1, 캐시 할인 없음”이므로, 본질적으로 형태가 완전히 다릅니다.
같은 37억 토큰을 모델별 고정 가격으로 지불하면
이 모델로 37억 토큰을 전부 처리한 것으로 정가를 기준으로 다시 계산했으며 (실제 지불은 구독 기반이므로, 여기의 금액은 가상의 숫자입니다).
- 오퍼스 5.5: 2,321달러 (1백만 토큰당 0.627달러, 총 8달러)
- 오퍼스 5: 3,757달러 (동일 1.015, 표기 금액은 10달러)
- 소네트 5: 1,503 달러 (이전 0.406 달러, 표는 4 달러)
- 하이기 4.5: 751달러 (동 0.203, 표는 2달러)
단가는 Anthropic의 공개 가격입니다. Opus 5.5의 경우 입력은 $4, 출력을 $20, 캐시 쓰기는 $5, 캐시 읽기는 $0.20입니다. 다른 모델의 경우 캐시 읽기는 입력을 10%, 쓰기는 1.25배로 계산합니다.
어떤 모델도 자신의 사용 방식에서는 표의 10분의 1 정도 수준에 머물렀으며, 비교해 보면 차이의 폭이 큽니다.
- 표의 가격: Opus 5.5는 Sonnet 5의 2배입니다.
- 저의 사용량은 Opus 5.5의 1.54배입니다.
- 표의 가격: 오페스 5.5는 오페스 5의 0.8배이다.
- 저의 사용법: Opus 5.5는 Opus 5의 0.62배입니다.
이는 Opus 5.5에서만 캐시 읽기 비율이 입력의 20분의 1(0.20)까지 감소했기 때문입니다. 제 입력의 93%가 캐시 읽기로 구성되어 있어, 이 부분이 영향을 미칩니다. 표의 “입력 3: 출력 1”에서는 캐시가 계산에 포함되지 않아 이 차이가 보이지 않습니다.
저의 실제 모델 배분
덧붙여, 3개월 동안 실제로 어떤 모델에 얼마가 유입되었는지(정가 환산)도 제시했습니다.
- 오퍼스 5: 55.6%
- 소네트 5: 25.0%
- 오퍼스 4.8: 8.4%
- 하이기 4.5: 5.2%
- 소네트 4.6: 4.1%
- 오퍼스 5.5: 1.7%
오퍼스 5.5는 아직 2일밖에 지나지 않아 결과가 적은 편입니다. 9월 23일 밤 이후로만 한정하면 오퍼스 5.5는 57.5%, 오퍼스 5는 38.7%였습니다. 오퍼스 5의 경우에는 모두 9월 23일 22시 이후까지로 제한했고, 이후에는 0회였습니다. `opus` 지정이 자동으로 새로운 모델로 전환된 것뿐, 설정을 변경할 필요가 없었습니다.
표를 어떻게 사용하는가 (이하 본 텍스트는 해석에 기반합니다).
실측은 여기까지이며, 아래는 제 나름대로의 해석입니다.
- 표에 제시된 가격은 채팅을 통해 1회씩 질문하는 방식의 참고용입니다. Claude Code와 같이 동일한 전제 사항을 수백 번 반복적으로 읽어주는 에이전트 용도에서는 캐시 읽기 단가의 가중치가 더 효과적입니다.
- 손네트 5 → Qwen3.8-Flash-Next는 표면에서의 성능은 압도적이지만, 자신의 용도에서는 아직 비교하기 어렵다. Qwen 측의 캐시 단가가 표에 포함되지 않은 점과 Claude Code를 전체 패키지로 교체하는 데 추가적인 노력이 필요하기 때문이다.
- 오퍼스 5.5와 소네트 5의 차이는 사용 방식에 따라 평가표가 펼쳐지지 않는 정도와 관련이 있습니다. 점수 57.6과 38.2의 차이에 대해 1.54배를 지불할 가치가 있는지 판단하는 것이 합리적일 것 같습니다.
이번 주말에 츠키시마 료가 진행하는 ‘가쿠보 료’의 ‘사무라이의 숲’ 북토크에 참여하게 되어 매우 기쁩니다. 츠키시마 료는 ‘사무라이의 숲’을 통해 일본의 전통적인 사무라이 문화와 자연의 아름다움을 깊이 있게 탐구한 작품을 선보였기에, 그의 해설을 직접 듣는 것은 매우 특별한 경험이 될 것이라고 생각합니다.
특히, 이번 북토크에서는 ‘사무라이의 숲’에 등장하는 다양한 인물들의 삶과 그들이 겪었던 갈등, 그리고 작품 전체를 관통하는 주제에 대해 심도 있게 논의될 예정입니다. 츠키시마 료는 그의 풍부한 지식과 경험을 바탕으로 독자들에게 ‘사무라이의 숲’에 대한 새로운 시각을 제시해 줄 것이라고 기대합니다.
또한, 북토크 후에는 츠키시마 료와 함께 ‘사무라이의 숲’을 읽고 느낀 점을 공유하는 시간을 가질 수 있도록 준비되어 있습니다. 많은 관심과 참여 부탁드립니다.
- 예산별 최강 LLM” 표는 8만 엔 이상이면 Opus 5.5가 가장 상위에 위치한다 (2024년 9월 24일 기준).
- 표의 가격은 입력 3: 출력 1, 캐시 할인이 없는 조건 하에 작성되었으며, 본인의 Claude Code는 입력의 226배이고, 입력의 93%는 캐시 읽기 방식이었습니다.
- 그 결과, 제 사용 방식으로는 모든 모델이 표의 10분의 1 정도 수준으로 감소했고, Opus 5.5와 Sonnet 5 간의 차이는 2배에서 1.54배로 축소되었습니다.
- 외부 비교표는 자신의 토큰 형태에 맞게 변환한 후 읽으면 판단이 달라집니다.
위 스크립트를 실행하면 자신의 입력과 출력 비율이 즉시 나타납니다. 표를 보시기 전에 먼저 그것을 확인해 보세요.
검증 환경: MacBook (Apple M4 / 메모리 16GB), Claude Code 2.1.281, 2026년 9월 25일 오전 시점. 대상은 `~/.claude/projects/` 이하의 모든 JSONL (서브 에이전트 로그 포함), 6월 25일 ~ 9월 25일 동안 약 3만 3,300회 응답. 표의 데이터는 2026년 9월 24일 13시 33분 (UTC) 획득 분. 표의 “선 위”는 점수 30 이상 및 모든 변형을 대상으로 직접 재계산한 결과입니다.
입력의 90% 이상이 캐시 읽어오기라는 점은 컨텍스트의 크기가 그대로 요금으로 반영된다는 의미입니다. 긴 작업에서 요금이 폭등하는 “컨텍스트의 벽”과 그 구분 방법을 모아 정리했습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 27청크
원문 보기 | 출처: note.com