결론|“90% 저렴”은 짧은 프롬프트에 대한 이야기입니다. 2026년 10월 7일에 공개된 Claude Haiku 5.5는 “Haiku 4.5보다 90% 저렴”하다는 보고가 있습니다. 하지만 이는 10만 토큰 이하의 프롬프트에 한정된 숫자입니다.
* 10만 토큰 이하: 입력 0.10달러/출력 0.50달러 (100만 토큰 기준)
* 10만 토큰 초과: 입력 0.50달러/출력 2.50달러 (100만 토큰 기준)
* 10만 토큰 초과의 감축률은 약 50%
* Anthropic은 업무 전체 평균으로 약 75%의 감축을 산정했으며, “항상 90% 저렴해진다”고 가정하여 예산을 책정하면 오차가 발생할 수 있습니다.
요금의 전체 구성은 2단계로 나뉩니다(100만 토큰 기준). 10만 토큰 미만 시 일반 입력은 $0.10, 출력은 $0.50, 캐시 읽기는 $0.01, 캐시 쓰기(5분)는 $0.125, 캐시 쓰기(1시간)는 $0.20입니다. 10만 토큰 초과 시 일반 입력은 $0.50, 출력은 $2.50, 캐시 읽기는 $0.05, 캐시 쓰기(5분)는 $0.625, 캐시 쓰기(1시간)는 $1.00입니다. 모든 항목은 상위 단계가 하위 단계의 5배이며, 임계값을 초과하면 전체 요청의 단가가 높아집니다.
“90%”와 “50%”의 두 숫자가 나오는 이유는 Haiku 4.5는 입력 1달러, 출력 5달러였기 때문입니다. 비교하면 다음과 같습니다.
* 짧은 프롬프트: 1달러 → 0.10달러 (90% 감소)
* 긴 프롬프트: 1달러 → 0.50달러 (50% 감소)
또한, 약 75%라는 평균값은 토큰 소비량 변화까지 포함한 추정치입니다. 이 세 숫자는 다른 조건을 비교한 결과입니다.
쉽게 놓치기 쉬운 함정 3가지 1. 100만 토큰의 맥락에서도 가장 저렴한 가격은 10만 토큰까지 Haiku 5.5는 100만 토큰의 맥락을 처리할 수 있습니다. 하지만 가장 저렴한 단가가 적용되는 것은 그 중 10만 토큰까지입니다. 긴 텍스트를 전체적으로 읽게 하는 방식으로 사용하면 높은 단가의 비용이 발생합니다. 2. 새로운 토크나이저로, 같은 문장이 약 30% 증가하는 Haiku 5.5는 Claude 4.7 이후와 동일한 새로운 토크나이저를 사용합니다. 같은 문장이라도 Haiku 4.5보다 약 30% 더 많은 토큰을 소비합니다. 단가가 낮아지더라도 토큰 수가 증가하는 만큼 감축 효과는 작아집니다. 구형 모델의 토큰 수를 사용한 추정은 반드시 재검토해야 합니다. 3. 에이전트는 중간에 임계값을 초과하는 대화 기록, 도구 실행 결과, 스크린샷 등이 누적되면 프롬프트가 조금씩 길어집니다. 처음에는 저렴하더라도 중간에 10만 토큰을 초과하여 단가가 5배로 증가할 수 있습니다. 장시간 작동하는 에이전트는 기록 압축이나 분할을 통해 10만 토큰 이내로 줄이는 설계가 효과적입니다.
그러게, 얼마 전에 친구가 “요즘 읽은 책 중에 재미있는 거 있어?”라고 물어봤길래, “『汝、王の定め』”를 읽었다고 대답했어.
친구가 “어, 그거 재미있겠다! 무슨 내용이야?”라며 흥미로운 표정으로 물어봤길래, 간단하게 줄거리를 설명했는데, 솔직히 아직 완전히 이해하지 못한 부분도 많더라.
이야기는 어느 나라의 공자가 자신의 운명을 벗어나기 위해 고군분투하는 판타지 소설이야. 주인공인 카이는 자신이 왕이 될 운명이라는 것을 알게 된 후, 그 운명을 피하려고 여러 가지 방법을 시도해. 하지만 그 과정에서 그는 많은 어려움에 직면하고, 다양한 사람들을 만나지.
특히 카이의 동료인 신비로운 여성 캐릭터가 인상적이었어. 그녀는 카이에게 조언을 해주고, 그를 인도해 가지만, 그녀의 목적은 항상 불투명하고, 카이를 혼란스럽게 해.
이 책은 단순한 판타지 소설이 아니라, 인간의 운명, 자유의지, 그리고 선택에 대해 깊이 생각하게 만드는 작품이었어. 읽고 나니 잠시 동안 자신의 삶에 대해 깊이 생각하는 시간이 필요했어.
그리고 이 책을 읽고, 다시 한번 어떻게 자신의 인생을 살아갈지 고민하게 되었어.
실제 비용 계산(GPT-6 Luna와 비교) 비교 대상인 GPT-6 Luna는 짧은 프롬프트에서는 동일하게 $0.10/단가, $0.50/단가입니다. 다만 Luna의 저렴한 단가는 입력 27.2만 토큰까지 적용됩니다. 아래는 Kingy AI의 추산에 따른 1 요청당 토큰 요금입니다.
* 입력 1만 토큰 + 출력 2천 토큰
* Haiku 5.5: 약 $0.002/토큰, Luna: 약 $0.002/토큰 (동일)
* 입력 15만 토큰 + 출력 1만 토큰
* Haiku 5.5: 약 $0.100/토큰, Luna: 약 $0.020/토큰
* 입력 40만 토큰 + 출력 1만 토큰
* Haiku 5.5: 약 $0.225/토큰, Luna: 약 $0.0875/토큰
짧은 입력을 대량으로 처리하는 경우에는 동가격으로 벤치마크 성능이 높은 Haiku 5.5가 유리합니다. 긴 입력을 많이 사용하는 용도에서는 Luna가 더 경제적일 수 있습니다.
더 저렴하게 비용을 줄이는 3가지 방법 – 캐시를 사용한 공통 프롬프트 부분은 캐시를 사용하면 읽기는 $0.01로, 일반적으로 입력의 1/10입니다. 예를 들어, 캐시 읽기 8만 건 + 신규 입력 1만 건 + 출력 2천 토큰이라면 약 $0.0028의 비용이 발생합니다. 다만 첫 번째 작성은 비용이 많이 나가므로 재사용 가능성이 있다면 적합합니다. Batch API를 사용한 비동기 처리는 Batch API에서 입력과 출력을 모두 50% 할인받을 수 있으며, 대량의 분류나 요약에 적합합니다. Haiku 5.5는 노력을 5단계(low/medium/high/xhigh/max)로 조정할 수 있으며, 코딩 평가 시 medium 한 번당 비용이 약 $0.13, max는 약 $1.33으로, 점수 차이가 약 5점입니다. 품질 기준을 충족하는 최소 노력을 선택하는 것이 유리합니다.
진정으로 살펴봐야 할 지표는 “채용 1건당 비용” 단가뿐만이 아닙니다. 실패로 인해 다시 작업한 분량, 상위 모델로 전환한 분량, 인간이 확인하는 시간까지 포함하여 고려해야 합니다. 실패 분량까지 포함한 총 비용을 채용 성공 건수대로 나눈 것이죠. 예를 들어, Haiku로 처리하고 확인 과정에서 거절된 10%만 상위 모델로 전환하는 경우를 생각해 봅시다. 앞서 언급한 1만 입력, 2천 출력의 예시에서 상위 모델의 GPT-6.1 Sol이 약 $0.040라고 가정해 보겠습니다. 10%를 전환하는 경우, 1건당 약 $0.006입니다. 50%를 전환하면 약 $0.022까지 상승합니다. 확인 메커니즘이 약하다면, 저렴해 보이는 효과는 사라집니다. “90% 저렴하다”는 짧은 프롬프트를 전제로 하는 숫자입니다. 시작 전에 다음 3가지 사항을 확인해야 합니다. 1. 자사의 프롬프트가 10만 토큰 이하로 수렴되는지 확인합니다. 2. 토큰이 약 30% 증가하는 영향을 견적에 포함하는지 확인합니다. 3. 실패나 재실행을 포함한 채용 1건당 비용으로 비교하는지 확인합니다. 먼저 자사의 실제 데이터 수십 건으로 Haiku 5.5와 Luna를 동일 조건에서 테스트하는 것을 추천합니다.
클로이드 하이쿠 5.5 #클로이드 #API 요금 #생성 AI #비용 절감 #LLM #AI 활용
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 9청크
원문 보기 | 출처: note.com