입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러입니다. Claude Haiku 5.5와 GPT-6 Luna는 두 모델 모두 입력 10만 토큰 이하에서는 표준 API 기본 단가가 동일합니다.
그러면 둘 다 사용해도 결과가 같은 것일까요?
공개 자료를 비교해 보면, 자료 제작, 코드 수정, 답변을 기다리는 시간, 긴 자료를 전달했을 때의 요금에 차이가 있습니다. 동일한 모델이라도 “얼마나 깊이 생각하게 할 것인가”에 따라 성적과 비용이 달라집니다.
이 글에서는 공식 사양과 제3자의 공개 평가를 활용하여 맡기고 싶은 업무, 기대할 수 있는 시간, 입력 길이를 기준으로 선택하는 방법을 정리합니다. 공식 발표, 독립적인 평가, 요금 기반 계산 예시, 그리고 이를 바탕으로 한 논의를 분리하여 읽을 수 있도록 구성했습니다.
정보 확인일은 2026년 10월 8일입니다. Haiku 5.5는 10월 7일 발표 자료를 참조하며, 요금, 제공 조건, 평가 순위는 업데이트되므로 도입 시 각 항목 링크를 함께 확인해 주시기 바랍니다.
영상판
영상판에서는 중국 토끼와 즈다몬이 움직이는 그림으로 설명하고 있습니다.
클로이드 하이쿠 5.5와 GPT-6 루나: 같은 단가라도 선택 요인이 달라질 수 있습니다.
먼저 고려해야 할 사항은 긴 맥락과 긴 답변에 대한 별도의 제한입니다.
하이크 5.5의 맥락 전체 용량 제한은 100만 토큰이며, GPT-6 루나는 105만 토큰입니다. 모두 최대 출력은 12만 8천 토큰으로, 텍스트나 이미지를 입력받아 텍스트로 답변하는 모델입니다.
토큰은 문장을 처리할 때의 단위로, 문자 수와 완전히 일치하지 않으며, 동일한 일본어라도 모델마다 세는 방식이 다를 수 있습니다.
여기 중요한 것은 문맥 전체의 틀과 답변의 틀을 합한 것이 전체 틀을 사용하는 것이 아니라는 점입니다. 긴 입력, 대화 기록, 출력 등은 전체 틀을 활용합니다. “100만 토큰의 자료를 넣고, 추가하여 12만 8천 토큰을 출력할 수 있다”와 같이 읽을 수 없습니다.
그림: 문맥 전체와 최대 출력은 별도의 제한 사항입니다. 입력과 출력을 독립적인 추가 요소로 간주하지 않습니다. 출처: Anthropic “Haiku 5.5 Overview”, OpenAI “GPT-6 Luna Model”
두 모델의 표준 추론 설정은 미디엄입니다. 추론 설정은 답을 도출하는 데 필요한 심도 수준을 조절하는 것입니다. 동일한 이름의 설정이라도 두 회사의 계산량이 동일하다는 보장은 없습니다.
API를 사용하는 경우 모델 이름은 Haiku의 경우 claude-haiku-5-5, Luna의 경우 gpt-6-luna입니다. 이 기사의 요금은 API의 Standard 조건을 다루며, Claude Code나 Codex와 같은 월간 요금제에 금액이나 이용 가능량을 그대로 환산할 수 없습니다.
자료 제작을 중시한다면 하이쿠의 공개 평점이 힌트가 될 수 있습니다.
문서, 슬라이드, 여러 자료를 다루는 업무에서는 인공 분석이 실시한 평가를 Anthropic의 자료로 확인할 수 있습니다.
직업 관련 GDPval-AA v2.1은 Haiku가 1620, Luna가 1437입니다. 다중 자료를 활용하는 긴 작업을 다루는 AA-Briefcase v1.1은 Haiku가 1578, Luna가 1336였습니다. 이 비교에서 Haiku가 우세합니다.
이 숫자는 Elo라는 성과를 비교하는 데 사용되는 평가 점수입니다. 1620은 “1620문 정답”이거나 “1620%의 성공률”이 아니며, 다른 평가 기준의 Elo를 동일한 눈금을 사용하여 직접 비교하는 것 또한 아닙니다. 막대의 길이 또는 점수의 비율로부터 “능력이 몇 배”라고 해석할 수도 없습니다.
그림: Haiku는 최대 추론 설정에서 나타나는 값이며, 표준 설정 값도 함께 확인한다. 출처: Anthropic “Claude Haiku 5.5 System Card” p.131, Haiku 5.5 발표. 평가 주체는 Artificial Analysis이다.
하가구를 표준 미디어에 설정하면 동일한 두 평가가 1277과 1372입니다. 최대 설정인 1620·1578을 표준 설정의 능력으로 소개하는 것은 부적절합니다.
이 결과에서 도출할 수 있는 시사점으로는 기획서, 분석 자료, 여러 문서를 기반으로 한 결과물을 중시한다면 Haiku를 후보로 고려할 수 있습니다. 다만, 최고 설정의 성능을 추구한다면 해당 설정에 따른 대기 시간과 비용을 함께 확인해야 합니다.
코드가 유끼를 작업의 종류에 따라 읽는다
코드 관련 평가에는 다른 유형의 업무가 포함되어 있습니다. 복잡한 명령어 작업을 수행하고 레포지토리에 수정 사항을 적용하는 것은 동일한 능력이라고 보기 어렵습니다.
Anthropic의 시스템 카드에서는 Terminal-Bench 4.0이 Haiku 39.2%, Luna 16.4%를 나타냈습니다. 리포지토리 수정 작업을 다루는 FrontierCode 1.1 Main은 46.4%, 42.4%를 기록했습니다.
Terminal-Bench의 수치에는 주의가 필요합니다. Haiku는 Claude Code, Luna는 Codex CLI를 사용한 결과로 작업 진행 소프트가 다릅니다. 이 차이를 모델 단체의 차이로 보거나 “코드 작업은 전부 Haiku가 약 2배”라고 일반화할 수 없습니다.
화면 조작 OSWorld 2.1에서는 Haiku가 72.4%, Luna가 48.9%였습니다. 이는 동일한 82건의 오프라인 과제를 사용한 부분 점수를 포함한 평가이며, Haiku의 완전 성공률 37.1%를 고려할 때 “72.4%의 작업이 끝까지 완전히 완료되었다”라는 의미는 아닙니다.
Chartography는 46.4%와 29.1%로 나타났습니다. 여기서 사용된 조건은 어떤 도구나 툴을 사용하지 않은 것입니다. 이미지 편집 도구 등을 활용하여 성과를 섞어 읽지 않았습니다.
그림: 동일한 비율(%)에도 평가 대상이 다를 수 있다. 실행 소프트웨어의 차이, 부분 점수, 도구의 유무를 각 행에서 확인한다. 출처: Anthropic “Claude Haiku 5.5 System Card” p. 111–116, 123–124, 128.
용도에 맞게 분류한다면, 터미널에서 복잡한 작업을 수행하거나, 수정 오류를 만들고, 화면을 조작하며, 그래프에서 값을 추출하는 것을 먼저 구분합니다. 그 위에, 자신이 사용하는 소프트웨어나 도구와 유사한 조건의 평가를 보면서, 비교표를 읽는 실수를 줄일 수 있습니다.
전체 점수가 높더라도 각 항목별 비용은 동일하지 않습니다.
인공 분석(Artificial Analysis)의 지능 지수(Intelligence Index)는 여러 평가를 종합한 지표입니다. 2026년 10월 8일에 확인한 버전 4.3.2에서는 최대 설정의 Haiku가 43, Luna가 38였습니다. 이는 IQ나 성공률의 비율이 아닙니다.
동일한 표의 동일 과제당 평균 API 비용은 Haiku max가 0.21달러, Luna max가 0.07달러였습니다. Haiku 측에서는 성적이 높은 반면, 이 평가의 평균 비용은 3배입니다.
해키를 높이 올리면 지표는 38, 평균 비용은 0.08달러가 됩니다. 루나 맥스의 38·0.07달러에 근접한 조합이지만, 동일한 추론 과정에서 계산량을 비교한 의미는 아닙니다.
그림: 비교 단위는 “모델 + 추론 설정”입니다. 비용은 평가 1개 과제 평균이며, 100만 토큰 단가와는 별도입니다. 출처: Artificial Analysis의 “LLM Leaderboard”, Haiku 5.5 Max, Haiku 5.5 High, GPT-6 Luna Max.
단순히 낮은 기본 단가만으로는 “대량의 일을 저렴하게 맡길 수 있다”라고 결정할 수 없습니다. 얼마나 고민하고, 얼마나 생산성을 내고, 어느 정도 수준의 품질을 필요로 하는지에 따라 건당 비용은 달라집니다.
한편, 0.21달러나 0.07달러를 자신의 청구 금액 예측값으로 그대로 사용하는 것은 불가능합니다. 이는 평가 과제의 평균이기 때문입니다. 자신의 글의 길이, 필요한 답변량, 캐시 이용 조건에 맞춰 조정해야 합니다.
Claude Code와 Codex를 포함하면 선호하는 행이 달라집니다.
개발자에게는 인공 분석 에이전트 인덱스가 도움이 됩니다. 여기에서 사용한 조합은 Claude Code + Haiku 5.5 xhigh와 Codex + GPT-6 Luna max입니다.
종합 지표는 양쪽 모두 41이었습니다. 하지만 세부 내역을 살펴보면 다릅니다.
DeepSWE v1.1 리포지토리 수정 버전에서는 Luna 측이 49%와 64%로 우세했으며, Terminal-Bench 4.0에서는 Haiku 측이 24%와 15%로 우세했습니다. SWE-Atlas-QnA는 Haiku 측이 52%와 44%로 우세했습니다.
그림: Agent Index v1.5의 모델 변형 조합을 보여준다. 모델 단일 간 비교 및 구별을 명시한다. 출처: Artificial Analysis “Claude Code vs Codex: Model Variants”.
한 과제의 평균 API 비용은 Haiku 측에서 0.61달러, Luna 측에서 0.18달러였습니다. 월간 플랜 요금이나 개발에 소요되는 총 비용은 포함되지 않습니다.
같은 Terminal-Bench라는 이름으로도, 앞서 언급한 39.2%와 16.4% 및 여기서 24%와 15%는 공개 평가 조건이 다릅니다. 서로 다른 표에서都合の良い 숫자만 골라 하나의 비교에 포함시키지 않는 것이 중요합니다.
이 결과의 해석은 수정 작업을 진행하고 싶다면 수정된 행을, 코드를 이해하고 싶다면 질문 행을 참조하는 것입니다. “종합 41에서 무승부”라고만 표현하면 실제로 맡기고 싶은 작업의 차이가 사라져 버립니다.
출력이 빠르고 답변이 빠른 것은 또 다른 문제입니다.
두 모델 모두 최대 설정에서 텍스트 출력 속도는 Haiku가 243.4 토큰/초, Luna가 127.9 토큰/초였습니다. 첫 번째 답변 토큰까지 걸린 시간은 415.3초와 108.6초입니다.
따라서 이 측정 조건에서는 하이쿠의 응답 속도가 글이 시작된 이후에는 빠르지만, 첫 번째 답변이 시작될 때까지 상당한 시간을 기다리는 결과를 초래했습니다.
그림은 위쪽은 짧은 대기 시간이 유리하고, 아래쪽은 큰 값이 빠른 출력 속도를 나타낸다. 지표의 방향 또한 다르다. 출처: Artificial Analysis의 “Haiku 5.5 API Provider Benchmarks”, GPT-6 Luna Max, API 측정 방법.
수치는 약 1만 토큰의 입력을 사용한 API 측정 결과이며, 최근 72시간의 중앙값입니다. 첫 번째 답변까지 걸리는 시간에는 생각하는 시간도 포함됩니다. 짧은 질문이나 다른 추론 설정에는 415.3초, 108.6초를 적용할 수 없습니다.
채팅에서 짧은 답변을 빠르게 받기 위해서는 텍스트 출력 속도뿐만 아니라 첫 번째 답변까지 걸리는 시간을 확인합니다. 완성된 결과물을 기다릴 수 있는 업무에서는 품질과 비용을 포함하여 판단합니다. 이 사용 방식은 공개된 값에 기반한 분석입니다.
긴 입력에서는 “동일 단가”의 전제가 달라집니다.
표준 API에서는 Haiku의 경우 입력이 10만 토큰을 초과하면 100만 토큰당 0.50달러, 출력이 2.50달러입니다. Luna의 경우 27만 2천 토큰을 초과하면 입력 0.20달러, 출력이 0.75달러입니다.
중요한 것은 경계 부분에서 발생하는 증가분에 따라 가격이 상승하는 것이 아니라, 전체 요청에 대해 긴 텍스트의 단가가 적용된다는 것입니다. 입력 단가뿐만 아니라 출력 단가도 변동합니다.
그림: Standard, 캐시 없음, 두 모델에서 동일한 과금 토큰 수를 가정한 계산 예시입니다. 실제 측정된 청구 금액이 아닙니다. 출처: Anthropic “Haiku 5.5 Overview”, OpenAI “GPT-6 Luna Model”
입력 5만 토큰 및 출력 5천 토큰 모두 0.0075달러입니다. 기본 단가가 동일하다는 설명은 이 조건에서는 적절합니다.
입력 20만 토큰 및 출력 2만 토큰의 경우, Haiku는 0.15달러, Luna는 0.03달러입니다. Haiku만이 장문의 경계를 넘어서기 때문에, 계산 예시에서는 5배의 차이가 발생합니다.
입력 30만, 출력 2만 토큰 기준으로 Haiku는 0.20달러, Luna는 0.075달러입니다. Luna 역시 장문 요금으로 부과됩니다. Luna의 기본 단가는 영구적으로 유지되지 않습니다.
계산식은 입력 토큰 수 ÷ 100만 × 입력 단가에, 청구되는 출력 토큰 수 ÷ 100만 × 출력 단가를 더한 형태입니다. 생각하는 데 사용된 토큰도 출력 비용의 대상으로 간주합니다.
예시에서는 캐시 할인, 지역 지정, 별도 처리 방식, 툴 요금 등을 포함하지 않았습니다. 동일한 문장이라도 모델에 따라 토큰 수가 달라지므로, 동등한 금액으로 계산한 예시를 실제 동등한 청구와 동일하게 취급하지 마십시오.
긴 자료를 반복적으로 사용하는 업무에서는 캐시 확인도 중요한 포인트가 됩니다. 짧은 입력의 캐시 읽기 단가는 모두 0.01달러/100만 토큰이지만, 쓰기나 긴 문장 시의 조건도 존재합니다. 할인 혜택을 사용하는 경우에는 입력, 출력, 캐시 사용량을 분리하여 표시하고, 공식 적용 조건을 확인해야 합니다.
저의 업무에 적용할 수 있는 세 가지 판단
이 부분을 실제 선택으로 연결하기 위해서는 다음 세 가지를 먼저 결정하면 정리하기가 더 쉽습니다.
필요한 품질을 선택하고, 모델명과 추론 설정, 사용 소프트웨어, 도구 유무까지 확인합니다.
대기 시간입니다. 즉각적인 짧은 답변을 원하는지, 아니면 시간과 노력을 들여 만든 결과물을 원하는지에 따라 구분합니다. 첫 번째 답변까지 소요되는 시간과 일을 시작한 후의 속도를 분리합니다.
입력의 길이와 실제 비용을 확인합니다. 10만, 27만 2천이라는 금액대에 가까운 작업인지 확인하고, API 사용량에 따라 입력, 출력, 캐시를 분리하여 채택하는 요금 조건에 맞게 적용합니다.
그림: 자신의 업무에 공개 평가 및 요금 조건을 적용하기 위한 판단안. 우열을 보증하는 것이 아니다. 근거: Haiku 5.5 시스템 카드, 인공 분석 모델 평가, 개발 에이전트 평가, API 측정 방법, Haiku 사양, Luna 사양.
자료 제작 및 그래프 공개 평가를 중시한다면 Haiku가 후보가 됩니다. 긴 입력에 대한 비용이나 Codex 포함된 수정 평가를 중시한다면 Luna도 후보입니다. 단, 이를 “자료는 전부 Haiku, 코드는 전부 Luna”라는 고정 규칙으로 적용하지 않습니다.
공개 평가는 선택의 근거가 되지만, 맡기는 일의 성공을 보장하지는 않습니다. 특히 화면 조작 부분의 점수, 실행 소프트가 다른 코드 평가, 최대 설정의 대기 시간 등 조건이 달라지면 인식이 달라집니다. 찾을 수 없는 평가 값을 0으로 처리하는 것을 경계합니다.
처음 한 발걸음은 자신의 업무를 “무엇을 완성하고 싶은지”, “얼마나 기다릴 수 있는지”, “입력은 얼마나 있는지” 세 가지로 작성하는 것입니다. 그 조건에 가까운 절의 출처를 열어보면, 종합 순위만 보았을 때보다 선택 이유를 설명하기가 더 쉬워집니다.
이번 영상에서는 이 책에 얽힌 이야기와 제가 이 책을 집필하면서 중요하게 생각했던 사고방식에 대해 이야기하고 싶습니다.
이 책은 제가 대학교 시절에 소속되었던 연구실에서 선배들과 함께 진행했던 연구 프로젝트를 기반으로 합니다. 당시 저는 아직 젊고 연구에 대한 지식과 경험이 부족했으며, 선배들의 지도 아래 조금씩 연구를 진행해 나갔습니다.
이 프로젝트를 통해 연구의 재미와 어려움을 깨달았습니다. 연구는 단순히 지식을 채우는 것뿐만 아니라, 가설을 세우고 검증하고 결과를 분석하여 결론을 이끌어내는 매우 복잡한 과정입니다.
또한, 이 프로젝트를 통해 팀워크의 중요성을 배웠습니다. 연구는 혼자서 할 수 있는 것이 아니며, 선배나 후배, 다른 연구실 사람들과 협력하여 각자의 강점을 활용해야 하나의 목표를 향해 나아갈 수 있습니다.
이 책은 이러한 경험들을 정리한 것입니다. 독자 여러분이 연구의 재미와 어려움을 이해하고, 팀워크의 중요성을 배우는 데 도움이 되기를 바랍니다.
클로이드 하이쿠 5.5와 GPT-6 루나: 같은 단가라도 선택 요인이 달라질 수 있습니다.
사용마공장에서는 AI의 작동 방식과 사용법을 직접 선택하고 검증할 수 있는 형태로 제공하고 있습니다.
제목 이미지는 영상용으로 제작된 AI 생성 일러스트와 텍스트, 채용 로고를 기사 목적에 맞게 조정했습니다. 본문의 삽화는 공개 자료를 기반으로 직접 제작했으며, 그림의 내용은 각 그림 바로 아래 링크로 연결됩니다. 공식 평가, 제3자 평가, 요금 계산 예시, 판단 제안을 구분합니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 61청크
원문 보기 | 출처: note.com