# Haiku 5.5の料金と性能を読む：10万tokenの境界と7種類の公式試験

> https://bookfactory.kr/board/news/20467
> 게시판: 뉴스
> 작성자: admin
> 작성일: 2026-10-09T23:15:28.571Z

---

Claude Haiku 5.5が2026年10月7日に発表されました。この記事では、10月8日に確認した公式情報をもとに、使える場所、API料金、契約特典、7種類の性能試験を順に整理します。安価という見出しだけで選ぶよりも、自分の入力の長さと必要な仕事を重ねて読む方が、利用判断につながります。

ビィとめたんの図解付き本編はこちらです。

本編動画を見る

この記事では公式資料の解説に加え、Haiku 5.5の実APIへ架空の会議メモ4種類を計6回送り、事前条件への適合を確認しました。性能表は発表者や評価機関の測定値で、今回の小試験とは分けて記載します。公式7試験の再実行、他モデルとの品質・速度比較、Claude.aiの個別利用画面や実請求額の確認は行っていません。料金の計算例・単価推計を、請求済み金額としては扱いません。

## まず、自分が使う場所を分ける

Haiku 5.5は、クラウド上のClaudeを使うモデルです。MacやPCに重みをダウンロードして動かすローカルモデルの案内ではありません。Claudeのチャットから選ぶ場合と、開発したプログラムからAPIを呼ぶ場合では、利用枠と料金の確認先が異なります。

公式の提供案内には、Claude.aiのFree・Pro・Max・Team・EnterpriseでHaiku 5.5を選択できると記載されています。ただし、特定のアカウントにいつ表示されるか、利用上限がどう適用されるかまでこの記事で確認したわけではありません。まず自分のチャット画面のモデル一覧とプランを確認してください。

APIの正式なモデルIDは claude-haiku-5-5。仕様上は最大100万tokenのコンテキスト、通常の最大出力12万8000token、テキスト・画像の入力とテキスト出力に対応します。コンテキストの容量と、次に説明する料金の境界は別です。

資料：Anthropic：Haikuの提供案内、Claude API：Haiku 5.5の仕様

![画像](https://assets.st-note.com/img/1791420309-z69X2qxQVPkKyUicGgR0JAL5.png?width=1200)

最大100万tokenのコンテキストは、安い方の料金を100万tokenまで使えるという意味ではありません。図は基本料金で、実請求の測定ではありません。

資料：Claude API：Haiku 5.5の仕様・料金、Claude API：料金表

## API料金は、100万tokenまで同じではない

基本料金は100万tokenあたりの米ドル表示です。入力と出力をそれぞれ数えます。

プロンプトが10万token以下：入力0.10ドル、出力0.50ドル。

プロンプトが10万tokenを超える：入力0.50ドル、出力2.50ドル。

両方とも5倍の単価差があります。「100万tokenまで入る」という仕様から、「100万tokenまで安い方の単価」とは読めません。10万ちょうどと、10万を超える入力を分けて確認する必要があります。

入力は、目に見える質問文だけで決まりません。システム指示、会話履歴、ツール定義、画像なども関係します。キャッシュ利用時の使用量は、新規入力・キャッシュ作成・キャッシュ読取に分かれるため、新規入力のカウンターだけを見て判断しないでください。出力のtoken数を入力の10万token境界へ足すこともありません。

キャッシュは別単価です。5分キャッシュの書込は、短い入力の帯で0.125ドル、長い入力の帯で0.625ドル。1時間の書込は0.20ドルと1.00ドル、読取は0.01ドルと0.05ドルです。これらも100万tokenあたりで、キャッシュが毎回命中するという保証ではありません。

たとえば、短い入力の帯で「課金対象の入力1000token、課金対象の出力200token」と仮定すると、基本料金の計算は次の通りです。

入力：1000÷100万×0.10＝0.0001ドル。

出力：200÷100万×0.50＝0.0001ドル。

合計：0.0002ドル。

これはキャッシュやツール等の追加料金を含めない概算です。また、200tokenは表示された回答だけではなく、課金対象の思考tokenも含む想定です。実際の長さや請求額を測った例ではありません。長い資料を渡す用途では、同じ文章でもtoken数が変わる可能性があるため、実際の使用量と料金表を確認します。

資料：Claude API：Haiku 5.5の仕様・料金、Claude API：料金表、Claude API：コンテキストの数え方、Claude API：プロンプトキャッシュ

![画像](https://assets.st-note.com/img/1791420377-CI6Ptg4mZkTVYW3QeXndhcuM.png?width=1200)

チャットでモデルを選べる条件とAPI特典の対象は異なります。Teamは席ごとの額を組織でまとめ、月500ドルが上限です。

자료: 앤트로픽: 하이쿠 제공 안내, 클로드 API: 계약자 대상 API 크레딧

## 채팅 이용 여부와 API 혜택은 별도입니다.

하이크 5.5를 채팅으로 선택할 수 있는 것과 API 크레딧 혜택을 받을 수 있는 것은 동일한 조건이 아닙니다. 공식 안내에 따른 월간 API 크레딧 한도는 최대 5배 100달러, 최대 20배 200달러입니다. 팀 요금은 Standard 20달러, Premium 100달러이며, 조직 단위로 묶어 월 500달러로 제한됩니다. 이 금액은 계약의 월별 이용 요금이 아닌, 혜택 크레딧 금액입니다.

대상은 유효하며 결제 상태가 정상인 Max·Team 등 지정 조건에 부합하는 계약입니다. Free·Pro·Enterprise는 본 혜택의 대상이 아닙니다. 신규 계약자의 7일 대기, Console 조직과의 연동, 조작 가능한 역할, 프로그램 규약 등도 확인이 필요합니다.

크레딧 대상에는 콘솔 API, 에이전트 SDK, 플레이그라운드 등이 포함됩니다. 반면, Claude Code, 채팅 앱 추가 이용, 제3자 클라우드를 통한 청구는 별도입니다. 미사용 크레딧 잔액은 이월되지 않으며, 혜택이 소진된 후의 구매 잔액 및 자동 재충전 설정도 관련됩니다. “대상 계약이기 때문에 무엇을 하든 추가 요금이 발생하지 않는다”라고 단정할 수 없습니다.

자신이 사용할 경우, 계약명뿐만 아니라 콘솔의 대상 조직, 잔액, 사용 제한, 자동 재충전 상태를 확인하는 순서가 유용합니다.

데이터: 클로드 API: 계약자 대상 API 크레딧 조건

## 기존 API 코드는 모델 이름만으로 교체하지 마십시오.

이동 자료에서는 동일한 내용이라도 Haiku 4.5보다 토큰 수가 약 30% 증가하는 경우가 있을 수 있습니다. 내용에 따라 달라지므로, 모든 요청이 반드시 30% 증가하는 것은 아니며, 요금 및 출력 상한은 문자 수에 따른 추정치를 재검토해야 합니다.

Haiku 5.5는 적응적 사고를 기본으로 하며, 노력의 기본 값은 중간입니다. 이전의 budget_tokens 지정이나 표준 외 샘플링 값은 오류가 발생하는 조건입니다. 또한, 답변의 첫 번째 블록이 반드시 텍스트로만 구성되지 않을 수 있습니다. 사고 처리 방식, 블록 종류, 종료 이유를 확인한 후 처리 방식을 변경합니다.

다음 성능 시험의 대부분은 max라는 추론 설정입니다. API를 기본값인 medium으로 호출했을 때, 표의 결과가 그대로 나타나지 않을 수 있습니다.

데이터: 클로드 API: Haiku 5.5로의 전환

![画像](https://assets.st-note.com/img/1791420378-Y1ksldKvzf4PnaUg7FewcIOp.png?width=1200)

Elo는 비율이나 만점 기준의 점수와 같지 않습니다. OSWorld의 부분 점수나 FrontierCode의 품질 점수는 단순한 완전 합격률과 다릅니다.

Anthropic: Haiku 5.5 발표, Anthropic: Haiku 5.5 시스템 카드

## 가상 회의 메모를 실제 API로 6회 시도함

공식의 성능 표만으로는 자신의 문장으로부터 필요한 정보를 추출할 수 있는지 알 수 없습니다. 이에, 츠미마쿠工房에서는 가상 회의 메모 4종류를 Haiku 5.5로 보내고, 원본 메모와 미적용 제안 메모를 각각 한 번씩 시도했습니다. 조건은 변경하지 않고 총 6건으로 중단했습니다.

설정은 Claude API의 적응형, 노력을 중간, 출력 제한을 1,500 토큰으로 설정했습니다. 자료에 없는 담당자와 날짜를 보완하지 않고, 결정, 작업, 제안, 미결 사항, 근거를 JSON에 분할하도록 실행 전에 조건을 정했습니다. 개인 정보나 실제 업무 메모는 전송하지 않았습니다.

원래 입력은 다음 짧은 가상 메모입니다.

첫 번째 시도의 실제 결과입니다. 표시를 위해 JSON을 들여 쓰긴 했지만, 문자열, 값, 따옴표는 변경하지 않았습니다.

“비이”, “금요일까지”, “공개일은 미정”이라는 정보를 그대로 남겨두었습니다. “금요일”을 구체적인 날짜로 변경하지 않았습니다. 동일한 메모를 다시 발송하려는 시도 역시 사전에 설정된 조건을 충족했습니다.

다만, JSON 형식으로 정확하게 반환하고 정보 누락이 없다는 점은 별개의 문제였습니다. 6건 모두 HTTP 200 응답을 받았고, end_turn 완료 후 JSON 형식으로 문제 없이 읽을 수 있었습니다. 반면, 8개 항목의 사전 조건을 모두 만족한 시도는 3건이었습니다.

사용마법사 공방의 제한 API 시험: 4종의 가상 메모, 6회 시도, 적응형/중급, 2026년 10월 8일. 전 조건 달성은 사전에 제시된 8개 항목에 따른 평가입니다. 공식 7가지 시험이나 다른 모델과의 비교는 포함되지 않습니다.

사양: 메시지 API, 중단 사유. 출처: 카미마구 공장의 API 응답 및 사전 조건에 따른 평가.

다음 입력에서는 “담당자 및 마감일이 아직 결정되지 않았습니다.”과 작성했습니다.

실출량에서 tasks와 undecided만 추출하면 다음과 같습니다.

담당과 기한을 누락한 점은 타당합니다. 사전에 제시된 평가 기준에서는 미결정된 담당 및 기한도 목록에 포함해 달라는 요청이었으나, 목록에는 공개일 외에는 아무것도 없었습니다. 다만, 실제로 제출한 시스템 문구에는 담당 및 기한을 미결정으로도 명시하지 않았습니다. 평가 기준과 요청 사항 간의 차이점을 고려할 때, 이 누락을 모델 자체의 능력 부족으로 단정할 수 없습니다. “정보를 무리하게 채우지 않아야 한다”는 점을 고려할 뿐만 아니라, 목록에 포함해야 할 미결정 항목을 요청 사항에서 명확히 하는 여지도 있습니다.

다른 입력에서는 영상 제작 제안을 채택하지 않음을 명시했습니다. 첫 번째 답변에서는 영상 제안이 제시되었으나, 미채택이라는 조건이 답변과 근거 인용에서 삭제되었습니다. 재시도에서는 미채택된 인용을 남겼지만, 미정인 담당 및 기한 목록이 누락되었습니다.

실행 순서: 1회차 / 입력: 원본 메모 1회차 / 사전 점검 조건 완전 달성: O / 확인 내용: 모든 조건 충족

실행 순: 2회차 / 입력: 미승인 제안 (1회차) / 사전 점검 조건 완전 달성: × / 확인 결과: 미승인 조건이 답변 및 인용에서 소실됨

실행 순: 3회차 / 입력: 담당자와 기한이 미정 / 사전 점검 조건 완전 달성: × / 확인 내용: 미결정 목록에서 담당자와 기한이 누락

실행 순: 4회차 / 입력: 인용문 및 자료 내 지시 / 사전 점검 조건 완전 달성: O / 확인 내용: 모든 조건 충족

실행 순: 5회차 / 입력: 원본 메모 2회차 / 사전 점검 조건 완전 달성: O / 확인 내용: 전 조건 충족

실행 순: 6회차 / 입력: 미승인 제안 2회차 / 사전 점검 조건 완전 달성: 미달성 / 확인 내용: 미결정 목록에서 담당 및 기한 누락

採点は実行前の条件に従い、機械検査とCodexによる原入力・実回答の照合で行いました。言い換えや項目の順序は認め、実行後に正解を書き換えていません。小さな試験の結果を「日本語性能は半分」などへ広げることはできません。

6건의 실반환 사용량 합계는 입력 3,605 토큰, 출력 4,544 토큰이었습니다. 출력 중 ‘생각’은 3,289 토큰으로, 이는 출력의 내부 수치입니다. 캐시 생성 및 읽기 카운터는 6건 모두 실응답에 명시된 0이었습니다.

이 짧은 입력 및 캐시 없는 6건에 대해, 공개 기본 단가로 입력 100만 토큰당 0.10달러, 출력이 0.50달러로 계산하면 총 0.0026325달러로 추정됩니다. 실제 청구서나 잔액 감소는 확인되지 않았습니다. 10만 토큰 초과 요금대, 캐시 할인, 무료 혜택 적용을 검증한 시험이 아닙니다. Claude API 요금표

대기 시간은 HTTP 전송 직후 응답 본문 수신 완료까지의 클라이언트 측 왕복 시간입니다. 6개 항목의 경우 3.1265초에서 4.2696초 사이이며, 중앙값은 3.4827초였습니다. 통신 및 서버 처리 포함된 값으로, 생성 토큰/초 또는 다른 모델보다 빠르다는 비교는 아닙니다.

자신이 직접 테스트할 때는 짧은 긍정 사례뿐만 아니라, 담당자가 작성하지 않은 사례, 거절된 제안, 날짜를 수정하지 말아야 할 상대 기한도 포함하면 놓치기 쉬운 조건을 확인하실 수 있습니다. API로부터 완료된 답변을 받아도 그대로 일정표나 업무 데이터에 등록하기 전에 이러한 조건을 확인하는 설계를 구축해야 합니다.

여기에서 측정한 것은 이 입력과 설정에서의 6회 시도만을 의미합니다. 공식 7회 시험은 재실행하지 않았으며, 다른 모델과의 비교도 수행하지 않았습니다. 6건을 기준으로 일본어 전반의 성능이나 업무 성공률을 추정할 수 없습니다. 입력, 프롬프트, 실행 시점에 따라 답변은 달라집니다.

사양: 메시지 API, 중단 사유, Haiku 5.5 마이그레이션 가이드. 위에 제시된 출력, 사용량, 시간은 카이무공작소의 제한 API 시험에서 획득한 것입니다.

![画像](https://assets.st-note.com/img/1791426406-7RxygfBNX5A8cQbLDquYHzJP.png?width=1200)

## 7가지 유형의 시험은 동일한 점수로 치지 않는다.

여기서는 발표에서 제시된 7가지 공식 성능 시험을 살펴보겠습니다. HLE는 도구 사용 여부에 따라 2가지 항목이 있으므로, 비교표는 총 8행이 됩니다. 비교값은 발표 시점의 표를 그대로 사용하며, 이후 업데이트된 순위 숫자는 포함하지 않습니다. “—”는 값이 기재되지 않았음을 의미하며, 0점은 아닙니다.

시스템 카드의 일반 조건은 특기 사항이 없는 경우 적응적 사고, 최대 노력, 표준 샘플링, 5회 시행 평균입니다. 다만, 외부 기관의 독립 측정이나 시험 고유의 예외를 우선합니다. 이하에서는 측정 주체, 도구 유무, 시행 횟수, 추론 설정의 차이를 개별적으로 기재합니다.

데이터: Anthropic: Haiku 5.5 발표 및 비교표, Anthropic: Haiku 5.5 시스템 카드

![画像](https://assets.st-note.com/img/1791420379-vRf4Jsnhu8CmcWrqzGyNTA9X.png?width=1200)

발표 표는 max 값으로, Haiku 5.5의 기본 medium 값과 다릅니다. 각 평가는 Artificial Analysis를 독립적으로 실행합니다.

데이터: Anthropic: Haiku 5.5 발표, Anthropic: Haiku 5.5 시스템 카드, 인공 분석: GDPval-AA, 인공 분석: AA-브리프케이스

## 1．GDPval-AA v2.1：업무 결과물을 비교한다

44직종·9산업, 220과제를 활용하여 자료 및 표와 같은 업무 결과물을 제작하는 능력을 평가합니다. 답변을 짧은 정답 문자열과 비교하는 시험이 아닌, 결과물을 익명 집합으로 구성하여 품질을 비교하는 방식입니다. 인공 분석이 독립적으로 측정합니다.

발표된 Elo 값은 Haiku 5.5가 1620, Haiku 4.5가 735, GPT-6 Luna가 1437, Sonnet 5.5가 1840입니다. Elo는 상대 평가이므로 1620 점이 어느 점수대의 몇 퍼센트인지 해석하는 것은 적절하지 않습니다. 이 버전에서는 DeepSeek V4.1 Flash의 최대치를 1600점을 기준으로 합니다. 다른 버전의 Elo와 원시 숫자를 직접 비교하는 것을 피합니다.

평가용 에이전트에는 셸, 이미지 표시, 웹 검색·획득 등의 기능이 제공됩니다. Haiku 5.5의 1620은 최대 값으로, 기본 설정인 미디엄에서는 1277입니다. System Card에서는 미디엄의 출력 토큰 소비가 최대의 약 10분의 1 수준임을 나타냅니다. 설정을 강화한 점수만으로 일상적인 비용과 품질을 동시에 판단하지 않는 것이 중요합니다.

회사 고유 자료나 일본어 업무에서 어느 정도의 업무를 위탁받을 수 있는지 나타내는 숫자는 아닙니다. 필요한 결과물의 형식과 내용을 사람이 어느 정도까지 확인하는지를 먼저 결정합니다.

데이터: 인공 분석: GDPval-AA, 인공 분석: 평가 방법, 앤트로픽: 시스템 카드

## 2. AA-Briefcase v1.1：방대한 자료에서 결과물을 생성한다.

수 주에 걸친 업무를 기준으로 한 4개의 프로젝트, 91가지 과제를 활용하여 수천 개의 입력 파일에서 스프레드시트, 슬라이드, 메모 등을 제작하고, 지시 사항 및 근거를 충족하는지, 분석 품질 및 미관을 기준으로 평가하는 시험입니다. 또한 인공 분석(Artificial Analysis)에 의한 독립 측정으로, Elo의 상대 평가를 적용합니다.

発表値は、Haiku 5.5が1578、Haiku 4.5が614、GPT-6 Lunaが1336、Sonnet 5.5が1824。Haiku 5.5の既定mediumは1372で、mediumの出力token消費はmaxの4分の1未満と記載されています。

평가에서는 제공 자료만을 사용하며, 인터넷에 접속하지 않습니다. 최대 500턴의 조건이 적용됩니다. 시나리오가 여러 주에 걸친 작업이라도 각 과제는 독립적으로 실행되며, 이전 과제의 결과물을 이어서 제출하지 않습니다. 공개되는 Lite 시나리오는 평가 점수에 포함되지 않습니다.

따라서, 수週間이나 사람과 협상하며 일할 수 있는 능력이나, 사내의 최신 자료에 지속적으로 대응할 수 있는 능력을 입증하는 시험은 아닙니다. 제 목적에 필요한 자료가 모두 제공되는지, 근거를 확인할 수 있는 결과물이 존재하는지 등을 별도로 확인합니다.

데이터: 인공 분석: AA-가방, 인공 분석: 평가 방법, 앤트로픽: 시스템 카드

![画像](https://assets.st-note.com/img/1791420380-UV1baItADpuiJP9Lx3snhMfX.png?width=1200)

하이크 5.5의 72.4%는 부분 점수이며, 전체 점수 달성은 37.1%입니다. 총 108개의 과목 중 82개의 과목이 offline 방식으로 진행되었습니다.

데이터: Anthropic: Haiku 5.5 시스템 카드, OSWorld V2: 공식 평가

## 3．OSWorld 2.1：화면을 보면서 PC를 조작합니다.

Ubuntu 가상 머신에서 마우스와 키보드로 앱을 조작하며 스크린샷을 찍는 시험입니다. 전체 108개 과제 중, 이번에는 인터넷을 사용하지 않는 공식 82개 과제를 대상으로 합니다. 1080p 해상도, 최대 500단계, 1개 과제당 5회 시행 조건입니다.

발표표의 “부분 점수”는 미완성된 달성 항목에도 점수를 부여한 값입니다. Haiku 5.5는 72.4%, Haiku 4.5는 15.7%, GPT-6 Luna는 48.9%, Sonnet 5.5는 83.9%이며, 모든 달성 항목을 충족한 정확한 완전 달성률은 각각 37.1%, 1.7%, 17.1%, 48.8%입니다.

Haiku 5.5는 최대 설정을 사용하며, Haiku 4.5는 고정된 추론 예산을 사용하고 서버 측 컨텍스트 압축을 사용하지 않습니다. GPT는 Anthropic이 동일한 82개의 과제를 OpenAI API에서 실행하며, OpenAI 고유의 컨텍스트 압축을 사용합니다. 모델명 외 실행 조건에도 차이가 있습니다.

72.4%를 “72.4%의 업무를 완료까지 책임질 수 있다”고 해석하면 중요한 차이가 사라집니다. 또한, Ubuntu 시험이며, 자신의 Mac, 웹 사용 전반의 업무, 미숙한 앱 사용까지 보장하는 수치가 아닙니다.

데이터: OSWorld V2: 공식 평가, OSWorld V2: 구현 및 평가 자료, Anthropic: 시스템 카드

![画像](https://assets.st-note.com/img/1791420381-uXmZvKpSb2wYLDn4UerVPB97.png?width=1200)

도구의 유무는 별 조건이며, Haiku 4.5와 5.5는 사용 가능한 토큰 예산도 다릅니다. 미제시된 것은 0%로 변환하지 않습니다.

데이터: Anthropic: Haiku 5.5 발표, Anthropic: Haiku 5.5 시스템 카드, Humanity’s Last Exam: 공식 설명

## 4．인류 최후의 시험：학술적 난제에 답하다

HLE는 전문가가 제작한 2500문항의 폭넓은 학술 시험입니다. 이미지 포함 문제를 비롯하여, 정답을 알고 있더라도 얼마나 정확하게 정답을 맞힐 수 있는지를 측정합니다. 검색 편의성을 위한 문제만 모은 시험은 아니지만, 새로운 연구를 독자적으로 완성하는 능력 자체를 평가하는 것은 아닙니다.

도구 없이 얻은 정확도는 Haiku 5.5가 45.9%, Haiku 4.5가 10.2%, Sonnet 5.5가 56.9%입니다. GPT-6 Luna의 값은 게시되어 있지 않습니다.

도구가 있으면, Haiku 5.5가 57.4%, Haiku 4.5가 18.7%, Sonnet 5.5가 64.5%。GPT-6 Luna는 역시 미수록입니다. 이 조건은 웹 검색, 페이지 가져오기, 프로그램 호출, 코드 실행 등을 사용합니다. 도구가 없거나 있는 경우를 동일한 시험 조건으로 나열하지 마십시오.

Haiku 5.5는 최대 모델로, 각 시도별 작업 예산은 98만 토큰이며, 컨텍스트 압축은 적용되지 않습니다. 정답 판별에는 Claude Opus 4.6을 사용합니다. HLE 관련 답변 출처 검색 및 획득을 제외하고, 정답 기록을 검사하여 확인된 답변 유출 이용은 오답으로 재수정합니다.

한편, Haiku 4.5의 경우 6만 토큰의 추론 능력과 16만 토큰의 작업 예산을 갖습니다. 단순히 점수 차이에 그쳐 모델의 진보만을 강조하지 않고, 사용 가능한 예산 차이도 고려해야 합니다. 비용 곡선 역시 캐시 및 검색 요금 등을 가정하고 있으므로, 여기서는 API 청구액 산정 시에만 활용하지 않습니다.

데이터: Humanity’s Last Exam: 공식 설명, 척도: HLE 평가, Anthropic: 시스템 카드

![画像](https://assets.st-note.com/img/1791420383-1XH5EWAnpUhr682dOPuSDlZ7.png?width=1200)

터미널의 Haiku 5.5에는 대체 모델이 없고, Sonnet에는 일부 대체 모델이 있습니다. FrontierCode의 발표치는 추론 설정이 다른 비교입니다.

데이터: Anthropic: Haiku 5.5 발표, Anthropic: Haiku 5.5 시스템 카드, Terminal-Bench: 4.0 변경, Cognition: FrontierCode 1.1

## 5．Terminal-Bench 4.0：터미널에서 복잡한 작업을 수행한다.

과학·공학 중심의 66 챌린지를 컨테이너 터미널에서 진행하는 시험입니다. 생물, 물리 시뮬레이션, CAD, 형식적인 증명, GPU 관련 등 복잡한 작업을 수행하고 검증까지 진행합니다. 득점은 pass@1로, 1회 시도에서 성공할 확률을 여러 실행에서 평가합니다. 여러 번 시도하여, 특정 시도에서 한 번 성공한 비율과는 다릅니다.

発表値は、Haiku 5.5が39.2%、Haiku 4.5が0.0%、GPT-6 Lunaが16.4%、Sonnet 5.5が70.6%。Haiku 4.5の0.0%は、この版・条件の測定値であって、すべてのプログラミングを一切できないという意味ではありません。

Haiku 5.5와 4.5는 1차 과제당 10회 시도, Sonnet 5.5는 5회 시도입니다. Claude Code의 bare 모드를 사용하여 Haiku 5.5는 max, 4.5는 6만 3999 토큰의 고정 추론 예산을 제공합니다. Haiku 5.5의 실행은 네트워크 연결 없이, 필요한 자원을 사전에 준비하고 안전 제어를 활성화합니다. 제어 중 중단된 12회 시도는 660회 시도 중 실패로 계산됩니다.

Haiku 5.5에는 대체 모델 전환이 없으며, Sonnet에는 일부 안전 제어 시 대체 기능이 있습니다. GPT-6 Luna는 공개 순위의 Codex CLI·최대 설정 값으로, Claude Code와 실행 소프트웨어도 다릅니다. Haiku 5.5의 표준 오차는 ±1.9 포인트이며, 95% 신뢰 구간이라는 문구가 없습니다.

4.0에서는 시간 및 CPU·메모리 배분, 과제 자체에 조정이 있을 수 있으므로, 기존 버전의 숫자와 직접 비교하지 않습니다. 제 개발 단계에서는 짧은 코드 출력뿐만 아니라 실행, 테스트, 필요한 자원까지 모두 갖춰졌는지 확인합니다.

데이터: Terminal-Bench: 4.0 업데이트, Anthropic: 시스템 카드

## 6．FrontierCode 1.1 Main：수신 가능한 품질 수정인가

공개 저장소의 수정 과제에서 동작 여부뿐만 아니라 유지보수가 가능한 품질을 평가합니다. 메인은 어려운 100개의 과제이며, 확장(Extended)의 150개 과제와는 별개의 범위입니다. 필수 조건을 충족하지 못하면 0점이며, 통과 후에는 유지보수성, 테스트 등의 항목을 가중치를 두고 평가합니다.

메인 발표치는 값은, Haiku 5.5가 46.4%, GPT-6 루나가 42.4%, Sonnet 5.5가 52.1%이다. Haiku 4.5의 값은 미수록되었다. 이는 품질의 가중 점수로, 46.4%의 과제가 완전 합격했다는 단순한 합격률이 아니다.

각 과제 5회 시행의 평균은 다음과 같습니다. 추론 설정에 유의해야 합니다. Haiku 5.5의 46.4%는 max, 발표 표의 Sonnet 5.5의 52.1%는 xhigh입니다. Sonnet을 max로 측정하면 46.2%, Haiku의 xhigh는 45.8%이며, 이는 System Card에 명시되어 있습니다. 최적의 설정을 선택한 표와 설정이 일치하는 비교를 구별합니다.

공식 평가 구현을 활용하여 문서나 API 사양 등을 조사하는 인터넷 사용은 허용되지만, 정답이 되는 수정 정보 유출을 이용한 결과는 별도 처리됩니다. 이 숫자 하나로 전체 코드 리뷰를 대체할 수단이라고 판단할 수 없습니다.

데이터: 코그니션: 프론티어코드, 코그니션: 프론티어코드 1.1, 안트로픽: 시스템 카드

![画像](https://assets.st-note.com/img/1791420492-FSjDo2VW7O5yGsMI3QZCAT0i.png?width=1200)

5.5의 도구 미사용 비율이 46.4%이고, 도구 사용 비율이 86.2%는 별도의 조건입니다. GPT-6 Luna의 29.1%는 Surge AI에 의한 도구 미사용 공개 비율입니다.

데이터: Anthropic: Haiku 5.5 발표, Anthropic: Haiku 5.5 시스템 카드, Chartography: 저자 논문

## 7. 차트그래피: 전문적인 차트를 해석하는

전문가들이 제작하고 다른 전문가들이 검토한 100문제의 그래프 독해 능력을 평가합니다. 생존 곡선, 캔들스틱 차트, 등고선, 풍배좌표도, 뱅크 그림, 보드 선도 등 전문 분야의 규칙을 이해하고 읽는 문제를 포함합니다. 표를 생성하는 능력 시험이 아닙니다.

도구 없이 평균 Pass@1은 Haiku 5.5가 46.4%, Haiku 4.5가 6.4%, GPT-6 Luna가 29.1%, Sonnet 5.5가 61.6%입니다. 컨테이너 내에서 코드나 이미지의 잘라내기 사용 조건에서는 Haiku 5.5가 86.2%, Haiku 4.5가 8.8%, Sonnet 5.5가 90.2%입니다. GPT-6 Luna의 도구 포함 값은 이 비교에는 포함되지 않았습니다.

Anthropic의 평가는 5회 시행의 평균이며, Haiku 5.5와 Sonnet은 adaptive thinking의 최대값이다. Haiku 4.5는 최대 3만 2천 토큰의 고정된 사고 예산을 제공한다. 평가에는 Gemini 3.5 Flash를 사용하며, 전문가가 설정한 그림별 허용 범위 내에서 답변을 판단한다. GPT 등의 값은 Surge AI의 공개 값을 참고한 도구 없는 값이며, Anthropic이 재측정한 표와는 일치하지 않는다.

저자의 초기 논문과 공개 구현 반복 횟수, 그리고 이번 System Card의 5회 시도를 혼합하지 않는 것이 필요합니다. 제가 사용하는 이미지 해상도, 일본어 문자, 전문 분야 독해 방식, 잘라내기 도구 등 존재 유무를 별도로 확인합니다.

데이터: 차트그래피: 저자 논문, 앤트로픽: 시스템 카드

## 자신의 용도에 맞게 배열하는 순서

먼저, 채팅을 사용할지 API를 사용할지 결정합니다. 채팅이라면 자신의 플랜과 모델 목록을, API라면 공식 모델 ID와 입력 길이, 출력 및 추론 사용량, 캐시 및 혜택 조건을 확인합니다. 다음으로 원하는 결과를 하나 결정합니다. 예를 들어 “문서에서 특정 항목을 추출”한다면, 항목 추출, 고유 명사, 날짜, 근거 대응 등을 확인할 수 있는 자료를 준비합니다. 이번 6회 시도에서도 JSON 형식이 맞더라도 미채택 또는 미결정 사항이 누락된 답변이 있었습니다. 답이 명확한 몇 가지 예시와 반례로 시작하여 필요한 형식에 추가하고, 놓아서는 안 되는 의미도 검토합니다.

성능표에서는 자신의 업무와 관련된 시험을 선택하고, 척도, 도구, 추론 설정, 예산을 순서대로 확인하는 절차입니다. Elo 지수와 정답률을 평균하여 종합 점수로 계산하거나, 부분 점수를 완전 달성률로 변환하지 않는 것이 판단의 출발점입니다.

## 본편을 동영상으로 시청하시오

비와 메탄의 대화와 그림 설명으로 전체 내용을 파악하고 싶으신 분은 본편도 함께 시청해 주십시오.

**출처:** [note 원문](https://note.com/tsukaima_kobo/n/na6024968fa9e)

*번역: Gemma 3(.44) 초벌 + 교정 100청크*

[원문 보기](https://note.com/tsukaima_kobo/n/na6024968fa9e) | 출처: note.com