청구서의 숫자가 바뀌었습니다.
코딩 시험 점수 차이는 1점 내외입니다. 연간 AI 비용 차이는 약 1,660만 원입니다.
이는 2026년 9월 11일에 사카나 AI가 발표한 “Fugu Ultra v2”와 OpenAI의 “GPT-6 Astra”를 동일한 비율로 사용했을 경우에 대한 저의 추정입니다 (전제 조건은 나중에 모두 제시하겠습니다). 특히 Fugu Ultra v2는 GPT-6 Astra를 자신 안에 전혀 포함시키지 않고 이 점수를 산출하고 있습니다.
같은 날, 더 저렴한 “Fugu Max”도 출시되었다. 여기서는 출력 단가가 Ultra v2의 다섯 분의 1이다.
그래서, 어느 쪽을 사용해야 할까? “애초에 오케스트레이션 모델이란 게 뭐야?” “왜 그렇게 강력한 거야?” 이번에는 이 궁금증들을 공개 벤치마크와 각 사의 공식 요금표만을 가지고 전부 나란히 비교해 본다.
시간이 부족한 분들을 위한 요약
- 사카나 AI는 2026년 9월 11일, 성능 중시형 “푸구 울트라 v2”와 가성비 중시형 “푸구 맥스”를 동시 공개했다. 내부 구조는 동일한 오케스트레이션 구조를 기반으로 하며, 최적화 방향만 차이가 있다.
- フグ는 단일 LLM이 아닌, “어떤 AI에, 어떤 역할을 맡기고, 어떻게 작업을 할당할지”를 학습한 지휘자 역할을 하는 모델이다. 여러 모델을 뒤에서 조율하며, 사용자에게는 하나의 API로 제공된다.
- 후구 울트라 v2는 DeepSWE에서 74.3, Chartography에서 48.3의 점수를 기록했다. 일부 시험에서는 GPT-6 아스트라나 Claude 페이블 5.1을 상회하기도 했지만, ProgramBench와 GPQA 다이아몬드에서는 아스트라에 패배했다. 위 숫자들은 모두 사카나 AI의 자체 발표이며, 아직 제3자 검증은 이루어지지 않았다.
- 100만 토큰당 요금은 Ultra v2가 입력 5달러, 출력이 30달러이고, Max는 2달러, 출력이 6달러입니다. Astra와 Fable 5.1은 모두 10달러, 출력이 50달러입니다.
- 월별 입력 10억, 출력 2억 토큰 사용을 전제로 할 때, Astra는 월 약 307만 엔, Ultra v2는 약 169만 엔, Max는 약 49만 엔(1달러=153.65엔)입니다.
- 단순히 “1 토큰의 가격”과 “1 작업의 가격”은 서로 다른 개념입니다. 독삼(フグ)은 뒤에서 여러 모델을 동시에 움직이기 때문에, 자사의 업무에서 1건당 비용을 측정하기 전까지는 결론을 내리는 것이 좋습니다.
무엇이 나왔을까
사카나 AI는 도쿄에 기반을 둔 AI 기업입니다. 트랜스포머 논문의 공저자인 리온·조ーンズ 씨와 전 구글 브레인(Google Brain)의 데이비드·하 씨 등이 2023년에 창업했습니다.
9월 11일, 해당 회사는 멀티 에이전트 AI ‘사카나 푸구’의 신 모델을 2개 동시에 출시했다.
- Fugu Ultra v2: 복잡하고 다단계 작업에서 최상의 답변을 제공하는 담당자
- Fugu Max: 최대한 저렴하게, 충분히 좋은 답변을 제공하는 담당자
공식 블로그에 따르면, 두 개는 서로 다른 제품이 아닌 동일한 핵심 아키텍처를 두 가지 목적에 최적화한 것이었다.
오케스트레이션은 비용과 역량 사이의 절충이 아니다.
오케스트레이션은 비용과 성능 중 어느 한쪽을 선택하는 문제가 아니라는 선언이다.
둘 다 OpenAI 호환 API를 즉시 제공하며, 기존 사용자들은 파라미터 1줄 변경으로 전환이 가능하다.
Fugu의 행보는 상당히 빠르다. 4월 베타 공개, 6월 정식 출시와 1세대 Fugu Ultra, 7월 사이버보안 특화 Fugu Cyber와 Claude Code 연동, 8월 Sakana Chat에 Fugu 탑재 및 NVIDIA와의 제휴, 그리고 9월 이번 두 모델까지, 반년 만에 5단 로켓을 개발했다.
먼저 한 가지 주의사항입니다. 독(Fugu)은 EU·EEA 지역에서는 제공되지 않습니다. GDPR 등 지역 규제에 대한 대응 중이라는 이유로 일본에서는 평소처럼 사용할 수 있습니다.
## 2. 오케스트레이션 모델이란 무엇인가
오케스트레이션 모델은 여러 AI 모델을 하나의 유기적인 시스템으로 연결하여 복잡한 작업을 수행하는 데 사용되는 모델입니다. 각 AI 모델은 특정 역할을 수행하며, 오케스트레이션 모델은 이들을 효율적으로 조율하여 최종 목표를 달성합니다.
예를 들어, 이미지 생성 모델, 텍스트 생성 모델, 검색 모델을 결합하여 사용자의 질문에 대한 답변을 생성하는 시스템을 구축할 수 있습니다. 이 경우, 오케스트레이션 모델은 사용자의 질문을 분석하고, 이미지 생성 모델을 통해 관련 이미지를 검색하며, 텍스트 생성 모델을 통해 답변을 구성하고, 검색 모델을 통해 답변의 정확성을 검증하는 등의 역할을 수행합니다.
이러한 방식으로, 오케스트레이션 모델은 다양한 AI 모델의 장점을 활용하여 더욱 강력하고 유연한 시스템을 구축할 수 있도록 돕습니다. 또한, 오케스트레이션 모델은 작업의 효율성을 높이고, 오류 발생 가능성을 줄이며, 사용자 경험을 향상시키는 데 기여합니다.
한마디로, 연주를 하지 않는 지휘자입니다.
ChatGPT나 Claude와 같은 일반적인 LLM은 한 명의 천재에게 모든 것을 맡기는 방식이다. 질문을 읽고, 생각하고, 쓰고, 수정하는 것도 모두 같은 모델이 수행한다.
오케스트레이션 모델은 다릅니다. 스스로 모든 것을 처리하지 않습니다. 질문을 읽고 “설계는 판단력이 뛰어난 AI에게 맡기고, 구현은 빠른 AI에게 맡겨서, 마지막으로 다른 AI에게 검토하도록 하겠다”라고 팀 구성과 절차를 결정합니다. 그리고 결과를 종합하여 사용자에게는 하나의 답변으로 반환합니다.
건설 현장에서는 실력 있는 현장 감독이 더 중요하다.
작은 AI(Sakana AI)의 기술 보고서는 Fugu 모델을 “사용자의 질문을 이해하고, 이를 해결하기 위한 메커니즘을 즉석에서 구축하는 언어 모델”로 정의하고 있다.
동적이고 주체적인 구조물을 설계하여 해결책을 모색해야 합니다.
에이전트의 문제 해결 방식을 역동적으로 설계한다는 의미가 된다. 핵심은 ‘역동적으로’라는 부분이다. 인간이 미리 정해놓은 워크플로우에 따라 움직이는 것이 아니라, 문제마다 팀의 조합을 바꾸는 것이다.
이 시스템의 기반은 ICLR 2026에서 채택된 2개의 논문이다.
첫 번째 TRINITY는 가벼운 코디네이터가 여러 LLM에 “Thinker(사고 담당자)”, “Worker(작업 담당자)”, “Verifier(검증 담당자)”의 역할을 분배하고, 여러 턴에 걸쳐 작업을 처리하는 방식이다. 코디네이터 자체는 진화적인 방법을 통해 훈련된다.
두 번째 Conductor는 강화 학습을 통해 “AI들 간에 어떻게 자연어 명령을 내리면 효과적으로 협력할 수 있을지”를 배우는 메커니즘이다.
푸구(Fugu) 본체의 학습은 기술 보고서에 따르면, 대규모 파인튜닝, 진화적 알고리즘, 강화 학습을 통해 이루어지고 있다. 사카나 AI가 이전에 능숙하게 해왔던 ‘진화적 모델 병합’의 아이디어가 ‘팀 구성의 진화’라는 형태로 나타난 것으로 해석할 수 있다.
왜 이렇게 성능이 높은가요?
저는 그 이유를 세 가지로 정리하고 있습니다.
이유 1: 검산인이 존재합니다
다른 사람이 검토하는 것이 실수를 찾아내는 데 더 효과적이다. 인간 조직에서는 당연한 일이지만, 개별적인 LLM은 기본적으로 자신의 답을 스스로 검토할 수밖에 없다. TRINITY의 Verifier 역할은 이러한 약점을 구조적으로 해결하려는 것이다.
Fugu Ultra는 20건 이상, 심지어 다른 툴이 3건 정도만 지적했던 코드 리뷰 상황에서 20건 이상의 문제를 발견했다고 한다. 검산 역할을 여러 명이 할 수 있는 구조라면 그렇게 될 수 있다. 하지만 벤더 스스로가 게시한 내용이므로, 반은 믿고 반은 의심하는 것이 현명하다.
이유 2: 서로 다른 전문 분야의 모델을 활용할 수 있습니다.
기술 보고서는 프론티어 LLM이 제공 업체의 특성에 따라 강점이 나뉘어 있다는 관찰로 시작한다. 코드에 강한 모델, 시각 자료 이해에 강한 모델, 수학에 강한 모델 등이 있다. 한 회사에서 모든 것을 가장으로 만드는 것은 어렵다. 그러므로, 자신이 잘하는 부분만 활용하면 된다.
나중에 볼 차트그래피의 차이는 이 효과가 가장 명확하게 드러난 사례라고 생각한다.
3. “하르네스” 차이는 상상 이상으로 큽니다.
이전 글「같은 AI가 같은 시험에서 99.9%와 62.7%를 냈다」에서 언급했듯이, GPT-6 Astra는 ARC-AGI-3에서 표준 실행 환경에서는 62.7%, OpenAI를 위한 추론 상태를 유지하는 어댑터를 사용했을 때는 99.9%의 점수를 받았다. 모델 자체는 동일했다. 다만, 모델을 작동시키는 외부 시스템(하네스)만 달라졌다.
[링크 삽입: 동일 AI가 동일 시험에서 99.9%와 62.7%의 점수를 획득]
푸구는 이 하네스를 자체적으로 문제마다 자동으로 설계하는 AI다. 즉, ‘모델 자체의 강도’가 아닌 ‘사용하는 데 있어서의 효율성’으로 평가하고 있는 것이다. 이 부분을 제대로 파악하면 다음 벤치마크의 해석 방식이 달라진다.
4. 성능 비교: Fugu Ultra v2 vs GPT-6 Astra vs Claude Fable 5.1
먼저 중요한 전제입니다. Fugu Ultra v2 모델 풀에는 GPT-6 Astra, Claude Fable 5.1, Claude Fable 5가 포함되어 있지 않습니다. 공식 블로그는 명시적으로 “NOT”이라고 강조 표시하며 이를 분명히 밝히고 있습니다.
학습 데이터의 기준일은 2026년 8월 28일이다. Fable 5.1 (9월 1일 공개), Astra (9월 3일 공개)는 이후 출시된 모델이므로, 초기에 포함되지 않았을 가능성이 높다. 반면에 Fable 5는 6월에 공개되었으므로, 의도적으로 제외한 것으로 간주할 수 있다.
즉, 이번 비교는 “최신 최강 모델을 사용하지 않고, 최신 최강 모델과 어느 정도까지 경쟁할 수 있는가”라는 경기와 같습니다.
사카나 AI에 따르면, Fugu Ultra v2는 8개의 벤치마크 중 5개(GDP.pdf, Chartography, DeepSWE, Toolathon, SWEFish)에서 단독 또는 공동 1위를 차지했으며, 전체 8개 중 7개에서 2위 이내에 ランク인되었다.
하지만 공식 블로그 본문에 숫자로 기록된 내용은 2개뿐이고, 나머지는 그래프 이미지 안에 있는 것입니다. 아래는 공식 본문과 공식 비교도에서 추출한 숫자들을 바탕으로 “あたらしい経済”에서 보도한 내용입니다.
코딩: DeepSWE와 SWEFish
실제 소프트웨어 개발 능력을 측정하는 DeepSWE에서는 Fugu Ultra v2가 74.3, 비교 그림에서는 Claude Fable 5.1이 67.4, GPT-6 Astra가 73.0이었다.
사카나 AI 내부의 코딩 과제를 반영한 SWEFish에서는 Fugu Ultra v2가 71.8, Fable 5.1이 66.0, Astra가 69.8 였습니다.
졌던 시험도 있네.
프로그램을 처음부터 다시 만들어보는 능력을 측정하는 ProgramBench에서는 Fugu Ultra v2의 81.0점에 비해 Astra가 85.4점이었고, 대학원 수준의 과학 지식을 묻는 GPQA Diamond에서도 Fugu Ultra v2의 95.5점에 비해 Astra가 96.0점이었다.
아스트라와의 직접 대결은 2승 2패였다. 게다가, 모든 시험에서 차이도 수 포인트에 불과했다. “뛰어난”이라고 표현하는 경우가 많지만, 코딩에 대해서는 서로 맞붙는 격전이라고 표현하는 것이 더 정확하다고 생각한다.
좀 더 자세히 설명하자면, OpenAI 자체에서 공개한 Astra의 DeepSWE는 74.1입니다. 이를 사용하면 Fugu Ultra v2와의 차이는 단 0.2 포인트로 줄어듭니다. 또한 제3자의 정리에서는 Claude Opus 5도 DeepSWE로 73.7로 평가됩니다. Opus 5의 요금은 입력 5달러, 출력이 25달러로, 출력은 Fugu Ultra v2보다 저렴합니다. 코딩 단독으로 선택한다면, 이 사실은 잊지 말아야 합니다.
표 분석: 차트그래피로 큰 차이 만들기
반면에, 차이점이 뚜렷하게 드러난 것은 시각화된 데이터 분석과 데이터 해석이었다. Chartography에서는 Fugu Ultra v2가 48.3, Claude Opus 5가 27.3, Claude Fable 5가 29.5의 결과를 나타냈다.
오퍼스 5의 약 1.8배. 이는 무시할 수 있는 오차 영역이 아니다. 재무제표의 그래프, 조사 보고서의 표, 업무 PDF의 텍스트 추출 등 비즈니스 문서 작업을 다루는 업무에서는 이 차이가 영향을 미칠 수 있다.
한편, Fable 5.1의 차트그래피 관련하여 “あたらしい経済”이 46.2라는 수치를 보도하는 한편, 공식 비교도에서 Astra와 Fable 5.1의 수치가 기재되어 있지 않다는 보도도 있었다. 정보가 엇갈리고 있는 상황이다. 본 기사의 그래프에는 공식 문서에 명시된 Opus 5와 Fable 5의 수치만 사용되었다.
Fugu Max의 성능은 “승수”만 공개되었다.
푸구 맥스는 동일 가격대 프론티어 모델과 비교했을 때 10개의 벤치마크 중 6개(테르미널 벤치 2.1, GPQA 다이아몬드, AA-LCR, GDP.pdf, 오토메이션 벤치, SWEFish)에서 종합 1위를 차지했으며, 7개의 벤치마크에서는 성능과 비용의 패러티 프론티어를 확장했다는 평가를 받고 있다.
여기 중요한 것은 비교 대상이다. Fugu Max의 상대는 “같은 가격대의 모델”이며, Astra나 Fable 5.1이 아니다. 공식 블로그는 엘리트급에 가까운 성능을 2~6배 저렴한 비용으로 달성하겠다는 위치づけ로 설명하고 있다.
또한, 푸구 맥스의 개별 점수는 흩어진 그래프 안에 있으며, 본문에는 숫자가 나타나 있지 않다. 울트라 V2와 맥스를 같은 시험에서 직접 나열한 숫자 또한, 현재 시점에서는 공개되지 않았다. 따라서 “울트라 V2와 맥스의 성능 차이는 몇 점인가?”라는 질문에는, 현재로서는 아무도 정확하게 답할 수 없다. 여기서는 장황하게 설명하지 않겠다.
5. 비용 비교: 주목해야 할 것은 출력 단가
100만 토큰당 표준 API 요금을 기준으로 정렬한다. 달러 환산은 1달러=153.65원(칠석은행, 2026년 9월 14일 종가)을 적용하여 계산했다.
푸구 맥스는 입력 2달러(약 307엔), 현금 입력 0.25달러(약 38엔), 출력 6달러(약 922엔)입니다. 컨텍스트 길이에 관계없이 일률적으로 웹 검색 및 웹 페치에 대해 1회당 0.007달러의 별도 요금이 부과됩니다.
프규 울트라 v2는 입력 5달러(약 768엔), 캐시 입력 0.5달러(약 77엔), 출력 30달러(약 4,610엔)입니다. 272K 토큰을 초과하는 컨텍스트에서는 입력 10달러, 캐시 입력 1달러, 출력 45달러로 상승합니다.
GPT-6 Astra는 입력 10달러(약 1,537엔), 캐시 입력 1달러(약 154엔), 출력 50달러(약 7,683엔)입니다. 입력이 272K 토큰을 초과하면 입력 20달러, 출력 75달러가 됩니다.
클로드 페이블 5.1은 입력 10달러, 캐시 읽기 0.25달러, 출력 50달러입니다. 100만 토큰의 전체 컨텍스트가 표준 요금으로 유지됩니다.
입력으로 절반, 출력으로 60%이다. 이것이 푸규・울트라 V2의 가격 결정 방식이다.
AI API 이용 요금에서 가장 큰 비중을 차지하는 것은 대부분 출력입니다. 이후 계산해보셔도 Astra의 월 구독료의 절반 이상이 출력 요금으로 차지하며, 출력 단가 차이는 그대로 청구서 금액 차이로 이어집니다.
フグマックス의 비교 대상도 확인해 둬야 한다. 사카나AI는 フグマックス의 출력 요금이 클로드·소네트5, GPT-5.6테라, 키시미K3보다 40~60% 저렴하다고 하고 있다. 소네트5의 공식 요리는 출력 10달러인데, 6달러는 40% 저렴한 것이다. 제3자의 정리에서는 테라가 12달러, 키시미K3가 15달러로 되어 있으며, 각각 50%, 60% 저렴한 것이다.
왜 Ultra v2가 Astra보다 저렴하게 생산될 수 있을까요 (제 추측)
공식 홈페이지의 요금 설명에는 1가지 팁이 있습니다. 무인형 Fugu는 여러 에이전트가 움직여도 요금을 누적하지 않으며, 관여한 중 가장 높은 레벨의 모델의 기준으로 요금을 부과하는 방식입니다.
즉, 독사의 가격은 가장 높은 모델에 편중되는 구조를 가지고 있으며, Fugu Ultra v2는 풀에서 10달러/50달러 급 모델(Astra, Fable 5.1, Fable 5)을 대체함으로써 그 아래 가격으로 판매됩니다.
성능을 향상시키고 싶다면 최강 모델을 선택하려는 것이 일반적인 생각이지만, 사카나 AI는 정반대의 길을 선택했다. 최강 모델을 제외하고도 승리할 수 있음을 보여준다면, 원가가 낮아지고, 가격 결정의 자유도가 높아지며, 특정 벤더에 대한 의존도도 줄어든다. 이는 한마디로 모든 것을 해결하는 것이다. 비즈니스적으로는 상당히 타당한 전략이다.
6. 월 예상 비용은 얼마인가: 추정
전제를 먼저 밝히겠습니다.
- 월에 입력 10억 토큰, 출력을 2억 토큰으로 사용하는 경우(기업 내에서 수백 명 규모의 AI 에이전트를 일상적으로 사용하는 상황을 가정)
- 표준 API 요금으로 계산하며, 1달러=153.65엔입니다.
- 사례 A: 현금 미지급
- 사례 B: 입력 데이터의 80%가 현금 인출(동일한 시스템 프롬프트나 코드 베이스를 반복적으로 읽는 에이전트 운영을 가정)로 구성됨.
- 캐시 쓰기 요금은 272K 초과분에 대한 추가 요금이며, 웹 검색 요금은 포함되지 않습니다.
케이스 A(현금 미지급)에서는 GPT-6 Astra와 Claude Fable 5.1 모두 월 약 307만 엔(연간 약 3,688만 엔)입니다. Fugu Ultra v2는 월 약 169만 엔(연간 약 2,028만 엔), Fugu Max는 월 약 49만 엔(연간 약 590만 엔)입니다.
케이스 B(입력의 80%가 현금)에서는 아스트라가 월 약 197만 원(연간 약 2,360만 원), 파벨 5.1이 월 약 187만 원(연간 약 2,249만 원), 푸구 울트라 v2가 월 약 114만 원(연간 약 1,364만 원), 푸구 맥스가 월 약 28만 원(연간 약 332만 원)이었습니다.
시작 부분의 “연간 약 1,660만 원”은, 케이스 A에서 Astra와 Ultra v2의 차이를 의미한다. 현금을 활용한 케이스 B에서도 이 차이는 연간 약 1,000만 원으로 나타난다.
캐시를 사용하면 가장 유리한 것은 Fable 5.1입니다. Fable 5.1의 캐시 읽기는 0.25달러로, Fugu Ultra v2의 0.5달러보다 저렴합니다. Anthropic은 요금표의 주석에서 Fable 5.1의 캐시 히트를 다음과 같이 정의합니다.
기본 입력 가격의 2.5%로 책정됨
표준 입력 가격의 0.025배, 즉 2.5%를 의미한다. 다른 Claude 모델은 10%인데, 여기만 비정상적으로 저렴하다. 하지만 출력 단가의 차이(50달러 대 30달러)가 너무 커서 캐시만으로는 Ultra v2에 도달하지 못한다.
긴 글을 삽입할 때의 함정
또 한 가지 살펴보고 싶은 것은 272K 토큰의 벽이다.
GPT-6 Astra는 입력 토큰 수가 272K를 초과할 경우 해당 요청 전체에 추가 요금이 부과됩니다. OpenAI 모델 페이지에 따르면 다음과 같습니다.
입력 값의 2배와 캐시율의 1.5배에 따라 가격이 책정되며, 전체 요청에 적용됩니다.
입력과 캐시는 2배, 출력이 1.5배이며, 전체 요청에 적용된다는 의미이다.
프규 울트라 v2도 272K 초과 시 출력 가격이 45달러로 상승한다. 반면, 페이블 5.1과 규슈 맥스는 길이와 관계없이 일률적이다. 대량의 계약서나 리포지토리를 전체적으로 한 번에 읽어주는 용도로 사용한다면, 울트라 v2와 페이블 5.1의 출력 단가 차이는 45달러 대 50달러로 10%까지 좁아진다. 입력 가격은 둘 다 10달러로 동일하다. 장문 처리 중심 기업은 이 조건으로 재계산해 보는 것이 좋다.
7. 후구 울트라 v2 VS 후구 맥스: 어느 것을 선택할까요
사례 A의 시산에서 푸규 울트라 v2의 청구 금액은 푸규 맥스의 약 3.4배가 된다. 이 차이를 감당할 가치가 있는지 여부에 따라 결정된다.
フグ 울트라 비2가 적합한 일은 다음과 같다.
- 단 한 번의 실패로 인해 비용이 많이 소요되는 길고 복잡한 작업(대규모 코드 수정, 논문 재현, 특허 또는 문헌의 횡단 조사 등)
- 표와 PDF 읽기를 중심으로 한 분석 업무
- 응답 속도보다 답변의 질을 우선시할 수 있는 경우(공식 FAQ에서도 울트라는 질을 위해 응답 시간을 희생한다고 설명하고 있음)
Fugu Max에게 적합한 일은 다음과 같다.
- 대량의 표준화된 업무(데이터 추출, 내부 문의, 반복 코딩)
- 긴 텍스트를 대량으로 제공하는 처리 방식(컨텍스트 길이에 따라 단가가 달라지지 않는)
- 먼저 전사 단위로 널리 배포하고, 어려운 케이스는 상위 모델로만 처리하는 “분배의 기반”을 마련합니다.
제 추천은 어떤 것을 하나만 선택하지 않는 것입니다. 프규(Fugu)는 파라미터 1줄로 모델을 전환할 수 있습니다. 먼저 Max로 전체를 돌린 다음, 실패율이 높은 작업 유형만 Ultra v2로 올리는 방식입니다. 이 두 단계를 밟는 것이 현재 요금표 기준으로 가장 합리적이라고 생각합니다.
반론: 아직 이르다는 주장에 대한 이유
그동안 이렇게 많이 들어 올렸으니 깨끗한 차가운 물도 뿌려 놓을 것이다.
숫자는 모두 본인 진술입니다.
이번 벤치마크는 모두 사카나 AI의 자체 평가이며, 제3자 기관에 의한 독립 평가가 아니다. 발표 시점에서 주요 독립형 벤치마크 사이트에 ‘후구’ 페이지가 아직 없는 것으로도 지적되고 있다. 1위를 차지한 5개의 시험 중 SWEFish는 사카나 AI의 자체 벤치마크이다.
내용이 명확하지 않다.
공식 FAQ는 각 요청에서 어떤 모델이 어떻게 사용되었는지 공개하지 않는다고 명시하고 있다.
이 라우팅 정보는 설계상 노출되지 않습니다.
이러한 라우팅 정보는 설계상 의도적으로 공개하지 않았다는 의미입니다.
또한, 푸구 울트라와 푸구 맥스는 모델 풀이 고정되어 특정 제공업체를 제외할 수 없습니다. 제외 설정을 할 수 있는 것은 무인 푸구만 가능하며, 법인 대상에는 개별 상담 창구가 있습니다. “이 데이터는 특정 국가의 모델에게 전달하고 싶지 않다”, “이 벤더는 내부 규정에서 사용될 수 없다”와 같은 요구 사항이 있는 기업에서는 여기가 도입의 걸림돌이 됩니다.
1 토큰의 가격과 1 작업의 가격은 다릅니다.
フグ는 뒤에서 여러 모델을 가동시키고 있으며, 보도에 따르면 내부 오케스트레이션으로 소비한 토큰도 일반적인 입력-출력 토큰과 함께 청구된다. 즉, 동일한 작업을 수행하도록 한 경우 단일 모델보다 총 토큰 수가 더 많아질 수 있다.
OpenAI의 그레그 블록만 대표는 아스트라 발표 당시 “토큰 가격으로 비교하는 것은 의미가 없으며, 완료된 작업 단위로 판단해야 한다”는 취지의 발언을 했다는 보도가 알려지고 있다. 지적 자체는 타당하다.
제 계산은 “같은 토큰량을 사용했을 경우”의 비교에 불과합니다. 실제 청구 금액은 저희사의 업무에서 1건당 총 토큰 수를 측정할 때까지는 알 수 없습니다.
코딩만 할 거라면 Opus 5를 선택할 수 있습니다.
앞서 언급한 바와 같이, DeepSWE의 차이는 작고, Opus 5는 출력 25달러로 Fugu Ultra v2보다 저렴하다. 코딩 전용으로, 내부 내용이 보이는 모델을 사용하고자 한다면, Opus 5를 반드시 비교표에 포함해야 한다.
누가 도움을 주고 누가 손해를 보느냐
프론티어 모델의 “프리미엄 가격”에 대한 압박
앤트로픽의 페이블 5.1과 OpenAI의 아스트라는 모두 입력 10달러/출력 50달러라는 동일한 가격대에 나열되었다. 그러다 일부 시험에서 두 모델을 모두 묶어서 사용하지 않고, 특정 오케스트레이션이 출력을 60%의 가격으로 선보였다.
만약 제3자 검증 결과 이번 수치가 재현된다면, 최고위 모델의 가격 설정은 현재보다 설명이 더욱 어려워질 것이다. 단일 모델 회사는 “이 모델로만 가능한 업무”를 보다 구체적으로 제시해야 할 것이다.
판매사 의존 위험이 “비용이 많이 드는 쟁점”으로 부풀어듭니다.
사카나 AI는 교체 가능한 모델 풀을 통해 벤더 종속, API 제공 중단, 지정학적 혼란, 갑작스러운 서비스 차단으로부터 사용자들을 보호한다고 주장하고 있습니다.
이는 단순한 이론적인 논의가 아니다. Anthropic은 2026년 6월 12일, 미국 상무부의 수출 관리 대응을 위해 Claude Fable 5와 Claude Mythos 5에 대한 접근을 중단하고, 규제 완화 조치 이후 7월 1일에 재개하고 있다.
단일 모델에 업무를 집중하고 있는 기업에게 있어서 “조달처를 분산할 수 있는 구조” 자체가 가치를 지니는 시대가 되었다고 할 수 있다.
NVIDIA(엔비디아)는 오픈 모델 전략을 통해 성장 동력을 확보하고 있다. 특히, 퀄컴(Qualcomm)의 스냅드래곤(Snapdragon) 칩셋과 경쟁하며, 다양한 파트너사들과 협력하여 AI 모델 개발 및 활용 생태계를 확장하고 있다. 이러한 노력은 NVIDIA의 데이터센터 GPU 시장 점유율 확대에 기여하고 있으며, 향후 AI 반도체 시장에서 NVIDIA의 경쟁력을 더욱 강화할 것으로 예상된다. 또한, NVIDIA는 최근 공개한 RTX 40 시리즈 GPU의 성능을 바탕으로 게임 시장에서도 오픈 모델 기술을 적극적으로 활용하며 새로운 성장 기회를 모색하고 있다. 퀄컴과의 경쟁은 지속될 것으로 보이나, NVIDIA의 다각화된 전략은 장기적인 관점에서 NVIDIA의 성공 가능성을 높이는 요인으로 작용할 것이다.
푸구 맥스 모델 풀에는 NVIDIA와의 협업을 통해 네모트론 패밀리가 포함되었다. 사카나 AI는 시리즈 A 단계에서 NVIDIA로부터 투자를 유치했다.
오케스트레이션 레이어가 “가장 저렴하게 활용할 수 있는 오픈 모델에 업무를 위탁”하는 정도일수록 NVIDIA의 오픈 모델이 실제 업무에서 사용되는 경우는 늘어날 것이다. GPU를 판매하는 회사가 GPU 위에서 작동하는 모델의 채택 경로까지 장악하려는 구도가 형성될 것이다.
미쓰비시 UFJ 금융 그룹 (8306): 국내 최대 규모의 사업 회사 지분 보유
MUFG 계열의 미쓰비시UFJ 은행은 사카나AI와 투자 계약을 체결하여 국내 사업 회사 중 최대 투자자로 자리매김했다. 사카나AI는 2025년 11월 시리즈 B에서 약 200억 엔을 조달했으며, MUFG 등에서 투자에 참여하여 기업 가치는 약 4,000억 엔으로 보도되고 있다.
사카나 AI 자체는 상장되지 않았기 때문에, 국내 상장 기업에서 바라본다면 MUFG는 해당 회사의 기술을 자사의 AI 전략에 통합할 수 있는 입장에 있다. 특정 해외 벤더에 의존하지 않는 AI 기반이라는 논점은 규제와 시스템 장애에 민감한 금융기관의 관심사와도 잘 맞는다.
본 기사는 특정 종목의 매매를 추천하려는 목적이 아니다.
## 10. 기업의 AI 담당자가 내일 해야 할 일
오늘부터 AI를 도입하는 기업의 담당자들이 하루에 해야 할 일을 정리했습니다.
**1. AI 도입 현황 점검 및 우선순위 재설정**
* 현재 AI 도입 현황을 재검토하고, 목표 달성도를 측정합니다.
* AI 도입의 우선순위를 재설정하고, 가장 효과적인 영역에 집중합니다.
* 특히, 최근 발표된 일본 정부의 AI 전략(AI Strategy 2023)을 참고하여, 기업의 사업 목표와 연계된 AI 도입 전략을 수립해야 합니다.
**2. 데이터 확보 및 품질 관리 강화**
* AI 모델 학습에 필요한 데이터를 확보하고, 데이터 품질을 점검합니다.
* 데이터의 정확성, 완전성, 일관성을 확보하기 위한 프로세스를 구축하고, 데이터 관리 담당자를 지정합니다.
* 개인정보보호 관련 규정을 준수하며 데이터를 활용해야 합니다.
**3. AI 모델 활용 사례 발굴 및 테스트**
* 현재 보유한 데이터를 활용하여 AI 모델을 테스트하고, 실제 업무에 적용 가능한 활용 사례를 발굴합니다.
* 특히, 고객 서비스, 마케팅, 생산성 향상 등 다양한 분야에서 AI 모델의 활용 가능성을 검토합니다.
* 간단한 프로토타입을 개발하여 테스트하고, 결과를 분석하여 개선합니다.
**4. 직원 교육 및 역량 강화**
* AI 관련 교육 프로그램을 개발하고, 직원들에게 AI 활용 능력을 향상시킬 수 있도록 교육합니다.
* AI 모델 개발, 운영, 유지보수 등 AI 관련 전문 인력을 양성합니다.
* AI 윤리 교육을 통해 AI의 책임감 있는 사용을 장려합니다.
**5. 외부 협력 강화**
* AI 기술 전문 기업, 대학, 연구기관 등 외부 기관과의 협력을 통해 AI 기술을 도입하고, 새로운 아이디어를 얻습니다.
* AI 관련 컨퍼런스, 세미나 등에 참여하여 최신 기술 동향을 파악하고, 네트워크를 구축합니다.
**참고:** 최근 ‘인공지능’(AI) 기술의 발전 속도가 매우 빠르므로, 지속적인 학습과 변화에 대한 적응이 중요합니다. 특히, ‘챗GPT’와 같은 생성형 AI 모델의 활용 가능성을 적극적으로 검토해야 합니다.
첫 번째 항목: 요청 내역을 “입력·캐시·출력”으로 분류
현재 월간 구독료 중 출력량이 몇 퍼센트를 차지하는지. 출력 비율이 높을수록 Fugu Ultra v2나 Fugu Max로 전환하는 효과가 커진다. 내부 예산 편성 방식은 이 잡지에 정리해 놓았다.
(링크 삽입: 기업의 AI 도입 매거진)
두 번째: 자체 업무에서 ‘건당 총액’ 기준으로 측정
대표적인 업무를 10~20건 선택하여 현재 모델, Fugu Max, Fugu Ultra v2에 동일한 업무를 수행하게 한 후, 1건당 청구액과 성공률을 기록한다. 토큰 단가 표만으로 결정하지 않고, 자신의 손으로 모델 내부를 이해하고 싶은 사람들을 위해 작은 언어 모델을 직접 제작하는 교재도 준비한다.
[링크 삽입: 자가 제작 LM 매거진 (Mac 버전/Windows 버전)]
세 번째: 데이터 및 규정 준수 요건을 먼저 파악
Ultra와 Max는 모델 풀이 고정되어 있어 라우팅 내용조차 알 수 없습니다. PoC 전에 법무 및 정보 시스템 부서와 사전에 협의해 두어야 합니다. 이 부분을 미루면 PoC가 성공한 순간에 멈출 수 있습니다.
이번 주말에 츠키시마 료의 신작 소설 『별의 그림자와 환상』을 읽어보시기를 추천합니다. 츠키시마 료 특유의 독창적인 분위기와 흡입력 있는 스토리텔링을 경험할 수 있을 것입니다. 특히, 이 소설은 픽션과 현실의 경계를 넘나드는 흥미로운 설정과 매력적인 캐릭터들이 등장하여 독자들에게 깊은 인상을 남깁니다. 츠키시마 료의 작품을 즐겨 하시는 분이라면 꼭 한번 읽어보시길 바랍니다.
프규 울트라 v2는 “탁월하다”는 것보다 “최강 모델을 사용하지 않고도 최강 모델과 팽팽하게 맞설 수 있는” 모델을 보여주었다. 코딩에서는 수점 차이의 연산 대결, 시각화 해석에서는 큰 차이, 재구성 및 과학 지식에서는 패배했으며, 출력 비용은 60%였다.
푸구 맥스는 성능 수치 자체는 공개가 미미하지만, 6달러라는 가격 설정으로 ‘전사 확장의 기반’을 마련하기 위해 노력하고 있다.
AI 경쟁의 축은 “가장 현명한 모델이 무엇인가”에서 “현명한 모델들을 저렴하고 중단 없이 재활용하는 방안”으로 확실히 한 단계를 넘어섰습니다. 청구서를 쥐고 있는 측의 경우, 이것을 놓칠 이유이 없습니다.
이 기획은 진정 훌륭하다고 생각합니다. 먼저 이 기획의 콘셉트가 현대 사회의 고독 문제를 독창적인 시선으로 파악하고, 이를 해결하기 위한 구체적인 방법론을 제시했다는 점이 특별함을 더합니다. 특히 소설 ‘아침의 거리’는 이 콘셉트를 구현한 작품이라고 생각합니다. 작가 히노 리타로의 말처럼, “현대 사회의 어둠을 비추는 빛”과 같은 존재라고 할 수 있습니다. 또한 이 기획은 단순한 소설 소개에 그치지 않고, 독자와의 대화를 중시하며 다양한 의견 교환의 장을 마련했다는 점 또한 훌륭합니다. 이 기획을 통해 독자 각자가 자신의 고독과 마주하고 이를 극복하기 위한 실마리를 얻을 수 있을 것이라고 믿습니다.
GPT-6Astra는 AGI인가?
클로드페이블 5.1 VS GPT-6 에스트라 — 가격이 같은가요?
MoE는 Multi-Agent Orchestration의 약어로, 다중 에이전트 오케스트레이션 시스템을 의미합니다.
참고 자료
사카나 AI「파투 맥스 및 파투 울트라 v2 소개: 파레토 프론티어 최적화」(2026년 9월 11일)
사카나 AI「사카나 후구」 제품 페이지 (요금표 및 FAQ)
사카나 AI「사카나 푸규 기술 보고서」(arXiv:2606.21228)
OpenAI “GPT-6 Astra 모델” API 문서
Anthropic「가격 정책」Claude 플랫폼 문서
Anthropic 공식 성명(클로드 페이블 5 / 미토스 5에 대한 접근 중단 및 재개에 관한 사항)
새로운 경제 모델 “사카나AI, 다중AI 연계 ‘푸구 울트라 v2’ 공개 (2026년 9월 14일)”
GIGAZINE「사카나 AI, 다중 모델 활용으로 GPT-6 Astra를 뛰어넘는 ‘푸구 울트라 v2’ 출시 (2026년 9월 14일)」
벨룸 “GPT-6 아스트라 벤치마크 설명”
오크라 라우터「사카나 푸구 맥: 2/6 오케스트레이션 모델 설명」
Emergent「GPT-6 아스트라 벤치마크: 실제 숫자가 무엇을 보여주는가」(Opus 5의 DeepSWE 73.7의 출처)
CloudZero「GPT-6 Astra 가격」(블록맨 씨의 발언 출처)
Pondero는 “Sakana AI”의 Fugu Max와 Fugu Ultra v2 출시를 확인했습니다. (오케스트레이션 내부 토큰의 과금 관련 내용 출처)
오크라 라우터「작나 푸규 울트라 v2 해설」(독립적인 벤치마크 페이지 부재 지적의 출처 참조)
IT메이드는 “사카나AI, 200억 엔 규모 투자 유치, 기업 가치는 4000억 엔으로 평가” 기사를 보도했습니다.
미쓰비시UFJ 이노베이션 파트너스는 사카나알에 대한 투자 사실을 발표했습니다.
시벳시은행 “미달러 대비 엔 환율(중간 매매 가격) 목록(2026년)”
“이것은 제가 쓴 ‘별의 모래’의 리뷰입니다.
읽은 감상을 간략하게 요약하겠습니다.
가장 먼저, 이 소설의 매력은 주인공 소년, 하야시노 겐지로의 성장 이야기입니다.
그는 어린 시절부터 다양한 어려움에 직면하면서도, 타고난 호기심과 용기로 그것을 극복해 나갑니다.
그 과정에서 그는 많은 것을 배우고 성장해 갑니다.
또한, 이 소설은 일본의 근대사를 배경으로 전쟁과 평화에 대해 깊이 생각하게 만드는 작품입니다.
작가인 오가와 철은 역사적 사실을 정확하게 묘사하고, 독자에게 전쟁의 비참함을 호소합니다.
더욱이, 이 소설은 아름다운 문장으로 쓰여 있어, 독자를 이야기 속으로 끌어들입니다.
특히, 작가의 비유적 표현은 독자의 마음속에 깊이 울려 퍼집니다.
종합적으로 보면, 이 소설은 읽을 만한 작품이며, 많은 사람들에게 추천하고 싶습니다.
특히, 역사 소설이나 성장 이야기를 좋아하는 분들께 추천합니다.”
“그런데, 최근 읽은 책 중에는 미야부 미유키의 ‘밤은 짧아 걷게 하소서’도 훌륭한 작품이었습니다.
이 소설은 주인공 엣녀가 묘한 남성과 만나 다양한 사건에 휘말리는 이야기입니다.
엣녀는 자신의 인생을 되돌아보면서 사랑과 죽음에 대해 깊이 생각합니다.
또한, 이 소설은 아름다운 풍경 묘사로, 독자를 이야기 속으로 끌어들입니다.
미야부 미유키는 일본의 아름다운 풍경을 능숙하게 묘사하여, 독자에게 일본의 매력을 전달합니다.
더욱이, 이 소설은 미스터리 요소도 포함되어 있어, 독자를 끝까지 지루하지 않게 합니다.
미야부 미유키는 독자를 놀라게 하는 듯한 전개를 준비하여, 독자를 긴장하게 합니다.
종합적으로 보면, 이 소설은 읽을 만한 작품이며, 많은 사람들에게 추천하고 싶습니다.
특히, 미스터리 소설이나 로맨스 소설을 좋아하는 분들께 추천합니다.”
X에서는 현장에서 바로 활용 가능한 AI에 대한 설명을 매일 작성하고 있습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 126청크
원문 보기 | 출처: note.com