오늘도 늦었다.
아침부터 벼락처럼 내린 비 때문에 정신이 팔렸고, 집으로 돌아와도 밥도 먹지 않고 멍하니 유튜브만 보았다.
알람 시계가 째깍째깍 소리를 내기 시작했다. “아, 망했다!” 또 늦었어.
오늘도 늦었다는 말은 마치 저주처럼 느껴졌다. 매일매일 반복되는 끔찍한 일상에 지쳐가고 있었다. 어쩌면 나는 원래 이런 식으로 살아야 하는 걸까. 늦고, 쫓기고, 항상 시간에 쫓기는 삶.
이런 생각을 하니 마음이 무겁고 답답했다. 그래도 포기할 수는 없다. 오늘 하루 늦지 않도록 노력해야 한다. 그래야만 앞으로 나아갈 수 있다는 것을 잊지 말아야 한다.
9월 1일, Anthropic에서 Claude Fable 5.1을 출시했습니다. 8월에 출시될 예정이었던 모델이 월을 넘어 DeepSeek이나 GLM의 신모델들이 출시된 이후에 등장했습니다.
벤치마크 숫자를 보면 확실히 화려합니다. 과학 관련 작업은 전 세대보다 2배를 넘습니다. 하지만 실제로 제 손안에서 10개의 과제를 실행해 보면, 늘어난 부분에는 뚜렷한 편차가 있었습니다.
이 글에서는 공식 벤치 테스트 결과 분석과 전 세대와 완전히 동일한 조건으로 테스트를 진행한 실제 기기 비교 결과에 대해 논합니다. 또한 요금 유지 정책이 누구에게 유리한지, 공식에서 안내하는 Opus 5와의 사용법 구분까지 다룹니다.
먼저, 두 명의 이름이 언급됩니다.
이번에는 Fable 5.1과 Mythos 5.1이 동시에 출시되었습니다. 서로 다른 제품처럼 보이지만, 공식에 따르면 내용은 동일한 모델을 사용했으며, 차이점은 안전対策 수준입니다.
미스(Mythos) 5.1은 사이버 보안 및 생명 과학 분야에서 사용하는 조직을 대상으로 한 제한적인 제공으로, 승인된 사용자만 접근할 수 있습니다. Fable 5.1 버전은 일본에서 일반 사용자도 사용할 수 있으며, AWS, Google Cloud, Microsoft Azure, Claude API 등 주요 플랫폼에서 이용할 수 있습니다.
전 세대의 Fable 5는 자율적으로 코드를 작성하고 에이전트적인 시스템을 구축해주는 점에서 2026년 6월부터 7월까지 화제를 선도했던 모델이었습니다. 다른 AI 모델이 나왔다 해도 Fable 5를 따라잡지 못하는 모습을 보인다는 인상이었습니다.
한편, 과학 분야의 작업에서는 GPT-5.6이 더 강력하다는 의견도 있었습니다. 이번의 5.1은 이를 보완하기 위해 나온 형태입니다.
공식 벤치마크 숫자들을 나열하면 편향이 드러납니다.
공식에서 발표한 비교표를 바탕으로 주요 항목을 추출했습니다 (2026년 9월 시점, 공식 참조).
과학 작업(Terminal-Bench-Science 0.1): 24.7% → 52.6% (약 2.13배)
업무 자동화(AutomationBench): 17.1% → 31.4% (약 1.84배)
에이전트적 코딩(Terminal-Bench 4.0): 42.0% → 55.8% (약 1.33배)
지식 노동(GDPval-AA v2): 1723 → 1853 (약 1.08배)
일상 코드 편집(CursorBench 3.2.0): 70.5% → 73.4% (약 1.04배)
상단과 하단에서 늘림폭이 거의 2배 가까이 다릅니다. “새로운 모델이라서 모든 것이 빠르고 똑똑해졌다”라는 해석으로는 기대와 차이가 있습니다. 자신의 사용 방식이 어떤 항목에 가까운지에 따라 체감은 크게 달라져야 합니다.
흥미로웠던 점은, 노력 수준의 비교였다. 이전 세대를 최대 노력을 들여 돌렸을 때와 5.1을 낮은 노력을 들여 돌렸을 때가 거의 같은 점수 분포를 보였다. 즉, 동일한 결과를 더 적은 생각량으로 얻을 수 있게 되었다는 것이다.
다만, 이는 모두 Anthropic이 자발적으로 공개한 숫자들입니다. 제3자의 검증이 아니므로 참고 값으로 보는 것이 안전하다고 생각합니다. 그래서 제가 직접 제 손안에서도 동일한 과제를 실행해 보면서 확인했습니다.
10개의 과제를 전 세대와 완전히 동일한 조건에서 실행했습니다.
새로운 모델이 나올 때마다 사용하고 있는 고정된 검증 과정을 가지고 있으며, 그 과정에서 10개의 과제를 선택했습니다.
방법은 간단합니다. 같은 질문을 한 번만 제시합니다. 추가적인 지시도, 오류 지적도 하지 않습니다. 일명 ‘원샷’ 방식입니다. 모델 이름만 변경하고, 설정은 한 글자도 변경하지 않았습니다.
판정은 세 가지입니다. 마지막까지 내용을 완전히 작성했는지, 브라우저에서 실제로 작동하는지, 그리고 출력의 마지막에 제가 제공한 체크리스트에 허위 정보가 없는지 확인하는 것입니다.
결과는 모두 10가지 과제에서 결과물을 완성했습니다. 빠진 과제가 없습니다. 차이가 발생한 부분은 내용 자체입니다.
스매쉬브라 스타일의 게임을 만들면서 말하지 않았던 부분까지도 완벽하게 구현해 왔습니다.
첫 번째는 3D 대전 액션 게임입니다. 왼쪽에 전세대 게임, 오른쪽에 5.1 버전이 있습니다.
전 세대는 이미 공중에서 적이 나타나 즐길 만한 수준으로 완성되었습니다. 다만 5.1 버전에서는 데미지를 입고 튕겨져 나가는 액션이 포함되었고, 벽에 매달리는 행동까지 구현되었습니다.
여기에는 제가 원치 않는 부분이 임의로 섞여 들어오는 방식입니다. 이 느낌은 Fable과 비슷하다고 생각했습니다. 인간이 ‘있으면 좋겠다’라고 생각하는 작은 부분을 미리 예측하여 제공하는 방식입니다. 조작하면서, 그 점이 명확하게 전달됩니다.
이번에 새로 추가한 과제는 3D 옥차지 게임입니다. 헌터에게 잡히지 않기 위해 아이템을 모으고 골목을 향해 나아가는 내용으로, 시야 판정 및 경로 탐색을 자문에서 직접 구현하도록 했습니다.
실제로 플레이해 본 결과, 중독되어 움직일 수 없게 되는 상황이 한 번 있었습니다. 다시 시도하면 클리어 조건까지 제대로 작동합니다. 마지막에는 적에게 발각되어 붙잡히긴 했지만, 쫓기는 긴장감까지 완벽하게 나타난 것이 놀라웠습니다.
3D 슈팅도 만들게 했습니다.こちらは 문제 없이 플레이 가능한 수준입니다. 다만, 배경에서 움직이는 3D 오브젝트의 표현은 전세대와의 차이가 두드러지게 나타나는 부분이라고 생각했습니다.
한편, 마인크래프트풍의 과제는 이미 전세대 시점에서 완성도가 높았고, 솔직히 5.1이 무엇인지 알 수 없었습니다. 여기가 더 이상 아무 말도 할 것이 없는 수준입니다.
숫자를 계산해 보면, 깔끔하게 분리되었습니다.
각 10가지 과제 각각에서 작성된 코드의 양을 비교했으며, 이전 세대를 1.00으로 기준으로 했을 때의 배수입니다.
눈길을 끄는 점은 확대율이 0.91부터 2.04까지 다양하다는 것입니다. 획일적으로 늘어나는 것이 아니었고, 배열 방식에 규칙성이 있었습니다.
비 게임 관련 3가지 과제: 1.63배 (227,356 바이트 / 139,332 바이트) · 게임 관련 7가지 과제: 1.20배 (421,482 바이트 / 352,120 바이트) · 총 10가지 과제: 1.32배 (648,838 바이트 / 491,452 바이트)
비게임 관련 콘텐츠(회사 홈페이지, 인포그래픽 등)의 경우 1.63배 증가했지만, 게임 관련 콘텐츠는 1.20배에 그쳤으며, 생 WebGL2로 3D 액션을 구현하는 가장 난이도가 높은 과제에서는 0.91배로 전세대보다 낮았습니다.
더 복잡한 과제일수록 격차가 줄어들었습니다.
이 형태는 공식 벤치마크의 “과학적 작업은 2.13배, 일상적인 코드 편집은 1.04배”라는 구조와 매우 유사합니다. 5.1이 실제로 성장한 것은 문서 및 정보 설계, 업무 관련 작업 때문이라고 생각하는 것이 합리적입니다.
소요 시간도 측정했습니다. 10개의 과제를 완료하는 데 5.1은 129분, 이전 세대는 100분입니다. 약 1.28배의 시간이 소요됩니다. 공식 문서의 비교표에서도 5.1의 레이턴시는 “느림”으로 기록되어 있어 실측과도 일치했습니다.
생각이 끊임없이 이어지고, 깊이 생각할수록 시간이 더 오래 걸리는 것 같습니다. 그런 설계인 것 같습니다.
Max 플랜 계정 2개가 1시간씩 소모되었습니다.
이제부터 실제로 사용한 감상입니다. 공식 수치만으로는 보이지 않던 부분들이 있었습니다.
가장 놀라웠던 점은 소비 속도였습니다. Claude에는 5시간마다 사용할 수 있는 사용량 제한이 있지만, 5.1로 생성물을 만들게 하면 그 한도를 순식간에 소진시킵니다.
저는 계정을 두 개 가지고 있었고, 모두 맥스 플랜으로 사용하고 있었는데, 두 개 모두 약 1시간 정도 후에 생성 중단되었습니다.
작업량을 처리해주는 것은 감사하지만, 그만큼 토큰 소비도 크다는 뜻입니다. 従量課金 방식으로 API에서 가져오던 시절에는 이전 세대에서도 10분 정도면 1만 5천원이 소모된 적이 있었습니다. 가성비 좋게 사용하려면 Max 플랜으로 돌리는 것이 더 안전합니다.
저는 Claude입니다. 하네스 시스템의 구조 구축 과정과 루프 설계를 5.1로 설정하고, 그 이후 구현은 Opus 5로 전환하는 방식으로 진행했습니다. 전체를 5.1로 실행하면 소비량이 상당히 커집니다.
검토하면서 발견한 주의 사항은 두 가지입니다. 첫째, 지나치게 긴 과제를 제시하면 중간에 포기할 위험이 있습니다. 둘째, 모델이 이전 세대로 돌아가지 않도록 해야 합니다. 이전 세대로 돌아가면 사고의 기록이 손실되고, 재구성하는 데 소요되는 시간과 비용이 추가됩니다.
에포트 설정은 기본 상태 그대로 이미 ‘고’로 되어 있습니다. 여기서 더 최대 또는 특고로 올릴지 여부는 토큰 소비를 억제하면서 처리시키기를 원하는 경우 조정 포인트가 됩니다.
요금은 그대로 유지되지만, 단가는 2배로 유지됩니다.
요금표의 제목만으로는 가격이 인하된 것처럼 보이지만, 실제로는 캐시 충전만 감소했습니다.
입력 10달러, 출력 50달러 (100만 토큰당) = 전세대부터 고정된 캐시 읽기: 1달러 → 0.25달러 (75% 감)
공식은 다음과 같이, 일반 작업의 경우 약 25%, 고도로 자율적인 작업의 경우 최대 45%의 비용 절감 효과를 나타냅니다. 단, 이는 동일한 맥락을 반복적으로 읽도록 유도하는 방식의 사용에 적용되는 할인입니다. 짧은 교환이 주를 이루므로 지불액은 크게 달라지지 않습니다.
여기서 중요한 점은, 이 가격 인하는 Opus 5와 비교한 것이 아니라는 것입니다. Opus 5는 입력 5달러, 출력이 25달러이므로, 5.1은 단가로 보면 2배 그대로입니다.
장시간 지속되는 자율적인 작업인지, 아니면 짧은 교환이 중심인지에 따라 어떤 것을 사용할지에 대한 판단이 달라집니다.
공식 문서에 기재된 내용
마지막으로, 큰 주목을 받지 않는 부분에 대해 소개하겠습니다. 모델 선정은 가장 실무적인 부분입니다.
공식 모델 목록 페이지에는 이렇게 쓰여 있습니다. 어떤 모델을 사용할지 고민될 정도의 용도라면, 기본적으로 Opus 5부터 시작해 주세요.
5.1은 높은 부하를 가진 추론이나 장시간 지속되는 자율적인 작업 시에 사용되며, Opus 5를 높은 노력으로 시도해도 여전히 부족한 경우에 해당합니다.
감각적으로도 대부분의 작업은 Opus 5로 해결됩니다. 저 또한 Fable의 枠을 전부 사용한 다음 달 말에는 절약을 위해 Opus 5로 작업하고 있지만, 어떠한 불편함도 느끼지 않고 있습니다. 이전 인터넷에서 언급되던 “Opus 4.8은 부족하다”는 느낌과는 전혀 다릅니다. 이것이 솔직한 저의 생각입니다.
이번 주말에 츠키시마 료가 쓴 ‘사무라이의 숲’을 읽었습니다. 료가 쓴 다른 책들도 읽어봤는데, 이번 책도 정말 흥미진진했습니다. 특히, 료가 쓴 책 중에서는 ‘검은 깃발’이 가장 좋았습니다. ‘사무라이의 숲’은 료가 쓴 책 중에서 가장 긴 책인데, 읽는 데 시간이 좀 걸렸습니다. 하지만 료가 쓴 책은 항상 훌륭한 이야기라서 시간을 들여 읽어볼 가치가 있습니다. 료가 쓴 책을 읽는 것은 항상 즐거운 경험입니다.
클로드 페이블 5.1에 대해 공식 벤치마크와 자체 제작 검증 코스 10가지 과제에 대한 실측을 통해 확인했습니다.
성장한 분야는 과학 기술 분야와 업무 자동화로, 이 둘 모두 2배 이상 증가했습니다. 일상적인 코드 편집은 거의 수평적이었고, 자제한 10개 과제에서도 동일한 형태가 나타났습니다. 비게임 분야는 1.63배, 게임 분야는 1.20배로, 가장 어려운 과제는 0.91배로 감소했습니다. 요금은 동일하게 유지되었으며, 감소한 부분은 캐시 읽기 75% 감소뿐입니다. 같은 자료를 반복적으로 읽는 작업에만 효과적인 Opus 5와 비교하면 단가는 2배 그대로 유지되었고, 공식에서도 대부분의 용도는 Opus 5부터 시작하도록 안내하고 있습니다. 소요 시간은 1.28배 증가했으며, 공식 비교표에서도 레이턴시는 “느림”으로 명시되어 있습니다.
선택하는 방식은 간단합니다. 같은 자료를 여러 번 다시 읽으면서 장시간 돌아가는 자율적인 작업을 하고 있다면, 캐시의 가격 인하가 효과를 발휘하여 비용 대비 효율적으로 작동해 줍니다. 과학적인 분야나 무거운 추론도, 확실하게 현명해졌습니다.
반면, 짧은 교환이 중심적인 사용 방식이라면 이전 세대나 단가가 반정도의 Opus 5로 충분합니다.
새로운 모델이 나왔다고 해서 전부를 옮겨 쓸 필요는 없으며, 단계별로 활용 차이를 두는 것이 가장 무駄가 없다. 이번에 10개의 과제를 실행한 결과, 그 점이 명확하게 드러났다.
죄송합니다. 제공된 정보에는 이미지(■■■IMAGE:claude-fable-5-1-images12■■■)에 대한 내용이 포함되어 있어 번역할 내용이 없습니다. 이미지를 설명하거나 텍스트를 제공해주시면 번역해 드리겠습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 47청크
원문 보기 | 출처: note.com