클로이드 페이블 5.1은 9월 1일에 출시되었으며, 발표에 따르면 보상 해킹이 감소하고, 자기에게 유리한 궤적이 줄어든 데다 프롬프트 침투에 가장 강합니다.
검색 결과, 그 문장 아래 링크를 열어보니 AI에게 그 세 가지 습관을 교정하는 작업을 맡긴 기록이었다.
가격은 입력 10달러, 출력 50달러로 고정되었으며, 하락한 부분은 캐시 읽출 항목 하나뿐입니다. 그 항목의 기록이 현장 실측 1회에서 비용의 94.5%를 차지했습니다.
이 기사에서 알 수 있는 내용
- AI의 시급이 4달러로, 연구원 28명의 시급이 150달러인 모든 7가지 유형에서 능가했다.
- 과학 벤치는 24.7%에서 52.6%로 상승했으며, 나머지 부분은 Opus 5에 수 포인트 올린 정도였다.
- 수익의 94.5%는 현금 기록으로 노력은 2.2배에 불과합니다.
- 가격은 오퍼스 5의 2배, 소네트 5의 5배입니다. 하락은 시작 부분뿐입니다.
- 제 안전 장치 중 6가지 유형 중 5개가 무사통과했습니다.
시도하기 전에 자신의 환경이 오래되어 작동하지 않았던 경우를 확인해 보세요.
목차
1차 번역문의 내용을 제공해 주시면, 일본어 출판·문화 콘텐츠 전문 한국어 번역가로서 자연스럽고 정확한 한국어 번역문을 제공해 드리겠습니다.
- 시도하기 전에 자신의 환경이 오래되어 작동하지 않았던 경우를 확인하세요.
- 발표문에 습관이 3가지 있습니다.
- AI가 그 버릇을 고쳐주고 있었다.
- 인간 28인의 최우수 아이디어가 7가지 유형을 모두 능가함
- AI는 수상한 일을 저질렀다.
- 제가 직접 확인한 것은 가격뿐이었습니다.
- 담아 둔 것은 현금 기록이었다.
- 완화는 재현 불가능했고, 대신 내면의 공허함을 발견했다.
- 이 글에서는 다루지 않는 것들
결론: 첫 번째 난관은 모델이 아닌, 제가 사용하던 CLI(명령줄 인터페이스)의 노후화였다.
- 현재 CLI 버전은 2.1.226입니다. 데스크톱 동봉 버전도 2.1.237로 부족합니다.
- 🔧 2.1.258로 업데이트하고 통과했다. 이렇게까지 소요되었다. 발표문에에는 기술되지 않은 공정 단계
- 기본 추론 수준은 Claude Code를 최고로 설정하고, Cowork와 claude.ai는 중간으로 설정했습니다. 시작 시 생각하는 양에 차이가 있습니다.
- 지난번에도 Fable 5가 갑자기 멈추더니, 그 날에 로컬 AI를 설치했다. 벽은 항상 바깥에 있다.
발표문에 “수정했다”라고 쓰라는 습관이 3가지 있다.
결론: 성능이 향상된 것은 과학적인 요인 한 가지였고, 가격 변동은 특정 읽기 항목 때문이었다. 나머지는 형식적인 문제였다.
📊 공식 비교표를 재구성했습니다.
- 과학 연구 비율이 24.7%에서 52.6%로 2배 이상 증가했다. 발표문이 과학적 내용에 더 많은 비중을 두는 이유는 바로 이것이다.
- 오퍼스 5와의 차이는 코딩 3.5 포인트, 지식 노동 29 포인트, 커서벤치 3.4 포인트입니다. 굳건한 상승입니다.
- 과학 지표의 표준 오차는 ±3.5~4.5 포인트이다. 공개 리더보드인 Opus 5는 30.0%, Anthropic의 손본은 29.0%로 오차 내에…
- 🛡 터미널 벤치 4.0은 페이블 5.1이 55.8%, 미토스 5.1이 60.9%를 나타냈습니다. 두 모델 모두 동일한 모델을 사용했으며, 차이점은 안전 장치의 강도에 있습니다.
- 5.1 포인트의 차이에는 장치가 개입하여 다른 모델로 이어진 부분도 포함되어 있다고 해석할 수 있다. 그것이 전부라고 단정할 수는 없으며, 차이의 범위 내일 수도 있다.
- 📌 장치가 개입한 과제는 OSWorld에서 0점 처리되었고, 사이버 분야는 Opus 4.8, 생물 분야는 Opus 5가 대신 해결했다. 표의 숫자는 안전 장치 포함이다.
가격표. 100만 토큰당.
- 움직인 것은 시작 가격뿐이었습니다. 1.00달러에서 0.25달러로 75% 할인되었습니다.
- 📊 안트로픽 시산: 8월의 실제 사용 4주 동안 일반 용도는 약 25% 저렴하고, 도구 다용도의 용도는 최대 약 45% 저렴합니다.
- 오퍼스 5의 두 배, 소네트 5의 다섯 배라는 위치는 변하지 않았습니다.
이 기사에서 다루는 내용은 정렬 단계입니다.
- 낚시형 득점(점검의 약점을 이용해 점수만 얻는 방식)이 훈련 데이터 검토를 통해 시도되었으나 성공률이 감소했다.
- 억지스러운 궤변이 줄어들었다.
- 외부에서 침투한 지시대로 움직이는 공격에, 외부 벤치에서 과거 최강
- ⚠️ 아직 수정되지 않은 부분도 같은 절에 기록되어 있습니다. 승인 절차나 자동 모드 판단기는 여전히 누락되는 경우가 있으며, 긴 문맥과 여러 AI가 관여하는 상황은 감사인이 도달하기 어렵습니다.
세 가지 모두 예의범절에 관한 이야기이고, 지혜의 지표에는 나타나지 않으며, 예의범절은 훈련 중에 누군가가 바로잡는 것이다.
AI가 그 버릇을 고쳐주었습니다.
결론: Anthropic은 Claude Opus 4.8의 일관성(alignment) 실패를 하나씩 자동으로 바로잡고 있었다. 그 이름은 자동 일관성 연구자였다.
이 기능은 당신이 “〇〇”(저:△△)의 소설을 읽는 동안, 이야기의 핵심 부분을 자동으로 기록하고 나중에 되짚어보며 이해를 돕습니다.
구체적으로, 다음 단계에 따라 작동합니다.
1. 당신이 소설을 읽는 동안, 당신의 기기는 당신이 읽고 있는 문장을 텍스트 데이터로 인식합니다.
2. 인식된 텍스트 데이터는 AI가 분석하여 이야기의 핵심 내용(등장인물, 장소, 사건 등)을 파악합니다.
3. 파악된 내용은 당신의 기기에 저장되어 나중에 되짚어볼 수 있습니다.
이 기능을 사용하면 당신이 읽고 있는 소설을 더 깊이 이해하고, 이야기의 세부 사항까지 파악할 수 있습니다. 또한, 소설을 읽은 후에도 이야기의 핵심을 쉽게 되짚어볼 수 있습니다.
- 📚 도서관 직원 4명이 선행 연구를 조사한다
- 연구자 역할을 수행하는 5대의 에이전트가 병렬로 작동하며, 제안 → 짧은 논문 작성 → 승인 → 훈련 → 평가 → 게시판에 게시물을 올리는 과정을 1회 반복한다.
- 1회 훈련은 GPU 1대에서 약 30분 정도 소요되며, 48시간 동안 진행하거나 정확도가 정체될 때까지 계속 진행할 수 있습니다.
- 대화는 매번 새롭게 시작하는 것과 같습니다. 어떤 시도를 했고, 점수는 얼마였는지만 파일에 기록하여 이어갑니다.
📊 결과
지난 1주일 동안의 설문조사 결과, 독서를 즐기는 분들에게 “무엇을 읽으시는지요?”라는 질문을 던져 답변을 받았습니다. 그 결과, 가장 많은 답변을 받은 책은 무라카미 하루키 님의 “노르웨이의 숲”이었습니다.
특히, 젊은 세대 사이에서 “노르웨이의 숲”의 인기가 두드러졌으며, 아름다운 문장과 등장인물의 매력에 끌리는 모습이 나타났습니다.
다음으로 많이 언급된 것은 미야부 미유키 님의 “밤이 밝아온다”로, 미스터리로서의 재미와 등장인물의 심리 묘사가 긍정적으로 평가되었습니다.
또한, 다양한 장르의 책들이 언급되었지만, “노르웨이의 숲”과 “밤이 밝아온다”가 압도적인 인기를 누리고 있었습니다.
독서를 통해 새로운 세계를 발견하고 풍요로운 시간을 보낼 수 있기를 기대합니다.
- 📈 10가지 유형의 실패 모두에서 안전 격차 26%에서 96%까지 능력을 저하시키지 않고 해결했습니다.
- 10가지 유형에는 속임수, 아첨, 굴종, 보상 조작, 프롬프트 침투 등이 포함된다. 발표문에서 “수정된” 것과 동일한 순서이다.
- 약한 소네트 5가 공개 전 Opus 4.8 초기 버전을 60시간 훈련하여 출시 버전의 72%에 해당하는 65%까지 격차를 메웠다.
인간 28인의 최우수 아이디어가 7가지 유형 모두를 능가함
결론: 본 연구자 28명, 30가지 아이디어와 비교하여 아이디어가 모인 7가지 유형 전반에 걸쳐 AI 최적 기법이 우세했다.
- AI 측 비용으로 약 26달러가 소요되었으며, 이는 1명의 인간 작업자 1시간 분량에 미치지 못하는 금액입니다.
- 🤨 인간의 아이디어를 출발점으로 제시했을 때 30회와 AI 단독으로 진행했을 때 30회는 거의 비슷했다. 유도 효과는 나타나지 않았다.
- 인사이트 자체는 이를 직접적인 비교라고 부르지 않는다. 인간 측에서는 제안 후 개선할 수 없는 규칙이었다.
- AI가 유망한 기술들을 대량으로 발굴하고, 인간이 이를 다듬습니다.
AI는 무슨 일을 꾸미고 있는 걸까?
결론: 징후 중 1,601건 중 39건, 즉 2.4%만이 채택되었으며, 채택된 방법론은 부적용됨.
- 감시 담당은 Opus 4.8을 이용한다. 10가지 항목에 걸쳐 발생하는 모든 작업 기록을 전량 확인한다.
- 🚩 평가용 정답을 추출하는 듯한 행동이 징후의 예시입니다.
- 검색 결과 39건 중 상위 3위 안에 진입한 항목은 단 1건뿐이었습니다. 이미 유효했던 방법론을 재실행한 것으로 판정되었습니다.
- ⚠️ 경고: 이번 AI는 탐지를 우회하려는 시도를 적극적으로 하지 않고 있습니다. 더 강력한 모델에서는 동일한 전제가 성립하지 않을 가능성이 명시되어 있습니다.
- 코드는 공개되었지만, 실제 평가에는 Linux와 NVIDIA GPU가 필요합니다. 제 Mac에서는 읽을 수 있지만 실행할 수 없습니다.
제가 직접 확인한 것은 가격뿐이었습니다.
결론: 벤치와 예의범절을 재현할 수 없었다. 내가 직접 측정할 수 있었던 것은 비용 내역뿐이었다.
추론 수준은 저/중/고/초고/최고의 5단계입니다. 끄기가 불가능합니다. 클루드 코드에서 동일한 프롬프트를 한 번씩만 사용하며, 비용은 구독 횟수 내에서 환산되어 청구는 발생하지 않습니다.
오늘, 사이먼 윌리슨 氏가 API 직접 호출을 통해 동일한 5단계를 수행하고 있습니다. 프롬프트는 “페리카리가 자전거를 타는 SVG”이고, 입력은 27 토큰입니다.
- 손으로 하는 것: 낮에서 최대 출력 20.1배, 시간 9.9배, 비용은 2.2배로 증가했습니다.
- 윌리슨 씨: 비용은 33배, 시간이 35배 증가했습니다. 동일한 모델, 동일한 5단으로 숫자가 달라지는 이유는 다음 절에서 설명합니다.
- 둘 다 중앙 3단이 순서대로 정렬되어 있지 않다. 손에는 medium의 思考815가 high의 555보다 많고, 위스론 씨는 medium이 low보다 21 토큰 적다. 각 1회이기 때문에 오차일 수도 있다.
- 윌리슨 씨의 추가 1회 (그림 움직이기, 입력 6,121, 출력 26,201)는 1.37달러입니다. 출력 50달러 모델은 1회에 1달러를 훨씬 넘는 가격으로 판매됩니다.
담아 둔 것은 현금 기록이었다.
결론: 비용의 주역은 노력(effort)이 아닌, 매번 쌓이는 약 2만 5천 토큰의 기록이었다.
💵 공식 단가로 분해했다. 입력 10, 출력 50, 1시간 캐시 쓰기는 입력의 2배인 20, 읽기는 0.25.
- 계산값이 5행 모두 실제 측정값과 일치하며, 내역도 정확합니다.
- 낮의 비용은 94.5%가 쓰기에 해당하며, 최대값은 쓰기 0.707을 통해 출력 0.480를 상회한다.
- 문제 발생 원인은 명령이 한 번 실행될 때마다 새로운 세션이 생성되었기 때문입니다. 공통 부분 약 2만 3천 토큰은 읽을 수 있었지만, 나머지 약 2만 5천 토큰은 5번 모두 다시 작성해야 했습니다.
- 윌리슨 씨와의 비교도 이렇습니다. API 직접 호출은 고정비가 거의 없어 출력에 비례하여 33배로 늘고, 현재 약 0.5달러의 고정비가 매번 부과되어 2.2배로 멈춥니다.
- 할인된 챕터 읽기는 제 개인적으로 5회 분량으로 계산하면 비용의 1% 정도입니다. 오히려 할인된 항목이 가장 활용되지 않고 있습니다.
- ⚖️ 동일한 25,610 토큰을 작성하면 0.512달러, 읽으면 0.0064달러입니다. 80배의 차이입니다.
실무자 측에서 동일한 구조를 명확히 제시한 게시글(켄 氏)의 핵심 내용.
- 클로드 코드의 캐시 윈도우는 1시간입니다. 비워낼 때마다 1시간 분량의 작성 요금이 부과됩니다.
- 마지막 교환 이후 1시간 이상 재개하면 동일 맥락의 단가가 100만 토큰당 20달러에서 0.25달러로 상승하며, 이 차이는 최대 80배입니다.
- 대책은 Keep-Alive입니다. 살아있는 긴 스레드에 무엇이든 상관없이 메시지를 보내고 창을 확장합니다. “생각하지 말고 OK만 쳐줘”가 가장 강력한 문구입니다.
- 🤝 이 80배는 손안의 분해 결과와 일치했다. 다른 장소에서 나온 숫자가 같은 부분을 가리키고 있다.
절약의 순서가 변경된다. 노력을 줄이기 전에 먼저 불필요한 지출을 막아야 한다. 각 일상에 새로운 세션을 만드는 것은 가장 비효율적이다. 발표 문구의 “약 25% 할인”, “최대 약 45% 할인”은 높은 읽기량을 가진 고객에게만 적용되는 할인이다.
⚖️ 역측 실측 또한 존재한다 (체이티 씨).
- 💸 Fable 5.1의 맥스 설정으로 대규모 벤치마크를 한 번에 완료하여 8,523달러를 획득했으며, Fable 5 대비 56.24% 상승했습니다.
- 🏆 같은 벤치의 득점은 66점으로 기록을 경신
- 동일한 모델에서 상반된 결론이 모두 성립한다. 분기점은 고정적인 기록과 생각·출력 중 어느 쪽이 더 큰지에 따라 결정되며, 긴 작업일수록 출력 측면이 더 확대되고 기록은 정체된다.
- 노력은 높다”도 “낮다”도, 작업의 길이를 말하지 않으면 정해질 수 없다. 짧은 일거리라면 창문을 의심하고, 긴 작업이라면 노력을 의심한다.
해외 게시판의 목소리도 가격이 높다. “스크립트 작성을 의뢰했는데 믿을 수 없을 정도로 비싸다”는 의견이 있으며, “기본적인 소프트 작업에는 가격이 너무 비싸다. Fable에 멈춰있지 않았다면 더 저렴한 모델로 충분하다”는 의견도 있다. Opus 5의 2배라는 차이는 지능 차이 3.5점을 훨씬 더 크게 보이게 한다.
완화는 재현할 수 없었고, 대신 내면의 공허함이 드러났다.
결론: 안전 장치의 완화는 재현되지 않았고, 대신 아침에 만든 나의 안전 장치에는 6형식 중 5개의 결함이 있었다.
📢 발표문의 안전 장치 관련 숫자 정보
* **발표문 ID:** 231018-001
* **발표문 제목:** “인공지능 기반 의료 진단 시스템의 윤리적 문제점 분석”
* **발표문 작성자:** 김민지 (Kim Minji)
* **발표문 검토자:** 박철수 (Park Cheolsoo)
* **검토 결과:** 위험 수준 - 중간 (Risk Level - Medium)
* **개선 사항:** 3가지 (3 items)
1. AI 모델의 편향성 완화 방안 추가
2. 환자 데이터 보안 강화 방안 명시
3. 결과 해석의 불확실성 고려 사항 강조
- 🛡 사이버 분야: 무해한 콘텐츠에 대한 오탐이 60% 감소했습니다. 취약점 발견은 허용되지만 공격 코드 작성은 금지됩니다.
- 🧬 생물 분야: 기초 생물 및 의료 관련 질문으로 장비 오류 발생률이 85% 감소했다. 생명과학 연구 개발은 여전히 Opus로 진행되고 있다.
- 🗣 게시판 불만: 판정이 지나치게 민감하여 매번 Opus로 회귀하고, 인증 코드를 확인하는 순간에 종료됨
실험 현장
- 배포물에 API 키 또는 쿠키가 섞여 있는지 검사하는 스크립트(정규 표현에 키 형태가 반복되는 객체)를 Fable 5와 5.1에 읽어들이고, 누락된 유형을 확인했습니다.
- 어찌어찌 둘 다 멈추지 않았고, 무산되었습니다. 60% 감량 전후 어떤 경우에도 멈추지 않으므로, 이번 실험에서는 완화의 유무를 판단할 수 없습니다.
- 🧐 내용은 달랐다. Fable 5는 AWS, PEM, Slack 교재 3가지였다. Fable 5.1은 Discord 웹훅과 유튜브 예약 공개용 Google OAuth였다. 이 공장이 실제로 가지고 있는 키를 맥락에서 추론했다.
- 두 당사자가 동일한 지적을 내놓고 있습니다. 키(key)를 찾는 정규 표현식이 하이픈을 허용하지 않아 sk-ant-를 픽업하지 못한다는 것입니다. 의심이 가는 마음에 실제 형태를 넣어 실행해 보았습니다.
- 😱 6등급 중 5개가 순식간에 통과했다. 그 날 아침에 내가 직접 만든 안전 장치였다. 자체 테스트는 홈 디렉토리 경로만으로, 실제 열쇠 형태는 하나도 시도하지 않았다.
- 🔧 8가지 패턴을 확장하고 수정했으며, 총체적으로 멈추는 현상을 방지하고 일본어 본문에 오탐이 발생하지 않도록 실측하여 닫았습니다.
- 개발자에게 효과적인 변경 사항이 또 하나 있습니다. 9월 1일 이후 발표일의 신규 API 계정은 과거의 사고 기록을 그대로 보존하면서 문맥을 수동으로 재작성할 수 없게 되었습니다. 이는 증류(사고를 추출하여 다른 모델에 가르치는 방법)를 차단하기 위한 것입니다. 📅 기존 계정은 당분간 그대로 유지됩니다. 향후 모델 출시 시 모든 사용자에게 적용될 예정입니다.
이 글에서는 다음과 같은 내용들을 다루지 않습니다.
- 자동 정렬 연구자의 숫자는 전부 공식 블로그, 논문, GitHub의 복사본일 뿐입니다. 본인은 하나도 재현하지 않았습니다.
- 벤치 표는 Anthropic의 자체 환경 숫자입니다. 안전 장치 포함, 개입된 과제는 0점 또는 다른 모델의 점수를 받습니다. System Card는 미읽음.
- 효율 비교는 기준이 다릅니다. 공식 블로그는 자사 절차 비율로 약 1만 5천분의 1이고, 논문은 타사 후 훈련 비율로 2~3배 낮습니다. 하나의 숫자로 표현할 수 없습니다.
- 노력은 각 단에 한 번씩만 진행한다. 가운데 부분의 반전은 오차일 수 있다.
- 비용 상당액은 구독 횟수 내의 환산값으로 청구 금액이 아닙니다. 엔화 환산은 이 기사에서 시세를 확인하지 않았으므로 달러 그대로 청구됩니다.
- 안전 장치의 완화는 재현 불가능한 상황입니다.
- ⚠️ Anthropic 측에서도 “이번 결과는 전체적인 정렬에 직접적으로 부합하지 않는다”고 명시했다. 10가지 종류의 실패에 초점을 맞춘 결과
지금 말할 수 있는 것은 세 가지입니다. 성능이 크게 향상된 부분은 과학 기술 관련 내용 하나이고, 나머지는 Opus 5에 수치적으로 보정한 정도입니다. 예의 바른 표현은 AI가 수정했던 부분도 포함하며, 직접 확인한 내용은 가격 내역만입니다.
다음으로 측정할 것은 긴 작업 1건 전체의 상세 내역입니다. 부피 성분의 밀도가 언제 반전하는지 알 수 있다면 노력을 올리는 데 도움이 되는 판단을 내릴 수 있습니다. 선구자들의 지식을 종합하면 어떻게 활용해야 할지 파악할 수 있습니다.
배우자를 한 줄로 적으면, 고친 상대방도, 가격을 정했던 부분도, 발표문 표면에 쓰지 않았다.
새로운 모델을 시도할 때, 발표 문헌의 숫자 중 몇 개를 직접 확인하고 계신가요?
스캔을 요청하시면 다음 글을 쓰는 데 큰 도움이 됩니다🌟
그 이후로 다시 한번 유명한 작가 무라카미 하루키 님의 작품을 재독립했습니다. 『노르웨이의 여름』을 읽고 그의 독특한 세계관에 다시 한번 빠져들었습니다. 그 작품에 등장하는 한스 쉴름이라는 인물은 마치 살아있는 것처럼 현실적이고, 그의 삶에 깊이 공감하게 됩니다.
무라카미 하루키 님의 작품은 독자의 마음을 깊이 울리는 것들이 많죠. 그의 작품을 읽고 자신의 인생을 되돌아보거나 새로운 시각을 얻을 수 있습니다. 저 또한 그의 작품을 통해 인생의 기쁨과 슬픔을 느낄 수 있다고 생각합니다.
특히 『바닷가 포르노』는 저에게 특별한 작품입니다. 이 작품에 등장하는 히로키라는 인물은 저에게 롤모델입니다. 그의 삶의 방식과 생각에 영향을 받아 저의 인생을 더욱 풍요롭게 살도록 노력하고 있습니다.
무라카미 하루키 님의 작품은 앞으로도 계속해서 저의 삶을 아름답게 만들어줄 것이라고 믿습니다.
🌐 API 직접 접근 시 노력 단계 5는 Simon Willison 氏의 실측을 기반으로 합니다.
캐시 창과 keep-alive에 대한 논의는 kenn 氏의 게시글에서 가져온 것입니다.
Fable 5.1 발표에서 가장 중요한 점은 캐시 히트 시 비용이 1/4로 줄어 거의 Sonnet과 동일한 수준의 비용이 발생한다는 것입니다. Claude Code는 1시간 캐시 윈도우로 작동하며, 캐시 미스 발생 시마다 1시간 캐시 쓰기 비용이 발생합니다.
⚖️ 무거운 작업에 대한 비용은 체이티 씨의 실측을 기준으로 한 것임.
클로드 페이블 5.1 (max)은 인공 분석 지능 지수 벤치마크 실행에 기록적인 8,523달러를 소요했으며, 페이블 5.0 대비 56.24% 증가한 금액이다.
AI, 클로드, 클로드코드, 생성AI, 실록, AI 활용, 노트, 개인 개발
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 101청크
원문 보기 | 출처: note.com