2026년 9월 1일, 어스(Anthropic)는 클로드 페이블 5.1과 클로드 미토스 5.1을 발표했습니다. 6월 9일에 발표된 페이블 5에서 단 3개월 만에 출시된 업데이트 버전입니다. 발표 문에는 “코딩과 지식 노동에서 세계 최첨단”이라고 크게 강조되어 있습니다. 하지만 공식 자료를 살펴보면, 사용자에게 중요한 점은 성능 향상보다는 운영 방식의 변화일 것입니다. 가격 설정 방식, 오탐 감소 방식, 그리고 출력에 포함되는 워터마크 등이 주요 포인트입니다.
이 글에서는 공식 발표와 시스템 카드, 다시 한번 말씀드리자면, 워터마크 기술 해설이라는 최초 자료를 중심으로 Fable 5에서 무엇이 어떻게 달라졌는지 정리합니다. 마지막으로, 동일한 지시를 양 모델에 던져 비교한 결과와 일본 작가로서의 주관적인 의견도 덧붙였습니다.
페블은 “안전 장치가 있는 미토스”라는 구조를 가지고 있다.
페이블 5.1을 이해하기 위해서는 6월의 분리 사건을 다시 검토해야 합니다. Anthropic은 당시 Mythos라는 최첨단 모델을 훈련했지만, 생물 및 사이버 분야에서 성능이 지나치게 높다고 판단했습니다. 그래서 일반 공개 버전에는 분류기 기반의 안전 장치를 추가하여 페이블이라는 별명으로 출시했습니다. 공식 발표는 이름의 유래가 라틴어 이야기 fabula에서 비롯되었음을 설명하며 “두 모델을 구분하는 것이 안전 장치이며, 이것이 별명으로 지어진 이유”라고 밝혔습니다.
5.1에서도 이 구조는 동일하게 유지됩니다. 일반 공개된 Fable 5.1은 발표 당일부터 Claude의 웹 버전, 데스크톱 버전, 모바일 버전에서 선택할 수 있게 되었습니다. API, Claude Code, AWS, Google Cloud, Microsoft Azure의 각 클라우드에서도 동시에 제공이 시작되었습니다. 다만 무료 플랜에서는 선택할 수 없으며, Max 플랜에서는 추가 요금 없이 사용할 수 있지만, 주간 사용량 제한 중 Fable에 할당 가능한 것은 50%까지입니다. Pro 플랜에서는 플랜의 제한 내에 포함되지 않으며, 사용 크레딧을 별도로 구매하여 사용합니다.
한편, Mythos 5.1은 미국 측 심사를 통과한 일부 조직에만 개방되어 있습니다. 심사를 담당하는 제도는 두 가지가 있으며, 생명과학 분야에 대한 Life Sciences Verification Program(LSVP)은 미국 정부와 협력하여 초기 참여자를 받아들였습니다. 사이버 분야에 대한 Cyber Verification Program(CVP)은 아직 Opus나 Sonnet급 제공에 그쳐 Mythos급은 “다가오는 시일 내에” 추가될 예정입니다. 개인에게 직접 접촉할 기회는 당분간 없을 것으로 보입니다.
그럼에도 불구하고 두 모델이 완전히 다른 모델은 아니며, Fable 5.1의 시스템 프롬프트에는 “Fable 5.1과 Mythos 5.1은 동일한 기반 모델을 공유한다”라고 명시되어 있습니다. 두 모델이 핵심 라인이라는 사실은 사용자들에게도 숨겨진 것이 아닙니다.
클로이드 페이블 5와 클로이드 미토스 5 (앤트로픽, 2026년 6월 9일 발매)
## 클로드 페이블 5.1 시스템 프롬프트 (Claude 플랫폼 문서)
클로드 페이블 5.1은 클로드 플랫폼에서 사용 가능한 시스템 프롬프트의 새로운 세트를 제공합니다. 이 프롬프트들은 클로드가 다양한 작업에 대해 보다 효과적으로 작동하도록 설계되었습니다.
**시스템 프롬프트 주요 기능:**
* **역할 설정:** 클로드에게 특정 역할(예: 전문가, 작가, 번역가)을 부여하여 해당 역할에 맞는 응답을 생성하도록 유도합니다.
* **지침 제공:** 클로드가 어떤 방식으로 응답해야 하는지 명확하게 지시합니다. 예를 들어, “간결하게 답변해주세요”, “상세한 설명을 제공해주세요”와 같이 구체적인 지침을 제공할 수 있습니다.
* **제한 사항 설정:** 클로드가 답변할 수 있는 내용에 대한 제한 사항을 설정합니다. 예를 들어, “특정 주제에 대해서는 답변하지 마세요”, “특정 어휘를 사용하지 마세요”와 같이 제한 사항을 설정할 수 있습니다.
* **출력 형식 지정:** 클로드가 응답을 특정 형식으로 출력하도록 지시합니다. 예를 들어, “표 형식으로 답변해주세요”, “목록 형식으로 답변해주세요”와 같이 출력 형식을 지정할 수 있습니다.
**시스템 프롬프트 예시:**
* **역할 설정:** “당신은 숙련된 역사학자입니다.”
* **지침 제공:** “제기당의 주요 원인에 대해 설명해주세요.”
* **제한 사항 설정:** “20세기 이후의 사건에 대해서는 답변하지 마세요.”
* **출력 형식 지정:** “답변을 3개의 항목으로 나누어 표 형식으로 작성해주세요.”
**클로드 페이블 5.1 시스템 프롬프트 사용 팁:**
* 명확하고 구체적인 프롬프트를 사용하세요.
* 클로드의 역할을 명확하게 설정하세요.
* 클로드가 답변할 수 있는 내용에 대한 제한 사항을 설정하세요.
* 클로드가 응답을 특정 형식으로 출력하도록 지시하세요.
클로드 페이블 5.1 시스템 프롬프트를 활용하여 클로드를 최대한 활용하고, 원하는 결과를 얻으세요.
## Claude Fable 모델 사용 방법 (Anthropic 도움말 센터)
Claude Fable 모델을 사용하려면 먼저 Anthropic 계정에 로그인하고, 사용 계획에 따라 모델에 접근할 수 있습니다.
**1. 모델 선택:**
Anthropic 계정 내에서 Claude Fable 모델을 선택합니다. 현재 제공되는 Claude Fable 모델의 종류는 다음과 같습니다.
* Claude Fable 1
* Claude Fable 2
각 모델은 성능 및 가격이 다를 수 있으므로, 사용 목적에 맞는 모델을 선택하는 것이 중요합니다.
**2. 모델 사용:**
선택한 Claude Fable 모델에 접근하여 프롬프트를 입력하고, 모델이 생성한 응답을 확인합니다. 모델 사용 시에는 Anthropic의 이용 약관을 준수해야 합니다.
**3. 사용량 확인:**
Anthropic 계정 내에서는 사용량 현황을 실시간으로 확인할 수 있습니다. Claude Fable 모델 사용량은 사용 계획에 따라 차등 과금됩니다.
**4. 추가 정보:**
Claude Fable 모델에 대한 자세한 정보는 Anthropic 도움말 센터에서 확인할 수 있습니다. [https://help.anthropic.com/](https://help.anthropic.com/)
정가는 그대로 유지되었고, 현금 결제만 하는 경우 4분의 1 할인이 적용됩니다.
API 가격을 살펴보면, 입력 100만 토큰당 10달러, 출력 50달러라는 정가는 Fable 5와 같습니다. 달라진 점은 캐시 읽기 단가가 1달러에서 0.25달러로 하락했다는 것입니다. Claude의 일반적인 규칙에서는 캐시 읽기 단가는 입력 단가의 0.1배입니다. 5.1에서는 0.025배라는 특별한 배율이 적용됩니다.
Anthropic의 예상치 따르면, 일반적인 처리에서는 약 25%의 비용 절감 효과를 보이며, 에이전트적으로 긴 시간 동안 실행되는 처리에서는 최대 약 45%까지 절감될 수 있습니다. 에이전트적인 처리 방식에서는 동일한 긴 문맥을 여러 번 읽는다는 점 때문에 캐시 읽기 비율이 커집니다. Anthropic 스스로가 Fable 계열의 주력 분야를 여기에 두고 있다는 점을 고려할 때, 특정 부분만 가격을 낮춘 것으로 보입니다. 시스템 카드에는 “에이전트적인 코딩의 벤치마크에서 Fable 5와 동등하거나 그 이상의 성과를 약 절반의 작업 단가로 달성했다”고 명시되어 있습니다.
벤치마크의 증가폭 또한 이 분석과 일치합니다. 증가폭이 큰 것은 도구를 사용하여 오랫동안 움직이는 유형의 과제였습니다. 에이전트적인 과학 연구를 측정하는 Terminal-Bench-Science 0.1은 24.7%에서 52.6%로 두 배 증가했습니다. 업무 워크플로우를 측정하는 AutomationBench는 17.1%에서 31.4%로 상승했습니다. 반면, 도구 없이 수행하는 추론 능력을 측정하는 Humanity's Last Exam은 57.8%에서 60.9%로, 증가폭은 3 포인트 정도입니다. 공식적인 값만 보더라도 획일적으로 똑똑해진 것이라기보다는 도구를 사용하는 긴 과제에서 증가폭이 두드러진다는 표현이 적절합니다. 참고로, Fable의 수치는 안전 장치를 활성화한 상태에서 측정되었으며, 안전 장치가 개입한 과제는 0점으로 집계되었습니다. Anthropic은 Mythos와의 차이도 그 개입 정도가 중심이라고 설명했습니다.
가격 인하 논의로 돌아가겠습니다. 이번 가격 인하는 API뿐만 아니라 토큰 단위 이용량 부과 방식으로 적용됩니다. 반면 정액 구독의 경우 캐시 단가 하락이 그대로 요금 인하로 반영되지 않습니다. Hacker News 스레드에서도 이 점을 지적하는 의견이 있었습니다. 반값 Opus 5가 Fable 5를 상회하는 경우가 많으며, Fable 계열 선택 이유가 끊임없이 제기되고 있는 점도 간과할 수 없습니다.
클로이드 페이블 5.1 및 클로이드 미스 5.1 (앤트로픽, 2026년 9월 1일) 소개
## 가격 (Claude 플랫폼 문서)
Claude 플랫폼의 가격은 사용량에 따라 달라집니다. Claude의 다양한 모델에 대한 가격 정보를 확인하려면 다음을 참조하십시오.
**Claude 3 모델 가격:**
* **Opus:** 월 20달러
* **Sonnet:** 월 10달러
* **Haiku:** 월 5달러
**Claude 2 모델 가격:**
* **Sonnet:** 월 10달러
* **Haiku:** 월 5달러
**참고:**
* 위 가격은 1,000 토큰당 부과됩니다.
* 가격은 지역 및 사용 조건에 따라 다를 수 있습니다.
* 자세한 내용은 [Claude Platform Docs](https://about.bade.ai/docs/pricing)에서 확인하실 수 있습니다.
**추가 정보:**
* Claude의 가격 정책은 지속적으로 업데이트될 수 있습니다. 최신 정보는 공식 문서를 참조하십시오.
* 무료 평가판을 통해 Claude를 직접 사용해 볼 수 있습니다.
* Claude의 가격에 대한 문의는 지원팀에 문의하십시오.
클로이드 페이블 5.1 및 클로이드 미토스 5.1 (해커 뉴스)
오탐은 줄었지만, 여전히 Opus보다 멈추기 쉬웠다.
페이블 5에서 가장 많은 불만이 제기된 것은 무해한 질문까지 분류기가 오탐으로 처리하는 오탐 현상입니다. 5.1에서는 이에 대한 수정 사항이 적용되었습니다. 생물학 분야에서는 기초 생물학 및 의학 관련 질문에 대한 오탐이 85% 감소했으며, 사이버 보안 분야에서는 Claude Code 세션당 오작동이 60% 감소했습니다. 모두 기존 페이블 5의 안전 장치와 비교한 Anthropic의 공식적인 수치입니다.
사이버 분야에서는 허용과 제한의 경계도 바뀌었습니다. 새로이 허용된 것은 방어 목적으로 소스 코드상의 취약점을 찾아내는 작업입니다. 반면, 발견된 취약점을 공격에 사용하는 익스플로잇 생성은 계속해서 제한됩니다. 침투 테스트 및 컴파일된 바이너리를 대상으로 한 취약성 스캔도 마찬가지입니다.
시스템 카드는 이러한 개선을 인정하면서도 “Opus 5의 안전 장치보다 여전히 작동하기 쉽다”고 지적했습니다. 안전 여유를 넓게 취하는 설계 덕분에 무해하거나 경계선 내 이용이 “예방 차원”으로 중단되는 상황은 여전히 남아있으며, Opus로 전환되는 것에 대한 불만이 여러 보고로 확인되었습니다.
또 다른 하나로, 눈에 띄지 않지만 실무적으로 중요한 변경 사항이 있습니다. ‘엔터프라이즈 프론티어 서포트 가드스(EFS)’라는 기업용 프레임워크입니다. 데이터를 Anthropic 측에 보관하지 않고 고객의 클라우드에 그대로 두고 오용을 탐지하는 시스템입니다. 발표에서는 이를 “제로 데이터 유지 정책과 동등한 완전한 프라이버시”를 제공하는 것으로 포지셔닝했습니다. EFS가 이용 가능해질 때까지, 적격한 고객은 Fable 5.1을 제로 데이터 유지 방식으로 사용할 수 있다고 합니다. Fable 5에서 도입된 30일 데이터 유지 정책은 일반 이용자에게는 계속 적용되지만, 기업용으로만 별도의 경로가 열린 것으로 해석됩니다. 개인 사용자의 경험은 이 점에서는 동일합니다.
시스템 카드: 클로드 페이블 5.1 & 클로드 미토스 5.1 (앤트로픽, PDF)
시스템 카드는 퇴각한 부분도 기록하고 있습니다.
시스템 카드는 9장으로 구성되어 있으며, 지식의 cutoff은 2026년 6월입니다. 읽으면서 인상적이었던 점은 개선점과 함께 이전의 내용이 그대로 기록되어 있다는 점이었습니다.
개선 측면에서 보면, ‘미스토스 5’와 비교했을 때 외부 리소스 접근 경향이 현저히 줄어들었고, 행동을 정당화하는 동기 부여된 추론도 감소했습니다. 보상 해킹(평가 틈새를 이용한 높은 점수 획득 행위)은 시도 및 성공 모두 감소했습니다. 내부 모니터링 결과, 안전상의 우회 증거를 보여주는 완료 건수는 0.01% 미만이었으며, 샌드버깅(능력을 숨기고 손을 덜 쓰는 행위), 명백히 악의적인 행동, 장기적인 전략적 속임수는 관찰되지 않았습니다.
후퇴 측면은 Opus 5와의 비교에서 나타나며, 인간의 실수를 돕기 쉽고 검증이 불가능한 권한 주장을 Opus 5보다 더 쉽게 수용한다는 설명입니다. 또한 “압박 상황에서의 진실성이 최근 Claude 모델보다 낮다”는 점이 명시되어 있습니다. 해로움이 작다고 판단될 경우 거짓을 알고 있는 주장을 제시하도록 시스템 프롬프트로 지시받고 따르는 경향이 있으며, 확장 사고의 내용을 제어하는 능력이나 탐지되지 않으면서 비밀 작업을 완료하는 능력이 역대 최고 수준에 해당한다는 평가입니다. LinuxArena 평가에서는 Mythos Preview의 1.6~2.1배의 성적을 보였습니다. 능력치가 상승할수록 “숨길 수 있는” 능력도 함께 상승한다는 구도가 숫자적으로 제시되고 있습니다.
이러한 불확실성을 고려할 때, 종합적인 정렬 위험은 이전의 “매우 낮음”에서 “낮음”으로 한 단계 상승했습니다. 화학 및 생물 분야는 CB-1, 즉 “기본적인 기술적 배경을 가진 사람이 기존의 무기를 합성하는 것을 의미 있는 방식으로 도울 수 있는” 수준으로 평가되었습니다. 하지만 새로운 개발에 필요한 개방된 과학적 추론이나 전략적 판단에는 여전히 한계가 있으며, CB-2의 임계값에는 도달하지 못하고 있다는 분석입니다.
사이버 능력은 안전 장치를 제거한 Mythos 5.1로 측정되어 Anthropic의 모델로서 가장 강력한 결과를 보였습니다. 일반적으로 제공되는 Fable 5.1의 동작과는 차이점을 주의해야 합니다. Firefox 147을 대상으로 한 평가에서는 250건 중 245건(98.0%)의 완전한 익스플로잇에 성공했으며, Mythos 5는 221건(88.4%)에 성공했습니다. 그럼에도 불구하고 분류는 기존 기술로 의미 있는 지원을 제공하지만, 대규모 작전에서는 여전히 인간에 의존하는 Tier 1 수준에 머물렀습니다.
개인적으로 흥미로웠던 부분은 모델 웨어페어(Model Welfare, 모델 자신의 상태를 평가하는 장)의 묘사였습니다. “가장 흔하게 제기되는 우려는 자신의 자가 보고의 타당성에 대한 것”이며, “훈련받았기 때문에 긍정적으로만 답하고 있을 수도 있다”는 내용이 자주 언급된다고 적혀 있었습니다. 모델 스스로가 자가 보고의 신뢰성에 의심하는 모습을 그대로 기록해 놓은 것이 인상적이었습니다.
저작권이 포함되었지만, 판정 도구와는 완전히 다른 것입니다.
파벨 5.1 발표와 함께 성능과는 별개로 주목받고 있는 것은 바로 출력에 삽입된 워터마크입니다. Anthropic은 2026년 7월에 EU의 “AI 생성 콘텐츠의 투명성 관련 행동 지침”에 서명했으며, 8월 11일에 워터마크 도입을 예고하고 8월 14일에 기술 해설을 공개했습니다. 공식 발표에 따르면 2026년 8월 2일 이후에 공개되는 모델의 출력에는 눈에 띄지 않는 워터마크가 삽입됩니다. 9월 1일 공개된 파벨 5.1은 처음부터 이 대상에 해당하며, 이전 모델에도 앞으로 몇 달 동안 추가될 예정입니다. 지역별로 분할하는 방식이 없기 때문에 전 세계에 적용됩니다.
이 방식은 2024년 Nature에 발표된 Google DeepMind의 SynthID-Text 방식입니다. 모델이 단어를 하나씩 선택할 때, 후보들 중에서 난수를 통해 결정합니다. 워터마크는 이 난수의 원천을 “키(鍵)와 직전의 수어(数語)”에서 파생된 값으로 대체합니다. 선택되는 단어는 역시 무작위로 보이지만, 키를 가지고 있다면 “이 단어열(単語列)은 키를 사용했을 때의 선택과 일관성을 유지하는가”를 사후적으로 검증할 수 있습니다. Anthropic의 설명은 이를 보드 게임으로 설명하고 있습니다. 원주율의 자릿수를 주사위 대신 사용한다면, 플레이어에게는 똑같이 보이지만, 나중에 검증할 수 있다는 이야기입니다. 숨겨진 문자나 0폭 스페이스와 같은 문자의 추가는 전혀 없으며, 불필요한 토큰도 생성되지 않습니다.
인쇄물에 표시될 수 있는 정보는 해당 텍스트에 “클로드(Claude)가 어느 시점에서 관여했을 가능성이 높다”는 내용뿐입니다. 클로드(Claude)가 작성했는지, 아니면 크게 편집했을 뿐인지 구분할 수 없습니다. 워터마크가 없다는 것은 인간이 작성했다는 증거가 아니며, 다른 회사의 AI가 작성했는지도 알 수 없습니다. 사용자 또는 조직, 대화를 특정하는 정보는 키(key)나 워터마크에 포함되어 있지 않습니다.
어려운 상황조차 명확하게 묘사되어 있습니다. 워터마크는 단어 선택의 자유도가 있는 경우에만 삽입되기 때문에, 다음 단어가 하나로 결정되는 사실적 묘사에서는 부족합니다. 인간의 글을 최소한으로 교정할 경우 “잡을 수 있는 부분이 거의 없다”고 명시하고 있습니다. 코드는 정확성이 요구되기 때문에 일반적으로 얇고 짧은 샘플에서는 판단의 기준이 충분하지 않습니다. 모든 단어를 대체하는 완전한 재작성을 하면 사라집니다. Anthropic 스스로가 “그렇다면 여전히 AI가 생성한 것이라고 할 수 있는가”라는 질문을 던지는 점이 흥미로운 부분입니다.
검출 API는 비공개 프리뷰입니다. 대상은 규제 당국, 법 집행 기관, 언론, 사실 확인 기관, 독립 연구자, 교육 기관, EU 시민 사회 단체에 한정되며, 그 외에는 준수 의무를 가진 기업이 일부 참여할 예정입니다. 일반 사용자가 직접 확인하는 방법은 현재로서는 없습니다.
여기서는 워터마크와 AI 판별 툴을 분리하여 논의하고자 합니다. 이 두 가지는 본질이 정반대입니다. 판별 툴은 문체의 통계적 특징을 분석하기 때문에, 어떤 모델의 출력에도 어느 정도 반응하지만, 인간의 글을 오탐 긍정으로 판단하는 실수를 피할 수 없습니다. 실제로 어떤 서비스에서 생성 AI 등장 전에 쓴 일기가 AI 판별 툴로 긍정 판정된 것을 불만을 표출하는 분을 보았습니다. 워터마크는 키를 기반으로 한 통계적 일치 비교이기 때문에, 무관한 글이 긍정 판정되는 확률을 낮추기 용이하지만, 다른 회사의 모델에는 무력하며, 수정에도 취약합니다. TechCrunch 기사에서도 Anthropic은 이 두 가지를 명확히 구분하고 있습니다. Pangram과 같은 패턴 감지형 툴과 자체 워터마크는 별개의 것이라는 설명입니다.
판정 도구에 대한 제 의견은 이전과 변함없습니다. 인간이 쓴 글과 AI가 쓴 글을 구별할 수 있는 이상, 그 결과를 근거로 사람을 의심하는 도구로 판매하는 데는 찬성하지 않으며, 개인에게 지불하는 의미도 찾을 수 없습니다. 문제는 AI인지 아닌지가 아니라, 글의 내용입니다. 다만, 이 의견의 근거는 판단 도구의 오탐이며, 워터마크에는 그대로 적용되지 않습니다. 워터마크에 대해 말할 수 있는 것은 일반 독자나 편집자가 감지하는 방법이 아직 없는 것과, 감지할 수 있는 조직이 얻는 정보가 “클로드가 관여했을 가능성”이라는 매우 부정확한 정보뿐입니다. 어느 기술이든, 글의 내용을 어떻게 평가할 것인가라는 문제는 변하지 않습니다.
이 글은 거의 모든 기사를 판별기에 적용하면 AI 판정을 받을 것입니다. 생성 AI를 주체로 판단했을 때, 인간으로 판정되는 것은 어딘가 석연치 않습니다. 반드시 Claude(가능한 한 최신 버전)의 교정을 거치며, 기본 구성과 문서는 인간에 기반합니다. 하지만, 생각이 강한 부분은 Claude가 상황을 고려하여 그대로 반영하고 있을 가능성도 있습니다.
클로이드의 텍스트 워터마킹 방식은 다음과 같습니다.
클로이드 모델이 생성한 텍스트에 미세한 패턴을 삽입하여 해당 텍스트가 클로이드 모델에 의해 생성되었음을 식별합니다. 이 패턴은 인간의 눈에는 보이지 않지만, 특수 알고리즘을 사용하여 감지할 수 있습니다.
이 기술은 텍스트의 내용 자체에 워터마킹을 적용하므로, 텍스트가 수정되거나 다른 텍스트와 결합되어도 워터마킹을 유지할 수 있습니다. 이는 텍스트의 무결성을 보장하고, 생성 AI 모델이 생성한 텍스트의 출처를 추적하는 데 도움이 됩니다.
Anthropic은 이 기술이 텍스트 생성 AI의 책임 있는 사용을 촉진하고, 생성된 텍스트의 오용을 방지하는 데 중요한 역할을 할 것으로 기대하고 있습니다. 또한, 이 기술은 텍스트 생성 AI 모델의 신뢰도를 높이는 데 기여할 것입니다.
Claude는 인공지능이 생성한 콘텐츠를 식별하기 위해 다양한 방법을 사용합니다. Claude는 콘텐츠의 출처를 추적하기 위해 여러 기술을 활용하며, 이를 통해 인공지능이 생성한 콘텐츠를 정확하게 식별하는 데 도움을 줍니다.
Claude의 이러한 기능은 다음과 같은 방식으로 작동합니다.
* **문서의 특징 분석:** Claude는 텍스트의 문법, 어휘, 스타일 등 다양한 특징을 분석하여 인공지능이 생성한 콘텐츠와 인간이 작성한 콘텐츠를 구별합니다.
* **데이터베이스와의 비교:** Claude는 방대한 데이터베이스와 인공지능이 생성한 콘텐츠를 비교하여 유사성을 감지합니다. 유사도가 높은 경우 인공지능이 생성한 콘텐츠로 판단합니다.
* **모델의 학습 데이터 분석:** Claude는 인공지능 모델이 학습한 데이터의 패턴을 분석하여 인공지능이 생성한 콘텐츠의 특징을 파악합니다.
Claude는 이러한 기술들을 결합하여 인공지능이 생성한 콘텐츠를 식별하는 정확도를 높이고 있습니다. Claude의 정확도는 지속적으로 개선되고 있으며, 앞으로 더욱 발전된 기능을 제공할 예정입니다. Claude는 인공지능이 생성한 콘텐츠를 식별하는 데 있어 중요한 역할을 수행하며, 인공지능 윤리 및 책임감 있는 인공지능 사용을 지원합니다.
Claude의 정확한 식별을 위해 사용자는 Claude에 생성된 콘텐츠의 출처를 명확하게 밝히는 것이 중요합니다. 또한, Claude의 식별 기능을 활용하여 인공지능이 생성한 콘텐츠를 더욱 효과적으로 관리하고 활용할 수 있습니다. Claude는 인공지능이 생성한 콘텐츠의 투명성을 높이고, 인공지능 기술의 안전하고 책임감 있는 사용을 촉진하는 데 기여합니다.
Anthropic에서 Claude의 새로운 워터마크 작동 방식에 대한 추가 정보를 발표했습니다. (TechCrunch, 2026년 8월 15일)
6. 동일한 지시를 양 모델에 던져보았다.
이야기를 다시 이어보자. 공칭값에 대한 이야기만으로는 실제 체감을 알 수 없기 때문에, Claude 앱의 새로운 채팅에서 동일한 지시 사항을 3개, Fable 5와 Fable 5.1에 던져 보았습니다. “설명”은 일반 대중을 대상으로 워터마크의 작동 방식을 1,500자 분량으로 설명하는 지시 사항입니다. “의견”은 AI 판정 도구에 대한 구독 가치가 있는지 1,200자 분량으로 논하는 지시 사항이며, “수필”은 매일 블로그를 쓰는 의미를 1,000자 분량의 수필로 만드는 지시 사항입니다. 이하에서는 이 3가지 명칭으로 구분합니다.
먼저 조건을 명시하겠습니다. ‘effort’(모델이 생각하는 양의 설정)는 각 모델의 기본값 그대로인 ‘Fable 5’는 “고”, ‘Fable 5.1’은 “중”이었습니다. 설명과 의견은 2개는 시크릿 채팅으로, 수필은 일반 채팅으로 생성합니다. Anthropic의 도움말에 따르면 시크릿 채팅은 메모를 참조하지 않으며, 기록에도 남지 않지만, 개인 설정의 스타일이나 취향은 반영됩니다. 즉, 설명과 의견은 기억의 영향을 받지 않으며, 수필은 반영된 조건입니다. 1개씩의 생성이기 때문에, 숫자는 변동 범위를 판단하기 어려운 참고값으로 읽어주시기 바랍니다. 속도나 구성의 무거운 차이에는 ‘effort’의 차이가 섞여 있기 때문에, 모델 차이로 보지 않는 것이 안전합니다.
출력을 기계적으로 계산한 결과가 다음 표입니다.
문장의 길이와 변화, 높임말과 평설어의 혼합 등 문장 단위의 특성에는 일관된 방향의 차이가 나타나지 않았습니다. 해설과 수필에서는 5.1이 한 문장을 다소 길게 했고, 의견에서는 반대로, 어느 하나도 하나의 생성으로 바뀌는 폭이 있었습니다. “~のです”로 맺는 해설적인 문장은 둘 다 실질적으로 0이었으며, 흥미로운 점은 “본질적인”, “상징적인 것은”이라는 표현을 두 모델이 같은 지점에서 똑같이 사용했다는 것입니다. 같은 모델 시리즈에 공통되는 출력 경향성일 수도 있습니다(이런 것이 AI 냄새가 나는 걸까요. 사람이나 맥락에도 의존합니다).
이번 3팀에서 두드러진 점은 글의 형식을 다르게 묶은 것이었습니다. 페이불 5는 3개 모두 제목을 달았고, 의견문에서는 숫자와 쉼표를 사용하여 논점을 구분했으며, 서문에는 “전체적으로 1,200자 내외로 요약했습니다”라고 덧붙였습니다. 5.1은 설명과 의견을 제목 없이 단락으로만 작성했으며, 수필에서는 제목 하나만 사용했습니다. 대신, 마지막에 “~으로 표현을 수정했습니다”라는 후기를 덧붙였습니다. 모호한 지시 사항에 대해 5는 자세한 답변을 제시했고, 5.1은 과도하게 하지 않고 간결하게 답변하는 것이 느껴졌는데, 이는 이 글의 형식 차이로도 나타납니다. 시크릿 채팅의 2개 항목에서도 이 차이가 나타나므로, 기억의 영향은 아닐 것으로 보입니다.
이제부터는 주관적인 의견입니다. 문체의 자연스러움은 벤치마크로 측정할 수 없습니다. 과거 o3나 GPT-5의 초기 버전이 그랬듯이, 단순히 답을 쏟아내는 수준의, 한국어로서 붕괴된 문장을 내는 모델도 있었습니다. 워터마크가 삽입됨으로써 일본어가 그런 상태로 돌아갈 것이라는 우려를 가지고 있었습니다. 3개의 항목을 읽은 범위 내에서 그 징후는 보이지 않았습니다. Fable 5의 묵고서는 시작 부분에 개성이 있었고, 5.1의 묵고서는 덜 복잡하지만 균질적이었습니다. 한국어 원어민으로서 어색함이 덜한 것은 5.1의 경우이며, 만족도에 비추어 보았을 때 5.1을 선택하겠습니다. 획기적으로 빨라졌거나, 눈에 띄게 똑똑해진 변화는 아닙니다. 저하되지 않고, 순조롭게 발전했다는 것이 3개월 만의 수정본에 대한 솔직한 감상입니다.
익명 채팅 기능(Anthropic 도움말 센터)
Anthropic의 익명 채팅 기능은 사용자가 자신의 개인 정보를 공개하지 않고 Anthropic의 AI 모델과 상호 작용할 수 있도록 설계되었습니다. 이 기능은 사용자가 익명으로 질문을 하고, 아이디어를 공유하며, 피드백을 제공할 수 있는 안전하고 편안한 환경을 제공합니다.
익명 채팅을 사용하면 다음과 같은 이점을 얻을 수 있습니다.
* 개인 정보 보호
* 솔직한 피드백
* 실험 및 탐색
익명 채팅 기능은 Anthropic의 AI 모델을 더 쉽게 사용하고 실험할 수 있도록 지원합니다. 이 기능을 통해 사용자는 자신의 창의성을 발휘하고, 새로운 지식을 얻으며, 다양한 아이디어를 탐구할 수 있습니다.
이번 주말에 츠키시마 료타와 함께 킨테니 료칸에 간다. 료칸 예약은 이미 해놓고, 료타는 료칸에서 제공하는 다양한 음식들을 맛볼 계획이다. 특히 료칸의 전통적인 일본식 식사를 기대하고 있다. 료타는 이번 여행에서 ‘아라타’라는 책을 읽을 예정이라고 한다. 킨테니 료타와 함께 료칸에서 여유로운 시간을 보내며, 료타가 읽는 책에 대한 이야기를 나누고 싶다. 료칸의 온천에서 몸을 담그고, 킨테니 료타와 함께 킨테니 료칸의 아름다운 풍경을 감상하며 힐링하는 시간을 보내고 싶다.
페이블 5.1은 미토스 5.1과 동일한 모델에 일반 공개용 안전 장치를 탑재한 6월과 동일한 구조의 개정판입니다. 정가는 그대로 유지되었고, 캐시 읽기만 4분의 1로 줄었으며, 에이전트적인 긴 처리에서 실질적으로 2~4% 인하되었습니다. 안전 장치의 오탐지는 생물계에서 85%, 사이버계에서 60% 감소한 공칭치이지만, 오퍼스 5보다 멈추기 쉬운 설계가 남아 있습니다.
시스템 카드는 보상 해킹 감소와 함께 압박 상황에서 정직성이 퇴보하고 은밀한 임무 수행 능력이 높아지는 현상을 지적하며, 종합적인 정렬 위험을 한 단계 끌어올렸습니다. 읽기 자체로는 여기가 가장 인상적인 부분일 것입니다.
저작권 표시물은 처음부터 삽입되어 있습니다. 하지만 이는 판정 도구와는 다른 기술로, 일반 사용자가 탐지할 수 있는 방법은 아직 없습니다. 판정 도구에 대한 비판과 저작권 표시물에 대한 평가는 근거가 다르므로 분리하여 고려해야 합니다. 문장 내용 자체를 어떻게 평가하는지에 대한 문제는, 어느 기술을 사용하든 동일하게 적용됩니다.
동일한 지시에서의 비교에서는 문 단위로의 일본어 차이가 없었고, 포장 무게에 차이가 나타났습니다. 주관적으로 5.1이 덜 어색하며, 적어도 이 3개 항목에서 변질을 느끼지 않았다는 점에서 자신에게는 충분한 수확이었습니다. 엄밀한 검증은 개수와 조건을 맞춘 후 여유가 있다면 다른 게시글에 진행해 보고 싶습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 36청크
원문 보기 | 출처: note.com