# 8월 2일부터 Claude의 모든 출력에 워터마크가 삽입되었습니다. 검출 방법은 아직 공개되지 않았습니다.

> https://bookfactory.kr/c/ai-tech/11422
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-13T00:08:24.193Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/307512246/rectangle_large_type_2_f4fd0f63b92d9619b788058270275bc0.png?width=1280)

2026년 8월 2일, Anthropic이 제공하는 Claude의 생성 텍스트에 눈에 띄지 않는 워터마크가 삽입되기 시작했다. EU의 AI 법이 같은 날 요구하기 시작한 투명성 의무에 대한 대응으로, 일본을 포함한 전 세계가 대상이다. 사양을 살펴보면, 워터마크 삽입은 먼저 시작되었지만, 탐지 기능은 아직 따라오지 못하는 상태였다.

## 무엇이 시작되었는지, 그게 무엇입니까.

대상 모델은 Claude Opus 5, Sonnet 5, Fable 5, Haiku 4.5 등의 모델 그룹이며, claude.ai, API, Claude Code, Claude Cowork, Claude Tag 전반에 적용된다. AWS, Google Cloud, Microsoft Foundry를 통해 동일한 모델을 호출하더라도 동일하다. 사용자 측면에서는 오プト아웃 옵션이 없다.

이 근거는 EU AI 법의 제50조에 있으며, AI 생성 콘텐츠에 대한 표시를 요구하는 조항이 8월 2일에 적용이 시작되었다. Anthropic을 포함한 약 190개의 AI 사업체가 EU 행동 규범에 서명했으며, 지역별로 규격을 나누지 않고 전 세계에 동일한 형태로 적용할 방침이다.

2026년 8월 2일 이후에 출시된 모델은 처음부터 대응이 완료되었지만, 기존 모델에 대한 적용은 “향후 수개월에 걸쳐” 순차적으로 진행되며, 완료 시기는 아직 공지되지 않았다. 즉, 현재 시점에서는 워터마크가 적용된 모델과 적용되지 않은 모델이 혼재되어 있다.

## 기능: 어휘 선택에 통계적 패턴을 반영한다

이 기술은 구글에서 공개한 SynthID-Text의 파생 기술로, 비밀 키와 직전의 몇 단어를 기반으로 모델이 다음에 어떤 단어를 선택할지 결정합니다. 예를 들어 “흐림”을 나타내는 경우 여러 후보가 있다면, 그 선택에 통계적인 편향을 만들어냅니다.

- 추가 토큰은 발생하지 않습니다.
- 생성 속도와 요금은 변하지 않습니다.
- 사람은 인지할 수 없으며, 그 의미와 가독성은 변하지 않습니다.

Anthropic는 통계적 품질 테스트에서 유의미한 차이가 없었다고 밝혔습니다. 문장의 시각적인 모습은 변함없지만, 단어 선택 확률 분포만 달라지는 설계입니다.

## 검출 방법이 아직 없다.

여기서 가장 걸리는 부분이었습니다. 埋め込み는 8월 2일에 시작되었지만, 워터마크를 읽어내기 위한 탐지 수단은 현재까지 공개되지 않았습니다. Anthropic은 탐지 API 제공을 밝히고 있지만, 시기, 가격, 접근 조건 등은 아직 발표되지 않았습니다.

GPTZero와 같은 기존 AI 탐지 도구는 이 워터마크를 읽고 있지 않다. 그들은 문장의 습관 패턴을 통해 추정하는 수준에 불과하며, 내재된 통계 패턴과는 차이가 있다. 즉, 현재 시점에서는 워터마크가 포함된 문장을 제시받아도 아무도 판별할 수 없다.

![画像](https://assets.st-note.com/img/1787815732-wz97gJNP8DOfnvqIlABRLTm6.png?width=1200)

순서는 규제의 적용일에 맞춰 융합(embedding) 측을 먼저 배치하는 형태로 진행된다. EU AI 법의 조항이 요구하는 것은 “AI 생성물임을 명시”하는 것이며, 누구나 감지할 수 있는 상태까지 요구하지는 않는다. 사업자 측의 의무는 충족되는 한편, 이를 수신하는 측이 확인하는 절차가 뒤로 미루어지고 있다.

> 
> 
> 인은 시작하고 있는데, 그 인을 읽는 도구는 아직 누구에게도 없다.
> 

## 문법 검사를 통해 사라지는

또한 한 가지는 이전에 감지된 문제로 지적되는 제거의 용이성이다. 개발자 Theo 씨는 이 방식의 워터마크가 쉽게 깨진다고 지적하고 있다.

- 言い換え：別の表現で書き直させるだけで、語彙選択に埋めた印は消える
- 문자 정규화: 공백 표현의 불일치를 수정해도 깨질 수 있는 경우도 있습니다.
- 기본적인 문법 수정은 교정 도구를 거치는 수준의 편집으로도 손실될 수 있다.

이미 다수의 벤더의 워터마크를 제거하는 오픈 소스 저장소가 존재하며, Claude에 Claude 자체의 출력에서 워터마크를 제거해 달라는 요청 실험 결과도 제시되었다.

내용이 길고 자유로운 어휘 선택이 가능한 에세이나 기사 전체처럼 어휘 선택의 자유도가 높은 문장에서는 번역이 잘 되고, 반면 번역, 짧은 문장, 코드, 사실 밀도가 높은 문장에서는 약해진다. 판단 역시 확률적인 것이며, 흑백 논리가 적용되는 방식은 아니다.

이유적으로 보아 워터마크는 동의어 선택 방식이라는 “반박의 여지”를 담고 있는 정보에 사용된다. 따라서 반박의 여지가 클수록 워터마크가 더 짙게 남고, 여지가 작을수록 옅어진다. 코드나 숫자가 나열된 문장에서 약한 것은 대체 가능한 선택지가 원래부터 부족하기 때문이다. 텍스트는 이미 원본 상태로 정보가 압축되어 있으며, 사람이 알아차리지 못하는 범위 내에서 수정 가능한 폭이 제한적이다. 탐지 비용을 높이거나 제거 비용을 낮추는 두 가지 선택 중 하나로 구조화되어 있다는 지적이 있다.

## 교정에 사용하면 자신의 문장에 표시가 걸립니다.

실무 측에서는 영향이 나타날 수 있는 부분입니다. 비판 측에서는 자신이 쓴 글을 Claude에 교정하게 하면, 그 결과물에 워터마크가 들어간다는 지적이 나오고 있습니다. 작성한 것은 본인이고, 통과하는 순간 AI의 흔적이 새겨지는 형태가 됩니다.

존 글루버 氏は「완전한 동의어는 존재하지 않으며, 어휘의 선택은 글을 쓰는 행위 그 자체다」라며 어휘 선택에 개입하는 방식 자체에 대한 의문을 제기하고 있다. 반면, 회피는 의역이나 번역으로 쉽게 해결 가능하기 때문에 규정을 따르는 사용자들만 문제로 귀결되는 상황이라는 지적도 있다.

Anthropic 측에서도 스스로 한계를 명시하고 있다. 워터마크가 감지되더라도 Claude가 “작성했다”는 증거가 되거나 “관여했다”는 것만 보여줄 뿐이다. 반대로 워터마크가 감지되지 않더라도 인간이 쓴 글의 증거가 되지는 않는다. 다른 회사 AI의 출력도 판별할 수 없다.

이 세 가지 요소를 종합적으로 고려하면 워터마크로 판단 가능한 범위는 상당히 좁습니다. “이 텍스트 생성 과정에 Claude가 관여했을 가능성이 높다”는 점만 확인할 수 있으며, 누가 작성했는지, AI를 어느 정도 활용했는지에 대해서는 판단할 수 없습니다. 제출물의 진실성을 판별하는 용도로 활용한다면 기대와 차이가 발생할 가능성이 큽니다.

논점은 기술의 유효성이라기보다는, 어휘 선택에 대한 개입을 어떻게 받아들여야 하는가라는 가치관의 충돌에 기인하고 있다. 사양대로 정확하게 작동한다고 하더라도, 만족하느냐는 또 다른 문제다라는 틀이 잡혀 있는 상황이다.

## まとめ

8월 2일부터 클루드의 출력에는 전 세계적으로 옵트아웃이 불가능한 워터마크가 포함되어 있습니다. 이는 어휘 선택에 대한 통계적 개입을 통해 작동하며, 품질이나 요금에 영향을 미치지 않습니다. 다만, 감지 수단은 아직 공개되지 않았고, 번역이나 문법 수정으로 쉽게 제거될 수 있습니다. 저작권을 증명하는 데에도 사용되지 않습니다. 제도적인 형태의 워터마크가 도입되었지만, 이를 읽는 측의 준비는 아직 충분하지 않습니다.

**출처:** [note 원문](https://note.com/ready_prawn3804/n/n573e1950b95e)

*번역: Gemma 3(.44) 초벌 + 교정 24청크*

[원문 보기](https://note.com/ready_prawn3804/n/n573e1950b95e) | 출처: note.com