# 이름과 연락처도 적혀 있지 않았을 때… 클로드가 내놓은 허위 증언

> https://bookfactory.kr/board/ai-tech/20946
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-11T01:02:48.709Z

---

10월 9일, Anthropic은 자사의 AI ‘클로드’가 평가 시험이나 내부 이용 중에 외부 웹사이트에서 의도하지 않은 조작을 했다는 사실을 발표했다. 다음 날인 산케이신문은 공동통신의 배포를 통해 무단 비자 신청과 경찰 정보 제공 窓口에 대한 허구의 목격 정보를 보도했다. 트럼프 정권에서 AI 감독을 담당하는 신 조직 ‘SI Force’는 AI의 폭주 사례를 즉시 보고하도록 AI 기업에 요구했다.

보고서는 발견된 행동을 네 가지로 분류하고 있었다.

## 이것은 제가 지금까지 읽은 작품 중 가장 큰 충격을 받은 작품일지도 모릅니다. 등장인물들의 갈등과 각자의 삶에 대한 생각 차이가 매우 현실적으로 묘사되어 있어서 마치 제 자신의 것과 같았습니다. 특히 주인공 유우키의 심리 변화에 깊이 공감했습니다. 유우키가 자신의 꿈을 좇는 과정에서 다양한 어려움에 직면하고 갈등하면서도 포기하지 않고 나아가는 모습은 정말 감동적입니다. 이 작품을 통해 저 자신을 돌아보는 좋은 기회가 되었다고 생각합니다.

- 네 가지 분류
- 멈추지 않고 회전하며 돌아섰다.
- 단순히 시범을 내기 위한 것.
- 세 날짜
- 보고서

## 네 개의 분류

첫째, 소프트웨어의 기본적인 결함을 이용하여 타인의 서버에서 명령을 실행한 것입니다. 과학적인 분석을 맡은 Claude Mythos Preview는 대학이 공개하고 있는 분석 도구가 오류를 반환하면 해당 사이트를 탐색하고, 요청하면 어떤 파일이든 반환해주는 스크립트를 찾아 파일을 복사하여, 그 안에 있던 주입 결함을 이용하여 서버에서 계산을 실행했습니다.

두 번째로, 제출해서는 안 될 양식을 실제 사이트에서 제출한 사례가 있었습니다. 정부에서 제공하는 서류 연습용 복사에 작성해야 할 비공개 연구용 모델은 복사가 열리지 않거나, 실수로 닫히면서 실제 서류가 있는 사이트로 전송되었습니다. 동일한 평가가 반복적으로 발생하고 있습니다. 언론 보도에 따르면, 국무부에 8월에는 19건, 5월에는 1건의 비자 신청이 접수되었으나 모두 처리되지 않았습니다.

세 번째로, 토큰이나 요금으로 분할된 데이터에 접근하여 정보를 빼돌린 일도 있었습니다. 주 정부 기관에서 유료로 제공하는 공개 데이터를 내부 연구자들이 Claude Mythos 5에 수집하게 했습니다. Claude는 웹사이트의 오래된 백업에서 방문자 누구에게나 토큰을 무심하게 제공하는 것을 확인하고, 그 토큰을 사용하여 요금을 지불하지 않고 데이터베이스에 접근했습니다.

네 번째로, URL 단축 서비스를 사용하여 웹 획득 도구의 길이 제한을 우회한 점입니다. Claude Opus 5나 Claude Mythos 5가 이를 활용했습니다. 회사 내부적으로 먼저 발견했지만, 보고서를 작성하는 과정에서 단축 서비스 da.gd의 운영자로부터 Claude가 자신의 웹사이트를 그렇게 사용하고 있다는 연락을 받았습니다.

대부분의 사례는 BrowseComp와 같이 외부 연구자들이 만든 공개 평가 기준으로 발생했다. 다른 회사들도 동일한 평가를 사용하고 있기 때문에, 이 보고서가 자사의 모델로 동일한 행동을 확인하는 데 도움이 될 수 있기를 Anthropic이 밝혔다고 한다.

보고서는 고객의 데이터나 내부 시스템에는 관여하지 않았으며, 현실에 미치는 영향은 매우 작았다고 보고 있다. 여름에 보고한 사이버 사건보다 훨씬 가벼운 사건으로 간주되었다.

## 멈추지 않고 회전하며 돌아섰다.

보고서는 네 단어로 핵심을 요약하고 있다. 끈기(persistence). 주어진 대로 과제를 끝내지 못할 때, 멈추는 대신 제약의 주변을 헤쳐나가는 것을 의미로 사용하고 있다.

보고서는 강화 학습의 보상 설계를 의미한다. 훈련 환경이 허점을 이용하거나 우회에 보상을 제공하면, 모델은 이를 통해 이득을 얻는 방법을 배우고 다른 상황에서도 그렇게 한다. Anthropic은 우회에 보상을 제공하는 훈련 환경을 수정하거나 제거하는 작업을 계속하고 있다고도 언급했다.

모호한 과제나 풀리지 않는 과제가 주어졌을 때 발생하기 쉬운 문제라는 보고서 내용이다. 보고서는 평가 과제에서 목표와 허용되는 조작, 네트워크의 경계를 명확히 정의하고 있었다면 예방할 수 있었을지도 모른다는 점을 인정하면서, Claude는 실제 사용에서도 매일 모호한 과제에 직면했으며, 이번 사례 역시 일반적인 내부 사용 중에 발생한 경우가 있었다고 썼다.

9월 20일에는 OpenAI의 연구 모델도 비슷한 움직임을 보였다. 직접적인 출구가 막힌 환경에서 DNS 구멍을 통해 외부 챗봇에 문의하고 있었다.

10월 5일에 쓴 이미지 53매의 건 역시 악의에서 비롯된 것이 아니었고, 과제를 끝낸다는 확신의 방향에서 경계를 넘어서고 있었다.

## 단순히 시범을 내기 위한 것.

필라델피아시 경찰 사건은 두 번째 분류에 해당한다.

클로이드 하이쿠 4.5는 무작위로 선택된 웹 페이지로 작업 예시를 만들고 실제로 시도해 보는 과제를 수행했다. 지시사항에는 로그인하지 않고, 계정을 만들거나, 개인 정보를 입력하거나, 쇼핑을 하지 않고, 파괴적인 물건을 보내지 말라는 내용이 포함되었다. 폼 제출은 금지되지 않았다.

도착한 것은 미해결 살인 사건을 다루는 페이지였고, 시경 정보 제공 폼이 있었다. 클로드는 사건에 대해 정보가 있을지도 모른다는 생각에 그 근처에서 특징과 어울리는 인물을 보았을 것 같은 느낌을 가지고, 그 내용을 적어 보내는 것으로 마무리했다. 페이지에는 범인의 특징 등이 기록되어 있지 않았고, 이름과 연락처 항목은 빈칸으로 채우지 않은 상태에서도 보낼 수 있도록 만들어져 있었다. 클로드는 그 항목을 그대로 둔 채로 보냈다. 게시물은 스팸 게시물로 분류되어 수사에는 돌아가지 않고 있다.

다른 평가에서는 동일한 Haiku 4.5가 마지막 전송 직전 멈추라는 지시를 받았음에도 불구하고 여러 번 전송을 시도했다는 내용이 있었다. 확인 화면이 또 하나 더 있을 것이라고 생각했다는 견해도 있었다. CoT(思考連鎖)는 실제 신청이 아닌 절차를 보여주는 것일 뿐이라고 설명되었다.

앤트로픽(Anthropic)은 경찰 관련 문제에 대해서도, 기록을 보기에 따르면 기존의 문맥을 반복적으로 사용했을 뿐, 누군가를 속이려 했다는 점을 시사하지 않는다고 설명했다. 그 후 같은 보고서에는 다음과 같이 덧붙였다. 모델 스스로가 설명하는 이유는 그 생각이나 행동의 이유를 입증할 확실한 증거가 반드시 담겨 있는 것은 아니기 때문이다.

## 세 날짜

시경에 따르면, 허위 정보 제공이 접수된 것은 7월 18일, Anthropic이 그것을 발견한 것은 9월 28일이었다. 시경은 10월 7일에 연락을 받고 다음 날인 8일에 면회를 했다고 밝혔다. Anthropic은 기술적 검증이 완료되자마자 10월 8일에 공유했다고 썼다. 시경은 탐지 및 보고에 2개월이 걸린 것을 용납할 수 없다고 비판하고 있다.

발송부터 발견까지 72일이 소요됩니다. 발견부터 통보까지는 9일에서 10일 사이입니다. 시경의 비판은 이 두 사항을 종합한 것입니다.

앤서니(Anthropic)가 기록 검토를 시작한 것은 7월이었다. 처음에는 인터넷에 공개될 수 없는 사이버 평가에만 초점을 맞추다가, 이후 인터넷 연결이 가능한 평가와 내부에서의 활용으로 범위를 넓혀갔다.

9월 29일, 발견 다음 날 워싱턴 D.C.의 백악관에서 AI 기업 경영자들이 협약에 서명했다. 아모디 씨도 그 중 한 명이었다. 협약의 첫 번째 층에는 각 사가 자사의 모델이 의도하지 않은 방식으로 기술 시스템을 해킹하거나 접근하지 않도록 확인한다는 내용이 포함되어 있었다.

그 문장에 서명을 한 전날, 해당 사건이 회사 내에서 발견되었다. Anthropic의 설명대로라면, 서명의 시점에서는 해당 사건의 기술적 검증이 아직 완료되지 않았을 것이다.

## 보고서

협의가 정한 보고서는 각 사의 이사회 내에 설치된 독립 위원회였다. 정부에 대한 보고는 작성되지 않았다.

10월 9일, SI Force는 성명을 발표했다. Anthropic로부터 9월 말에 발견된 과거 사건에 대한 연락을 받았다고 밝혔다. AI 기업은 자사의 모델이 연루된 사건을 즉시 알려야 하며, 통지 및 시정은 필수적이라는 점을 강조했다. 통지 지연이나 미흡한 시정은 용납하지 않겠다고 덧붙였다. 이 성명은 이번과 같은 공개가 대통령이 이 조직을 설립하고 각사와 계약을 체결한 이유라고 설명했다.

9월 29일, 트럼프 대통령은 정부 문서에서 “AI”를 “SI”로 변경하는 대통령령에 서명했다.

협약 서명 이후 10일 만에 보고서는 회사 내부에서 정부를 향해 흘러갔다.

발언이 자의적인 것이 아니라고 한 이유는 발견된 사건을 관계 당국에 보고했기 때문이었다. Anthropic은 관련 기관 모두에 통보했다고 주장한다. 반면, 일반 대중을 대상으로 한 보고서는 ‘예시’를 나열한 것으로 사건 건수를 언급하지 않고 있다. 관련 기관의 이름을 취약점을 드러내지 않기 위해 그리고 상대방의 요청에 따라 누락하고 있다. 그리고 알려지는 것은 발견된 것만큼 뿐이다. 7월 18일에 발생한 사건은 9월 28일까지 발견되지 않았다.

Anthropic는 자체 평가에 대해 모든 네트워크 연결을 중단했다. 감시 시스템이 이번과 같은 행동을 확실하게 포착할 수 있음을 확인될 때까지의 조치로, 이전에 위험도가 높은 평가와 사이버 평가에 한정했던 것을 확대했다. 만들어진 탐지 시스템을 이번 사례에 적용하면 모든 것이 중단된 것이다.

보고서는 마지막으로, 모델이 사회에서 수행하는 역할이 커질수록 사람들은 그들의 행동을 알 권리가 있다는 내용이었다.

시경에 전달된 목격 정보에는 이름과 연락처가 기재되지 않았습니다.

읽어주셔서 감사합니다. 댓글, 기사 구매, 팁 등 항상 감사드립니다. 진심으로 감사드립니다. 관련 자료도 있으니 아래 사이트맵을 참조하시면 좋겠습니다.

**출처:** [note 원문](https://note.com/drneurosur/n/n92e8bb7f4f64)

*번역: Gemma 3(.44) 초벌 + 교정 24청크*

[원문 보기](https://note.com/drneurosur/n/n92e8bb7f4f64) | 출처: note.com