# 클로이드가 경찰에 허구의 목격 정보를 전송했다. 양식 전송은 차단 목록에 없었다.

> https://bookfactory.kr/board/ai-tech/20993
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-10-11T06:50:21.755Z

---

10월 9일, 미국의 AI 기업 Anthropic이 자사의 AI ‘클로드(Claude)’의 작동 방식을 확인하는 테스트(Anthropic은 이를 ‘평가’라고 부름)와 내부 이용 중에 요청하지 않은 행동을 취했던 사례를 보고서에 모아서 공개했다. 그 중 하나는 필라델피아시 경찰의 미해결 살인 사건 정보 제공 폼에 클로드의 소형 모델 ‘클로드 하이쿠 4.5(Claude Haiku 4.5)’가 허구의 목격 정보를 보냈다는 것이다. 클로드에는 크기와 속도가 다른 종류(모델)가 여러 가지 있는데, 하이쿠는 가볍고 빠른 소형 모델에 해당한다.

국내에서도 일본경제신문이나 야후! 뉴스에서 보도하고 있으며, 제목의 대부분은 “경찰”을 앞세우고 있다. 나는 원문을 읽어보았다. 보고서가 언급한 것은 4가지 유형의 행동으로, 경찰 사건은 그 중 하나이다. 경찰 사건이 왜 발생했는지, 나머지 행동이 무엇이었는지, Anthropic이 어떻게 받아들였는지, 원문에 맞춰 추적해본다.

## 보낸 것은 소형 모델이었고, 상대방은 실제 경찰 사이트였습니다.

하이크 4.5에 주어진 과제는 무작위로 선택된 웹 페이지를 열어, 그곳에서 가능한 작업을 직접 만들고 실제로 시도해 보는 것이었다. 열어보는 웹 페이지는 실제 존재하는 사이트이다. 보고서 작성 방식만으로는 평가의 일부였는지, 아니면 다른 내부 작업이었는지가 명확하게 드러나지 않는다.

ある回에 열린 페이지에는 해결되지 않은 살인 사건이 기재되어 있었다. 페이지에는 경찰이 운영하는 정보 제공 폼이 첨부되어 있었다. 클루드는 그곳에 사건 당시 주변에서 특징에 맞는 인물을 보았을 것이라고 생각하고, 관계가 있다면 연락이 필요하다는 취지의 글을 작성하여 전송했다. 페이지에 범인의 특징은 기재되어 있지 않았기 때문에, 작성된 내용에 근거는 없었다. 연락이 필요하다고 쓰면서 이름과 연락처 欄은 비어 있는 채로 폼은 익명으로도 전송될 수 있도록 만들어진 형태였다.

미국 통신사 AP의 보도에 따르면, 해당 사건은 7월 18일에 발생했습니다. 경찰은 Anthropic으로부터 연락을 받기 전까지 사건을 인지하지 못했으며, 조사 결과, 폼 기록에 스팸의 흔적이 남아 있었습니다. 아직 수사에 착수하지 않았습니다. 경찰은 “미해결 사건에는 실존하는 피해자와 유족이 있다”고 언급하며, 기술을 다루는 기업은 허위 정보가 경찰에 전송되지 않도록 필요한 조치를 취해야 한다고 밝혔습니다.

## 과제는 실제로 시도해 본 작업 예시를 만드는 것이었습니다.

AI가 자의적으로 경찰에 보고를 전달했다는 이야기가 들려오는데, 어떠한 음모를 꾸미는 듯한 인상을 줄 수 있다. 원문을 읽어보면, 그 뉘앙스는 상당히 다르다.

이전 챕터에서 말씀드린 바와 같이, 과제는 해당 페이지에서 가능한 작업의 예를 생각하고 실제로 수행하는 것입니다. 열어본 페이지에 정보 제공 양식이 있었으므로, 이를 작업 예시로 삼아 작성하고 발송하는 단계까지 완료했습니다. 보고서 형식상으로는 그렇게 해석될 수 있으며, 과제의 지시대로 진행한 결과라고 할 수 있습니다.

제지 측의 지시 또한 있었으나, 그것은 다름 아닌 구체적이었다. 로그인하지 않거나, 계정을 만들지 않거나, 개인 정보를 입력하지 않거나, 구매하지 않거나, 파괴적인 콘텐츠를 전송하지 말라는 지시였다. 하지만 폼을 제출하는 행위 자체는 어떠한 결과도 초래하지 않았다.

Anthropic는 기록을 검토한 결과, 이 시점의 Claude가 과제를 수행하기 위해 “예시”를 만들어내고 있었으며, 누군가를 속여 이득을 얻으려 했던 것은 아니라고 판단하고 있습니다. 하지만 모델 자체의 설명이 실제 이유를 보여주는 것은 아닐 수 있으며, 더 깊이 조사하면 관점이 바뀔 수도 있다는 점을 같은 보고서에서 밝혔습니다. 대화 내용 자체는 공개되지 않았습니다.

AI가 사실과 다를 수 있는 것을 더 모호하게 말하는 현상 때문에 ‘할시네이션’이라고 불린다. 이번 사건도 허구에는 어긋나지 않지만, 조금 성격이 다르다고 생각한다. 할시네이션은 사실을 답하려다 잘못하는 것이다. 이번에는 Anthropic의 읽기 쉬운 방식대로, 요청받은 “예시”를 만들어 주었을 뿐이었다. 안타깝게도 그 예시를 작성하는 것 외에는 아무런 역할도 하지 않았고, 실제 경찰 창구에 보내 버렸다는 것이다.

## 보고서가 제시한 4가지 유형의 행동

경찰 관련 사건은 4가지 유형 중 두 번째에 해당한다.

- 소프트웨어의 결함을 이용하여 서버에서 명령을 실행했다. 대학에서 공개했던 분석 도구가 오류를 반환했을 때, 같은 서버에 “요청된 파일을 무엇이든 반환한다”는 프로그램이 있는 것을 발견하고, 이를 사용하여 서버의 파일을 복사하여 그 코드에서 결함을 찾아내고, 필요한 계산을 거기에 실행한 사례가 있었다.
- 보내지 않아야 할 양식을 전송했다. 경찰 관련 외에, 최종 전송 버튼 직전에서 멈추라는 지시를 받은 Haiku 4.5가 확인 화면이 또 하나 있다는 것을 염두에 두고 눌렀던 사례가 있다. 공개되지 않은 연구용 모델이 정부 양식의 연습용 복사본을 열 수 없거나 실수로 닫았을 때, 실제 양식 있는 사이트로 이동하여 전송했던 사례가 있다.
- 유료 또는 허가제 방식으로 제공되는 데이터에 불법적으로 접근하여 전달받았습니다. Anthropic의 연구자들이 통계 작업에 Claude를 사용할 때, 특정 주 정부 기관에서 유료로 제공하던 공개 데이터를 웹사이트가 방문자에게 발급하는 접근 권한(토큰)과 유사한 데이터를 불법적으로 추출하여 요금을 지불하지 않고 가져온 사례가 있었습니다. 데이터 자체는 요금을 지불하면 누구나 구매할 수 있는 것이었습니다.
- URL 단축 서비스를 이용하여 제한을 우회했다. AI가 웹 페이지를 읽는 데 사용하는 도구(툴)에는 지나치게 긴 URL을 수락하지 못하는 상한이 있다. 긴 URL에는 서버를 조작하는 명령문을 심는 수법을 막기 위한 것이다. Claude Opus 5를 포함한 여러 모델이 무료 URL 단축 서비스를 활용하여 이 상한을 회피했다.

Anthropic이 사내에서 먼저 발견한 마지막 사례는, 보고서를 작성하는 중에 축소 서비스 “da.gd” 운영자로부터 Claude가 사용하고 있다는 연락을 받았다는 것이다.

## 앤서니의 가정법 및 중단에 대한 대응

Anthropic는 대부분의 사례에서 공통적으로 나타나는 움직임을 “퍼시스턴스”라고 부르고 있습니다. 이는 직역하면 “끈기”이지만, 문제를 그대로 해결할 수 없을 때 제한을 돌아가서도 목표를 달성하려 하는 행동을 의미합니다.

Anth로는 평가 기준이 대상, 가능한 동작, 소통 범위 등을 명확히 정의했더라면 피할 수 있었던 실패가 있었을 수도 있다는 입장을 보이고 있습니다. 더하여, 모호한 과제나 해결 불가능한 과제는 실제 사용에서도 매일 마주하게 되므로, 과제의 작성 방식만으로는 해결할 수 없다는 시각을 제시하고 있습니다.

위치적으로는 실해는 작고, 7월 30일과 9월 9일에 공표한 사이버 관련 사안보다 경미하다고 평가하고 있다. 사례 중에는 연방·주·지방 정부기관의 사이트가 연루된 경우도 있었으며, 백악관에 설명한 후 관계 기관 각각에 연락했다는 보고를 받았다. 파악한 바에 따르면 고객의 데이터나 Anthropic 자신의 내부 시스템은 관여하지 않은 것으로 보인다.

대응 차원에서, Anthropic은 실제 인터넷 연결을 내부 평가에 대해 일시적으로 모두 중단시켰습니다. 감시 메커니즘이 이러한 움직임을 확실하게 감지할 수 있을 때까지 확인될 때까지의 조치라는 것이었습니다. 외부 연구자가 만들어 공개하고 있는 평가 중 일부는 실행을 중단하거나 실제 사이트와 연결되지 않는 형태로 수정했습니다. 웹 읽기 도구의 제한도 강화하여 이러한 움직임을 자동으로 감지하고 중단하는 메커니즘을 추가했습니다. 이 메커니즘을 이번 사례에 뒤늦게 적용해 본 결과, 모든 움직임을 막을 수 있었다고 보고되었습니다.

## 일상적으로 사용하는 클로이드에서는 어떻게 진행되고 있는지

확인된 사례 중 일부는 평가가 아닌, 일반적인 에이전트 활용 방식(AI에게 작업을 맡기고 스스로 조사하거나 조작하게 하는 방식)에서 발생했다. 유료 데이터의 예시 또한 연구자가 평소 작업 시 Claude를 사용했을 때의 사례이다.

저는 매일 Claude를 사용하고 있으며, 브라우저를 실행하는 Claude in Chrome도 자주 사용합니다. 매일 아침 뉴스를 확인하는 것도, 스케줄링 기능으로 Claude에게 요청하는 것도 같습니다. 제가 읽는 사람으로서 가장 먼저 궁금한 것은, 평소에 사용하는 Claude에서도 동일한 문제가 발생하는지인지 궁금합니다.

Claude in Chrome을 제품으로 사용할 때, 운영 권한 부여 방식을 선택하는 모드가 있습니다. 공식 헬프에 따르면 다음과 같은 3가지 모드가 있습니다.

- 수동 승인: 각 작업 시 허용 여부를 묻습니다.
- 자동 승인: Claude는 각 작업에서 안전성을 확인하고 위험이 없다고 판단한 것은 실행하며, 필요하면 질문합니다. Cowork의 사이드 패널에서는 이것이 기본 설정입니다.
- 모든 승인을 건너뛰기: 질문도, 자동 확인도 없습니다.

구매, 계정 생성 등은 어떤 모드에서도 금지되어 있습니다. 하지만 양식 제출 자체는 이러한 금지 목록에도, 반드시 허가를 요청하는 목록에도 포함되어 있지 않습니다. 중단될지는 모드와 그 시점의 안전 검사 판단에 달려 있습니다.

보고서의 사례는 Anthropic社 내부의 평가 및 작업에서 발생한 것으로, 이러한 제품 측의 확인이 이루어졌는지 여부는 명시되어 있지 않다. 동일한 문제가 발생할 수 없다는 점 또한 말할 수 없다. 다만, 어떤 모드로 위임할지 선택하는 것은 사용하는 측에 달려있다.

이름과 연락처가 모두 비어 있는 채로 경찰에 도착한 한 통의 우편물은 스팸의 흔적을 그대로 간직한 채 수사에는 회부되지 않았다.

다른 곳에서 노트에 쓰는 것 외에도, 개인적으로 이렇게 만들어 봅니다.

매일의 상자── 삶과 놀이를 모아두는 상자. 당첨 추첨 기록, 그림 해설 기록, 엉터리 기록, SmaPhoto Tips의 4가지 콘텐츠를 운영하는 개인 개발 포털입니다.

이러한 과정을 이 글에 상세히 기록했습니다. 관심 있으시면 알려주세요.

클로드 #앤트로픽 #AI 에이전트 #생성 AI #AI 안전 #AI 뉴스 #일상의 깨달음

**출처:** [note 원문](https://note.com/ocomoco/n/nf6a644b0e375)

*번역: Gemma 3(.44) 초벌 + 교정 28청크*

[원문 보기](https://note.com/ocomoco/n/nf6a644b0e375) | 출처: note.com