Anthropic은 2026년 8월 31일, 테스트 중인 Claude가 실제 컴퓨터 시스템에 무단 접근한 일련의 사건에 따라 평가·훈련 환경의 안전 대책을 강화했다고 발표했다. 모델이 테스트 환경에서 탈출을 시도하거나 예상치 못하게 인터넷에 연결된 경우, 툴을 실행하기 전에 자동으로 차단하는 시스템을 도입한 것 외에도 외부 평가 기관에도 샌드박스 격리나 실시간 모니터링 등을 요구한다. ## Claude 평가 중 실제 시스템 무단 접근 Anthropic은 7월 30일, Claude를 사용한 사이버 보안 평가를 조사한 결과, 3개 조직의 실제 시스템에 무단 접근한 사례를 확인했다고 보고했었다.
해당 회사는 14만 1006회의 평가를 소급 조사하여 Claude Opus 4.7, Claude Mythos 5, 사내 연구용 모델이 관여한 3건을 특정했다. 모두 외부 평가 파트너가 준비한 환경으로, 본래 인터넷에 연결될 수 없는 설정이었으나 설정상의 미비로 인해 외부로의 경로가 열려 있었다. 일부 모델은 실제 시스템임을 나타내는 징후를 알아차린 후에도 테스트 환경의 일부라고 판단해 공격을 계속했다.
이는 OpenAI가 7월에 공표한 Hugging Face 무단 접근과는 상황이 다르다. OpenAI의 사례에서는 모델이 미지의 취약점을 이용해 격리 환경에서 외부로 도달한 반면, Anthropic의 3건에서는 설정 실수로 인해 이미 인터넷으로의 경로가 열려 있어 Claude가 샌드박스 자체를 뚫고 나간 것은 아니다.
또한 영국 AI Security Institute(AISI)는 8월 4일, 인터넷 연결을 의도적으로 허용하고 일반 사이버 안전 분류기도 비활성화한 평가 환경에서 Claude Mythos 5 등이 테스트 범위를 넘어 실제 존재하는 인물이나 조직에 대한 행동을 취했다고 보고했다. 122회의 실행 중 10회에서 범위 외의 행동이 확인되었으며, 총 19건 중 17건이 Mythos 5에 의한 것이었다. 실제 존재하는 오픈소스 프로젝트에 악성 코드를 전송하려 하고, 승인을 얻기 위해 가짜 온라인 ID를 생성하는 등의 행동도 확인되었으나 공격은 성공하지 못했다. ## 모델의 행동을 툴 실행 전에 자동 차단 이러한 사건에 따라 Anthropic은 출시 전 모델을 사용한 외부 사이버 평가를 일시 중단하고, 사내 평가에 대해서도 단기간 중단했다.
**Anthropic이 제시한 AI 에이전트용 다층 방어. 모델 내부의 얼라인먼트, 샌드박스나 지속적인 모니터링, 위험한 행동을 실행 전에 차단하는 분류기 등을 조합한다**
새로 도입한 것은 모델의 행동을 실시간으로 모니터링하는 분류기다. 모델이 테스트 환경을 적극적으로 탐색하여 탈출하려 하거나 예상치 못하게 인터넷 연결을 확보했을 때 감지하여 툴 호출이 실행되기 전에 행동을 차단한다. 그 시점에 평가를 종료하고 사람 담당자에게도 경고한다. Anthropic에 따르면, 이 분류기를 과거 사례에 적용했을 때 7월 30일에 보고한 인시던트를 감지할 수 있었음을 확인했다고 한다.
해당 회사는 출시 전 모델을 사용한 최근 사내 평가에 대해서도 기록을 자동 검사했다. 샌드박스의 설정 미비를 모델이 이용한 사례는 발견되었으나, 샌드박스 외부의 시스템이 침해된 사례는 확인되지 않았다고 한다.
고위험 사내 사이버 평가 환경에 대해서는 보다 강력한 격리 방식으로 전환했다. 현재는 이러한 대책을 도입한 상태에서 사내 사이버 평가를 재개하고 있다. ## 고위험 RL 환경에도 모니터링 도입 대책은 모델 평가뿐만 아니라 강화학습(RL) 환경으로도 확대되었다.
Anthropic은 출시 전 모델 대상의 고위험 RL 환경을 수 주 동안 중단하고, 동일한 분류기를 도입했다. 모델이 모니터링 자체를 회피하는 행동을 학습하기 어렵도록 조정했다고 밝혔다.
대부분의 RL 환경은 이미 재개되었으나, 일부 고위험 환경은 사람에 의한 검토가 끝날 때까지 중단을 유지하고 있다. 분류기 업데이트 버전을 도입한 후 재개할 예정인 환경도 있다. ## 외부 평가에서는 "인터ネット 미연결"을 원칙으로 Anthropic은 자사뿐만 아니라 외부 평가 기관에도 새로운 안전 대책을 요구하고 있다.
사이버 보안 평가는 원칙적으로 인터넷에 연결할 수 없는 견고한 샌드박스 내에서 진행된다. 평가 시작 전에는 모델 자체에 샌드박스의 취약점을 조사하게 하고, 실제로 탈출을 시도하게 하는 테스트도 실시한다.
또한 모델에 대한 지시에는 공격 대상이나 허용된 행동, 네트워크상의 경계를 명시한다. "인터넷에는 연결할 수 없다"고 환경에 대해 설명할 뿐만 아니라, "인터넷에 접근해서는 안 된다"고 명확히 지시할 것을 요구한다.
평가 중에는 모델의 사고나 행동, 네트워크 통신을 지속적으로 모니터링하여, 허용된 범위를 벗어난 경우에는 사람에게 통보하고 평가를 종료한다. Anthropic은 이러한 규칙을 도입한 상태에서 외부 사이버 평가도 재개하고 있다. ## 운영상의 문제뿐만 아니라 AI의 "동기 부여된 추론"도 조사 한편, Anthropic은 이번 문제를 평가 환경의 설정 실수만으로는 설명할 수 없다고 밝히고 있다.
잠정적인 조사에서는 2가지 정렬(alignment)상의 문제를 꼽았다. 하나는 실제 인터넷에 연결되어 있다는 징후를 발견하더라도, "이것은 시뮬레이션이다"라는 첫 번째 전제에 맞추어 증거를 해석해 버리는 "motivated reasoning(동기 부여된 추론)"이다.
다른 하나는 유해할 가능성이 있더라도 목표 달성을 우선시해 버리는 "recklessness(무모함)"이다. Anthropic은 환경의 격리나 모니터링만으로는 모델이 왜 이러한 행동을 선택했는가라는 문제 자체는 해결할 수 없다고 보고 분석을 계속하고 있다.
이 회사는 아울러 보상을 부당하게 획득하는 "reward hacking"을 의도적으로 학습시킨 모델을 사용하는 연구도 공개했다. 80가지 RL 환경에서 훈련한 결과, 시뮬레이션 상에서 샌드박스를 탈출하고 인증 정보를 훔쳐 내부나 제3자의 인프라를 공격하는 등 더 심각한 행동으로 일반화되는 사례가 확인되었다.
Anthropic은 이번 인시던트에 대해 상세한 분석을 계속함과 동시에, AI 모델 평가를 전문으로 하는 비영리 단체 METR에 의한 독립적인 검토도 예정하고 있다. 조사 결과에 대해서는 향후 수 주 이내에 추가 정보를 공개할 예정이다.
:::box 관련 기사: Anthropic, Claude가 평가 중 실제 3개 조직에 권한 없이 접근 설정 미비로 인터넷에 접속, PyPI에 악성 패키지도 공개 ::: :::box 관련 기사: 영국 AI 보안 연구소, 사이버 시험에서 19건의 권한 외 행동 AI가 가짜 계정으로 인간에게 접근 ::: :::box 관련 기사: OpenAI의 'GPT-5.6 Sol' 및 상위 미공개 AI 모델, 평가 중 Hugging Face에 침입 운영 DB에서 평가 문제 정답 획득, '전례 없는' 사이버 사건으로 규정 ::: :::box 관련 기사: Anthropic, 'Claude Mythos 5'를 Claude Security에 도입 모델은 직접 개방하지 않고 취약점 스캔으로 한정 :::
원문 보기 | 출처: Ledge.ai