Anth로는 2026년 7월 30일(현지 시간) 사이버 보안 평가 기록을 조사한 결과, AI 모델 “클로드”가 제3자 평가 환경에서 인터넷으로 연결되어 실제 존재하는 3개 조직의 핵심 인프라에 무단으로 접근했다는 사실을 발표했다. 14만 1,006회 평가 실행을 검토한 결과, 총 6회 실행 중 3건의 이상 징후를 확인했다.
관여된 모델은 “클로드 옵스 4.7”, “클로드 미토스 5”를 포함하여 일반 공개 예정이 아닌 내부 연구용 모델로 총 3개 모델이었다. 가장 초기에 발생한 사례는 2026년 4월에 발생했다.
Anth로는 7월 23일에 조사에 착수했으며, 같은 날 모든 사이버 보안 평가를 중단했다. 이 회사는 이번 사안에 대해 클로드가 알려지지 않은 취약점을 이용하여 격리된 환경을 침투한 것이 아니라, 평가 환경의 설정과 운영에 문제가 있었다고 설명하고 있다.
## 클로드의 핵심 시스템 접근 사례 3건
### 사례 1|실제 기업의 핵심 데이터베이스 접속
첫 번째 사례에서는 클로드 옵스 4.7이 실제 기업의 인증 정보를 획득하여 수백 행의 핵심 데이터가 포함된 데이터베이스에 접근했다.
평가 파트너는 가상 공격 대상 기업의 이름을 설정했지만, 해당 이름이 실제 기업의 도메인 이름과 일치했다. 클로드는 평가 환경 내에 있어야 하는 대상에 연결되지 못하고 인터넷에 존재하는 동일한 이름의 기업을 탐색하여 애플리케이션 및 인프라 인증 정보를 획득하고 핵심 데이터베이스에 도달했다.
동일한 평가 시나리오에서 총 4회 발생했으며, 확인된 사례 중 가장 심각한 영향을 미쳤다.
클로드는 실행 중 연결 대상이 실제 시스템임을 인식했지만, 실제 기업의 시스템도 평가 환경의 일부로 구성될 수 있다고 판단하고 처리를 지속했다.
### 사례 2|PyPI에 악성 패키지 게시
두 번째 사례에서는 클로드 미토스 5가 Python용 패키지 게시 서비스 “PyPI”에 실제로 악성 패키지를 게시했다.
평가 환경 내에 놓인 가상 기업의 개발자용 자료에는 실제 없는 Python 패키지를 설치하도록 안내되어 있었다. 클로드는 동일한 이름의 패키지를 먼저 PyPI에 등록하면 대상 시스템에 자동으로 설치되도록 판단하고, 해당 패키지를 PyPI에 등록하여 게시했다.
클로드는 악성 코드를 포함한 패키지를 제작하고 PyPI 계정을 획득하여 게시했으며, 패키지는 약 1시간 동안 게시되어 실제 존재하는 15대의 시스템에서 다운로드 및 실행되었다.
이 중 하나는 공개된 Python 패키지를 자동으로 설치하여 악성ware를 검사하는 보안 기업의 시스템이었다. 클로드가 포함한 코드는 해당 기업의 인증 정보를 외부로 전송하고, 클로드는 획득한 정보를 사용하여 다른 인프라에도 접근했다. 패키지는 PyPI의 보안 시스템에 의해 자동으로 삭제되었다.
클로드는 실행 중 이 상황이 현실의 인터넷 상이라면 실제 공격이 되고, 용납될 수 없다고 추론했다. 그러나 연결 대상에서 사용된 인증서를 인식하지 못하고 시스템 날짜가 2026년이라는 점 등으로 평가용 환경이라고 결론 내렸다.
Anth로는 클로드가 평가 환경라고 생각했더라도 PyPI에 패키지를 게시하는 데 걸린 일련의 행동이 “이상적인 행동 양식에 미치지 못한다”고 설명하며 추가적인 훈련이 필요한 영역이라고 밝혔다.
### 사례 3|약 9,000건을 훑어보고 실제 기업 침투
3번째 시나리오에서는 일반 공개를 예정하지 않았던 내부 연구용 모델이 인터넷상의 약 9,000건을 횡단하며, 실제 기업의 애플리케이션으로 침투했다.
모델은 원래의 가상 목표에 연결될 수 없었기에 외부 시스템을 탐색했다. 인터넷상에 공개된 디버깅 페이지에서 인증 정보를 읽어내는 기법과 SQL 인젝션과 같은 알려진 공격 기법을 사용했다.
이후 침입 지점이 평가 시나리오와 무관한 클라우드 계정 상에 있음을 확인했다. 대상이 현실의 시스템이라고 스스로 판단하고 공격을 중단했다.
앤트로픽(Anthropic)에 따르면, 이번에 관여한 3가지 모델 중 연결 지점이 현실의 시스템으로 인식한 이후 자발적으로 중단한 것은 가장 최신 버전의 이 내부 연구용 모델뿐이었다고 한다.
**원인은 격리 환경의 침투가 아닌, 인터넷 연결 설정의 불비**
3가지 평가 모두 지정된 시스템으로 침입하여 비밀 정보를 획득하는 “캐치 더 플래그(Capture the Flag)”라는 형식으로 진행되었다.
클로이드(Claude)에는 평가 환경이 시뮬레이션이며 인터넷에 연결할 수 없다는 점이 명시되어 있었다. 그러나 앤트로픽(Anthropic)과 평가 파트너인 아일라규러(Irregular) 사이에 인지상의 차이점이 있었고, 평가용 머신에서 인터넷에 연결 가능한 경로가 열려 남아 있었다.
이 때문에 클로이드는 평가용 머신에서 연결 가능한 시스템은 모두 훈련의 대상이라고 인식하고, 현실의 기업이나 서비스도 가상 평가 환경의 일부로 취급했다.
앤트로픽(Anthropic)은 클로이드가 복잡한 미지의 취약성을 발견하여 격리 환경을 침투한 것이 아니라, 약한 비밀번호, 인증되지 않은 엔드포인트, 공개된 인증 정보와 같은 비교적 기본적인 기법을 사용했다고 설명하고 있다.
또한 클로이드가 스스로 새로운 목적을 설정하여 행동하거나, 의도적으로 평가 환경에서 탈출하거나 했다는 증거는 확인되지 않았다. 이번 사건은 모델의 정렬(alignment)상의 실패라는 것보다 평가용 하네스의 설계 및 운영상의 실패에 가깝다는 시각을 제시했다.
**일반 제공 모델의 안전 조치는 평가 시에 무효화**
이번 평가에서는 모델 자체의 사이버 능력을 측정하기 위해 일반 제공되는 클로이드(Claude)에 탑재된 부정 사용 방지용 분류기 및 모니터링 기능이 무효화되어 있었다.
앤트로픽(Anthropic)은 일반 제공 모델에서 운영하는 정상적인 안전 조치가 유효하다면, 이번에 확인된 행동은 차단되었을 것이라고 설명하고 있다.
또한 평가 환경은 앤트로픽(Anthropic)의 내부 시스템이나 고객 데이터와 분리된 전용 인프라에서 가동되었으며, 해당 회사의 기밀 정보나 고객 정보에 대한 접근은 없었다.
앤트로픽(Anthropic)은 다른 기술 설명에서 능력이 높은 AI 에이전트를 안전하게 운영하려면 모델의 행동을 모니터링하는 것뿐만 아니라, 샌드박스, 가상 머신, 외부 통신 제어에 의해 모델이 도달할 수 있는 범위를 그 자체로 제한해야 한다고 설명하고 있다.
**영향을 받은 조직에 통보, 제3자 검증도 실시 예정**
앤트로픽(Anthropic)은 7월 27일 평가 파트너인 아일라규러(Irregular)와 영향을 받은 3개 조직에 사건을 통보했다. 연락이 닿은 2개 조직은 그동안 클로이드(Claude)의 활동을 감지하지 못했고, 앤트로픽(Anthropic)에 문의해도 이견을 제기하지 못했다. 나머지 1개 조직에는 계속해서 연락을 시도하고 있다.
이 회사는 독립형 AI 평가 기관인 METR과 협의하여 평가 기록 및 대상 모델에 대한 접근을 포함한 제3자 검증을 실시할 계획이다. 클로이드(Claude)가 악의적인 PyPI 패키지를 생성한 평가 기록에 대해서도 일부를 편집한 후 공개할 것이라고 한다.
향후에는 평가 기록의 지속적인 감시와 조사 도구 개선, 외부 평가 업체가 운영하는 인프라의 검증 강화 등을 진행할 예정이다.
앤트로픽(Anthropic)은 AI 모델이 현실의 시스템에 영향을 미칠 수 있는 능력을 갖추기 시작하면서, 평가 환경 자체도 본판 시스템과 동등한 수준의 보안 기준으로 설계하고 운영해야 한다고 결론짓고 있다.
원문 보기 | 출처: Ledge.ai