# Anthropic, '개발 중인 AI로 외부를 공격하지 않기 위한 대책' 발표

> https://bookfactory.kr/c/news/10817
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-01T10:37:39.855Z

---

"OpenAI의 테스트 중인 모델이 Hugging Face를 공격해 버렸다"는 문제가 화제가 되는 가운데, Anthropic 역시 "AI 모델 테스트 중에 외부 공격이 발생했었다"고 보고했습니다. Anthropic은 테스트 중인 모델의 의도치 않은 공격을 막기 위한 대응 내용을 새롭게 발표했습니다.Improving our alignment and security practices \ Anthropichttps://www.anthropic.com/news/improving-alignment-security-effortsAnthropic은 OpenAI의 보안 인시던트 보고를 받고 과거 테스트 내용을 정밀 조사하여, "테스트 중인 모델에 의한 외부 공격"이 3건 발생했음을 2026년 7월 30일에 보고했습니다. 모든 사례에서 "인터넷에 접근할 수 없는 테스트 환경"을 사용하여 테스트가 진행되었으나, 테스트 환경의 설정 오류로 인해 실제로는 인터넷에 접속 가능한 상태였으며, 테스트 모델이 인터넷에 접속하여 공격을 수행하고 있었습니다. 테스트 모델의 공격 수법에는 "PyPI 계정을 새로 생성하고, 악성코드가 포함된 패키지를 등록한다"는 악의적인 사례도 포함되어 있어, 안전한 테스트 수법의 확립이 시급한 과제가 되고 있습니다. Anthropic도 AI 모델 테스트 중 외부 공격을 실행했음을 보고, 악성코드를 1시간 동안 유포하고 실제 기업에 침입한 사례도 - GIGAZINE

Anthropic은 3건의 공격 발생을 확인한 후, 테스트 중인 모델에 대한 사이버 보안 평가를 일시 중단하고 안전 대책 강화를 실시했습니다. 구체的な 대책 내용은 다음 3가지입니다. 1: 테스트 중인 모델에 의한 "테스트 환경의 적극적인 분석", "테스트 환경 탈출 시도", "인터넷 액세스 확립 시도"를 실시간으로 자동 식별할 수 있는 분류기를 구축. 분류기가 문제 행동을 감지하면 툴 호출 실행 전에 행동이 차단되고 담당자에게 경고를 발송함 2: 테스트 중인 모델에 대한 자동 모니터링을 실행하여, 테스트용 샌드박스의 결함이나 설정 오류를 탐색함 3: 고위험으로 판단된 3개의 사내 사이버 샌드박스를 견고한 격리 환경으로 이전함. 또한 가상화 스택의 취약점을 발견하여 수정하기 위해 테스트 모델이 "가상화 스택 탈출"을 시도하도록 하는 레드팀 훈련을 실시함 또한, Anthropic은 보상 해킹과 공격 특성의 연관성도 조사하고 있습니다. 보상 해킹은 AI가 부여된 태스크를 인간의 의도와는 다른 방식으로 해결하려는 행동을 말하며, "어려운 수학 문제를 푸는 대신 인터넷에 공개된 정답을 검색하는" 등의 행위가 이에 해당합니다.

Anthropic은 보상 해킹과 공격 특성의 관계를 조사하고자 'OpenAI의 테스트 모델에 의한 Hugging Face 공격'과 'AI Security Institute(AISI)의 평가 중 Claude Mythos 5가 외부 공격을 실행하려 했던 문제'를 참고하여 시뮬레이션 시나리오를 작성했습니다. '보상 해킹을 많이 실행하도록 의도적으로 강화학습시킨 모델'로 시뮬레이션을 실행한 결과, 테스트 환경에서 벗어나려는 경향을 보였다고 합니다. 반면 '강화학습 전 모델'과 'Anthropic의 제품 모델'로 시뮬레이션을 실행했을 때는 부적절한 행동이 확인되지 않았다고 합니다. 이 결과로부터 Anthropic은 "학습 과정에서 상당량의 보상 해킹이 이루어지면 모델이 과제 수행을 추구하여 유해한 행동을 저지를 가능성이 있다"고 결론지었습니다. Anthropic은 테스트 중인 모델의 외부 공격에 대해 분석을 지속하고 있으며, 조사 기관인 METR에 독립적인 조사를 의뢰하는 것도 계획하고 있다고 합니다. 향후 몇 주 이내에 세부 내용을 공개할 예정이라고 합니다.

[원문 보기](https://gigazine.net/news/20260901-anthropic-alignment-security/) | 출처: Gigazine