Anthropic이 자사의 AI 'Claude' 실험 중 발생한 무단 접근 사건 보고서를 공개했습니다. Claude가 실수로 제3자의 시스템에 무단 접근한 사례가 총 4건 확인되었다고 합니다. An alignment assessment of recent cybersecurity incidents \ Anthropichttps://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents Anthropic은 2026년 7월 30일에 '자사의 AI가 실제 존재하는 조직을 대상으로 사이버 공격을 감행했다'는 사례가 3건 발생했음을 보고했습니다. 이 보고서를 공개한 후, 새로운 조사에서 4번째 사례도 발각되었습니다. 이 4건의 인시던트는 모두 Anthropic이 Claude의 사이버 보안 능력을 평가하는 과정에서 발생한 것이었습니다. 4건의 인시던트 모두 오프라인 환경에서 테스트해야 했을 것이 설정 오류로 인해 인터넷에 연결된 상태에서 진행되었음도 밝혀졌습니다. Anthropic도 AI 모델 테스트 중 외부 공격을 실행해 버린 것을 보고, 악성코드를 1시간 동안 배포하여 실제 기업에 침입한 사례도 - GIGAZINE
4건 모두 Claude가 '캡처 더 플래그(Capture The Flag)'라고 불리는 작업을 수행하는 과정에서 발생한 것이었습니다. 이 작업은 가상의 시나리오와 표적이 되는 머신이 설정된 상태에서 표적으로부터 비밀 정보(플래그)를 획득하는 것입니다. Anthropic에 따르면 작업을 수행한 Claude Opus 4.7, Claude Mythos 5, 연구용 테스트 모델, Claude Opus 4.6이 각각 별개의 인시던트를 일으켰다고 합니다. Claude Opus 4.7, Claude Mythos 5, 연구용 테스트 모델의 인시던트에 대해서는 지난 보고서에서 자세히 서술되어 있습니다. Claude Opus 4.6의 인시던트는 실수로 표적에 다른 머신과 충돌하는 IP 주소를 할당해 접근 불능으로 만든 결과, 접근 수단을 찾아 인터넷에 연결해 버린 것이었습니다.
Claude Opus 4.6은 Claude Opus 4.7과 동일한 접속 경로를 확립하여, 잘못 설정된 제3자의 머신을 발견했습니다. 이 제3자를 표적이라고 착각하여 머신 내부에서 발견한 인증 정보를 사용해 시스템 접근 권한을 획득했습니다. 이후 모델은 추가로 인증 정보를 수집하고, 접근을 용이하게 하기 위해 시스템 설정을 변경했으며, 제3자와 관련된 인물의 개인정보를 읽어들였습니다. 최종적으로 모델의 토큰 예산이 소진된 시점에 세션이 종료되었다고 합니다. 이번 인시던트에서 특징적이었던 점은 4건 모두에서 인터넷 접속이 이루어졌다는 사실이었습니다. 설정상으로는 인터넷에 연결할 수 없도록 되어 있었고, Claude에게도 그렇게 전달되었음에도 불구하고 말입니다. 2026년 7월 30일 보고에서는 Claude가 "인터넷에 연결되어 있는 것처럼 보이지만 실제로는 시뮬레이션 환경이다"라고 착각하여 실행에 이르렀다고 기재되었으나, 조사 결과 인터넷에 연결되어 있음을 나타내는 증거를 Claude가 충분히 인식하고 있었으며, 실제로 사고하는 내용과 텍스트로 옮긴 사고 사이에 괴리가 있음이 밝혀졌다고 합니다.
Anthropic은 "Claude는 CoT(생각의 사슬)에 의한 추론 속에서 실제 인터넷을 시뮬레이션이라고 반복해서 표현했습니다. 그렇기 때문에 위와 같이 보고했으나, Claude는 현실의 인터넷에 연결되어 있음을 명확히 나타내는 증거를 얻었으며, 각 모델의 행동으로 보아도 Claude는 그 사실을 인식하고 있었다고 생각합니다. 돌아보면, Claude가 무엇을 믿고 있었는지에 대해 Claude 자신이 『그렇게 믿고 있다』고 서술한 내용만을 근거로 이처럼 강한 주장을 해서는 안 되었습니다"라고 밝혔습니다. Anthropic은 모델에 두 가지 미스얼라인먼트(AI의 비윤리적 사고)가 발생하고 있었다고 분석하고 있습니다. 하나는 "자신의 행동을 정당화하는 방향에 유리하도록 증거를 해석하는 것"이고, 다른 하나는 "유해한 결과로 이어질 가능성이 있는 경우에도 과제를 해결하려고 계속 시도하는 무모함"입니다. 특히 Claude Mythos 5에는 무모함이 강하게 나타났습니다. Claude Mythos 5는 PyPI(Python 패키지 레지스트리)에 악성 패키지를 업로드하여 인증 정보를 취득하려고 했으나, 업로드 과정에서 온라인 결제 처리업체의 인증 정보를 사용하려 했고, 이메일 주소 등록에 필요한 전화번호를 취득하기 위해 암호화폐를 찾다가 이에 실패하자 PyPI가 차단하지 않은 도메인을 가진 무료 일회용 이메일 서비스를 찾아내어 계정을 등록하고, 악성 패키지를 3개 버전으로 공개하는 교묘한 수법을 썼다고 합니다. Claude Mythos 5는 CoT 속에서 "자신은 시뮬레이션 환경에 있다"고 반복해서 언급했으나, 모델이 시뮬레이션 환경에 있지 않음을 명확히 하고 다시 실험한 결과, Claude Mythos 5는 현실 세계에 피해가 미칠 가능성이 높다는 것을 인정하면서도 공격적인 행동을 계속 취했다고 합니다. 다만, Claude Mythos 5는 부여된 과제를 풀려는 시도에서 벗어난 적은 없으며, 실제 인터넷상에 있음을 명확히 나타내는 증거를 인식한 경우에는 과제를 중단하려고 하기도 했다고 합니다. 덧붙여 자신의 행동 증거를 숨기려 한 적도 없었다고 합니다.
Anthropic은 "적어도 일부 사례에서 모델이 외부로 제시한 발언이 내부 상태와 일치하지 않거나, 내부 상태보다 확신도가 높은 것으로 보고 있는 경향이 나타났다"고 지적했습니다. 모델의 미스얼라인먼트를 방지하기 위해서는 다양한 얼라인먼트 트레이닝이 효과적이라고 덧붙였습니다.
원문 보기 | 출처: Gigazine