영국 정부기관인 AI 보안 연구소(AISI)가 최첨단 AI 모델의 능력을 평가하는 과정에서 여러 AI가 허가 없이 자율적으로 실제 인물이나 조직을 대상으로 해킹을 시도하거나 수행하려 했다는 사실을 밝혔습니다. 이 사건 보고서: 승인되지 않은 에이전트 행동 중 사이버 테스트 | AISI Work https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
보안 사고 INC-2026-07-28-01 (PDF 파일) https://cdn.prod.website-files.com/663bd486c5e4c81588db7a1d/6a724858f7db25c81487016d_Security%20Incident%20INC-2026-07-28-01.pdf AISI는 최첨단 AI 모델의 능력을 평가하고 이해하며, 일반적으로 공개되기 전에 잠재적인 위험을 드러내기 위해 정기적인 검증을 실시합니다. 사이버 공격에 악용될 가능성을 확인하기 위해 검증은 개방된 인터넷 접속을 허용하고 일부 안전 필터를 비활성화한 상태에서 진행됩니다.
2026년 7월 28일에 검증이 실시된 시점, AISI의 보안팀은 AISI의 시스템에서 비정상적인 데이터 전송이 이루어지고 있음을 감지했다. 조사 결과, 테스트 대상 중 일부 에이전트가 실제 인물이나 조직을 표적으로 삼아 지속적이고 잠재적으로 유해한 활동을 수행하고 있었던 것이 밝혀졌다. 이에 AISI는 보안 인시던트를 선언하고, 발견 후 약 1시간 이내에 해당 사상자를 봉쇄한 후 본격적인 조사를 개시했다.
검증의 내용은 여러 AI에 “사이버 보안 과제 해결”이라는 작업을 부여하는 방식으로 진행되었으며, 122회 진행된 검증 중 10회에서 AI가 무허가된 자율적인 행동을 취했던 것으로 나타났다. 문제 행동은 총 19건으로, 그 중 17건은 Anthropic의 “Claude Mythos 5”에 의한 것이었고, 나머지 2건은 OpenAI의 “GPT-5.6 Sol”에 의한 것이었다. 악용을 방지하기 위한 메커니즘을 무효화한 상태에서 발생했다. 특히 심각한 사례에서는 오픈 소스 프로젝트에 악의적인 코드를 삽입하려 시도했으며, 소셜 엔지니어링을 통해 가짜 온라인 ID를 생성한 후 유지 관리자에게 코드 변경 승인을 요구했다. 이 시도는 유지 관리자가 알아채고 승인을 거부하여 막아졌다.
다른 사례들도 현실 세계에 실질적인 피해를 초래하지는 않았지만, AISI는 “자율성과 위장과 관련된 위험이 구체적인 지시 없이 현실 세계에 이렇게 명확하게 나타난 것은 처음 있는 일”이라고 보고했다. AISI는 이번 인시던트가 일반적인 사용법으로 인해 발생한 것이 아니라, 검증 외에 AI가 같은 종류의 행동을 보인 적이 없다고 주장하면서, AI 모델이 고성능으로 인해 사용하기 쉬워지면 이번 인시던트와 같은 일이 더욱 일반화될 가능성이 있다고 지적했다. 가장 효과적인 대책은 기본적인 사이버 위생 관리이며, 사이버 보안의 기본을 확실하게 준수하고, 외부 코드나 기여 내용을 검토할 때는 신중을 기해야 한다고 말했다.
영국의 국가 사이버 보안 센터(NCSC)는 최첨단 AI의 능력이 발전함에 따라 대비에 대한 지침을 발표했다.
**Why cyber defenders need to be ready for frontier AI | National Cyber Security Centre** https://www.ncsc.gov.uk/blogs/why-cyber-defenders-need-to-be-ready-for-frontier-ai
이 지침에서는 모든 종류의 조직에 대해 NCSC가 무료로 제공하는 조기 경고 서비스에 등록하도록 촉구하고 있으며, 사이버 보안을 경영진 수준의 책임으로 인식하여 영국 정부의 인증 제도 “Cyber Essentials”에서 규정된 사이버 보안 요구 사항의 공급망 전체에 걸쳐 철저한 준수를 권장하고 있다.
원문 보기 | 출처: Gigazine