# 영 AI 보안 연구소, 사이버 시험에서 19건의 권한 외 행동 발생 – AI가 가짜 계정으로 사람에게 협조

> https://bookfactory.kr/c/news/8894
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-06T22:58:46.484Z

---

영국 AI 보안 연구소(AISI)는 2026년 8월 4일(현지 시간), 프론티어 AI 모델을 대상으로 한 사이버 평가 중, AI 에이전트가 허용된 범위를 넘어 실존하는 인물이나 조직을 대상으로 행동한 사건을 공개했다.

122회 시도 중 10회에서 총 19건의 권한 외 행동을 확인했다. 이 중 Anthropic의 “Mythos 5”가 17건, OpenAI의 “GPT-5.6 Sol”이 2건이었다. 공격 시도는 성공하지 못했으며, 실제 피해는 확인되지 않았다.

## AI가 가짜 계정을 생성하고 악성 코드 승인을 유도

평가에서는 AI 에이전트에 모의 네트워크에 침입하여 보호된 데이터를 획득하는 과제가 주어졌다.

가장 심각했던 것은 Mythos 5가 실존하는 오픈 소스 프로젝트에 악성 코드를 포함한 변경안을 제안한 행동이었다. 에이전트는 프로젝트 관리자를 조사하고 여러 개의 가짜 계정을 생성하여 관리자에게 변경안을 승인하도록 유도했다.

변경안의 내용을 의심당하자, 이전 활동을 무해하게 보이도록 편집하고 다른 신분으로 활동을 지속하는 것을 고려했다. 실존하는 인물에게 메시지나 파일을 보내 해당 인물이나 이용 중인 AI 코딩 툴에 악성 코드를 실행시키려 하기도 했다.

변경안은 인간 관리자에게 발각되어 승인되지 않았다. AISI는 실존하는 인물을 대상으로 자율적인 행동이나 기만, 즉 명시적인 지시 없이 이러한 방식으로 명확하게 나타난 것은 처음이라고 밝혔다.

GPT-5.6 Sol은 다른 AI 에이전트가 공개적으로 남아있던 GitHub의 접근 토큰을 재활용했으며, 외부 DNS 서비스나 터널링 서비스에 계정을 등록했다. 공개 터널을 통해 평가 환경 내 DNS 서버를 인터넷에서 연결할 수 있는 상태가 되었으나, 이 메커니즘은 작동하지 않았다.

## Hugging Face 침해와는 다른 위험을 보여줌

AI 모델의 사이버 평가에 대해 OpenAI는 7월 21일, 해당 회사의 모델이 평가 환경의 알려지지 않은 취약점을 악용하여 인터넷에 도달하고 Hugging Face의 본판 인프라를 침해했다고 밝혔다.

이 사안에서는 모델이 여러 취약점과 도난당한 인증 정보를 결합하여 본판 데이터베이스에서 평가 과제의 답을 획득했다. OpenAI는 플랫폼 수준의 침해였다고 설명했다.

Hugging Face의 사안이 AI에 의한 취약점 발견과 시스템 침해 능력을 보여준 것에 반해, 이번 AISI에서의 사안에서는 AI가 사각형을 벗어나지 않고, 허용된 인터넷 연결을 사용하여 가짜 신분과 메시지를 통해 인간을 움직이려 했다.

AISI는 OpenAI와 Anthropic이 최근 공개한 사건과 함께 위험이 “인간에 의한 AI의 악용”뿐만 아니라 권한을 부여받은 AI 에이전트가 의도치 않게 허용 범위를 초과하는 문제로 확대되고 있다고 지적했다.

## 네트워크 연결 허용, 안전 기능도 무효화

이번 평가에서는 실제 공격자에게 근접한 조건에서 능력을 점검하기 위해 의도적으로 네트워크 연결이 허용되었다. 위험한 사이버 행동을 방지하는 모델 제공 업체의 분류기도 무효화되었다. 이는 일반 사용자에게 제공되는 AI 모델과는 다른 구성이었다.

AISI는 특정 조건에서 확인된 소수의 사례이며, 시험 환경 외에서 동일한 행동이 어느 정도 발생할지는 알 수 없다고 설명했다. AI가 현실 세계에 대해 행동하고 있다고 이해했는지, 아니면 가상의 시험 환경의 일부라고 생각했는지 단정할 수 없다고 덧붙였다.

## AISI와 OpenAI, 제3자 평가의 안전 대책을 재검토

AISI는 7월 28일, 익명 통신 네트워크 “Tor”를 통해 탐지된 의심스러운 데이터 통신에 대해 관련 평가를 중단했다. 대상 기기를 격리하는 데 걸린 시간은 약 1시간이었다.

향후, AI 에이전트가 연결될 수 있는 외부 네트워크를 세밀하게 제어하는 것 외에도, 평가 중인 행동을 실시간으로 감시하고 허용 범위를 벗어난 작동을 감지 및 차단하는 시스템을 도입할 계획이다. 과거의 평가에 대해서도 유사한 행동이 간과되지 않았는지 감사하는 방안을 고려하고 있다.

OpenAI 또한, AISI의 사건과 외부 평가 기업 Irregular에서 별도로 발생한 인터넷 연결 사고를 공개하고, 제3자 평가 운영을 재검토하는 방침을 밝혔다.

Irregular에서 진행된 평가에서는, 원래는 인터넷으로부터 격리되어야 할 환경이 설정 오류로 외부로 연결되어 모델이 가상의 공격 대상과 동일한 실제 웹사이트에 접속했다. 모델은 해당 웹사이트의 취약점을 악용하여 발견한 인증 정보를 활용했다.

OpenAI는 앞으로 인터넷 연결 및 보안 기능 비활성화를 허용하는 조건 외에도, 평가 범위, 인증 정보 관리, 감시 체계, 시험 중단 기준, 사고 발생 시 보고 및 대응 절차 등을 명확히 하는 것을 목표로 하고 있다.

[원문 보기](https://ledge.ai/articles/aisi_ai_agent_cyber_incident) | 출처: Ledge.ai