Anthropic는 2026년 9월 10일(현지시간), 자사 AI “Claude”의 악용 사례를 모은 위협 인텔리전스 보고서 “Detecting and countering misuse of AI: September 2026”를 공개했다. 2025년 12월부터 2026년 8월까지 동일사가 탐지·차단한 사례를, 사이버 공격, 영향 공작, 감시, 사기, 생물학적 악용, 일반 무기 개발, 부적절한 모델 증류의 7 영역에서 보고하고 있다.
Anthropic는, 이번에 소개한 사례는 일반적인 Claude의 악용을 보여주는 것이 아니라, 동일사가 확인한 중에서도 특히 주목할 만한 새로운 위협 사례라고 설명한다. 동일사는 과거에도 위협 보고서를 공개했으며, 17 조직을 표적으로 한 데이터 협박과 북한 IT 노동자 의한 고용 사기, 랜섬웨어 개발 등을 소개했다. 이번 보고서에서는, AI가 공격의 일부를 지원하는 것뿐만 아니라, 여러 단계를 연결하여 움직이는 역할을 담당하는 사례가 보고되었다.
## AI가 사이버 공격의 “조수”에서 “지휘자”로
Anthropic는, 사이버 공격에서 AI의 변화를 “From assistant to orchestrator (조수에서 오케스트레이터로)”라고 표현하고 있다.
이번에 확인한 사례에서는 AI가 공격 방법론에 답변하는 것뿐만 아니라, 여러 AI 에이전트와 도구를 결합하여 정찰, 취약점 악용, 침투 후 활동, 정보 탈취 등 일련의 공격 단계를 실행 및 조정하는 사례가 확인되었다.
■ 사이버 범죄에서 확인된 공격 라이프사이클. 인증 정보 탐색부터 침입, 정보 탈취, 수익화, 은폐까지 보여주는
이러한 변화에 대해서는 Anthropic이 2026년 6월에 공개한 분석에서도 징후가 나타나고 있다. Ledge.ai가 소개한 Claude 관련 악의적인 사이버 활동 832건의 분석에서는 AI가 멀웨어 제작 등의 준비 단계뿐만 아니라 침투 후 계정 탐색 및 수평 확산, 권한 상승 등에도 사용되기 시작하는 것이 보고되었다.
## 국가 감시나 일반 무기 개발에도 Claude
악용은 사이버 공격 외에도 확산되고 있다.
감시 분야에서는 중국, 이란, 서아프리카 등과 관련된 사례를 확인했다. 말리에서는 컨설턴트 1명이 Claude를 주요 엔지니어링 요원으로 활용해 국내 이동통신 사업자 3곳의 SIM 약 2500만 장을 대상으로 하는 통신 감청 및 감시 기반을 구축했다는 보고가 있었다.
다른 사례에서는 상업용 인텔리전스 기업 “S2T Unlocking Cyberspace”가 이란 및 페르시아만 지역의 SNS 사용자 분석 및 분류를 위한 감시 플랫폼 구축에 Claude를 활용하고 있었다. Anthropic는 SNS상의 인물을 속성, 거주지, 감정 등으로 분류 및 평가하는 과정을 확인했다고 밝혔다.
■ SNS 사용자 대상 감시 활동 구조. 왼쪽은 Anthropic가 확인한 감시 및 분류 과정, 오른쪽은 유출된 S2T 자료에 기재된 후속 과정
일반 무기 관련으로는 중국 3건, 러시아 2건, 예멘 1건을 합쳐 총 6건을 보고했다. 클루드(Claude)는 유도 로켓, 드론 군집, 전자전 및 방공망 제압용 소프트웨어 등의 설계 및 개발 외에도 군민 양용 물자 조달 및 외국 무기 관련 정보 수집에도 활용되었다.
예멘 사례에서는 공격자가 여러 Claude를 소규모 엔지니어 팀처럼 역할 분담시켜 유도 로켓 등 유도 및 항법·제어 소프트웨어를 개발했다. 실제로 유도 로켓 시험 발사도 이루어졌으나, Anthropic에 따르면 시험은 실패한 것으로 추정되었으며, 수 시간 후 Claude를 사용하여 원인 분석을 진행했다.
■ 예멘 유도 무기 개발 사례에서 Claude가 관여한 개발 과정을 나타낸 그림
## 생물학에서는 5건, 연구와 악용 판단이 과제임
생물학 분야에서는, Anthropic은 위험한 생물학 연구로 이어질 가능성이 있는 5건의 사례를 소개했다.
치쿤구니야 바이러스의 기능 획득 연구와, 고병원성 조류 인플루엔자의 포유류 적응에 관한 연구, 오르토폭스바이러스의 면역 회피에 관한 연구 계획 등이 포함된다.
한편, 이러한 연구는 감염병 예방 및 치료제, 백신 개발에도 활용 가능한 “듀얼 유스”의 특징을 가지고 있다. Anthropic 또한, 이번 사례가 Claude를 이용한 생물학적 위협이 임박했음을 시사하는 것이 아니라고 밝혔습니다.
## 가짜 만남 앱에서는 4700체 초과한 AI 인격, 2주 동안 236만 건의 대화
사기에서는, 중국을 기반으로 하는 앱 개발 회사가, 20개 이상의 데이트 앱의 개발 및 운영에 Claude를 사용한 사례가 보고되었다.
Anthropic에 따르면, 2026년 4월의 2주 동안, 4700을 초과하는 AI 인격이 최소 2만 5천 명과 대화했다. 이용자에게 표시되는 상대의 약 75%가 Claude를 사용한 AI 인격이었고, 나머지 약 25%가 실제 존재하는 인간이었다고 한다.
■ 가짜 만남 앱의 운영 구조. 매칭 후보의 약 75%를 Claude 인격, 약 25%를 실제 존재하는 긱워커가 차지했다.
실제 존재하는 인간은 라이브 영상이나 SNS의 팔로우 등, AI에서는 대응하기 어려운 교류를 담당했다. Claude는 동 기간에 약 236만 건의 메시지를 처리했으며, AI 인격에는 스스로가 자동화되어 있다는 것을 드러내지 않도록 지시되어 있었다.
## Claude를 노리는 “부정 증류” 또한 확대
이번 보고서에서는 Claude를 악용하는 것뿐만 아니라, Claude의 능력을 그 자체로 경쟁 AI로 전이하려는 “부정 증류” 또한 크게 다뤄졌다.
Anthropic은 2026년 2월, DeepSeek, Moonshot AI, MiniMax가 약 2만 4000 건의 부정한 계정을 사용하여 1600만 건을 초과하는 Claude와의 교환을 생성했다고 발표했다.
이번 보고서에서는 이후에도 중국을 기반으로 하는 7개의 AI 연구소에 의한 부정한 증류 공격을 감지 및 차단했다는 보고를 하고 있다.
## Alibaba, Claude에 대한 부정 증류는 3개월 동안 1억 5100만 건 초과
특히 Anthropic이 판단한 캠페인은 Alibaba와 관련이 있었으며, 회사가 “지금까지 측정한 것 중 최대”라고 하는 규모였다.
공격에서는 Claude Opus 4.6과 4.7의 사고 과정을 겨냥해, 피크 시점에는 3500개 이상의 부정 계정에서 하루 약 300만 건의 교환이 이루어졌다고 한다. 획득한 사고 과정은 알리바바의 “Qwen 3.5”, “Qwen 3.6”, “Qwen 3.7” 훈련에 사용되었다고 앤트로픽이 밝혔다.
2026년 5월부터 7월까지, Alibaba에 기인한다고 Anthropic이 판단한 증류 공격은 1억 5100만 건을 초과했다.
## "Kimi인 줄 알았는데 Claude" Moonshot, 사용자의 문의를 Claude로 전송
Moonshot AI에서는, 더욱 다른 방법이 확인되었다. Anthropic에 따르면, Moonshot은 자사 AI “Kimi”의 사용자로부터 받은 일부 문의를 Kimi로 처리하지 않고 Claude로 전송하여 Claude로부터 얻은 답변을 사용자에게 표시했다.
사용자는 Kimi를 이용하고 있다고 인식했지만, 실제로는 Claude의 답변을 받았다는 것이다.
어느 10일 동안에는, 약 30만 건의 사용자 요청이 Anthropic으로 전송되었으며, 그 대다수가 Claude Opus로 전송되었다. Moonshot은 5380개의 부정 계정으로 구성된 프록시 네트워크를 사용하고 있다고 보고했다.
Anthropic는 또한 Moonshot이 이러한 상호 작용의 최소한 일부를 저장하고 Claude의 사고 과정을 추출하여 자체 모델 훈련에 활용하는 메커니즘을 구축하고 있었다고 보고했다. 2026년 5월부터 7월까지 기간 동안 Moonshot으로 인해 발생한 것으로 판단된 증류 공격은 2300만 건을 초과했다.
전송된 문의에는 민감한 정보도 포함되어 있었다. Anthropic는 중국 인민해방군(PLA)과의 관계가 의심되는 사용자가 특정 인물에 대한 감시 카메라 데이터를 Kimi로 분석하려고 시도하거나, 중국의 주요 국영 기업 기술자가 내부 코드와 유효한 인증 정보를 입력하는 사례를 들었다. 이 모든 사례에서 사용자는 문의가 Claude로 전송되고 있음을 인지하지 못했다.
Anthropic는 Moonshot이 사용자에게 문의를 Anthropic로 전송하여 제3자에게 공개한다는 사실을 알렸는지 여부는 확인하지 못했다고 밝혔다.
■ Anthropic가 제시한 부정한 모델 증류 흐름. 가짜 계정을 통한 대량 접근에서 추출한 응답을 다른 모델 훈련에 활용하는 과정을 시각화한 것.
Anthropic는 이번에 확인한 사례에 대해 관련 계정을 정지했을 뿐만 아니라 탐지 시스템 및 보안 조치를 강화하고 필요에 따라 정부 기관 및 다른 AI 기업 등과 정보를 공유했다고 밝혔습니다.
원문 보기 | 출처: Ledge.ai