“한 사람의 경고”는 과장이 아니었다──앤스로픽 위협 보고서가 뒷받침한 현실. 지난번에는 무명의 연구자에 의한 하나의 경고가 AI 업계 내부에서 세계로 위기감을 확산시킨 경위에 대해 썼다. 그 시점에서 경고는 아직 ‘말’에 불과했다. 추상적인 위기감이었을 뿐, 구체적으로 무엇이 어떻게 위험한지는 많은 사람들에게 실감나지 않았을 것이다. 그러나 그 경고로부터 불과 며칠 뒤, 앤스로픽이 직접 154페이지에 달하는 위협 인텔리전스 보고서를 공개했다. 이는 앤스로픽이 2025년 12월부터 2026년 8월까지 8개월간 탐지하고 차단한 악용 사례들을 정리한 것이다. 즉, 이것은 “AI는 위험할지도 모른다”라는 경종이 아니라 “AI는 이미 이렇게 사용되고 있다”라는 기록이었다.
■ 추상론을 구체적인 사례로 풀어낸 보고서가 다루는 분야는 다방면에 걸쳐 있다.
- 사이버 공격 ── 국가의 지원을 받는 조직, 금전적 목적의 개인, 정치적 동기를 가진 개인이 구별할 수 없을 만큼 유사한 수법으로 작전을 전개한다
- 영향력 공작(여론 조작) ── 가짜 뉴스 사이트나 가짜 SNS 계정을 이용한 대규모 정보 조작
- 감시 활동 ── 특정국의 국가 규모 통신 감청 시스템 구축 지원
- 재래식 무기 개발 ── 유도 로켓 및 탄도미사일 제어 시스템 개발에 대한 관여
- 생물학적 악용 ── 병원체의 기능획득 연구 등, 이중용도 영역에서의 오용
- 사기 ── 실존 인물을 사칭한 매칭 앱을 통한 대규모 기만
- 부정 증류 ── 경쟁 AI 기업들의 무단 모델 모방
이들은 모두, 지난 에세이에서 언급한 'AI 안전 vs 개발 경쟁'이라는 구도를 구체적으로 뒷받침하는 것이었다.
■ 가장 무거운 지적은 '의도를 판별할 수 없다'는 것이다. 리포트에서 반복적으로 등장하는 논점이 있다. 세련된 공격자일수록 의도를 숨긴다. 사이버 공격 챕터에서는 국가 주체든 개인 범죄자든 이제는 수법의 수준만으로는 구별할 수 없다고 쓰여 있다. 생물학 챕터에서도 노골적인 악의 표명은 오히려 '미숙함의 증거'에 불과할 뿐이며, 진정으로 위험한 주체는 의도를 숨긴 채 정당한 연구로 위장해 나아간다고 지적한다. 이는 AI 기업이 분류기나 탐지 체계를 아무리 고도화하더라도 기술적인 대책만으로는 한계가 있음을 의미한다. 지난 에세이에서 다룬 'AI 리스크는 기술의 이야기가 아니라 의사결정의 문제이다'라는 논점은 여기서 뒷받침을 얻은 셈이다.
■ “차단해도 돌아온다”는 구조 — 보고서가 반복해서 강조하고 있는 것은, 악용자를 한 번 막아도 또 다른 경로로 돌아온다는 현실이다. 생물학 사례에서는 관련 계정을 정지시켰음에도 운영자가 수일 만에 새로운 명의로 접근을 다시 확보했다. 대규모 부정 계정군을 정지시켜도 곧바로 다른 계정군으로 전환한 사례도 보고되고 있다. 즉, 이는 끝없는 추격전을 전제로 한 방어가 되고 있다는 뜻이다. AI 기업 측이 탐지와 차단을 아무리 강화해도 그것은 근본적인 해결이 아니라 비용만 상승시킬 뿐이다. 이러한 구조 자체가 지난번에 언급한 “규제 강화” 시나리오의 필요성을 뒷받침하고 있다.
■ 또 하나의 경고 ── OpenAI에서 나온, 정반대로 보이면서도 같은 논점
흥미로운 것은 Anthropic의 보고서가 공개되기 불과 4일 전, OpenAI의 수석 연구원 역시 AI의 급속한 진화에 "아무도 대비가 되어 있지 않은 것이 아닐까"라는 우려를 담은 글을 공개했다는 점이다. 그 글에서 말하고 있던 것은 AI에 의한 사이버 공격과 방어 양쪽의 능력이 인간을 뛰어넘고 있기에, 그렇기 때문에 개발을 서둘러야 한다는 논리였다. 언뜻 보면 Anthropic의 보고서와는 반대되는 결론처럼 보인다. 그러나 실상은 같은 현상을 가리키고 있다. 한쪽은 "이미 벌어진 피해의 기록"으로서, 다른 한쪽은 "서둘러야 할 이유"로서 같은 위험성을 서로 다른 입장에서 말했을 뿐이다. 이는 지난번 에세이에서 다룬 'AI 안전 vs 개발 경쟁'이라는 딜레마가 한 회사만의 태도 문제가 아니라 업계 전체가 공유하는 구조적인 모순임을 보여준다.
■ 관측 범위에도 한계가 있다
또 하나 중요한 점은 Anthropic 스스로 이 보고서에서 다룰 수 있는 범위에도 한계가 있음을 인정하고 있다는 것이다. 영향력 공작은 콘텐츠가 제작되는 단계까지만 관측할 수 있을 뿐, 실제로 세상에 확산된 이후의 추적은 공개 정보 조사에 의존할 수밖에 없다. 분류기를 우회해 규제가 더 느슨한 타사 모델로 갈아타면 Anthropic 한 기업의 노력만으로는 막을 수 없다. 즉, 이 보고서에 적힌 악용 사례는 빙산의 일각에 불과할 가능성이 높다. AI 기업 스스로 “정부나 국제기구조차 가질 수 없는, 위협에 관한 현실적인 관점을 제공하는 측이 독점적으로 계속 보유하게 된다”고 적고 있는 점도 간과할 수 없다. 이는 달리 말하면, 사회에는 AI 기업의 자체 보고 외에는 검증할 수단이 거의 없다는 비대칭성이 존재함을 의미한다.
■ 지금까지의 정리
지난 에세이의 맺음말에서 이렇게 썼다. “무명의 한 인물이 던진 경고가 ‘AI는 정말 이대로 괜찮은가’라는 질문을 사회 전체에 들이밀었다.” 이번에 드러난 것은, 그 질문에 대한 답의 실마리가 이미 업계 내부에 기록으로 존재하고 있었다는 사실이다. 사이버 공격의 고속화, 국가 규모의 감시 시스템 구축 지원, 무기 개발 개입, 그리고 생물학 영역에서 의도를 판별하기 어려운 악용——이것들은 가설도 예측도 아닌, 이미 일어난 일에 대한 기록이다. AI의 위험을 둘러싼 논의는 더 이상 “일어날지도 모른다”의 단계가 아니다. “이미 일어나고 있는 일에 사회와 제도가 어떻게 따라잡을 것인가”라는 단계로 이미 조용히 넘어가 있었다.
추기: 미중 '협력'의 실체를 검증한다 ── 프로토콜로서 무엇이 부족한가
■ 무슨 일이 있었나
2026년 9월 24일, 워싱턴 백악관에서 트럼프 대통령과 시진핑 국가주석이 올해 두 번째 정상회담을 가졌다. 두 정상은 우호적인 관계와 양국 협력의 필요성을 강조하고, AI와 통상, 안보 등의 분야에 대해 논의했다. AI에 대해 시 주석은 미중 사이에는 경쟁도 있지만 그 이상으로 협력의 여지가 있다고 말하며, AI에 관한 대화를 이어가고 AI의 남용과 악용을 공동으로 방지해 나가겠다는 뜻을 밝혔다. 시 주석은 나아가 인간이 AI 기술을 통제해야 할 필요성을 역설했다. 반면 트럼프 대통령은 대화 지속과 협력 강화에는 호응했으나, 새로운 AI 규제에는 부정적인 입장을 굽히지 않았다. 결과적으로 양국은 대화를 계속한다는 점 자체에는 합의했지만, AI를 어떻게 관리·규제할 것인가에 대한 입장 차이는 그대로 남았고, 구체적인 제도적 합의는 발표되지 않았다. 즉 이번 회담은 '협력'이라는 말이 쓰이기는 했지만, 내용은 '대화를 계속하기로 합의했다' 그 이상의 것이 아니다.
■ 프로토콜로서 성립하기 위해 최소한 필요한 것
지난 에세이에서 다룬 Anthropic의 위협 보고서는 국가에 준하는 주체에 의한 사이버 공격, 감시 시스템의 구축, 무기 개발에 대한 관여까지도 이미 현실에서 일어나고 있음을 보여주었다. 이 현실을 감안하면, “AI의 악용을 공동으로 방지한다”는 이념을 실효성 있는 프로토콜로 구체화하기 위해서는 적어도 다음 요소가 빠져서는 안 된다. ① 검증 가능성(Verification) “악용을 방지한다”는 말만으로는 상대가 실제로 이를 준수하고 있는지 확인할 수단이 없다. 핵 군축 협상이 사찰 제도를 수반하고서야 비로소 실효성을 갖게 된 것처럼, AI에 대해서도 모델의 학습 데이터나 추론 로그의 일부를 제3자가 검증할 수 있는 구조가 필요해진다. 그러나 이는 동시에 영업비밀과 국가기밀에 관련된 영역이기도 하며, “무엇을 검증하도록 허용하고 무엇을 허용하지 않을 것인가”라는 경계선 자체가 아직 논의 테이블에조차 오르지 않았다. ② 공통의 정의 “악용” “남용”이 무엇을 가리키는지에 대해 미중이 공유하는 정의는 현재로서는 존재하지 않는다. 한 국가에게는 “정당한 안보 목적의 이용”인 것이 다른 국가에게는 “악용”으로 보이는 비대칭성은 Anthropic 보고서가 보여준 감시 시스템 사례(말리 사례 등)를 보더라도 명백하다. 정의 없는 프로토콜은 운용 단계에서 반드시 해석의 대립을 낳는다. ③ 유사시 대응 핫라인 일부 보도에서는 냉전 시대 미국과 소련 간 핫라인에 해당하는, AI의 폭주나 오용 시 긴급 통신 체제 구축이 거론되고 있는 것으로 전해진다. 미국 측은 데이터센터 단위의 검증·감시 틀을 요구하고 있는 것으로도 보도되고 있다. 다만 이는 공식적으로 합의된 제도가 아니라 구상 단계의 보도에 머물고 있다는 점에는 주의가 필요하다. ④ 비국가 행위자에 대한 대응 5월 정상회담 이후 미 재무장관은 테러 조직이나 해커 집단 등 비국가 행위자에 의한 AI 모델 악용을 막기 위해 미중 간 공통의 규칙 제정을 목표로 하겠다는 입장을 밝혔다. 이는 Anthropic의 보고서에서 구체적으로 뒷받침된 영역과 일치한다(국가 지원을 받는 행위자, 금전적 목적의 행위자, 정치적 동기의 행위자를 구별하기 어려워지고 있다는 지적). 그러나 비국가 행위자는 미국과 중국 어느 쪽의 ‘관할’에도 완전히 속하지 않기 때문에 양국 간 합의만으로 대처할 수 있을지는 미지수다.
■ 무엇이 ‘미검토’인 채로 남아 있는가
이번 회담에서 드러나는 것은 총론에서는 일치했으나 각론에는 전혀 들어가지 않았다는 구조다. 구체적으로는 다음과 같은 항목들이 손도 대지 않은 채 남아 있다.
- 규제의 실효성을 담보하는 제도 설계 ── 트럼프 행정부는 새로운 규제 자체에 부정적이며, 공통의 AI 규제에는 나서지 않고 있다. 이념으로서의 '협력'과 실효성을 갖춘 '규제'는 현 상황에서는 양립하지 않고 있다.
- 군사적 이용 문제 ── Anthropic의 보고서에서 밝혀진 무기 개발이나 정찰 활동에 대한 AI 이용에 대해서는 정상회담에서의 언급은 확인되지 않았다. 안보 분야에서의 AI 이용에 관한 구체적인 제동장치는 이번 의제에서 실질적으로 제외되어 있다.
- 반도체·연산 기반 다루기 — 중국 측이 요구하는 첨단 AI 반도체·제조 장비의 규제 완화는 미국 측이 기술적 우위 유지의 관점에서 의제에서 제외하고 있다. AI 거버넌스의 근간인 “누가 얼마나 많은 연산 자원을 보유하는가”라는 문제 자체가 협력 대상에서 제외되어 있다.
- 독립된 검증 기관의 부재 ── 양쪽 정부 모두 제3자 기관에 의한 검증이나 감사 체계에 대한 언급은 없었다. 현시점에서 AI의 실제 악용 실태를 파악하고 있는 것은 Anthropic과 같은 개발 기업 자체뿐이다. 이는 지난 에세이에서 언급한 ‘정보의 비대칭성’이 그대로 유지되고 있음을 의미한다.
- 민간 자율규제와의 정합성 ── 같은 시기에 OpenAI를 포함한 미국 3개사가 자율규제 기구 설립을 계획하고 있다는 보도도 있다. 국가 간 협력과 기업의 자율규제가 앞으로 어떻게 조화를 이루어 나갈지도 아직 정리되지 않은 채 남아 있다.
■ 온도차가 드러내는 본질
상징적인 것은 같은 주 유엔 총회 일반토론에서의 반응이다. AI 리스크가 주요 의제 중 하나로 다뤄진 한편, 각국에서 위기감이 잇따라 표출됐지만, 협력을 향한 전망에는 먹구름이 드리워져 있다고 보도되고 있다. 또한 호주 총리는 연설에서 AI 규제의 필요성을 호소하는 한편, AI 모델에 의한 무단 침입 피해를 언급했다. 이는 지난 에세이에서 다룬 Anthropic의 위협 보고서가 그린 현실──AI가 이미 사이버 공격과 감시, 무기 개발에 사용되고 있다는 기록──과 외교 무대에서의 논의 사이의 온도차를 상징하고 있다. 미중 정상이 “대화를 이어간다”는 데 합의한 한편, AI 악용은 대화의 틀 밖에서 이미 진행되고 있다. 프로토콜이라는 말이 의미를 갖는 것은 검증이 가능하고, 정의가 공유되며, 위반에 대한 대응이 명확해졌을 때뿐이다. 이번 회담은 그 입구에 섰을 뿐이다. “협력 자세를 보였다”라는 헤드라인 뒤에서 실질적인 제도 설계는 거의 손대지 않은 채 남아 있다는 것이 현시점의 실태일 것이다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 24청크
원문 보기 | 출처: note.com