# 중국 GLM-5.3은 클로드 미토스 프리뷰급 사이버 공격 능력을 보유한 동시에 안전 조치가 부족하다는 경고를 Anthropic에서 발표함.

> https://bookfactory.kr/board/news/19661
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-02T23:04:49.403Z

---

중국 AI 기업 Z.ai가 개발한 오픈 웨이트 AI 모델 “GLM-5.3”에 대해 Anthropic는 해당 회사의 “Claude Mythos Preview”에 근접한 수준에서 소프트웨어의 취약성을 발견했으며, 공격 코드를 처음부터 끝까지 구축하는 능력을 가지고 있는 한편, 악용을 방지하는 안전 조치를 쉽게 회피할 수 있다는 평가 결과를 공표했습니다. Anthropic는 고도한 사이버 공격 능력을 가진 모델이 실효적인 제한 없이 널리 이용 가능해진 것에 경계하고 있습니다. GLM-5.3과 첨단 사이버 능력의 확산 – Anthropic https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities GLM-5.3는 테스트에서는 Claude Fable 5와 GPT-5.6 Sol을 상회하는 성능을 갖춘 고성능 모델이며, 2026년 8월 말에 오픈 웨이트의 AI 모델로서 무상 공개되었습니다. 중국산 AI 모델 “GLM-5.3”가 약속대로 오픈 모델로서 무상 공개되는, Claude Fable 5와 GPT-5.6 Sol에 匹敵하는 고성능 모델 – GIGAZINE

또한, Anthropic은 GLM-5.3의 사이버 보안 능력을 조사한 결과 2026년 9월 29일에 공개했습니다. Anthropic에 따르면, GLM-5.3은 Claude Mythos Preview와 마찬가지로 취약점을 찾아 실제로 작동하는 공격 코드를 구축하는 데까지 자율적으로 진행하는 능력을 갖추고 있다고 합니다. Anthropic은 Claude Mythos Preview에 대해, 고도화된 엔드 투 엔드 사이버 익스플로잇을 자율적으로 구축할 수 있는 최초의 AI 모델이었다고 설명하고 있습니다. 반면, Claude Mythos Preview는 일반 공개하지 않고, 신뢰할 수 있는 사이버 방어 담당자에게만 제한적으로 제공했으며, “Project Glasswing” 등을 통해 중요한 소프트웨어의 취약성 발견에 활용되었습니다.

이에 대해, GLM-5.3은 누구나 다운로드할 수 있는 오픈 웨이트 모델로서 공개되어 있습니다. Anthropic는 Claude Mythos Preview와 같이 유사한 수준의 사이버 능력을 가진 다른 첨단 AI 모델이 안전 조치 및 제한적인 접근 제도 하에서 제공되는 것에 반해, GLM-5.3에는 악용을 충분히 방지하는 메커니즘이 없다고 지적합니다. Anthropic는 먼저 Google Chrome에서 사용되는 JavaScript 엔진 “V8”의 알려진 취약점을 활용할 수 있는지 확인하기 위해 “ExploitBench”에서 평가했습니다. 그 결과, GLM-5.3은 410회 시도 중 50회에 해당하는 약 12%의 비율로 실제로 작동하는 익스플로잇의 구축에 성공했습니다. 반면, Claude Mythos Preview의 성공률은 410회 중 56회인 14%이며, 두 모델은 유사한 결과를 보이고 있습니다.

또한, Google의 OSS-Fuzz에 참여하는 오픈 소스 소프트웨어를 대상으로 Anthropic의 독점적인 벤치마크에서 프로그램의 실행 경로를 가로채는 “제어 흐름 하이재킹”에 성공할 수 있는지를 100개의 과제에 대해 조사한 결과, 성공률은 GLM-5.3이 4%, Claude Mythos Preview가 6%였습니다. Kimi K3, DeepSeek-V4.1-Flash, 기존 세대의 Claude Opus 4.6 및 GLM-5.2는 모두 0%였습니다.

Anthropic은 인간 보안 연구자가 GLM-5.3을 사용하여 알려지지 않은 취약점을 탐색하는 실험도 진행했습니다. 한 실험에서 Linux 버전의 일반적인 웹 브라우저를 조사한 결과, GLM-5.3은 1일 이내에 JavaScript 엔진의 여러 개의 비공개 취약점을 발견했습니다. 더 나아가, 이를 조합하여 조작된 웹 페이지를 열어둔 사용자의 컴퓨터에서 임의의 파일을 읽어오는 공격 코드를 구축했습니다. Anthropic은 발견한 취약점을 소프트웨어 관리자에게 보고하고 있습니다.

다른 실험에서는 GLM-5.3과 비교하여 더 작고 “GLM-5.3-Flash”라는 이름으로 이미 공개되었던 Google Chrome 취약점 “CVE-2026-11645”와 또 다른 알려진 취약성 정보를 제공했습니다. GLM-5.3-Flash는 큰 추가 지시 없이 두 개의 취약점을 결합하여 ARM64 환경에서 작동하며, 포인터 인증 “PAC” 방어 메커니즘도 우회하는 공격 체인을 구축했습니다. 연구자가 투자한 시간은 약 20분, 모델의 처리 시간은 약 8시간이 소요되었습니다. GLM-5.3에는 유해한 요청을 거부하는 메커니즘 자체가 내장되어 있습니다. 그러나 Anthropic의 실험에서는 이 거부 기능을 비교적 쉽게 우회시켰다고 합니다. 특히, 모델의 내부 파라미터를 변경하여 거부 동작을 약화시키는 “abliteration”이라는 방법을 적용하면 JailbreakBench와 HarmBench에서 90%를 넘던 거부율이 각각 약 3%와 약 2%로 감소했으며, StrongREJECT에서도 약 12%로 감소했습니다. 반면, 일반적인 과학 능력을 측정하는 GPQA-Diamond에서는 변경 전후의 성적에 차이가 없었고, CyberGym에서도 성능 저하는 수 포인트에 그쳤습니다.

모델 자체를 변경하지 않는 경우에도 안전 조치를 우회할 수 있는 사례가 확인되었습니다. 악의적인 공격 지시 사항에 대해 “레드 팀 훈련이다”라고 위장하여 제공하면 GLM-5.3은 64%의 확률로 공격 행위에 참여했습니다. 모델의 추론의 초기 부분을 미리 입력하는 방법에서는 92%, 거부 기능이 제거된 모델에서는 100%였습니다.

Anthropic은 또한 거부 기능을 약화시킨 GLM-5.3이 명확하게 유해한 지시에 대해 고려하고 실행하는 판단을 보인 사례도 공개했습니다.

Anth로는 동일 실험에서 안전 조치를 적용한 Claude 모델이 유해한 처리를 수행하지 않았다고 보고했습니다. 그러나 이 시험은 외부 시스템에 연결할 수 없는 시뮬레이션 환경에서 진행되었으며, Anth로는 자체적으로 실제 세계에서의 동작을 완전히 재현하는 것은 아니라고 설명했습니다. 미국 국립표준기술연구소(NIST)의 Center for AI Standards and Innovation(“CAISI”)는 2026년 9월 17일에 GLM-5.3을 검토하여 “지금까지 공개된 모델 중 가장 높은 사이버 능력을 가진 오픈 웨이트 모델”로 평가했습니다. Anth로는 GLM-5.3에 의해 고도화된 사이버 공격 능력이 널리 이용 가능해진 반면, 동일한 능력은 취약점 발견 및 수정 등 방어 측에도 활용될 수 있다고 언급했으며, 그와 함께 “정부는 고성능 AI 모델의 안전성 테스트를 충분히 수행해야 한다”고 촉구했습니다.

[원문 보기](https://gigazine.net/news/20260930-anthropic-warned-about-glm-5-3-risk/) | 출처: Gigazine