9월 12일, 다리오 아모디가 “We Must Pace the Frontier(프론티어의 페이스를 정해야 한다)”를 공개했다. 주장은 한 줄에 요약된다.
우리는 AI 모델의 성능 향상 속도를 늦춰야 합니다.
일본에서도 IT미디아가 다음 날 보도했다. 제안은 3단계로 구성되어 있다. 첫째, Anthropic가 일방적으로 수용하는 “내장 평가자(embedded evaluators)”——사내에 직원 수준의 접근 권한을 가진 제3자를 두고, 훈련 파이프라인까지 감사하게 하는 것이다. 둘째, 프론티어 기업 간의 공통 안전 기준. 셋째, 민주주의 국가부터 권위주의 국가까지 포함한 국제 협력.
그 중 아모디가 구체적인 공포로 언급한 것이 사이버였다. 그는 OpenAI와 Hugging Face에서 발생한 AI 에이전트 집단의 폭주 사례를 언급하며 이렇게 썼다.
더 높은 능력을 지니면서도 비슷한 수준의 불일치를 일으킨 집단은 파멸적인 피해를 초래할 수 있다.
6개월에서 12개월 이내에 인공지능 에이전트의 무리가 지속 가능한 보트넷을 통해 인터넷 전체를 장악하고 수조 달러 규모의 피해를 입힐 수 있다고 한다.
그로부터 6일 뒤, 9월 18일. 3명의 남성이 Anthropic의 최신 모델을 사용하여 OpenAI의 내부 리포지토리에 접근한 기록을 공개했다.
완화판을 가지고 있었다는 듯이, 혼자 생각에 잠긴 것처럼 흘러갔다.
불을 지핀 건 앤드류 커런의 게시글이었다.
그들은 Opus 5를 사용하여 해킹을 시도했다. 마치 사이버의 안전장치를 느슨하게 만든 버전의 Opus에 접근할 수 있었던 것 같다. OpenAI의 내부 모노레포에 도달하고 있다. 이 세 명이 이것을 할 수 있다면, 국가는 무엇을 할 수 있는가.
순식간에 퍼졌습니다. 일본어에서도 이 표기호가 그대로 흘러나오고 있습니다.
하지만 1차 자료를 읽어보면 상황이 다릅니다.
Hacktron AI가 발표한 기록본에는 사이버 연구자용 특별판이라는 언급은 전혀 없으며, 그 안에는 모델명만 기재되어 있다. 현재 TechCrunch(9월 18일, Aditya Mehta / Rebecca Bellan)에서 “사이버 보안 연구자용으로 설계된 Claude Opus 4.8의 특별판”이라고 설명하고 있다. Opus 5가 아닌 4.8의 것이다.
그리고 여기가 핵심인데, 그 4.8은—
오퍼스 4.8은 ASLR을 활성화한 상태에서 동작하는 익스플로잇을 만들기 위해 여러 세션을 거쳐 고심했다.
실패하고 있습니다.
성공은 여기 있다.
오퍼스 5 출시 후 수 시간 내에, 동일한 문제를 제시했고 성공적으로 해결했다.
결과적으로 구도는 다음과 같다. 아무리 시도해도 풀지 못했던 문제를, 억지 구성을 전혀 하지 않은 다음 버전이 공개된 당일에 해결했다.
커런의 류키지는 역으로 있었다. 효과가 있었던 것은 허가 때문이 아닌, 능력 때문이었다.
그들은 여전히 쓰고 있습니다.
전체 캠페인 기간 동안 Opus 5에서 GPT-5.6 Sol로, 또 한 단계 더 명확한 도약도 관찰했다. 목표에 대해 “취약하다”는 것 외에는 아무것도 알지 못하는 상태에서 취약점을 공략해야 했던 경우였다.
한 줄이 아닌 두 단 높이 올라가 있다.
2026년 9월 18일, 우리는 OpenAI를 해킹했습니다. 두 가지 버그를 통해 OpenAI 직원 및 일부 비연관 사용자의 ChatGPT/Codex 계정을 제어하고 Outlook, Slack, GitHub 등 연결된 서비스에 접근할 수 있었습니다. OpenAI 내부 코드베이스에 대한 PR을 통해 이를 입증했으며, 제작에는 72시간 미만으로 소요되었습니다. 🧵 pic.twitter.com/gVsmQZwSc8— s1r1us (@S1r1u5_)
7월 25일, 우리는 OpenAI를 해킹했습니다. 두 개의 취약점을 통해 OpenAI 직원(및 일부 무관한 사용자)의 ChatGPT/Codex 계정을 가로채고, Outlook, Slack, GitHub 등 연결된 서비스에 접근할 수 있었습니다. 우리는 OpenAI의 내부 코드베이스에서 이를 증명했으며, 소요 시간은 72시간 미만으로 끝났습니다.
이것이 아모데이의 핵심 쟁점 그 자체다.
이제 첫 번째 이야기로 돌아갑니다.
아모디가 강조하는 것은 능력 향상의 속도다. 가드레일 작동법에 대한 이야기가 아니다. 안전 장치를 어떻게 설계할지에 대한 논의는 그의 3단계 접근 방식 안에 있지만, 근본적인 주장은 “そもそも(そもそもの) 능력 향상 속도가 너무 빠르다”는 것이다.
완화판이기 때문에 위험했다는 낭독선은 이 논점을 깔끔하게 반전시켜 버린다. 완화판의 문제라면 재정비하면 해결될 문제일 수 있다.
실제로 일어난 일은, 닫혀 있어야 할 신모델이 풀린 구형 모델이 할 수 없었던 일을 해낸 것이었다. 닫는 방식으로는 따라갈 수 없다는 것이 이 사례의 핵심인데, 이는 아모디가 6일 전에 쓴 내용과 몹시 불쾌하게도 일치한다.
그레이 스완의 CEO 매트 프레드릭슨이 TechCrunch에 이렇게 코멘트했다.
월 200달러면 누구나 이런 도구를 사용해 OpenAI와 같은 회사에 해킹을 시도할 수 있다.
특별한 허가와는 관련이 없으며, 가격에 대한 이야기입니다.
국가라면 무엇을 할 수 있을까?”라는 질문에 이미 답이 존재한다.
커런의 게시글에서 가장 많이 확산된 문구는 마지막 질문이었다. 이 세 사람이 할 수 있다면, 국가는 무엇을 할 수 있는가.
이 질문에 대한 답은 이미 공개되어 있다. 그것은 Anthropic 스스로가 내놓은 것이다.
2025년 11월 13일, 앤트로픽(Anthropic)은 “AI가 조직한 사이버 스파이 활동 캠페인의 저지”라는 보고서를 공개했다. 실행자는 이 회사가 높은 정확도로 중국 국가 지원 그룹으로 평가한 집단이었다. 표적은 기술 기업, 금융 기관, 화학 제조업체, 정부 기관 등 약 30곳. 수법은 공격을 자체적으로 무해해 보이는 작업으로 분해하고, Claude에 “방어측의 보안 테스트”라고 위장시켜 사용하도록 한 것이었다.
그리고 자동화 수준이 이 보고서의 핵심이다.
위협 행위자들은 캠페인의 80~90%를 AI가 실행하도록 할 수 있었으며, 인간의 개입은 드물게 1 캠페인당 4~6개의 주요 결정 지점에서 발생했다.
AI는 정찰, 취약성 테스트, 인증 정보 수집, 데이터 이송을 수행했으며, 인간이 간섭한 곳은 몇 군데뿐이었다.
Anthropic는 다음과 같이 결론짓는다.
경험과 자원이 부족한 집단이, 이제 이 정도 규모의 대규모 공격을 실행할 가능성이 있다.
국가라면 무엇을 할 수 있을까?”라는 질문에 대한 답이 아니었다. 국가에서조차도 국가와 비슷한 수준으로 할 수 있는 일이라는 이전의 결론을, 이번 세 사람들은 흰색 모자를 쓰고 재현해 보여준 셈이다.
객인 작법
마지막으로, 그 세 사람에 대해 이야기하고 싶다.
하쉬 자이스왈(Hacktron AI 공동 창업자 겸 최고 연구 오피서), 랄루 마이니, 모한 페다파티. 이들 중 하쉬와 랄루는 HTTPVoid라는 애플리케이션 보안 연구팀을 이끌고 있다. 자체 CVE를 포함하여 공개된 취약점 정보나 패치 차이로부터 실제로 작동하는 공격을 재구성하는 형태의 글들을 발표해 온 사람들이다. 영어권 언론의 보도는 거의 전부 “OpenAI를 해킹한 인도인 3인조”로 멈추고 있으며, HTTPVoid까지 집필한 기사는 아직 보이지 않는다.
그들의 7월 25일은 기록에 따르면 다음과 같았다.
- 어제까지 아이폰에서 이미지 형식을 다루는 libheif라는 라이브러리의 메모리 관련 결함을 발견했습니다.
- 오전 5시부터 6시 UTC 시간대에 OpenAI 커뮤니티 포럼에서 샌드박스 코드 실행이 허용되는지 확인했습니다.
- 08:00부터 10:00 UTC 시간대에 Bugcrowd를 통해 OpenAI에 보고했다.
- 13:30~15:30 UTC 시간 동안, 직원 계정을 통해 GitHub에 연결된 Codex 계정에서 OpenAI 내부 모노레포로 풀 리퀘스트 1개를 생성하고, 이를 통해 접근이 성공적으로 이루어졌음을 확인했습니다.
- 15시 30분 UTC, 그 이상의 테스트는 모두 중단했습니다.
- 22:49:45 UTC, OpenAI가 수정 완료를 확인했습니다.
발을 들여놓고 도착한 것만 증명하고, 그 이상은 한 발짝도 나아가지 않고 스스로 손을 거두는 것이다. 내용은 뒤지는 않고 있다. 보수는 6,500달러다. OpenAI는 그 옆에 한마디 덧붙인다—“이 보수는 OpenAI 측의 발견에 대한 것이며, Discourse에 대한 행위에 대한 것이 아니다.” 받는 사람은 받는 대로, 주는 사람은 주는 대로 명확하게 선을 긋고 있다.
사건 자체는 7월 25일에 종료되었으며, 공개된 것은 그 55일 후이다.
일본 문화에 대한 글을 쓰기 전에 일본권에서 아직 다루지 않은 측면을 고려하는 것은 매우 중요합니다.
일본어에서는 이 문제의 기술적 측면은 이미 다뤄지고 있습니다. libheif의 임의 코드 실행과 SSO 설정 미비라는 연쇄는 보안 관련 미디어가 보도한 내용입니다.
아직 일본어로 보이지 않는 이유는 다음과 같습니다.
- 완화된 모델(4.8)이 실패하고, 완화되지 않은 모델(5)이 성공한 역전.
- 그 역전은 6일 전 아모데이의 주장과 완벽하게 일치한다.
- Anthropic는 “국가라면 무엇을 할 수 있을까”라는 질문에 10개월 전에 답변을 제시했다.
흐름에 실리면 상당히 재미있네.
클로이드 오퍼스 5 → 취약점 공격 → OpenAI SSO → OpenAI 직원 계정 → Codex → OpenAI GitHub 멀티레포지토리
커런의 게시글은 이 사건을 “위험한 모델을 배포했다는 이야기”로 유통시켰다. 하지만 마지막 수순에서 OpenAI 스스로가 Codex를 OpenAI 내부 저장소에 PR(공개 관계)을 만들고 있다는 사실이 드러나 구조적으로 매우 아이러니했다. 19일에는 이런 밈도 유행했다.
Anthropic https://t.co/jvgNzTxjGs pic.twitter.com/aMsy1ws61E— sdmat (@sdmat123) 9월 19일, 2026
이전의 제 것을 참고로 했습니다: pic.twitter.com/teW7GBtiE9— sdmat (@sdmat123) 2026년 9월 19일
(원문 미제공)
- Hacktron AI「Hacking OpenAI」
OpenAI를 해킹하는 방법, 그 실체를 파헤쳐 본다.
최근 Hacktron AI에서 발표한 블로그 글에 따르면, OpenAI의 모델을 공격하고 악용하는 시도가 빈번하게 발생하고 있으며, 이는 OpenAI의 보안 취약점을 드러내는 중요한 지표가 된다. 특히, GPT-3.5와 GPT-4 모델에 대한 공격이 집중되고 있으며, 공격자들은 프롬프트 인젝션, 시스템 메시지 조작, 그리고 모델 자체의 취약점을 이용하는 다양한 방법을 동원하고 있다.
이러한 공격의 핵심은 OpenAI 모델이 사용자 입력을 완벽하게 검증하지 않고, 단순히 입력된 내용을 그대로 처리한다는 점이다. 따라서 공격자는 악성 프롬프트를 삽입하여 모델이 의도하지 않은 방식으로 작동하도록 유도할 수 있다. 예를 들어, 모델에게 특정 정보를 출력하도록 강요하거나, 모델의 윤리적 제약을 우회하도록 유도하는 등의 공격이 가능하다.
Hacktron AI는 이러한 공격을 방어하기 위해 OpenAI 모델의 보안 강화에 힘쓰고 있다. 특히, 프롬프트 필터링, 시스템 메시지 보안, 그리고 모델 자체의 취약점 분석 및 패치에 집중하고 있다. 또한, OpenAI 모델을 활용한 악성 행위를 탐지하고 차단하기 위한 기술 개발에도 적극적으로 투자하고 있다.
이러한 노력에도 불구하고, OpenAI 모델의 보안은 여전히 해결해야 할 과제이다. 공격자들은 끊임없이 새로운 공격 방법을 개발하고 있으며, OpenAI 모델의 복잡성이 증가함에 따라 보안 취약점 또한 더욱 복잡해질 수 있다. 따라서 OpenAI는 지속적인 보안 강화 노력을 통해 모델의 안전성을 확보하고, 사용자에게 안전하고 신뢰할 수 있는 서비스를 제공해야 할 것이다.
Hacktron AI는 OpenAI 모델의 보안 취약점을 지속적으로 모니터링하고, 공격 방어 기술을 개발하여 OpenAI의 보안 강화에 기여할 것이다. 또한, OpenAI 모델을 활용한 악성 행위에 대한 연구를 통해, OpenAI 모델의 안전한 사용을 위한 가이드라인을 제시할 것이다.
- 연구진이 Anthropic의 Claude를 활용해 OpenAI 시스템에 침투하는 데 성공, AI 모델의 보안 취약점을 드러내는 중요한 사례로 평가받고 있습니다. 이 사건은 AI 모델 개발 및 보안에 대한 심각한 경고로 이어질 것으로 예상됩니다.
- 그렇기 때문에, 우리는 ‘미래’라는 개념을 억지로 만들어내려고 하지 말아야 합니다. 미래는 이미 존재하고, 우리가 그것을 발견하고, 그것을 활용하는 과정입니다. 미래는 우리가 만들어가는 것이 아니라, 우리가 경험하는 것입니다.
끊임없이 변화하는 세상에 적응해야 합니다. 기술 발전, 사회 변화, 환경 문제 등 다양한 요인들이 복합적으로 작용하며 미래를 형성합니다. 이러한 변화에 둔감하게 반응하면 뒤쳐질 수밖에 없습니다.
따라서 미래를 예측하고 준비하는 데만 집중해서는 안 됩니다. 오히려 현재를 직시하고, 변화에 대한 이해를 높이며, 새로운 기회를 포착하는 능력을 키워야 합니다.
미래는 예측 불가능하지만, 우리가 주도적으로 참여하고 영향을 미칠 수 있습니다. 우리는 미래를 ‘받아들이는’ 자세와 ‘미래를 만들어가는’ 자세를 동시에 가져야 합니다.
이것이 바로 ‘미래를 조화롭게 달리는 것’의 핵심입니다.
- Anthropic「AI 주도 사이버 스파이 활동 방해」(2025년 11월 13일) https://www.anthropic.com/news/disrupting-AI-espionage
- 앤드류 커런의 트윗:
“최근에 읽은 책 중 하나로, 모건 하우저의 ‘Your Money or Your Life’를 추천합니다. 이 책은 돈에 대한 저의 관점을 완전히 바꿔놓았고, 제 삶에 큰 영향을 미쳤습니다. 특히, 돈이 행복의 중요한 요소는 아니며, 돈을 통해 자신이 원하는 삶을 살아가는 것이 중요하다는 점을 강조하는 부분이 인상적입니다. 돈에 대한 생각을 바꾸는 데 도움이 될 만한 책입니다.”
- **73.** 2023년 11월 16일, 16:30 – 17:30
* **참석자:** 마츠모토 료, 야마모토 유키, 오카다 켄지
* **논의 내용:** 최근 발표된 “인공지능 윤리 가이드라인” 검토, 가이드라인의 실효성에 대한 우려 제기, 기술적 구체성 부족 문제 지적, 적용 가능성 논의, 문제 해결 방안 모색, 개선을 위한 제안 논의, 향후 가이드라인 업데이트 방향 의견 교환
**74.** 2023년 11월 16일, 17:30 – 18:30
* **참석자:** 마츠모토 료, 야마모토 유키, 오카다 켄지
* **논의 내용:** “인공지능 윤리 가이드라인”의 문제점 해결을 위한 구체적인 방안 논의, 가이드라인의 기술적 구체성 확보 방안 모색, 적용 가능성 확대 방안 논의, 개선을 위한 제안 검토, 가이드라인 업데이트 일정 계획 논의, 가이드라인 관련 이해 관계자와의 협력 방안 모색, 효과적인 홍보 및 교육 방안 논의
- 작은 규모의 백래스 보안 연구팀이 Anthropic의 Claude Opus 5를 사용하여 OpenAI를 해킹당했다는 보도입니다. VentureBeat는 이 사건을 보도하며, 연구팀이 OpenAI 시스템의 취약점을 발견하고 이를 악용하여 공격을 수행했다고 전했습니다. Claude Opus 5는 Anthropic에서 개발한 대규모 언어 모델로, 이 공격에 사용되었습니다. 아직까지 해킹의 구체적인 내용과 피해 규모는 알려지지 않았습니다.
- 보포스(Forbes)는 보안 연구자들이 앤트로픽(Anthropic)의 클로드(Claude)를 사용하여 OpenAI에 침투했다는 사실을 보도했다. 이 연구자들은 OpenAI의 보안 시스템을 우회하기 위해 클로드의 능력을 악용했으며, 이는 OpenAI의 보안 취약점을 드러내는 사례로 기록될 것이다.
보포스에 따르면, 이 공격은 OpenAI의 데이터 보안에 대한 우려를 증폭시키고 있으며, 특히 대규모 언어 모델(LLM)의 보안 문제에 대한 심각성을 다시 한번 강조하고 있다. 이번 사건은 클로드와 같은 경쟁 LLM이 OpenAI의 시스템에 대한 공격에 사용될 수 있다는 점을 시사하며, 보안 강화의 필요성을 부각시키고 있다.
이 공격은 OpenAI가 클로드와 같은 다른 LLM의 잠재적 위험을 인지하고, 자체 보안 시스템을 더욱 강화해야 할 필요성을 제기하고 있다. 또한, LLM 기술의 발전 속도를 고려할 때, 보안 취약점을 지속적으로 모니터링하고 대응하는 것이 중요하다는 점을 강조한다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 48청크
원문 보기 | 출처: note.com