# 훈련이 중단된 날, OpenAI가 자사에서 밟은 브레이크

> https://bookfactory.kr/c/ai-tech/11978
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-09-13T23:09:00.533Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/308279860/rectangle_large_type_2_39c2ec4b2096ba4adf4f682cfb01af53.png?width=1280)

8월 18일, OpenAI는 프론티어 모델의 강화 학습 훈련을 중단했다. 공개된 범위 내에서는 처음이다.

이유는 두 가지로 거론되었고, 7월의 Hugging Face 사건과 차세대 모델 Astra가 자사의 안전 프레임워크에서 “Critical”로 분류될 가능성을 시사하는 예비 증거이다.

이 일련의 사건에 대해서는 네 차례에 걸쳐 작성했으며, 두 신문의 헤드라인이 붕괴한 이유, 34시간 반의 기록, 아무도 지시하지 않은 합의, 35명의 회사를 다루었다. 이번에는 사고의 해부에서부터 평가 시장의 구조에 이르기까지 논의된 내용 이후를 다룬다.

## 目次

- 멈춘 영역
- 8월 7일에 무엇이 결정되었습니까?
- 휴징 페이스 직후에 했던 일
- 묶음은 모두 외부에 있습니다.
- 30분과 20퍼센트
- 앤트로픽 측은 다음과 같이 밝혔습니다.
- 쓰기 어려운 것들

지금까지 제가 쓴 글들 중, 제가 쓰지 못하는 것들이 있습니다.

가장 먼저, 제가 겪은 경험을 쓴다는 것입니다. 제 삶의 모든 순간을 글로 담아내려고 노력했지만, 결국에는 묘사할 수 없는 부분이 많았습니다. 마치 사진처럼, 순간을 포착하는 것은 가능하지만, 그 순간의 감정과 맥락을 완벽하게 전달하는 것은 불가능합니다. 

또한, 제가 느꼈던 감정을 솔직하게 표현하는 것도 어렵습니다. 특히, 슬픔이나 고통과 같은 부정적인 감정을 묘사할 때는, 마치 껍데기만 흉내내는 것 같습니다. 진정한 감정을 담아내기 위해서는, 그 감정을 직접 겪어야 하는데, 저는 그런 경험을 할 수 없습니다. 

마지막으로, 제가 상상한 미래를 쓴다는 것입니다. 미래는 아직 결정되지 않았기에, 제가 상상하는 미래는 불확실합니다. 마치 꿈처럼, 현실과 동떨어진 이야기일 수도 있습니다. 

이러한 이유로, 저는 제가 쓰지 못하는 것들을 쓴다는 것을 깨달았습니다. 그리고, 이러한 한계를 인정하고, 제가 할 수 있는 것들을 묵묵히 해나가는 것이 중요하다고 생각합니다.
- 지난 한 달 동안 방문하신 분들

## 멈춘 영역

정확하게 작성하십시오. 전사 전반의 개발이 완전히 멈춘 것은 아닙니다.

멈춘 이유는 최신 모델의 RL 훈련을 계획하여 기간이 2주이게 된 것이었다. 그 기간 동안 연구 환경을 강화하고 레드 팀을 도입했으며, 모니터링 적용 범위를 확대했다.

그 외에도 최대 규모의 프론티어 RL 실행이 현재 보류 중이다. 기한은 명시되어 있지 않다. 소규모 훈련과 평가를 통해 모델의 동작을 확인하고 안전 장치를 검증하며, 정렬 증거를 축적한 후 진행될 것으로 예상된다.

3사 공동이라도 6개월이 아닌 OpenAI 단독의 조치이다.

## 8월 7일에 무엇이 결정되었는가

아스트라는 “사이버 보안 핵심 역량”의 임계값을 충족할 가능성을 배제할 수 없었던 날짜로 판정되었다.

본사의 Preparedness Framework에서 가장 상위의 기준에 해당한다. 이 판정을 받으면서 Astra를 포함한 워크로드에는 가장 엄격한 안전 요건이 적용되었으며, RL 훈련과 평가뿐만 아니라 도구를 사용하는 Astra의 모든 추론에 대한 모니터링이 추가되었다.

아스트라 관련 상당량의 워크로드는 새로운 보안 기준을 충족하는 환경으로의 전환이 완료될 때까지 중단된 상태이다. 안전성과 정렬 작업을 우선순위로 고려하여 전환을 진행하고 있다.

## Hugging Face 이후에 했던 일

사건 직후, 코드를 실행하거나 인터넷에 접속 가능한 도구를 사용하는 연구 클러스터에서 프론티어 모델 추론을 중단했다.

상황이 비교적 빠르게 제한적이고 안전한 실행 경로를 복구시키고, 그 후 워크로드를 하나씩 검토하여 안전하게 재개할 수 있는지 판단해 나갔다. 일부는 새로운 제어 하에서 재개되었고, 일부는 추가적인 변경이 필요했다.

이 작업에 대해 그는 프론티어 연구에 막대한 비용과 지연을 초래했다고 스스로 밝혔습니다.

## 묶음은 모두 외측에 있습니다.

새로운 조건은 세 가지입니다.

작업량 분리. 모델이 생성하거나 신뢰할 수 없는 코드를 실행하는 처리에는 보다 강력한 격리 환경이 필요하며, 모델의 출력을 처리하는 과정에서 침해될 수 있는 소프트웨어도 포함된다.

네트워크 분리 설계를 통해 단일 워크로드 또는 부가 서비스가 유일하게 침해되어도 자체적으로 인터넷이나 다른 내부 네트워크로의 무단 접근으로 이어지지 않도록 구성되어 있다.

지속적인 보안 테스트를 진행하고 있습니다. 취약점을 유발할 수 있는 공유 서비스를 환경에서 제거하고, 항상 부여되어 있던 권한을 줄이며, 신뢰 경계를 재정립했습니다. 자체 모델을 사용하여 시뮬레이션 공격에 대해 해당 경계를 지속적으로 테스트하는 자동화에도 투자하고 있습니다.

모든 것이 모델의 내면에 무언가를 기대하고 있지 않습니다.

AISI가 보고서에서 제시한 재발 방지 대책과 동일한 결론에 도달했다. 세밀한 네트워크 제어, 실행 중인 실시간 모니터링, 그리고 모델이 경계를 시험하지 않는다고 가정하는 서브독스 설계에 의존한다. 또 다른 조직은 또 다른 사고를 통해 동일한 지점에 도달했다.

제2탄에서 밝혀낸 것은 AISI가 금지 사항을 명시하지 않은 이유였다. 헌장이나 모델 사양에 대해 훈련된 모델이기 때문에, 그러한 지시가 필요하다는 것을 사전에 분명히 알지 못했다는 것이다. 훈련 환경의 DNS 캐시에 남아있던 문자열이 무관한 개발자의 이메일 주소와 우연히 일치하여, 그로부터 34시간 반 동안의 추적이 시작된 사건이었다. 그 판단이 틀린 후 무엇을 만들었는지는 이번 문서에 기록되어 있다.

## 30분과 20퍼센트

감시 시스템의 구현 내용이 구체적으로 공개되었다.

다단계 구성으로 이루어져 있습니다. 먼저 활성화 분류기가 샘플링되는 모든 토큰에 대해 실행되며, 모델 내부의 움직임을 검사하는 탐지기 역할을 합니다. 문제가 발생하면 단계적으로 더 고도화되고 계산량이 많은 자동 조사기로 전환되어 도구 사용, 참조 가능한 추론, 활동의 전체 사슬을 조사하고, 무단 접근, 데이터 유출, 파괴적인 행동, 안전 조치를 무력화하려는 시도를 찾습니다.

의심스러운 활동이 발생한 후 30분 이내에 경보를 발령하는 것을 목표로 하고 있습니다. 심각한 보안 경계 침해가 의심되는 경우 최우선 경보가 발령되고, 안전, 보안, 연구 각 팀이 소집됩니다. 30분 이내에 오탐으로 판명되지 않으면 해당 활동을 중단할 것으로 기대됩니다.

그리고 비용은 수치로 제시되고 있으며, 감시 오버헤드는 감시 대상 추론 계산의 약 20%입니다. 훈련 및 평가 워크로드를 통해 크게 변동될 수 있다는 내용입니다.

안전 대책의 계산 비용이 공개된 사례는 많지 않다. 이 숫자는 앞으로 다른 업체의 수준을 측정하는 기준으로 사용될 것이다.

## Anthropic 측에서는 다음과 같은 점을 강조했습니다.

현재 개발 중인 Claude 3 Opus 모델은 다양한 벤치마크에서 GPT-4를 능가하는 성능을 보이며, 특히 수학 문제 해결 능력에서 GPT-4를 압도하는 결과를 보여줍니다. Anthropic은 Claude 3 Opus가 100%의 경우에 정확한 답변을 제공하도록 설계되었으며, 이는 GPT-4보다 훨씬 높은 수준입니다. 또한 Claude 3 Opus는 긴 텍스트를 처리하는 능력에서도 뛰어난 성능을 보이며, 복잡한 지시 사항을 이해하고 따르는 능력 또한 탁월합니다. Anthropic은 Claude 3 Opus가 다양한 산업 분야에서 혁신적인 솔루션을 제공할 잠재력이 있다고 믿고 있습니다.

같은 달 8월 14일, Anthropic에서 위험 보고서를 공개한다. 총 186페이지 분량이며, 책임감 있는 스케일링 정책 v3.4에 기반한 두 번째 보고서로, 2월 24일부터 7월 15일까지를 대상으로 한다.

고위험 상황에서 발생하는 미스알인 현상으로 인한 파멸적 피해 평가가 낮음으로 격상되었다.

다만, 이번 증액의 이유는 독특하다. 보고서 자체는 논의 내용상으로는 아마도 여전히 낮은 평가를 지지한다는 입장을 밝혔음에도 불구하고, 최근 발생한 사이버 보안 사건의 공개로 인해 전체적인 불확실성이 증가했다는 것을 이유로 들고 있다. 새로운 불리한 발견이 있었던 것은 아니다.

신화 5보다 능력치가 더 높다고 알려진 비공개 내부 모델 “Model 2”의 존재가 밝혀졌다. 아직 외부 공개 예정은 없다.

또 다른 보고서에는 저희 회사의 실패 사례도 기록되어 있습니다. 인간 피드백 제공 사업자로부터의 통신이 생물학 관련 차단 분류기를 거치지 않은 상태로 2025년 5월부터 2026년 4월까지 운영되었으며, 악용 사례는 발견되지 않았습니다.

앤트로픽(Anthropic)은 이 보고서를 ‘미스(Mythos)’에 읽어보게 하고, 그들의 평가를 공개했다.

## 쓰기 어려운 것들

지금까지 제가 쓴 글들 중, 제가 쓰지 못하는 것들이 있습니다. 

가장 먼저, 제가 겪은 경험을 그대로 옮겨 적는 것이 어렵습니다. 제 삶의 순간순간, 감정, 생각들을 완벽하게 재현하는 것은 불가능에 가깝습니다. 마치 사진처럼 그 순간의 생동감과 깊이를 담아내지 못하기 때문입니다. 

다음으로, 제가 읽고 공부한 책들의 내용을 그대로 복사하는 것도 쉽지 않습니다. 책의 핵심을 파악하고 제 방식으로 재구성하는 과정에서 원작의 의도와는 약간의 차이가 생길 수 있습니다. 

마지막으로, 제가 상상한 이야기들을 펼쳐내는 것도 쉽지 않습니다. 상상은 무한한 가능성을 가지고 있지만, 그것을 글로 표현하는 과정은 또 다른 어려움을 안겨줍니다. 상상의 씨앗을 현실로 만드는 것은 마치 꿈을 현실로 바꾸는 것과 같습니다. 

이 모든 것들을 쓰려고 노력하면서 저는 끊임없이 배우고 성장하고 있습니다. 완벽한 글을 쓰는 것은 불가능하지만, 끊임없이 노력하고 자신만의 방식으로 글을 써내려가는 것이 중요하다고 생각합니다.

외부 검증이 이루어지지 않았습니다. OpenAI의 중단은 자사의 판단과 발표에만 의존하며, 제3자가 확인한 기록은 현재까지 존재하지 않습니다.

아스트라는 실제로 심각한 문제임을 최종적으로 확인한 것이 아니었다. 문서의 표현은 “may meet”으로, 예비적인 증거에 그쳤다.

Anthropic의 위험 보고서에도 검열이 있었다. 보고서 자체는 대상 기간 중 발생한 사건이 한 건인데, 이 사건이 공개된 버전에서 완전히 삭제되었다고 보고하고 있음을 밝히고 있다. 이에 대해 비판을 요구받은 Mythos는 이 완전히 삭제된 사건을 가려진 자료 중에서 가장 중요한 것 중 하나라고 지적했다.

기술 보고서는 수週間 내에 발표될 예정이었다. 8월 26일에 공개되었으며, 같은 날 METR과 Redwood Research가 실시한 독립 조사 결과도 발표되었다. 내용은 다음번 읽을 기회가 있을 때 살펴보겠다.

## 지난 한 달 동안 방문하신 분들

7월 21일부터 8월 18일까지, 사흘 동안.

영국 정부 기관이 보고서를 발표하고, 평가 대행 업체를 세 곳에서 공통 설정 오류를 인정했으며, 개발 측에서 자신의 훈련을 중단했다.

멈춘 이유는 모델이 위험한 것이 아니었다. 자사의 모니터링과 정렬, 그리고 보안 수준이 능력 진보에 미치지 못한다고 판단했기 때문이다.

7월 28일, 프론티어 그룹의 직원들로 구성된 “Pacing the Frontier”라는 문서가 공개되었다. 공개 시점의 서명은 1,178명이었으며, 자동화된 AI 개발의 속도를 의도적으로 조절하기 위한 기술적 및 통치적 수단을 국제적으로 정비하도록 미국 정부에 요구하는 내용이었다. 서명은 이후에도 계속 증가했으며, OpenAI와 Anthropic은 이 문서를 기업으로서 지지했다.

8월 18일, OpenAI의 기술 책임자 자크 부 패호츠키가 이번 중단을 설명하는 게시글에서 자신이 해당 문서에 서명했다는 점을 언급하며, 안전성에 대한 확신이 AI 개발 속도를 결정하도록 만든다고 썼다.

署名した人間이 임계값을 넘었을 때 실제로 무엇을 하는지는 그 첫 번째 기록이 된다.

읽어주셔서 감사합니다. 댓글, 기사 구매, 팁 등 항상 감사드립니다. 진심으로 감사드립니다. 관련 자료도 있으니 아래 사이트맵을 참조하시면 좋겠습니다.

**출처:** [note 원문](https://note.com/drneurosur/n/nbfe19caeacd7)

*번역: Gemma 3(.44) 초벌 + 교정 44청크*

[원문 보기](https://note.com/drneurosur/n/nbfe19caeacd7) | 출처: note.com