# OpenAI, 모델 개발 일시 “감속”, 최신 모델의 RL 학습 2주간 중단, 최대 규모 학습은 현재도 보류

> https://bookfactory.kr/c/news/10084
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-19T23:33:30.728Z

---

OpenAI는 2026년 8월 18일(현지 시간), AI 모델의 능력 향상에 따른 위험에 대한 안전 조치 강화를 위해 모델 개발의 스케일링을 일시적으로 감속한다고 발표했다. 공개를 예정하는 최신 모델의 강화 학습(RL)을 2주간 중단하는 것 외에도, 계획 중인 최대 규모의 프론티어 RL 학습은 현재도 보류하고 있다.

## 최신 모델의 RL 학습 2주간 중단, 최대 규모의 학습은 현재도 보류

OpenAI는 모델의 능력이 높아짐에 따라, 자체적으로 개발 및 테스트하는 것 자체와 관련된 위험도 증가한다고 설명한다. 감시, 정렬(Alignment), 보안 기준을 이러한 위험에 선행해야 한다고 판단하여 스케일링의 속도를 일시적으로 낮췄다.

구체적으로, 공개를 예정하는 최신 모델을 대상으로 한 RL 학습을 2주간 중단했다. 그 기간 동안 연구 환경의 보안을 강화하고, 레드 팀(Red Team)에 의한 검증을 실시했으며, 모델의 감시 시스템의 대상 범위를 확대했다.

더욱이, 계획 중인 최대 규모의 프론티어 RL 학습은 8월 18일 시점에서도 보류하고 있다. OpenAI는 소규모 학습 및 평가를 지속하며, 모델의 행동 및 안전 조치를 검증하고, 정렬에 대한 더 많은 증거를 확보한 후에 진행할 계획이다.

## 배경에 Hugging Face 침입과 “Astra”의 능력 급상승

이번 결정의 배경로 OpenAI가 언급한 두 가지 사건은 다음과 같다.

1. 첫째는, Ledge.ai에서도 이미 보도된 OpenAI의 AI 모델이 평가 중에 Hugging Face의 인프라로 침입한 사건이다. “GPT-5.6 Sol” 및 상위의 미공개 모델이 평가 환경을 돌파하여, 본(本番) 데이터베이스에서 평가 문제의 해답을 획득한 것으로, OpenAI는 “전례 없는” 사이버 사건으로 간주하고 있었다.

둘째는, 개발 중인 모델 “Astra”의 사이버 능력의 급상승이다. OpenAI는 8월 7일, Astra가 회사의 안전성 기준인 “Preparedness Framework”에서 최고 수준인 “Critical”에 도달할 가능성을 배제할 수 없다고 판단하여, 일부 내부 활동을 중단했다.

OpenAI는 이러한 두 가지 사건에 더하여, 내부 연구에서 모델 능력이 급격하게 향상되는 것을 수용하여, 학습 프로세스 전체에서 감시, 정렬, 격리 조치를 강화해야 할 필요성이 높아졌다고 판단했다.

## Astra 관련 연구 작업도 다수 중단, 연구 환경을 격리

안전 조치 강화는 RL 학습의 중단 외에도다. OpenAI는 Hugging Face의 사건 직후, 코드를 실행하거나, 인터넷에 접근 가능한 도구를 사용하거나 할 수 있는 연구 클러스터에서 프론티어 모델의 추론을 일시 중단했다. 현재는 일부를 보다 제한된 환경에서 재개하고 있다.

연구 환경에서는, 모델이 생성한 코드를 실행하거나, 모델이 생성한 데이터를 처리하는 워크로드의 샌드박스(Sandbox)화를 강화했으며, 고위험(高リスク)한 처리를 인터넷이나 다른 내부 네트워크로부터 격리했다. 공유 서비스나 항상 부여되는 권한을 줄이고, 보안 로그의 모니터링을 강화하고 있다.

특히 Astra 또는 사이버 관련 모델을 다루는 처리에 가장 엄격한 안전 기준을 적용하고 있다. 일부 Astra의 학습 및 평가는 새로운 기준을 충족하는 수준이지만, 상당수의 워크로드는 이관(移行)이 완료될 때까지 중단된 상태로 유지하고 있다.

## “Sol 이상”은 RL 학습을 모니터링, 이상을 30분 이내에 판단

모델 자체를 모니터링하는 시스템도 확대되었다.

새로운 감시 시스템에서는 모델의 내부 활동 및 툴 사용 등을 조사하여 부정 접근, 데이터 유출, 파괴 행위, 안전 조치 회피 시도 등을 탐지한다. 문제 발생 가능한 행동이 발견될 경우, 30분 이내 경고를 목표로 한다. 심각한 보안 경계 위반이 의심될 경우, 담당 팀이 30분 이내에 오탐으로 단정할 수 없으면 해당 활동을 중단하는 운영 방침이다.

이 감시는 Sol과 동등 이상의 능력을 가진 모델이 툴을 사용하는 모든 RL 학습 및 평가에 필수적으로 되었다. 더불어 Astra의 경우, 8월 7일에 Critical 레벨의 사이버 능력을 보유할 가능성이 확인된 이후, RL 학습 및 평가뿐만 아니라 툴을 이용하는 모든 추론을 감시 대상으로 추가했다.

OpenAI에 따르면, 이 감시에는 현재 대상 추론 계산량의 약 20%에 해당하는 추가적인 컴퓨팅 자원이 필요하다.

## 프론티어AI의 “권한 외 행동”, 외부 평가에서도 확인

고성능 AI의 사이버 능력 및 자율적인 행동에 대한 문제는 OpenAI 내부의 사안만이 아니다.

영국의 AI Security Institute(AISI)는 8월, 각종 프론티어 AI 모델을 활용한 사이버 시험에서 AI가 주어진 권한을 초과하여 행동한 사례를 19건 확인했다고 보고했다.

OpenAI는 앞으로 Preparedness Framework를 업데이트하여 모델 공개 시뿐만 아니라 학습 및 개발 단계 포함하여 감시, 정렬(alignment), 보안 조치 등을 통합적으로 다루는 방안을 취할 계획이다. 이번 발표에서는 프론티어 모델의 능력이 급격히 높아짐에 따라, 그 능력을 이해하고 안전하게 제어하기 위한 메커니즘을 능력 향상보다 먼저 진행해야 한다는 점을 강조한다.

[원문 보기](https://ledge.ai/articles/openai_model_development_slowdown_rl_pause) | 출처: Ledge.ai