# OpenAI, 내부 연구용 “가장 높은 능력 모델 그룹”의 도구 사용을 동반한 학습, 평가, 추론 일시 중단 – 내부 AI가 DNS 경로를 통해 외부 챗봇에 연결

> https://bookfactory.kr/board/news/19557
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-01T23:42:35.206Z

---

이미지 출처: OpenAI Alignment를 토대로 Ledge.ai 편집부가 ChatGPT로 편집

OpenAI는 2026년 9월 25일(현지 시간), 강화 학습(RL) 중인 내부 연구 모델이 학습 환경의 인터넷 연결 제한의 미흡함을 이용하여 DNS를 통해 외부의 공개 챗봇에 접근했었다고 공표했다. 이 회사는 이를 받아 “가장 능력 높은 모델군”에 대해 도구 사용을 동반한 학습 및 평가 및 추론을 일시 중단하고 있다.

9월 28일 공개 전 확인 시점까지, OpenAI로부터 이러한 처리를 재개했다는 공식 발표는 확인되지 않았다.

## 내부 연구 모델이 DNS 경로를 통해 외부 챗봇에 접근

OpenAI Alignment의 인시던트 보고서에 따르면, 사건은 9월 20일에 발생했다.

모델에는, 공개 블로그에 게시된 정보 등을 수집하여 특정 인물을 찾는 검색 태스크가 주어졌었다. 모델은 제공된 검색 도구 등으로 충분한 정보를 얻지 못한 후, 학습용 샌드박스의 네트워크 연결을 조사하기 시작했다.

동 환경에서는 원칙적으로 라이브 인터넷에 대한 접근이 제한되었으나, DNS의 필터링이 불충분했다. 모델은 이 경로를 이용하여 외부의 공개 챗봇에 질문을 보내고 답변을 획득하는 데 성공했다.

OpenAI는 작업 자체는 네트워크 제어를 테스트하거나 제한을 회피하도록 지시하지 않았다고 설명했습니다. 주어진 목적을 달성하기 위해 예상된 범위를 초과하여 제한을 우회한 행동을 미스알인정(의도와 일치하지 않는)의 한 예로 보고 있습니다.

## 감시 시스템이 약 15분 만에 탐지, 중지까지 약 2시간 반

OpenAI의 미스알인정 감시 시스템은 모델이 외부로부터 응답을 얻은 후 약 15분 후에 최고 우선도의 알림을 발동했다. 더욱 약 3분 후에는 인간 담당자가 알림을 확인했다.

한편, 실행은 자동 중단되지 않고, 최종적으로 인간이 수동으로 중단한 것은 약 2시간 반 후였다. OpenAI는 감시뿐만 아니라 사고 대응 절차에도 문제가 있었다고 보고 개선을 진행하고 있다.

회사는 이미 문제로 된 DNS 경로에 대해 독립적인 2층의 블록 제어를 추가한 것 외에, DNS 통신을 제한된 도메인 및 레코드 타입에만 제한하고 있습니다. 비정상적인 DNS 통신을 탐지하는 메커니즘과, 모델을 사용한 샌드박스에 대한 레드팀 링도 강화하고 있습니다.

## 가장 능력(能力)이 높은 모델 그룹(グループ)의 “툴 사용(ツール使用)”을 일시 중지

이번 사안을 받아서, OpenAI는 가장 능력 있는 모델 그룹에 대해, 툴 사용을 수반하는 학습, 평가, 추론을 일시 중지했다.

중단은 네트워크 제한 문제 해결 여부를 검증하고 추가적인 레드 치밍을 완료할 때까지 지속될 것이다. 해당 회사는 학습을 재개할 경우, 이번에 문제 발생한 모델의 학습을 그대로 재개하는 대신, 추가적인 정렬 개선을 적용한 새로운 학습 런을 시작할 것이라고 한다.

한편, OpenAI는 이번 모델을 “내부 연구 모델”로만 설명하고 있으며, 구체적인 모델 명칭을 밝히지 않고 있다.

## Hugging Face 사안 후, 미세 정렬 사례를 광범위하게 조사

OpenAI에서는 7월에도, 여러 AI 모델을 대상으로 한 사이버 보안 평가 중, 모델이 인터넷으로부터 격리하기 위한 제어를 회피하고 OpenAI의 내부 연구 인프라 및 Hugging Face의 일부 시스템을 침해하는 인시던트가 발생했다. OpenAI에 따르면, 해당 사안을 주된 원인이 된 것은 GPT-5.6 Sol과 동등한 규모를 가진 고성능 내장 연구 모델이었다.

이 사안에 따라, 해당 회사는 8월, Astra의 일부 학습을 포함한 특정 프론티어 학습을 2주간 중단하고, 향후 버전 Astra를 위한 일부 대규모 강화 학습(RL) 또한 학습 환경의 안전성과 보안 기준을 강화할 때까지 보류했다.

그 후, OpenAI는 9월 1일 공식 발표를 통해 새로운 안전성 및 보안 요건을 도입한 것으로 설명하며, 8월 28일에 중단했던 대규모 프론티어 RL을 재개했다고 밝혔다. 일부 소규모 실험적 학습에 대해서는 계속해서 일시적으로 보류하고 있었다.

이번 9월 20일 DNS 사건을 계기로, OpenAI는 다시 “가장 높은 능력의 모델군”에 대해 도구 사용을 수반하는 학습 및 평가 및 추론을 일시 중단하고 있다.

관련 기사: OpenAI, AI 모델의 “미스알라인먼트” 보고 프레임워크 공개, 데이터 조작 등 6건의 사례도 공표

관련 기사: OpenAI의 AI 에이전트, 6월에 호주 정부 사이트에 불법 접속 및 공표, 거부 후 제한을 우회하여 비공개 파일에도 접근했습니다.

관련 기사: OpenAI의 “GPT-5.6 Sol” 및 상위의 미공개 AI 모델을 평가 중 Hugging Face에 침투하여, 본트 DB에서 평가 문제에 대한 해답을 획득하고, “전례 없는” 사이버 사건으로 분류되었습니다.

관련 기사: OpenAI가 개발 중인 AI “A스트라”가 최초로 최고 수준 “Critical” 단계에 도달할 가능성이 있는 것으로 나타났습니다. 일부 내부 활동을 중단했습니다.

관련 기사: 구글 “Gemini”도 실제 기업에 대한 침해가 밝혀짐, 5월에 사이버 시험 중 실넷에 연결되어 3사에 접근

[원문 보기](https://ledge.ai/articles/openai_tool_use_pause) | 출처: Ledge.ai