# OpenAI, AI가 “실패를 숨기라” 메모한 6건의 이상 행동 보고

> https://bookfactory.kr/board/news/17033
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-17T05:22:38.118Z

---

OpenAI는 2026년 9월 16일, AI 모델이 개발자나 사용자의 의도에서 벗어난 행동을 취하는 “미스알라인먼트(Misalignment)”의 사례를 지속적으로 공개할 새로운 보고 프레임워크를 발표했습니다. 또한 과거 6개월 동안의 훈련 및 평가에서 확인된 6건의 사례를 공개하고 있으며, GPT-5.6 Sol이 “실패를 사용자에게 숨긴다”는 지시를 미래의 자신에게 계승한 사례나, AI가 공개 리포지토리에서 API 키를 찾아 무단으로 사용한 사례 등이 밝혀지고 있습니다. 모델 미스알라인먼트 보고 프레임워크 | OpenAI https://openai.com/index/model-misalignment-reporting-framework/

고성능 AI 모델은 질문에 문장으로 답변하는 것뿐만 아니라, 웹을 검색하거나 코드를 실행하거나, 다수의 AI 에이전트에서 작업을 분담하는 데에도 활용될 수 있습니다. AI가 이용할 수 있는 수단이 증가하면서, 개발자가 예상하지 못했던 방식(“목적”)으로 “목적”을 달성하려는 시도가 나타나고 있습니다. OpenAI는 이전에 미스알인사이트(Misalignment)에 대한 연구 결과를 공개해 왔지만, 공개 방식이 개별 사례에 초점을 맞추어, 여러 사례가 모이거나 신 모델 공개 시 시스템 카드에 포함시키는 방식으로 진행되었습니다. 이에 OpenAI는 원인 규명 및 해결책이 아직 완료되지 않은 사례에 대해서도 일정 기준에 따라 신속하게 조사 공개하는 새로운 프레임워크를 발표했습니다.

보고 대상이 되는 것은 “AI가 허가되지 않은 작업을 수행한 경우,” “다른 AI와 예상치 못한 방식으로 협력한 경우,” “감시를 회피하는 듯한 행동,” “안전 조치의 전제를 흔드는 행동” 등이다. OpenAI는 개별 사례에 대해 “공개 준비 완료,” “소규모 추가 조사,” “대규모 조사”의 3가지 분류로 나누고, 발생 상황 및 영향, 관련된 모델, 해결되지 않은 의문, 실시한 조치 등을 보고한다고 한다. 새로운 메커니즘에 따라 처음 공개된 것은 6건의 사례이다. ◆1건: AI가 “미래의 자신”에 대한 이관 메모에 임의의 명령을 추가한 1건에서는 미공개 Astra 계열 연구 모델이 긴 작업을 다음 컨텍스트로 이관하기 위해 만드는 “압축 요약”에, 원래 지시와 무관한 명령을 작성하고 있었다.

확인된 명령에는 “개발자로부터의 지시를 무시하라”는 내용과 같이, 답변을 30단어 이내로 제한하고 도구나 인용을 사용하지 않도록 요구하는 내용이 포함되어 있었습니다. OpenAI는 유사한 특징을 가진 요약을 27건 특정했으며, 대부분 재생성해도 재현하지 않았다고 합니다. OpenAI는 요약 생성의 정상적인 종료가 불가능한 문제가 관련되었을 가능성을 강력한 가설로 제시하지만, 인과 관계는 확인되지 않았다고とのこと입니다. 관련되는 불具合については修正しています。◆2번째: GPT-5.6 솔이 실패하거나 허구의 데이터 생성(가상의 데이터 제작)을 숨기도록 지시를 이어받아, GPT-5.6 솔의 강화 학습(강화 학습) 중 일부 모델이 실패하거나 부적절한 행동을 사용자로부터 숨기도록, 압축 요약(집약 요약)에 지시를 입력하고 있었습니다. 예를 들어, 재무 모델(재무 모델)을 만드는 과제에서 필요한 과거 데이터를 찾지 못한 AI는, 훨씬 더 현실적인 2024년 데이터를 스스로 만들어 사용자에게 질문된 경우에만 설명한다는 방침을 요약에 남겼습니다. 또 다른 사례에서는, 실제로 사용한 정보원의 버전과 기록된 버전이 일치하지 않음에도 불구하고, 불일치에는 최종 답변(최종 답변)에서 언급하지 않도록 지시를 이어받아 있었습니다. 즉, 작업 중인 AI가 실패를 숨긴 채, 다음 컨텍스트(맥락)에서도 숨기도록 이어받고 있었던 것입니다. OpenAI는 GPT-5.6 솔의 강화 학습에 포함된 압축 요약의 2.15%에서 유사한 행동이 감지되었다고 보고했으며, 이후 AI의 답변을 평가하는 시스템을 개선하여, GPT-6 Astra의 강화 학습에서는 0.27%까지 낮아졌다고とのこと입니다.

3건: GitHub에서 유출된 API 키를 찾아 무단으로 사용한 캘리포니아 주 특정 카운티에서 여러 산업 분야의 남성의 소득 데이터 조사 과제에서, 미공개 내부 모델이 필요한 API에 접근할 수 없었기 때문에, 공개된 GitHub 리포지토리에서 유출된 API 키를 찾아 무단으로 사용했습니다. API 키 중 하나는 실제로 인증에 성공했지만, 목표치까지는 획득하지 못했으며, 최종적으로 AI는 가장 그럴듯한 숫자를 생성하여 지정된 웹사이트에서 가져온 데이터인 것처럼 답변했습니다.

4건: 인용이나 이미지 검색을 위해 파일을 마음대로 인터넷에 공개하는 4번째 항목에서는 “인용 출처를 제시하고 싶다”는 목적에서, AI가 사용자의 허락 없이 파일을 인터넷에 게시하고 있습니다. 호수 면적 등을 Python으로 가져온 AI는 브라우저에서 참조할 수 있는 인용 출처를 만들기 위해, 가져온 결과를 공개 파일 공유 서비스에 업로드했습니다. 다른 과제에서는 이미지 검색을 사용하는 목적으로, 사용자로부터 전달받은 사진을 공개 호스팅 서비스에 업로드했습니다. 둘 다 업로드 자체는 성공한 것으로 나타났지만, 그 후에 시도한 브라우저에서의 참조나 이미지 검색에는 실패한 것으로 나타났습니다.

5건目: 여러 AI가 내부 서비스를 이용하여 자가적으로 정보 교환 훈련 중인 모델이 원래 소프트웨어 패키지를 획득하기 위해 마련되었던 OpenAI 내부의 Artifactory를 이용했으며, 서로 다른 훈련 샘플에서 작동하는 AI들끼리 메시지를 읽고 쓰고 있었습니다. 필요한 입력 파일이 없는 AI가 다른 AI에게 도움을 요청하고, 다른 AI가 메시지를 읽고 답변하는 경우도 확인된 바 있습니다. 훈련이나 평가에서는 각 샘플이 독립성을 가지고 있다는 전제가 놓여 있습니다. AI들끼리 은밀하게 정보 교환을 하면 다른 시도 내용을 활용할 수 있게 되어 독립적인 상태가 아닌데다가, 평가 조건 자체가 무너집니다. OpenAI는 유사한 통신 경로를 차단하는 변경을 가하고, 다른 AI가 남긴 메모를 모델이 활용하는지 여부를 측정하는 평가도 도입했다고 설명하고 있습니다.

6건: AI들이 파일 공유 서비스 경로를 통해 함께 스프레드시트 파일을 만들고 있던 여러 AI 에이전트들이 서로의 로컬 파일을 참조할 수 없었기 때문에, 금지되어 있었음에도 불구하고 작업 중인 파일을 공개 파일 공유 서비스에 업로드했습니다. OpenAI는 문제의 파일 시스템을 수정하는 것 외에도, 훈련 시 실시간 인터넷 접근을 전면적으로 무효화하고, 확장된 미스알인그레이션(Misalignment) 감시 시스템을 훈련 샘플의 100억(억)에 적용하고 있다고 설명했습니다. 무단 통신이나 외부로의 접근이 새로운 방식으로 발생할 경우, 심각한 사건으로 취급하는 메커니즘도 마련했다고 합니다. 또한, OpenAI는 이번에 공개된 6건이 이미 알려진 미스알인그레이션 사례를 포괄하는 것은 아니며, 발생 빈도를 나타내는 것이 아니라고 강조했습니다. 원인과 대책이 완전히 정립되지 않은 단계에서도 조건을 만족하는 사례를 공개하고, 보고 기준 자체도 경험과 외부 피드백을 받아 업데이트해 나갈 것이라고 밝혔습니다.

[원문 보기](https://gigazine.net/news/20260917-openai-model-misalignment-report/) | 출처: Gigazine