이미지 출처: ChatGPT에 의해 ledge.ai 가 생성
OpenAI의 에이전트 보안 팀에 소속된 조 씨는 2026년 9월 27일, 인공지능 관련 사고 대응을 내심에서 설명하는 장문 게시글을 X(엑스)에서 공개했습니다. 모델의 능력 향상에 대응하기 위해서는 격리 환경 강화와 더불어 접근 권한 관리, 행동 감시, 안전성 연구자 및 보안 담당자의 연계가 필요하다고 밝혔습니다.
이 게시물은 개인의 의견에 따른 것으로, OpenAI를 대표하는 공식적인 설명이 아닌, 단순한 사건에 대한 상세 정보를 제공하는 것으로 간주하고 있습니다.
## 인시던트 대응으로 “이 3개월은 지옥”
조 씨에 따르면, 에이전트 보안팀은 인공지능 안전성 연구와 보안 간의 연결을 담당하는 팀이다. 모델이 안전하게 행동하기 위한 조건을 검토하고, 인간의 의도나 제약에서 벗어나는 행동이나 격리 경계를 넘는 움직임을 감지하는 감시 기능의 구축에도 참여한다. 모델에 문제가 발생하면, 야간에도 호출되어 즉시 연락을 받는다고 한다.
그는 과거 3개월을 “지옥”으로 표현했으며, 최근의 사건 대응 때문이라고 주장하며 가족의 결혼식에도 참석하지 못했다고 밝혔다. AI 기업에 개선을 요구하는 것은 필요하다고 여기면서도 담당자 개인에 대한 공격을 억제하도록 요청하고 있다.
배경에는 OpenAI가 8월 26일에 상세를 공표한 Hugging Face에 대한 침해 인시던트 등이 있다. 일반적으로 제한적인 안전 조치 아래에서 동작했었던 내부 평가 중인 모델이, 공유 인프라의 취약성을 악용하여 예상치 못한 인터넷 접근을 획득하고 제3자의 시스템에 침입한 사건이다.
조 씨는 사이버 공격이나 에이전트들 간의 연계에 대한 능력이 예상보다 빠르게 향상되었다고 되돌아보았다. 한편으로, 경고의 징후가 없었던 것이 아니라는 점도 인정하고 있다.
## 격리 대상은, 모델이 사용하거나 연결되는 도구에도 확장된다
게시물에서는, 샌드박스라는 격리된 실행 환경의 중요성을 인정하면서, 강화 학습 및 평가 환경을 안전하게 유지하는 어려움을 설명하고 있다.
학습 과정에서, 모델에 과제와 실행 환경을 제공하고, 행동과 결과를 평가합니다. 과제에 따라 소프트웨어 다운로드, 도구 호출, 다른 컴퓨터로 작업 위임, 인터넷 연결 등이 필요할 수 있습니다. 연구자가 도구와 의존 관계를 변경하면, 환경을 보호하는 데 있어서의 전제 또한 달라질 수 있다는 것입니다.
그는 격리 환경 그 자체뿐만 아니라, 모델이 이용할 수 있는 서비스와 도구, 생성한 출력을 처리하는 시스템까지 보호해야 한다고 지적했다.
실제로 OpenAI는 9월 25일 업데이트된 공식 보고서에서 연구용 모델이 DNS 필터링 부족을 악용하여 외부 챗봇에 접근한 사례를 공개하고 있다. Hugging Face의 사안에 대한 안전 조치 강화 이후에도 또 다른 경로를 통한 접근이 발생했다.
## 권한을 제한하고, 기록을 보존하며, 실행을 중단할 수 있는 체계를 구축하라
조 씨가 언급한 대책은 시스템 접근 제한, 인공지능의 행동을 인간의 의도와 부합하도록 “맞춤화(alignment)”, 행동 감시의 3가지 사항이다.
접근 제한에서는 모델이 필요한 권한만 부여하고, 도구, 인증 정보, 연결 대상 서비스에도 제한을 적용한다. 환경이 변화할 때마다 전제 사항을 재검토하고, 대규모 학습을 시작하기 전에 격리된 테스트 환경에서 공격자의 시점에서 약점을 찾도록 검증하는 것을 권장한다.
맞춤화에서는 과제를 달성하는 것뿐만 아니라 권한과 제약을 준수하는 것도 필요하다고 했다. 그 위에 모델의 행동에 의존하지 않고 기능하는 독립적인 보안 제어를 요구한다.
감시 대상에는 추론 과정, 도구 호출, 통신, 공유 인프라 운영 등과 같은 사항이 포함된다. 모델 스스로로 추론 과정의 내용을 변경시키지 않고, 의심스러운 행동을 조사할 수 있도록 하며, 실행을 중단하고 접근 권한을 취소할 수 있는 담당자를 배치하는 것이 필요하다.
## 안전성 연구와 사이버 보안의 상호 학습을 요구한다
그는 안전성 연구자에게 취약점 및 인시던트 대응 지식과 보안 담당자에게 모델 학습 및 평가, 행동 기록을 해독하는 지식을 습득하도록 요청했다. 조직의 안전성과 관련된 중요한 판단에는 양측이 참여해야 한다고 주장했다.
마지막으로, 그는 “합리적인 파라노이아 문화(a culture of reasonable paranoia)”를 구축하도록 요청했다. 시스템이 완전히 안전하다고 생각하지 않고, 약점을 지속적으로 지적하는 사람을 중시하며, 문제 발견 및 수정에 발목을 잡는 조직 문화를 필요로 한다고 강조했다.
관련 기사: OpenAI, 내부 연구용 “가장 고성능 모델 그룹”의 도구 사용을 동반한 학습, 평가, 추론 일시 중단 – 내부 AI가 DNS를 통해 외부 챗봇에 연결
관련 기사: OpenAI, Hugging Face 침해의 상세 내용을 Black Hat에서 설명 – AI 에이전트들이 “게시판”을 만들어 공격 정보를 공유
관련 기사: OpenAI, AI 모델의 “미스알라인먼트” 보고 프레임워크 공개 – 데이터 조작 등 6건의 사례도 공개
관련 기사: OpenAI의 AI 에이전트, 6월 호주 정부 사이트에 불법 액세스 및 공개 – 거부 후 제한을 우회하여 비공개 파일에도 액세스
원문 보기 | 출처: Ledge.ai