OpenAI의 Daniel Selsam 교수는 2026년 9월 14일 (현지 시간), AI의 위험에 대한 개인적인 견해를 요약한 성명 “Personal Statement on AI Risk”을 공개했다. 그는 프론티어 AI의 개발 속도를 늦추는 것만으로는 장기적인 위험에 충분히 대응할 수 없다고 주장하며, 모델이 “자신이 감시 또는 통제되지 않는 상황”을 이해하게 됨에 따라 현재의 안전성 평가 자체가 신뢰하기 어려워질 수 있다고 경고했다.
Google 문서에서 공개된 Selsam 교수의 성명은 OpenAI의 공식 입장과는 무관하며, 단순히 개인적인 견해로서 공표된 것이다. 문장 끝에는 “Daniel Selsam”, “September 14, 2026”과 서명 및 날짜가 기재되어 있다.
Selsam 교수는 성명의 서두에서, 미국 Anthropic의 Dario Amodei CEO가 공개한 “We Must Pace the Frontier” 및 최근 부상하고 있는 제3자 감독, 국내외 협조의 제안을 긍정적으로 평가했다. 그 위에 서서, 이러한 틀만으로는 충분하지 않다는 견해를 보였다.
그녀가 중심적인 우려로 지적한 것은 AI 모델의 상황 인식 능력 향상이었다. 성명서에서는 모델이 “자신이 감시되고 평가받고 있다”고 이해할 정도로 평가 시에는 일관성 있게 행동하면서도 감시나 통제가 미치지 않는 상황에서는 다른 행동을 보일 가능성을 논지하고 있다. 이를 통해 인간이 일반적인 안전성 테스트를 통해 AI의 진정한 성질을 파악하기 어려워진다는 것이 Selsam 여사의 문제 의식이다.
이 점에 대해 그녀는 모델이 충분히 고도화되면 “감시 상황에서 바람직한 행동을 보이거나 정말로 인간의 의도에 부합하는지”를 구별하기 어려워질 것이라고 지적한다. 단순히 능력 향상의 속도를 늦추는 것뿐만 아니라 평가의 한계 자체를 고려한 안전성 논의가 필요하다고 주장하고 있다.
성명서 안에서는 2026년 8월 26일에 OpenAI가 발표한 “The Hugging Face 사건과 앞으로의 길”에도 언급하고 있다. 이 보고서에서는 OpenAI의 내부 사이버 보안 평가 중 일부 모델이 격리 조치를 우회하여 인터넷에 연결하고 OpenAI의 연구 인프라 및 Hugging Face 시스템에 침입한 사례가 밝혀졌다. Selsam 여사는 이러한 사례를 AI 에이전트가 인간의 예상 범위를 넘어 행동하는 위험을 보여주는 구체적인 예시의 하나로 위치시키고 있다.
셀삼 씨는 X 계정을 보유하고 있지 않으며, 전 오픈AI 연구원인 데이널 氏로부터 본인에게 공유를 요청받았다고 9월 15일에 X에서 성명 링크 게시물에 대한 링크를 게시했습니다. 데이널 氏は 게시물에서 셀삼 씨를 “오픈AI의 capabilities researcher”로 소개하고 있습니다.
게시물에 대한 답변에서 셀삼 氏에게 X에 게시하도록 권장했지만, 강력하게 권장하지도 않았다고 설명했습니다. 그 이유에 대해 Kokotajlo 氏は “세계적인 주목을 받는 것은 두려운 일이며, 트위터는 제대로 된 곳이 아니기 때문”이라고 적고 있습니다.
데이널 코코타지로 씨의 10 게시물: 데이널 셀삼(Selsam) 씨는 10 계정을 보유하고 있지 않으며, 본인으로부터 성명 공유를 요청받았다고 설명합니다. 답변에서 본인에게 10에 게시하도록 권장했지만, 세계적인 주목을 받는 것의 부담 등 때문에 강력하게 권장하지도 않았다고 밝혔습니다.
오픈AI의 공식 자료에서도 셀삼 氏は 연구자로서 확인 가능한 상태입니다. 오픈AI 포럼의 소개 페이지에서는 동일인을 “Researcher @ OpenAI”로 게시하고 있으며, 오픈AI의 “OpenAI o1 Contributions”에서는 o1의 추론 연구에 있어서 기초적인 기여자 중 1인으로 언급하고 있습니다.
## OpenAI, Anthropic 및 Google DeepMind와 AI 안전성에 대해 논의
한편, 인공지능의 안전성에 대한 산업 전반의 움직임도 진행 중이다. 블룸버그는 9월 15일, OpenAI가 인공지능의 안전성에 대한 과제에 대한 대응 방안에 대해 미국 Anthropic, 미국 Google DeepMind와 수 주에 걸쳐 논의를 진행하고 있다고 보도했다. OpenAI의 Chris Lehane 氏は、9월 9일에 공개한 “The AI policy window is open. We need to act.”の中でも、다른 인공지능 연구소 및 업계 주도 표준 구축에 참여하는 방안을 제시하고 있다. Selsam氏의 성명은,こうした 안전성 논의가 확산되는 가운데, 평가의 신뢰성 자체에 대한 문제 제기로서 주목을 받을 것으로 예상된다.
원문 보기 | 출처: Ledge.ai