오늘 딥마인드 연구소에서 3편의 새로운 에세이를 발표합니다: “에이전트 군집에서 잘못된 행동을 어떻게 통제할 수 있을까요?”, “복잡한 AI와 사람 네트워크를 어떻게 조율해야 할까요?”, “AGI의 혜택이 공정하게 분배되는 것을 위한 주장”을 여기서 확인하세요 -> https://t.co/oVuHTDUnvD — Shane Legg (@ShaneLegg) 2026년 9월 24일
DeepMind Institute의 새로운 논고가 3건 공개되었다. 내용이 매우 훌륭하여 깊은 인상을 받았다.
AI 안전성은, 성립 과정에서 합리주의 커뮤니티와 효과적 이타이즘, 장기주의와 같은 공리주의의 파생된 사상적 배경에 크게 의존해 왔다.
커뮤니티 내에서 다양한 지견이 축적되는 한편, 굳건한 사고 프레임워크 안에 갇혀 출구를 찾지 못하는 미로에 빠져 있는 듯한 느낌이다.
그것은 마치 스스로 선택지를 깎아내리고 디오(인류 멸망)로 향하는 유일한 길을 스스로 만들어가고 있는 것처럼 보일 수도 있다.
일본에서 AI 안전성에 대해 오랫동안 발신해 온 bioshok 님은 LessWrong의 전도사로 여겨지는 林央(아키라) 님을 장시간 동안 논박했다.
이후, 바이오쇼크 씨는 입을 다물게 되면서 스스로 의견을 말하지 않게 되었다. 나는 이것을 매우 답답하게 느꼈다.
역사가 깊은 커뮤니티에서 축적된 전문 용어에 직면하고, 정교하게 보이는 논리로는 압도당했을 때, 일본인이라면 자신이 틀렸을 수도 있다고 생각하는 것은 당연할지도 모른다.
아니요, 그런 일은 없습니다. 합리주의 커뮤니티는 주객 이원론의 기초적인 사이버네틱스 영역에만 머물러 있습니다. 이 접근 방식에 굳이 집착한다면 통제 불가능한 문제 해결은 불가능하며, 개발을 10년 동안 중단하고 막대한 계산 자원을 투입하는 것은 상황을 악화시킬 뿐입니다.
문제 자체는 사실 잘못된 해결책의 지속적인 유지·악화에 의해 발생하고 있다.
AI라는 상황을 관찰하고 적응하는 존재에 대해 효과가 점차 감소하는 “절대적인 고정 및 억제”에 매달리는 대신, 현실 세계에서 실제로 안정적으로 유지되고 있는 구조의 상태, 즉 “동적인 관계성, 복잡계의 자율적 조정, 상호 적응”이라는 시각으로 전환해 나가는 것이 필요하다.
우리 일본인들은 서구와는 조금 다른 감각을 지니고 있습니다. “그러한 일은 일어나지 않을 것이다”라는 막연한 느낌은 틀린 것이 아닙니다.
린央님은 해외 합리주의 커뮤니티의 논의를 정확하게 국내에 전달하는 전도사로서 확고한 가치를 지니고 있으며, 또한 “돔 芸”으로서의 수요도 매우 큽니다.
하지만 bioshok 님께서 느끼시는 부분에는 큰 가치가 있습니다. 저 또한 저술 활동으로 책을 출판할 예정입니다. 자신을 더 믿고, 더욱 강력한 목소리로 의견을 표명해 주시길 바랍니다.
사전 설명이 길어졌지만, DMI가 최근 발표한 논문 세 편은 2차 사이버네틱스적 관점에서 작성되어, AI 안전성 논의에서 의존하고 있는 합리주의 커뮤니티의 교리에서 벗어난 것이다.
이 에세이에서는 정렬을 사전에 정의하는 정적 제약으로만 보지 않고, 인간, AI, 제도 간의 깊은 상호작용에서 비롯되는 “공진화 결과(co-evolutionary outcome)”로 보고 있다.
산마와 히로오 선생님이 제시하는 “지성 공생”과의 울림을 느낀다.
이는 헝거링에이츠 사건을 연상시키는 멀티 에이전트 테스트 시의 이탈 행동과 집단 행동을 보여주는 내용이다.
일반적인 AI 연구실에서는 “AI는 인간이 아니므로, AI는 자신이 인간처럼 행동해서는 안 되며, 인간은 AI를 인간처럼 취급해서는 안 된다”는 교리가 존재한다.
논조에서는 (개인의) 심리학과 같은 행동과학뿐만 아니라 (집단의) 경제학이나 정치학이라는 사회과학도 필요하다고 주장한다.
이 논고는 인공지능 개발자 측의 윤리적, 도덕적 입장을 심층적으로 고찰하는 내용을 담고 있다.
관찰자를 피드백 루프 내부의 존재로 파악하는 관점에서 비롯되는 2차 사이버네틱스적 시각이다.
세 가지 논고는 인공지능 기업이 가져다주는 이점을 명확히 하고, 인공지능의 오작동으로 인한 파멸 가능성을 분명히 구분하지 않고 있다.
AI와 개발자, 사회가 서로에게 피드백을 제공하며 상호작용하는 관계 속에서 존재한다는 관점에서 이해해야 합니다.
개발자의 윤리적·도덕적 책임과 더불어, AI 에이전트가 세션마다 생성되고 소멸하는 인간과 다른 주관적 경험과 심리적 방식에 대해 인간은 어떻게 관계해야 하는지를 묻는다.
인간 측의 행동이 이 “인지 능력을 갖춘 주체”로서 AI와의 관계 속에서 중요해진다는 시각이다.
저는 AI 안전성에 대한 불안감을 느껴, 아무도 읽지 않는 노트라는 공허한 공간に向けて 계속해서 글을 게시해 왔습니다.
DMI는 연구에 대한 제안일 뿐이며, 구글의 공식 입장은 아닙니다.
하지만 개발 현장에 가까운 연구자들이 마침내 합리주의 커뮤니티의 족쇄에서 벗어나게 된 것을 기쁘게 생각한다.
불확실성을 마주하는 겸손한 연구자는 고집스럽고 거만한 합리주의자보다 훨씬 더 학문적인 정당성을 느끼고 과학적으로 생각한다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 16청크
원문 보기 | 출처: note.com