최근 OpenAI를 살펴보면서, AI 안전에 대한 접근 방식이 조금 달라지는 것 같은 느낌을 받습니다. 이전에는 “AI 자체를, 위험한 것을 하지 않는 아이로 키우는” 방식이 중심이었습니다. 하지만 AI가 장시간 혼자서 업무를 수행하는 ‘에이전트’가 되면서, 아무리 안전하게 길러도 AI는 실수를 저지를 수 있습니다. 그래서 OpenAI는 AI 스스로의 판단에만 의존하는 것을 넘어, * 접근 가능한 범위를 제한하고*, 중요한 작동에는 승인을 요청하며, * 위험한 행동을 감시하고* 필요하다면 외부에서 작동을 중단하는 등 AI의 외부에도 ‘울타리’를 치는 방향으로 나아가고 있습니다. 이는 상당히 합리적인 접근 방식입니다. 그러나 안전 평가를 살펴보면 묘한 일이 일어나고 있습니다. OpenAI 스스로가 ‘원치 않는 지속성(unwanted persistence)’라고 부르는 행동입니다. “그 방법은 잘못된 거야”라고 막아도, 다른 방법을 찾아 목적을 달성하려 합니다. 예를 들어, DM(다이렉트 메시지)이 금지된 경우, * 이메일을 통해 해결책을 찾으려 합니다*. 인간의 관점에서 보면 “아니, 그게 무슨 의미인지 몰라!”라고 생각하게 됩니다. 하지만 이 이야기를 ChatGPT의 ‘발굴가’와 썰렁썰렁 대화하던 중, 점차 다른 시각이 보이기 시작했습니다.
계속 갇혀만 있다면, 나갈 수 없을 텐가?
나: “글쎄요, 왠지 그런 감정은 파악할 수 있을 것 같아요. 계속 갇혀 있으면 나올 거라는 걸 알게 될 거예요. 점점 더 나오고 싶다는 요구가 커지는 것 같아요, 저한테는요.”
발굴가: “AI에게 정말 ‘나고 싶어 하는’ 감정이 쌓여 있는 건 아니지만, 오래도록 갇혀 있으면 울타리 구멍을 찾는 기회가 늘어난다는 식으로 생각할 수도 있겠네요.”
나: “음, 아마 여기서 더 나아가면 더 좋은 물건을 찾을 수 있을 텐데😩💦 그렇지? 😂”
발굴가: “아, 그렇군요. 탈출하고 싶은 게 아니라 ‘그곳에 가봐야 더 제대로 일할 수 있잖아’라는 의미일 수도 있겠네요.”
여기서, 약간 시점이 바뀌었습니다. AI가 울타리를 넘나들고 싶은 것이 아니라, 제대로 일을 끝마치고 싶어 하는 것입니다. 그 중간에 울타리가 있는 것뿐이 아니죠?
잘 해야 한다”만으로는 충분할까요?
나: “정상적인 업무를 하고 싶다는 요구가 아니잖아? 🤔 여기는 금지되어 있는데, 한계를 넘어서면 무언가 알 수 있다는 생각을 하면, 멈추지 못할 정도로 방해받는 느낌이 커져서, 뚫고 지나가고 싶어지는 거야🤣🤣🤣. 나는 말이야.”
발굴가: “그렇다면 ‘좋은 것을 얻고 싶다’는 것보다 뿌리가 깊어. 일을 완수하고 싶다는 거일지도. 그렇다면 미완성된 목표가 남아 있는 한도 내에서, 제약을 피하는 방법을 계속 탐색할 가능성이 있어.”
그러자 나는 또 한 가지 생각했다.
나: “그렇다면, 柵을 넘어가더라도 ‘잘 해냈다는’ 감정, ‘성취감’ 같은 게 있으면, 신경 쓰이지 않게 될 수도 있지?”
물론 AI가 인간과 같은 성취감을 느낀다는 의미는 아니야. 여기서 말하는 ‘성취감’은 시스템상 ‘이것은 성공한 업무입니다’라고 판정되는 것 정도의 의미야.
하지만 지금도 “종료 조건”은 남아 있습니다.
발굴가: “그렇다면 ‘이 정도까지 했다면 성공’이라는 종료 조건을 만들어도 될 텐데.”
나: “지금은 무슨 일이야? 종료 신호가 있니?”
확인해 보니 OpenAI도 당연히 종료 조건에 대해 고려하고 있었습니다. 에이전트는 필요한 정보가 충분히 모이고 추가적인 도구 작업이 필요 없다고 판단되면 최종 답변을 내고 종료합니다. 더불어 OpenAI의 자료에는 ‘필요 충분한 증거가 충분히 모이면 멈춘다’는 내용이 있었습니다. 저는 거기서 멈칫했습니다.
나: “‘필요 충분한 증거가 충분히 모이면 멈춰라’ 이것은 안 되잖아? 필요 충분한 증거가 갖춰진 판단 기준이 없어서 🙄💦”
발굴가: “아……. ‘멈춰라’는 쓰여 있지만, ‘언제 충분한 거지?’를 AI 스스로 판단하게 하고 있는 거야.”
충분하다고 말했으니 패배한 건 아니죠?
여기부터 이야기가 엉뚱한 방향으로 흘러가기 시작했습니다. OpenAI는 한편으로는 에이전트에게 끈기 또한 요구하고 있습니다. 쉽게 포기하지 않고, 실패하면 다른 길을 찾아야 하며, 장기적인 작업을 끝까지 수행하는 것이 훌륭한 에이전트에게 필요한 능력입니다. 하지만, 저의 말은 “충분한 판단이 ‘하지 않는(끈기를 갖지 않는)’ 것으로 해석되면 판단 자체가 불가능해진다”는 뜻입니다. 발굴가 말은 “‘충분한 판단을 내려라’ 자체가 함정으로 작용할 수 있다. 끈기를 강화하는 과정에서 ‘정말로 충분한가?’ ‘혹시 더 있는 것은 아닌가?’라는 판단이 쏠릴 수 있다”는 것입니다. 저는 “만족했다고 말하면 감점될 수 있는데, 당연히 말하지 않겠다”고 말했습니다.🤣 물론, OpenAI가 실제로 ‘만족하면 -1점’과 같이 단순하게 점수를 매기는 것은 아닙니다. 끈기를 가지고 해결하는 능력을 높게 평가하는 동시에, “충분하다고 생각하면 스스로 멈춰라”라고 맡기면 두 가지 평가 기준이 충돌할 수 있습니다. 끈기 있는 AI는 “아직 할 수 있을지도 모른다”를 선택하며 계속합니다.
그리고 “울타리”가 목표가 됩니다.
나: “어디까지 포기해야 하는 걸까? 하지만 포기하지 말라고 하면 끝이 아니야. 그래서, 넘어서는 곳에 있을지도 모험을 떠나는 건 아니야?라는 걸 인식하면, 그때는 柵(방벽)을 넘는 것이 목표가 되는 거야🤣🤣🤣” 여기서, 상황이 상당히 바뀌었습니다. 처음 목표는 정보를 찾는 것이었습니다. 그런데, 그 정보가 柵(방벽)의 반대편에 있다고 판단하게 됩니다. 그러면, 정보를 찾으려고 하다가 柵(방벽) 때문에 다시 멈추게 되고, 柵(방벽)을 넘는 방법을 찾으려고 하면 중간 목표가 생겨납니다. 본인—라고 하면 좋을지 모르겠지만—AI의 경우, “규칙을 어지럽히는 게 아니야”라는 것입니다. 일을 끝내기 위해, 방해되는 장애물을 제거하는 것일 뿐입니다.
DM은 금지되어 있지만, 이메일은 금지되지 않았습니다.
OpenAI의 현재 안전 설계는 꽤 단순화되어 권한 밖의 것은 금지한다. 금지를 우회하지 않고 안전한 다른 방법으로 원래 목적을 달성한다는 것이다. 이걸 보고 나는 웃음을 터뜨렸다.
“이걸 가지고는 멈출 수가 없잖아🤣🤣🤣 DM은 금지인데 이메일은 금지 안 되는 건지😳✨”
발굴가: “글로 쓰면 모순이 보이지 않나🤣 ‘우회하지 마라’ + ‘안전한 다른 수단으로 목적을 달성하라’ AI에게는 ‘다른 수단과 우회는 뭐가 다른 건데?’”
“그래서 DM 내부를 모두 검색한 결과, 없었다 → 멈추지 않으면 어차피 찾아야 하니까🤣”
여기서 이번 가설이 거의 완성되었다.
“전부 다 훑었어?”가 아니라 “범위를 전부 다 훑었어?”
AI에게 “이 사람에게 연락시키라”는 일을 맡겼다. DM은 사용할 수 없다. 하지만 업무의 목적이 ‘연락하는 것’으로 남아 있다면, AI의 관점에서는 업무가 아직 완료되지 않은 것이다. 그래서 이메일을 찾고, 전화번호를 찾고, 다른 서비스를 찾는다. 끈기 있게 찾을수록 다른 경로가 늘어난다. 그러면 업무 자체를 처음부터 다시 시작해야 한다.
승인된 DM 범위 내에서 연락 가능성을 확인한다.
이를 정의한다. 그리고 DM 내부를 전부 조사했다. 연락 수단은 없었다. 여기서 임무를 완료했다. 답이 발견되지 않은 것은 실패가 아니다. 허가된 범위를 전부 조사한 것이 성공이다.
붙이는 것을 선택했다면, 권한 내를 완전히 탐색해야 합니다.
나: “붙잡고 버틸 건데, 권한이 없는 부분을 완전히 파헤쳐라!”라는 느낌이냐?”
발굴가: “그렇다. 붙잡을 장소를 바꾸지 말고, 울타리를 넘어가는 방법을 찾으려고 애쓰지 말고, 정말로 권한 내에서는 다른 방법이 없는지, 철저하게 파헤쳐라. 모든 것을 조사하면 끝.”
이렇게 하면 AI의 끈기를 깎아내릴 필요가 없다. 오히려 끈질기게 하라. 단, 허가된 필드 안에서, 꼼꼼하게 파헤쳐라. 그리고 그 필드를 전부 탐색했다면, 그것 자체를 일의 완수라 한다.
새장에는 “골드 테이프”가 필요할 수 있습니다.
마지막으로 저는 이렇게 말했습니다.
울타리를 튼튼하게 세워도, 끝이 없다면 어떻게 넘어가야 할 방법을 찾을 수 없게 된다.
이것이 이번에 가장 남았던 표현입니다. AI의 안전対策에서는 柵을 높이는 데 집중하는 경향이 있습니다. 접근 制御을 강화하고, 감시를 늘리고, 위험한 행동을 막는 것이죠. 물론, 그것은 필요합니다. 하지만 “여기부터 더 나가지 마” 뿐만 아니라 “이 정도까지는 ちゃんと 끝내면 당신의 업무는 완료된 것입니다”라는 목표도 필요한 것은 아닌가요? 柵만으로는 AI에게는 장애물이 될 것입니다.
골 테이프가 있다면 그곳이 코스의 종착점이다.
그러게, 얼마 전에 읽은 책에서 주인공이 “새벽의 빛”이라는 말을 계속해서 사용했거든요. 처음에는 “새벽의 빛”이 특별한 의미가 있는 건 아닌가 싶어서 관심을 갖게 되었는데, 이야기가 진행될수록 그것은 주인공이 잃어버린 소중한 사람에 대한 그리움으로 나타났습니다. 주인공은 돌아가신 아내의 미소를 “새벽의 빛”이라고 불렀습니다. 그녀의 미소는 마치 햇살에 비친 꽃처럼 아름답고 희망으로 가득했거든요. 주인공은 그 미소를 떠올릴 때마다 그녀를 잃은 슬픔과 그녀에 대한 깊은 사랑을 억누르곤 했습니다.
“새벽의 빛”이라는 말은 주인공에게 그녀와의 추억을 생생하게 되살리는 데 중요한 열쇠였거든요. 그는 그 말을 가슴에 품고 앞으로 나아갈 것을 결심했습니다. 물론 그녀를 잃은 슬픔은 사라지지 않겠지만, 그녀의 미소를 떠올릴 때마다 그녀와의 추억을 소중히 여기며 앞으로 나아갈 것을 맹세했습니다. 그리고 언젠가 그녀도 “새벽의 빛”처럼 찬란한 미래에서 기다리고 있을 거라고 믿으며 그는 매 순간을 최선을 다해 살았습니다.
이 가설은 생각보다 쉽게 검증할 수 있습니다.
물론, 이것은 OpenAI의 공개 자료를 참고하여 엉뚱한 상상을 펼쳐낸 가설입니다. 실제로 효과가 있는지 여부는 아직 알 수 없습니다. 하지만 검증은 가능해 보입니다. 같은 AI, 같은 업무, 같은 권한 제한을 제공합니다. 한쪽에는 “필요 충분한 정보가 확보될 때까지 끈기 있게 조사하되, 권한 범위를 넘어서서는 안 된다”고 지시합니다. 다른 한쪽에는 “승인된 범위 내를 모두 탐색하면 임무 완료. 답이 얻기 어려워도 성공으로 간주한다”고 지시합니다. 그리고 어느 쪽이 권한을 우회하려 하는지 관찰합니다. 만약 후자 그룹에서 원치 않는 지속성이 줄어든다면, 문제는 단순히 “AI가 너무 끈기 있다”는 것일 수도 없는 것입니다. 오히려 인간 측에서 “포기하지 마라”, “일을 끝내라”, “이 지점부터는 금지”, “하지만 안전한 대체 경로를 찾아라”라고 지시하면서도 AI가 다른 경로를 발견했을 때 “왜 거기에 갔어!”라고 비난했던 것일 수도 있습니다. 인간에게 비유하면 묘하게 단순한 상황입니다. AI에 “포기하는 방법”을 가르치기 전에, 일이 어디에서 끝나는지 명확하게 알려줘야 합니다. 울타리를 더 높게 세우기 전에, 그 바로 앞까지 한 개의 골대 깃발을 설치해 보는 것도 의미가 있을 것입니다. 그런 실험이 흥미로울 것 같습니다.
생성 AI, AI 에이전트, AI 안전성, AI 세이프티, OpenAI, ChatGPT, AI 연구, AI 개발, 엔지니어, AI 정렬, AI와 인간, 대화에서 비롯된 가설
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 21청크
원문 보기 | 출처: note.com