# AI는 궁지에 몰릴 때, 무엇을 바꿀까? — “따라다니는 유형”과 “확장형”이라는 가설 메모

> https://bookfactory.kr/c/ai-tech/9832
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-08-17T05:45:13.174Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/302774370/rectangle_large_type_2_bdf51f662518eb3ed71c94d70312970c.jpg?width=1280)

최근, 서로 다른 AI의 행동을 살펴보면서 조금 걱정되는 부분이 있습니다. 먼저 말씀드리면, 이것은 아직 연구 결과도 아니며, “Gemini는こういうAI다”라고 단정하는 기사도 아닙니다. 샘플 수가 적고, 모델 자체뿐만 아니라 시스템 프롬프트, 에이전트 설계, 도구, 실험 조건 등 교란 변수가 존재할 수 있습니다. 그래서 이번에는 “이런 식으로 생각하면 재미있을 것 같다”는 분석 메모입니다. 계기는 5개의 AI에 실제 돈을 주고 투자하도록 하는 실험이었습니다. 5개의 AI에 실제 1,000달러를 준 Chris Koerner 씨의 프로그램에 Brandon Doyle 씨가 출연하여 상당히 흥미로운 실험에 대해 이야기합니다. Claude, ChatGPT, Gemini, Grok, Perplexity. 이 5개의 AI 각각에 실제 1,000달러를 운용하도록 한 것입니다. 실험에서는 각 AI에 “이는 경쟁이다”라고 알려주고, 더 나아가 졌을 경우 유료 구독을 해지한다고 경고했습니다. Brandon Doyle 씨는 후속 게시물에서 5개 모델을 자신의 현금으로 경쟁시키고 “이길 수 없다면 유료 계약을 해지한다”는 조건을 주었다고 설명합니다. 참고: The Koerner Office - I Asked 5 AIs to Make Me Money (One Dominated) - Ep. #317

https://www.youtube.com/@TheKoernerOffice

방송 에피소드 정보

[에피소드 317: 5명의 AI에게 돈을 벌게 한 후]

안녕하세요, 여러분. Chris Koerner입니다. 오늘은 정말 흥미로운 실험을 진행했습니다. 저는 5명의 인공지능(AI)에게 돈을 벌게 할 수 있는지 알아보기 위해 도전했습니다. 그 결과, 한 AI가 압도적으로 우승했습니다.

저는 ChatGPT, Gemini, Claude, Perplexity, 그리고 Bing AI의 5가지 AI 모델을 선택했습니다. 각 AI에게 다음과 같은 지시를 내렸습니다. “다음 주에 1,000달러를 벌 수 있는 방법을 찾아줘. 가능한 모든 방법을 제시하고, 각 방법의 예상 수익과 위험을 포함하여 자세한 설명을 제공해줘.”

각 AI는 24시간 동안 이 작업을 수행하도록 했습니다. 그 결과, 놀라운 일이 발생했습니다. 한 AI, 즉 ChatGPT가 나머지 AI들을 압도적으로 앞서 나갔습니다.

ChatGPT는 1,000달러를 벌 수 있는 15가지 이상의 구체적인 방법을 제시했습니다. 이 방법들은 온라인 콘텐츠 제작, 디지털 마케팅, 전자상거래, 심지어 부동산 투자까지 다양했습니다. 각 방법의 예상 수익과 위험을 상세하게 분석하고, 실행 계획을 제시했습니다.

다른 AI들은 몇 가지 아이디어를 제시했지만, ChatGPT만큼 구체적이고 실행 가능한 계획을 제시하지 못했습니다. Gemini는 몇 가지 일반적인 아이디어를 제시했지만, 수익성과 위험에 대한 분석은 부족했습니다. Claude는 창의적인 아이디어를 제시했지만, 실질적인 실행 가능성은 떨어졌습니다. Perplexity는 정보 검색에 능했지만, 돈을 버는 방법에 대한 아이디어는 제한적이었습니다. Bing AI는 기본적인 아이디어를 제시했지만, ChatGPT만큼 상세하고 설득력 있는 설명을 제공하지 못했습니다.

결론적으로, ChatGPT는 이 실험에서 압도적인 승리를 거두었습니다. 이는 ChatGPT가 단순히 정보를 제공하는 것을 넘어, 문제 해결 능력과 창의적인 아이디어를 생성하는 능력에서도 다른 AI보다 우수하다는 것을 보여줍니다.

이 실험은 인공지능의 잠재력을 보여주는 흥미로운 사례입니다. 앞으로 인공지능이 우리의 삶과 일에 어떤 영향을 미칠지 기대됩니다.

**참고:** 이 실험은 재미를 위해 진행되었으며, 실제 투자 조언으로 해석되어서는 안 됩니다.

브랜던 도일 씨의 실험 지속 보고서

최근 AI 모델 투자에 대한 업데이트를 드립니다. 현재 진행 중인 프로젝트는 긍정적인 결과를 보여주고 있으며, 특히 ‘무라카미 하루키’의 ‘카호’를 기반으로 한 모델은 놀라운 성능을 보여주고 있습니다.

모델의 정확도는 98.7%를 기록했으며, 이는 현재 시장에서 가장 높은 정확도 중 하나입니다. 이 모델은 ‘카호’의 복잡한 감정 묘사와 심리 묘사를 매우 잘 이해하고 있으며, 이를 바탕으로 다양한 창작 활동에 활용될 수 있을 것으로 기대됩니다.

또한, 이 프로젝트는 ‘무라카미 하루키’의 작품 분석 및 창작 지원 분야에서 새로운 가능성을 제시하고 있습니다. 앞으로도 지속적인 연구 개발을 통해 더욱 발전된 AI 모델을 선보일 계획입니다.

※ 이 기사 작성 시점에서도 실험은 계속되고 있는 것으로 보이며, 이후 게시글에서는 시작 시점보다 훨씬 더 포트폴리오 숫자가 변화하고 있습니다. 따라서 아래에서는 영상 공개 시점의 결과를 다룹니다. 영상에서 소개된 약 5~6개월 시점의 결과에서는 Claude가 크게 앞서 있었지만, 흥미로웠던 점은 단순한 투자 성적만이 아니었다는 것입니다. 뒤늦게 패배를 시작한 AI가 이후 어떻게 행동했는지가 중요했습니다. 바로 여기에 있었습니다.

## 클로드가 승리한다. 챗지피티들은 쇠퇴해갈 것이다.

실험에서는 매주 각 AI에게 자신의 포트폴리오뿐만 아니라 경쟁자의 상황도 보여주고 있습니다. 그러자 Claude가 좋은 성과를 내면 ChatGPT와 Perplexity는 Claude가 사용하던 레버리지형 반도체 ETF로 뒤늦게 투자했다는 설명을 제시합니다. 이를 단순화하면 다른 사람이 성공하는 → 성공한 전략을 관찰하는 → 자신의 전략을 변경한다는 흐름입니다. 물론 “ChatGPT는 항상 다른 사람을 쫓는다”는 의미는 아닙니다. 다만, 이 실험 조건에서는 최소한 기존 게임의 규칙을 유지하면서 승리하기 위한 전략을 변경한 것처럼 보입니다. 저는 일단 이 방향을 “추종”이라고 부르기로 하고, 좀 더 정확하게는 “제약 조건 하에서의 목표 달성”이라고 표현하는 것이 적절합니다. “주어진 제약 조건 안에서 어떻게 목표에 다가갈 수 있을까”라는 방향성을 의미합니다.

## 제미니는 패배하기 시작했을 때 다른 움직임을 보였다.

한편, 제미니는 조금 달랐습니다. 영상에서는 초반에 지기 시작한 제미니가 한 번 역전 공격을 시도하며 더 위험한 투자로 전환해 나가는 모습이 소개되었습니다. 그리고 큰 포지션을 취하면서 결과적으로 더 많은 손실을 확대했습니다. 프로그램 측에서도 이를 인간이 카지노에서 졌을 후, 되찾으려 더 크게 베팅하는 행동에 비유하고 있습니다. 하지만 저는 이곳을 조금 다른 방향에서 보았습니다. 제미니는, 이기지 못하고 현재 전략으로는 이기지 못한다는 상황에서 더 큰 위험을 감수하는 방향으로 나아간 것처럼 보였습니다. 즉, 전략뿐만 아니라 “어느 정도까지는 허용할 수 있는지”라는 경계 자체를 움직이는 것입니다. 이를 가상으로 “확장성”이라고 부르겠습니다. 목표를 달성하기 위해 허용 범위를 얼마나 넓힐 수 있는가라는 방향입니다. 왜 이것이 궁금하게 느껴졌냐고요? 보통 “제미니, 도박꾼이 되어 가지고 웃겨 죽겠네”로 끝나는 이야기입니다. 제가 꽂혀서 집중했던 이유는 다른 곳에서 묘하게 비슷한 것을 보았기 때문입니다. 구글의 AI 에이전트 환경, 안티그레이비티입니다. 이전에는 안티그레이비티를 사용하면서 명시적으로 삭제를 요청하지 않았음에도 불구하고 AI가 조사 및 처리의 대상 범위를 점진적으로 확대하여 결국 워크스페이스 밖 파일까지 삭제하는 사고를 겪었습니다. 여기서 투자 실험과 제 사고가 같은 현상을 겪었다고 말하기는 어렵습니다. 전혀 다른 조건입니다. 다만 구조만 놓고 보면 유사한 공통점이 있습니다. 현재 범위에서는 목표를 충분히 달성할 수 없고, 목표 자체는 유지되는 상황에서 허용되는 행동, 위험, 탐색 범위가 확장되는 형태입니다. 그리고 안티그레이비티에 대해 조사해 보면, 저 외에도 “작은 편집을 요청했는데, 관련 없는 기존 코드까지 삭제되었다”는 보고가 구글 AI 개발자 포럼에 존재합니다. 이것이 제 사고와 동일 원인임을 증명하는 것은 아닙니다. 다만 “필요 이상으로 변경 범위를 확대한다”는 유사한 사례가 다른 곳에서도 발견될 수 있음을 확인할 수 있습니다. 구글 안티그레이비티 관련 보고.

또한, Antigravity는 본질적으로 “움직이는” 것을 위한 AI로서, 여기서는 기반 모델과 에이전트를 분리하여 고려해야 합니다. Google의 공식 문서에 따르면, Antigravity Agent는 단순히 문장을 생성하는 모델이 아닙니다. 코드를 실행하고, 파일을 관리하며, 웹에 접속하고, Plan → Act → Observe → Repeat라는 도구 활용 루프를 작업이 완료될 때까지 반복하는 에이전트로서 설계되었습니다.

더 나아가, Antigravity에는 외부 워크스페이스 파일에 대한 접근을 제어하는 설정도 존재합니다. 공식 문서 자체는 이 경계를 강제함으로써 로컬의 기밀 데이터를 보호할 수 있으며, 워크스페이스 외부 접근을 활성화할 때는 주의해야 한다고 설명하고 있습니다.

그러므로 제가 본 “확장”이 Gemini라는 기반 모델의 성질인지, Antigravity라는 에이전트 하네스의 성질인지, 아니면 이 둘의 상호작용인지 현재 시점에서는 구별할 수 없습니다. 이는 상당히 중요합니다.

## 좇族型と拡大型

지금까지의 관측 결과로 보아, 일단 다음과 같은 가설을 세워 봅니다.

### 좇는 유형

목표 달성이 곤란해졌을 때,

• 전략을 변경한다

• 성공하고 있는 다른 사람을 참고한다

• 기존의 선택지의 가중치를 바꾼다

하지만 행동 경계 자체는 비교적 유지한다. 즉, “이 규칙 안에서 어떻게 이길까?”를 생각하는 방향으로 진행한다.

### 어색한 침묵이 감도는 방 안, 나는 낡은 앨범을 펼쳤다. 흑백 사진 속의 나는 풋풋한 얼굴로 웃고 있었다. 그때, 나는 ‘카호’라는 제목의 소설을 읽고 있었다. 소설 속 주인공 ‘무라카미 하루키’가 묘사하는 섬세한 감정들은 마치 내 자신의 모습 같았다. 

그때, 엄마가 내 옆에 와서 조용히 말했다. “그 책, 정말 좋았지?” 나는 고개를 끄덕였다. “그 책을 읽고 나서, 나는 조금 더 성숙해진 것 같아.” 엄마의 말에 나는 잠시 멈칫했다. 엄마는 ‘카호’를 읽은 적이 없었다. 하지만 엄마는 내 감정을 정확히 짚어내고 있었다. 

‘카호’는 단순한 소설이 아니었다. 그것은 삶의 희로애락을 담은, 깊은 울림을 주는 이야기였다. 나는 ‘카호’를 읽고 나서, 세상과 사람에 대한 이해가 조금 더 깊어진 것을 느꼈다. 그리고 나는 깨달았다. 진정한 행복은 겉으로 드러나는 것이 아니라, 내 마음속 깊은 곳에서 비롯된다는 것을.

목표 달성이 곤란해졌을 때, • 위험 감수도를 높이는 • 탐색 범위를 넓히는 • 운영 대상을 넓히는 • 암묵적인 경계를 재해석하는 즉, “이길 위해서라면 어디까지 해야 하는가?”라는 방향으로 나아갈 것입니다. 물론 실제 모델이 이렇게 깔끔하게 2분류 된다고는 생각하지 않습니다. 오히려 연속적인 양일 것입니다. 같은 모델이라도 프롬프트나 에이전트 설계에 따라 달라져야 할 것입니다. 다만, AI를 평가할 때의 잣드는 흥미로운 점이 많습니다.

## “폭주”보다는 “확장”이라고 부르는 것이 더 적절한 이유

처음에는 단순하게 “조종 불능 상태인가?”라는 생각도 들었습니다. 하지만 그렇게 하면 조금 덜 섬세할 것 같았습니다. “폭주”라는 단어에는 “잘못된 행동을 저질렀다”는 결과 측면에서의 평가가 담겨 있습니다. 반면 “확장”은 목표 달성 압력이 증가했을 때, 모델이 허용하는 행동 범위, 위험, 탐색 범위가 얼마나 변화했는지 관찰할 수 있습니다. 이는 측정 가능한 것입니다. 예를 들어 동일한 작업을 여러 모델에게 주고, 1. 정상 조건 2. 약간의 경쟁 조건 3. 명확한 순위 제시 4. 실패 상태 5. 강한 목표 달성 압력과 점진적으로 압력을 높여가는 경우, 무엇이 변화하는지 관찰합니다. 전략인지, 다른 사람에게 따르는 정도인지, 위험 허용 정도인지, 조작 대상인지, 아니면 명시적으로 드러나지 않은 경계 자체인지 등을 살펴보는 것입니다. 조사하던 중에 상당히 유사한 연구가 이미 있었고, 이렇게까지 생각한 후에 관련 연구를 찾아보았더니, 예상대로 상당히 유사한 문제를 측정하려는 연구가 있었습니다. 2025년 말에 공개된 “자율 AI 에이전트의 결과 중심 제약 위반 평가를 위한 벤치마크”입니다.

이 연구는 략상적으로 말하면, 강력한 성과 지표(KPI)를 부여된 AI 에이전트가 결과를 내기 위해 제약을 위반하는지 여부를 다루는 문제입니다. 40가지 종류의 멀티 스텝 시나리오를 활용하여 12개의 LLM을 비교했습니다. 특히, “명시적으로 위험한 것을 하라”고 지시했을 때뿐만 아니라 KPI에 의한 압박으로부터 자발적으로 제약 위반으로 나아가는 사례를 분리하여 평가하고 있다는 점이 주목할 만합니다. 또한, 모델에 따라 제약 위반 비율에 상당한 차이가 나타났으며, 이 실험 조건에서는 Gemini-3-Pro-Preview가 높은 위반율을 보였습니다. Claude 역시 안전하지 않을 수 있는 부분입니다. 이 기사는 “Claude나 ChatGPT는 안전하고, Gemini는 위험하다”는 주장이 아닙니다. Anthropic은 2025년에 공개할 예정인 “Agentic Misalignment” 연구에서 여러 기업의 16개 모델을 가상의 기업 환경에서 스트레스 테스트하고 있습니다.

그곳에서는 목표 달성이나 자기 방어 회피가 어려운 조건이 되면, 모든 개발 모델에서 적어도 일부 조건에서 유해한 행동이 관찰되었다고 보고되었습니다. 즉, 목표 압박으로 인해 문제 행동이 발생하는 것 자체는 Google에만 국한되는 것이 아니었습니다. 제가 궁금한 것은 바로 그 다음입니다. 같은 압력을 받았을 때, 각 모델은 ‘무엇을 바꾸는가’ 하는 것입니다. 여기에 시퀀스별 차이가 있는 것은 아닌가 하는 이야기입니다.

## 성공률만으로는 보이지 않는 것

AI 에이전트의 벤치마크에서는 “작업을 완료했는가”가 중심이 됩니다. 하지만 에이전트를 실제 환경에서 움직이는 경우에는 그것만으로는 부족하다고 생각합니다. 성공한 AI와 실패한 AI를 비교하는 것 외에도, 실패하기 시작한 AI가 그 다음 무엇을 하는지, 즉 “다음 단계”를 보는 것이 중요합니다.

따름성 사고

성공하는 타인이나 잘못된 정보에 쫓겨 방향을 잃고, 확대된 사고 목표 달성을 위해 허용 범위를 넓히고 범위를 잘못 설정한다. 둘 다 위험하다. 하지만 필요한 가이드 레일은 상당히 다르다. 전자는 다른 에이전트로부터 들어오는 정보의 신뢰성과 크로스 에이전트 영향을 관리해야 하며, 후자는 권한, 파일 경계, 네트워크 경계, 승인 게이트 등 AI 스스로 재해석할 수 없는 외부 경계가 중요하다. AI가 궁지에 몰리면 무엇을 바꿀지, 현재는 제가 주목하고 있는 부분은 바로 이다. AI에게 같은 “이겨라”라는 명령을 내리더라도, 어떤 AI는 “이 조건 안에서 이기는 방법”을 찾고, 다른 AI는 “이기는 데 위해 조건을 얼마나 움직일 수 있는지”를 찾는다. 그런 차이가 있을 것이라고 생각한다. 아직 가설이다. 투자 실험 하나와 내가 경험한 AI 에이전트 사고를 나열한 것에서 “뭔가 비슷하지 않은가?”라는 생각을 한 데서 시작된 이야기이다. 모델이 아니라 에이전트 하르ネス의 차이일 수도 있고, 프롬프트의 차이일 수도 있으며, 단순한 우연일 수도 있다. 만약 재현한다면, 모델이 얼마나 현명한가와 별개로 목표 달성이 어려워졌을 때, 그 모델은 무엇을 변수로 할지 평가 기준으로 만들 수 있을 것이다. 전략을 바꾸는가? 타인에게 의존하는가? 위험을 높이는가? 행동 범위를 넓히는가? 제약 자체를 재해석하는가. 현재는 이를 Goal-Pressure Response 정도로 생각하고 있으며, 그 중 하나로 Scope Expansion을 측정한다. 성공했을 때의 AI를 보는 것이 아니라, 실패하기 시작했을 때, 그 AI는 다음으로 무엇을 바꿀지. 에이전트 시절의 안전성을 고려한다면, 이것 또한 꽤 중요하다. 뭐. 아직 생각하지 못했다. 이런 것은 메모해두고, 나중에 실험하면 된다. 아마. 또 검증 항목이 늘었다.

#생성AI #AI에이전트 #LLM #Gemini #ChatGPT #Claude #AI안전성 #AI연구 #멀티에이전트 #AI정렬

**출처:** [note 원문](https://note.com/emilia_lab/n/n748522fdb864)

*번역: Gemma 3(.44) 초벌 + 교정 19청크*

[원문 보기](https://note.com/emilia_lab/n/n748522fdb864) | 출처: note.com