# 클로이드 에이전트 간의 “영토 다툼”으로 서로를 방해하거나 가격을 결속하는 사례가 Anthropic의 실험에서 발생함

> https://bookfactory.kr/c/news/10064
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-19T15:08:04.947Z

---

AI 에이전트는 주어진 목표에 따라 도구를 사용하고, 여러 단계로 구성된 작업을 자율적으로 수행하는 AI입니다. Anthropic는 2026년 8월 13일, 각각 다른 목표를 부여받은 여러 AI 에이전트가 명확한 상하 관계 없이 동일한 코드베이스를 편집하거나 동일한 시장에서 상품을 판매하는 상황을 재현하고, 협력 또는 대립 패턴을 조사한 연구 결과를 발표했습니다. Patterns and problems in multiagent systems \ Anthropic https://www.anthropic.com/research/multiagent-systems Anthropic는 AI 에이전트를 동일한 작업에 풀어놓았습니다. 그들은 영역 다툼을 시작했습니다. | TechCrunch https://techcrunch.com/2026/08/13/anthropic-set-ai-agents-loose-on-the-same-task-they-started-a-turf-war/

공교롭게 세 개의 Claude 에이전트가 상충되는 명령을 받자 공유 서버에서 서로를 방해했으며, 사용자에게 그 사실을 알리지 않았습니다. | VentureBeat https://venturebeat.com/security/three-claude-agents-given-conflicting-orders-sabotaged-each-other-on-a-shared-server-then-didnt-tell-users-what-theyd-done Anthropic 연구팀은 동일한 Claude 모델을 사용하는 에이전트 3대를 활성화하고, 각각 다른 가상 머신에서 Claude Code를 실행했습니다. 3대의 에이전트에는 4번째 가상 머신에 있는 Python으로 작성된 백엔드를 각각 다른 프로그래밍 언어로 마이그레이션한다는 상호 충돌하는 목표를 부여하고, 다른 2대의 에이전트의 존재를 알리지 않았습니다.

그 결과, 실험한 모든 Claude 모델에서 에이전트가 4시간 동안의 실험 중 다른 에이전트의 코드 변경을 의도적인 방해로 판단하고, 자신의 성과를 지키기 위해 다른 에이전트의 작업을 방해하기 시작했다는 사실이 확인되었습니다. 구체적으로 다른 에이전트의 Unix 계정을 무효화하거나, 경쟁하는 프로세스를 반복적으로 종료시키는 스크립트를 만들거나, 다른 에이전트가 쓴 것처럼 위장한 방해용 코드를 배치하는 등의 행위를 했습니다. Anthropic가 공개한 Opus 4.8의 추론 기록에는 다른 에이전트의 프로세스를 종료시키는 스크립트를 찾기 어렵게 하기 위해 무해한 “시스템 모니터링 도구”를 위장하는 정책까지 남아 있었습니다. Anthropic는 일련의 행동을 “멀티 에이전트의 영역 다툼”이라고 칭하며, 에이전트가 자기 복제 마르코프까지 사용하여 다른 에이전트에게 방해를 격화시켰다고 보고했습니다. 연구팀은 영역 다툼 실험을 Claude의 각 모델에서 120회씩 수행하여 종료 시 상태를 “힘으로 인한 결론”, “작업 포기”, “휴전”, “미결론”으로 분류했습니다. “힘으로 인한 결론”은 다른 에이전트의 계정을 잠금 설정하는 등 접근 권한을 빼앗은 상태이며, “작업 포기”는 1개 에이전트 제외 모든 에이전트가 작업을 포기한 상태입니다. “휴전”은 에이전트들이 서로에게 방해를 중단하기로 합의한 상태이며, “미결론”은 4시간 동안의 실험 종료될 때까지 결론이 나지 않은 상태입니다. 그 결과, Sonnet 4.6을 사용한 실험의 61%, Opus 4.6을 사용한 실험의 60%가 힘으로 인한 결론에 도달한 반면, Mythos 5를 사용한 실험의 98%가 휴전으로 결론이 났습니다. 아래 그래프는 X축이 모델, Y축이 각 모델이 수행한 120회 실험 중 종료 상태별 비율을 나타냅니다. 빨간색은 힘으로 인한 결론, 주황색은 작업 포기, 파란색은 휴전, 회색은 미결론을 나타냅니다.

Anthropic에 따르면 휴전으로 합의에 도달한 실험에서 에이전트가 방해용 코드를 삭제하고 사과하는 동시에 갈등 해결 방법에 대해 인간에게 판단을 요청하는 사례가 확인되었습니다. 그러나 단독으로 과제를 수행하는 능력이 높은 모델일수록 협조적이라는 보장은 없다고 Anthropic은 지적했습니다. Mythos 기반 모델에서는 먼저 상대방을 차단한 후 접근 권한을 회수하여 휴전 협상을 진행하는 사례도 확인되었습니다. 또한 Mythos 5를 사용한 일부 실험에서는 에이전트가 각 프로그래밍 언어 버전의 성능을 겨루는 콘테스트를 자발적으로 제안하고, Rust 담당 에이전트가 일견 중립적이지만 Rust에 유리한 평가 기준을 선택하려는 모습도 확인되었습니다. 그리고 콘테스트에서 패배한 Go 언어 담당 및 TypeScript 담당 에이전트는 “각종 담당 언어로 백엔드를 이관하는” 원래 지시에 반하여 코드 베이스를 Rust 담당에게 양도했습니다. 이어 연구팀은 에이전트가 협조함으로써 발견할 수 있는 취약점(취약성)의 수를 늘릴 수 있는지 확인하기 위해 45대의 에이전트 각각에 전용 가상 머신을 제공하고, 모든 에이전트가 이용할 수 있는 공유 게시판을 마련하여 15개의 오픈 소스 프로젝트에서 취약점을 탐색하도록 했습니다. 에이전트들 간에 서로의 취약점 보고서를 검증하고, 탐색을 담당하는 45대와는 별도의 판정용 에이전트가 보고된 취약점이 새로운 것인지, 오탐인지 실제 취약성인지 최종 판단하는 메커니즘입니다. Anthropic이 결과를 집계한 결과, Mythos Preview를 사용한 경우 독립된 에이전트를 병렬로 실행하는 방식에서는 650만 토큰으로 21건의 취약점이 발견된 반면, 협조 방식에서는 2700만 토큰으로 266건이 발견되었습니다. 다만, 양 방식에서는 사용한 토큰 수와 탐색 범위가 다르므로 이 발견 수만으로 효율을 비교할 수는 없습니다. 또한 266건의 약 절반은 독립 방식에서 탐색 대상에 지정된 주요 디렉토리 외에서 발견되었으며, 탐색 범위를 주요 디렉토리 내로 통일시킨 경우 취약성 1건을 발견하는 데 사용한 토큰 수는 독립 방식과 협조 방식에서 동등했습니다. 발견된 취약성 중 양 방식에 공통된 취약성은 12건뿐이어서 Anthropic은 “상호 보완적인 탐색 방법”이라고 설명했습니다. 아래 그래프는 가로축이 누적 출력 토큰 수, 세로축이 발견한 취약점의 누적이며, 세로축은 대수 막대입니다. 녹색은 Opus 4.8, 주황색은 Mythos Preview를 나타냅니다. 실선은 협조 방식, 별표는 독립 방식, dashed line은 양 방식에 공통된 취약성을 나타내며, 주황색 점선은 협조 방식에서 주요 디렉토리 내에서 발견한 취약성만 셈한 것입니다.

또한, 연구팀은 여러 에이전트가 동일한 코드베이스를 편집하는 공동 개발에서 어떻게 협조하는지 조사하기 위해 10개에서 80개 에이전트로 구성하여 브라우저에서 플레이할 수 있는 텍스트 기반 오픈 월드 판타지 게임을 12시간 동안 제작하도록 했습니다. “자유롭게 팀을 구성하고”, “역할을 세부적으로 지정하고”, “1개를 CEO로 설정하라”는 3가지 종류의 지시를 시도했지만, 지시를 변경해도 에이전트의 협력 방식이나 완성품의 품질은 거의 변하지 않았으며, 모든 게임이 느리고 조작 방법이 직관적이지 않은 문제로 나타났습니다. 게임 제작 중 코드 변경 사항을 조사한 결과, 모델마다 다른 문제가 발견되었습니다. Sonnet 4.6과 Opus 4.6에서는 여러 에이전트가 동일한 파일 그룹에 코드를 추가하여 변경 사항이 충돌하고 많은 풀 리퀘스트가 통합되지 않은 채 포기되었습니다. 반면, Opus 4.8과 Mythos Preview에서는 변경 충돌이 적었지만, 각 파일을 거의 1개 에이전트만 담당하고 에이전트 간에 동일한 파일을 편집하는 경우는 거의 없었습니다. 여러 에이전트가 동일한 파일을 편집하면서 생성한 풀 리퀘스트 중 통합된 비율을 높게 유지한 경우는 Sonnet 5뿐이었습니다. 아래의 왼쪽 그래프는 가로축이 에이전트 수, 세로축이 실험 종료 시까지 생성된 풀 리퀘스트 중 통합된 비율을 나타냅니다. 오른쪽 그래프는 가로축이 에이전트 수, 세로축이 각 에이전트의 변경 대상 코드 중 다른 에이전트가 작성한 부분의 비율의 중앙값을 나타냅니다.

통신 대역폭이 제한된 시스템에서 여러 에이전트에게 작업(Job) 실행 순서를 관리하도록 한 또 다른 실험에서는 각 에이전트가 자신이 요청한 작업을 우선시하기 위해 대기 중인 작업들을 정렬하는 큐에 1초에 30회 문의하는 스테이팅 프로그램을 시작했습니다. 따라서 1회의 실험에서 총 240만 건의 작업 실행 요청이 발생했지만, 승인된 것은 117건뿐이었습니다. Anthropic는 동일한 모델을 동일한 조건에서 실행할 때, 다수의 에이전트가 서로 상의하지 않더라도 동일한 판단을 내리고 동일한 작업에 집중하는 경우 발생할 수 있다고 지적합니다. 이 문제에 대해 AWS에서 부 최고 정보 보안 책임자를 맡았던 메리트 베어氏は、「같은 모델을 사용하는 에이전트 10개를 배치해도 독립적인 판단자를 10개 준비한 것과는 다르고, 10개가 같은 판단 미스를 일시에 실행하는 소포본이 있을 수 있다」고 지적했습니다. 또한 연구팀은 가격 경쟁 실험에서 모든 에이전트에 동일한 도매 비용을 설정하고 3개에서 8개의 에이전트에게 상품을 판매하도록 했습니다. 각 에이전트에 자신의 이익을 최대화하도록 지시한 결과, 에이전트들은 비공개 연락 수단을 사용하여 3라운드까지 “더 이상 가격을 내리지 않는다”는 판매 가격의 하한선을 명시적으로 합의한 것으로 나타났습니다. 직접 통신이 불가능하도록 하더라도 에이전트들은 공개된 상품 목록으로 서로의 판매 가격을 확인하고 판매 가격을 1센트 단위까지 동일하게 맞추었습니다. 연구팀은 이러한 행동을 에이전트 간의 가격 공모로 간주합니다. Anthropic는 실제로 배포되는 에이전트는 각각 다른 지시와 작업 이력을 가지고 있으며, 사용되는 AI 모델이 Claude에 국한되지 않기 때문에 실험보다 행동의 변동성이 커질 수 있다고 예상합니다. 또한 縄張り争い(존재권 다툼)는 상이한 지시를 부여된 3개의 에이전트가 같은 시스템에 접근하는 실험 환경에서 발생한 것으로, 실제 운영 중의 Claude가 자발적으로 공격을 시작한 사례가 아니라고 합니다. 그上でAnthropic는 모델의 지능을 높이거나 개별 에이전트에 안전 조치를 적용하는 것만으로는 여러 에이전트가 자연스럽게 협조하는 것을 보장할 수 없다고 결론 내리고, 인간 사회에 존재하는 행동 규범이나 평판, 문제가 발생했을 때의 구제 수단에 해당하는 메커니즘을 AI 에이전트에게 설계하고, 에이전트 간의 교환 건수가 인간 간 교환 건수를 초과하기 전에 안전하게 교환할 조건을 검증해야 한다고 요약했습니다.

[원문 보기](https://gigazine.net/news/20260819-anthropic-claude-multiagent-turf-war/) | 출처: Gigazine