# AI가 "Brood War Bench" 출시, 모든 모델이 초보 수준으로 Codex Astra는 18전 전승

> https://bookfactory.kr/board/news/19074
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-29T05:46:23.197Z

---

AI 에이전트에게 실시간 전략 게임 “스타크래프트: 브루드 워”를 조작시켜 대전 능력을 비교하는 벤치마크 “브루드 워 벤치”를 소프트웨어 엔지니어인 벤·스워드로우(Ben Swerdlow) 씨가 공개했습니다. OpenAI 기반 및 Anthropic의 Claude, xAI의 Grok 등 19종류의 구성 에이전트와 대전한 결과, 최상위의 Codex Astra는 18전 전승을 기록한 반면, 스워드로우 씨는 “어떤 에이전트도 초보 수준을 넘어서지 못한다”고 보고했습니다. 브루드 워 벤치 https://bw.swerdlow.dev/report

스타크래프트: 브루드 워는 1998년에 등장한 실시간 전략 게임 “스타크래프트”의 확장팩입니다. 플레이어는 자원을 모으면서 시설과 병사를 생산하고, 부대를 움직여 적과 싸웁니다. 대전 중에도 시간은 멈추지 않기 때문에, 장기적인 전략뿐만 아니라 엿바꾸는 상황을 파악하고 다음 행동을 빠르게 결정하는 능력이 요구됩니다. 스타크래프트 시리즈는 이전부터 AI 연구의 대재료로 사용되었습니다. 구글 산하 AI 기업 DeepMind가 개발한 “알파스타”는 “스타크래프트 2”를 플레이하기 위해 전용 뉴럴 네트워크를 훈련한 AI로, 2018년 12월에 프로게이머인 TLO(다리오 벝슈)와 MaNa(그제고슈 코민취)를 상대로 10연승을 기록했습니다. 알파스타는 이후 온라인 대전에서 인간의 상위 0.2%에 해당되는 그랜드마스터에도 도달했습니다. DeepMind의 AI “알파스타”가 세계 최정상 플레이어를 상대로 “스타크래프트 2”에서 10-1의 압승 - GIGAZINE

브루드 워 벤치가 탄생하게 된 계기는 스워드로우 씨가 친구들과 함께 즐기기 위해 “AI 에이전트 경로를 통해서만 조작 가능한 브루드 워”를 만들었기 때문이라고 합니다. 스타크래프트를 거의 해본 적이 없는 친구가 AI에게 “공격해”라고 요청했을 때, AI가 소규모 군대를 만들어 공격까지 실행했습니다. 이에 스워드로우 씨는 인간으로부터 세세한 지시가 없었을 때 AI가 어디까지 싸울 수 있는지 의심하고 브루드 워 벤치를 제작하게 된 것입니다. 알파스타가 스타크래프트 2를 플레이하기 위해 훈련된 전용 AI였던 것에 반해, 브루드 워 벤치에서는 평소에는 텍스트 생성이나 프로그래밍 등 다양한 업무에 사용되는 범용 AI 에이전트인 “스타크래프트: 브루드 워”에 참여시켜 “범용 AI에게 실시간으로 진행되는 게임을 맡기면 어디까지 자력으로 대응할 수 있는지”를 측정합니다.

브루드 워 벤치에서는 모델 및 추론량 설정을 조합한 19개의 구성을 준비하여, 각 구성이 나머지 18개 구성과 대전하는 총当たり전을 실시했습니다. 총 171경기를 여러 가상 머신에서 병렬적으로 실행했으며, 게임 엔진에서 얻어지는 데이터와 각 AI 에이전트의 로그도 저장하고 있습니다. 로그를 기록함으로써, AI가 게임 중에 어떤 판단과 행동을 했는지까지 확인 가능하도록 되었습니다. 아래 이미지는 브루드 워 벤치의 총 합성 득점입니다. 코덱스 아스트라의 추론량 “xhigh”가 18승 0패로 1위를 차지했으며, 코덱스 아스트라의 medium이 16승 2패, 클로드 페이블이 15승 3패로 뒤를 잇고 있습니다.

실시간 게임에서는 AI가 추론하는 동안에도 상대방이 계속 행동을 지속합니다. 스워드로우氏에 따르면, 오래된 모델에는 Brood War를 턴제 게임처럼 취급하는 경향이 있었으며, 생각하는 동안 공격받아 파괴되는 상황이 발생했습니다. 일부에서는 추론량을 제한한 설정이 더 좋은 성과를 보였으며, 판단의 질과 행동 속도가 모두 필요한 과제임을 시사합니다. Codex 계열의 AI가 능숙하게 활용했던 전략은 초반부터 상대방을 방해하는 것이었습니다. 프로토스를 조작한 경기에서는 자원 채취를 담당하는 Probe를 적 진지에 보내어 상대방의 노동 유닛과 건물을 공격하는 행동을 반복했습니다. 상대방 측 AI가 1개의 Probe에 대한 대처를 수십 초 동안 고민하는 사례가 있었으며, 단순한 방해로도 효과가 있었던 것으로 나타났습니다.

한편, 군대를 지속적으로 생산하고 모아서 공격하는 장기 운용에 어려움을 겪었습니다. Codex는 경제 운영, 병사 생산, 군대 조작을 별도의 서브 에이전트에게 담당하도록 할 수 있었지만, 각 담당 간의 연계가 불충분하여, 새로 완성된 병사를 1개씩 적 기지로 보내는 사례도 확인되었습니다. 스워드로우氏は 충분한 병력이 모일 때까지 기다릴 수 없다는 초보자들이 흔히 저지르는 실수라고 설명했습니다. Anthropic의 Claude Fable은 다른 플레이 경향을 보였습니다. Fable은 자원을 모으고 시설을 늘리고, 더 높은 수준의 유닛을 사용할 수 있도록 기술 트리를 발전시키는 경향이 있었습니다. 한 경기에서는 Lair와 Spire를 건설하여 파일럿 유닛인 Mutalisk까지 생산하여 승리했으며, 다른 경기에서는 Robotics Facility와 Templar Archives 등 여러 고급 시설을 건설했습니다. 그러나 기술 개발에 성공했음에도 불구하고 군대로 제대로 운영하지 못하고 패배하는 사례도 있었습니다.

특히 어려움을 겪었던 것은 Grok 4.6입니다. 추론량을 최대화한 Grok 4.6은 한 경기에서 1만 1138 토큰 분량의 추론을 수행했지만, 43분 동안 게임에 전달한 명령은 단 6회에 불과했습니다. 전투 유닛을 1개도 완성하지 못하고 경기를 종료했습니다. 또 다른 경기에서도 Marine을 3체 만들었지만 적 기지에 도달하지 못했으며, 스ワードロウ氏は 전략 자체보다 “상황을 관찰하고 행동하는” 일련의 루프를 유지하지 못하는 것처럼 보였다고 설명했습니다.

하지만 18전 전승의 Codex Astra를 포함하여 인간 StarCraft 플레이어와 비교하면 여전히 큰 차이가 있습니다. 스워드로우氏에 따르면 Codex Astra나 Claude Fable로도 복잡한 군대를 편성하거나 단순한 공격을 막거나 구체적인 전략을 실행하는 단계에는 도달하지 못했습니다. 스워드로우氏は 초심자가 “Photon Rush”라고 불리는 초반의 속공 전술을 사용하면 모든 에이전트에 승리할 수 있을 것이라고 말했습니다. 스워드로우氏は AI 에이전트에게는 배우べき 것이 아직 많고, 벤치마크 측에도 시도해 볼 과제가 많이 남아있는 것으로, 앞으로 AI가 어디까지 발전할지 지켜보는 것을 기대한다고 밝혔습니다.

[원문 보기](https://gigazine.net/news/20260925-starcraft-brood-war-bench/) | 출처: Gigazine