# AI 코딩 에이전트에게는 하르ネス가 얼마나 중요한가?

> https://bookfactory.kr/board/news/17405
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-17T23:11:17.175Z

---

AI 코딩 에이전트는 동일한 AI 모델을 사용하더라도, 모델을 실행하는 하네스에 의해 비용 및 성능이 달라질 수 있습니다. 캘리포니아 대학교 버클리 캠퍼스와 AI 랭킹 사이트 “Arena”의 공동 연구팀은 7개의 모델과 3개의 하네스를 조합한 21가지 조합을 2가지 벤치마크에서 비교했습니다. 그 결과, 작업의 성공률은 크게 변하지 않는 반면, 비용에는 최대 5배의 차이가 발생했으며, 모델 본래의 제공 원천이 아닌 하네스가 최적의 경우에 있을 수 있다는 사실이 밝혀졌습니다. HarnessTax: How Much Does the Harness Matter for Coding Agents? 코딩 에이전트를 평가할 때에는 사용되는 모델의 성능에 주목하길 쉽습니다. 그러나 실제 에이전트는 모델 단일로 움직이는 것은 아니며, 모델에 어떤 도구를 사용하게 할지, 어떤 정보를 컨텍스트에 전달할지, 명령을 어떻게 실행하게 할지といった 처리 방식을 “하네스”라는 툴이 관리합니다.

이번 연구에서는 “Claude Code”, “Codex CLI”, “Pi”라는 3가지 하네스를 비교했습니다. 대상이 된 모델은 Claude Fable 5, Claude Opus 4.8, Claude Sonnet 4.6, Claude Haiku 4.5, GPT-5.6 Sol, GPT-5.6 Luna, Kimi K3의 7가지입니다. 평가에는 소프트웨어 수정 능력을 측정하는 SWE-bench Lite와 명령줄 상의 어려운 작업을 평가하는 Terminal-Bench 2.0이 사용되었습니다. 연구팀은 각 벤치마크로부터 동일한 30개의 작업을 무작위로 선택하여 21가지 패턴을 가진 모델과 하네스의 조합으로 각 작업을 3회씩 실행했습니다. 각 하네스의 표준 설정을 출발점으로 하여 높은 추론 강도를 설정했으며, 1회 시도는 최대 100턴에 제한했습니다. 성공 판정에는 각 벤치마크가 공식적으로 제공하는 평가 프로그램을 사용했습니다. 각 모델과 하네스의 조합에 대해 SWE-bench Lite(왼쪽)와 Terminal-Bench 2.0(오른쪽)에서 작업의 성공률(가로축)과 평균 토큰 비용(세로축)을 나타낸 것이 다음과 같습니다. 계단 형태의 선은 특정 비용 이하로 얻어지는 최고 성공률을 나타내는 파레토 프론티어이며, 선의 가까이에 있는 조합일수록 비용과 성공률의 균형이 좋음을 의미합니다. 전체적으로 GPT-5.6 Luna가 양쪽 벤치마크에서 가장 낮은 비용을 보였으며, SWE-bench Lite에서는 Claude Fable 5가 가장 높은 성공률에 도달했습니다. 오픈 웨이트 모델의 Kimi K3도 SWE-bench Lite에서는 GPT-5.6 Sol과 가까운 위치에서 파레토 프론티어에 근접했으며, Terminal-Bench 2.0에서는 그 바로 아래에 위치했습니다.

연구에서 처음 제시된 결과는, 하네스의 차이가 작업의 정답률보다 비용에 훨씬 큰 영향을 미친다는 것입니다. 동일한 모델을 사용한다면 하네스를 바꾸어도 성공률은 크게 변하지 않는 반면, 필요한 비용에는 명확한 차이가 발생했습니다. 예를 들어, Claude Fable 5는 Claude Code로 시도한 97.8%의 성공률을 달성했으며, Codex와 Pi에서는 96.7%를 달성했습니다. Claude Code의 성공률은 약간 더 높았지만, 비용은 Pi의 약 2배였습니다. SWE-bench Lite에서는 일반적으로 이용 가능한 모델을 비교했을 때, Claude Code의 비용은 Pi의 약 2배, Codex의 약 1.6배였습니다. Terminal-Bench 2.0에서도 Claude Code는 Pi보다 약 1.5배 더 비쌌습니다. 반면, 하네스를 바꾼 것에 따른 성공률의 평균적인 차이는 SWE-bench Lite에서는 플러스 마이너스 2% 이내, Terminal-Bench 2.0에서도 대체로 플러스 마이너스 5% 이내에 도달했습니다. 연구팀은 거의 동일한 품질의 결과를 얻기 위해 불필요한 비용을 지불하는 상태를 “하네스세(Harness Tax)”라고 표현했습니다. 에이전트의 초기 설정을 그대로 사용하면 이 비용 차이를 놓칠 수 있습니다. 또한, 턴 수가 동등하더라도 1턴당에 처리하는 토큰량 등이 다르다면 지불하는 비용은 달라집니다. 예를 들어, Claude Fable 5를 SWE-bench Lite에서 돌린 경우, Pi의 평균 턴수는 15.4, Claude Code는 15.3로 거의 같았습니다. 그에도 불구하고, Claude Code의 비용은 약 2배였고, 성공률의 상승은 1.1 포인트에 그쳤습니다. 완료된 시도를 가장 저렴한 순으로 정렬하고, 누적 비용과 성공률의 관계를 나타낸 그래프는 다음과 같습니다. 실패한 시도도 비용으로 더해지므로, 동일한 성공률을 달성하기 위해선 어떤 하네스가 일찍 성공을 쌓아 올리는지에 따라 필요한 총 비용이 달라집니다. 비용 차이의 한 원인은 모델에 처음 전달되는 컨텍스트에도 있습니다. 컨텍스트는 작업 설명, 하네스의 지시, 이용 가능한 도구의 사양 등 모델이 첫 번째 판단을 내리기 위해 읽는 정보입니다.

다음 그래프는 SWE-bench Lite에서 모델이 처음 수신하는 정보량에 대해 Pi, Codex, Claude Code를 비교한 것입니다. 왼쪽에서 “사용 가능한 도구 수”, “도구 사양의 문자 수”, “명령문의 문자 수”, “초기 모델 호출에 포함된 입력 토큰 수”를 나타냅니다. 7개의 모델 전체적으로 볼 때, Claude Code의 초기 컨텍스트는 Pi의 10배를 초과했습니다. Claude Code에서는 Pi에 비해 명령문이 더 길고, 도구의 사양 또한 평균 약 7만 7천 문자 정도로 컸습니다. 초기 컨텍스트가 크다면, 그만큼 입력 토큰 처리 비용이 증가할 수 있지만, 최종적인 총 비용은 캐시의 이용 상황, 모델이 생성하는 토큰, 후속 호출 횟수 등에도 영향을 받습니다. 따라서 컨텍스트 양만으로 비용 차이의 전부를 설명할 수 있는 것은 아닙니다.

연구에서는 기능이 많은 하르ネス가 항상 유리하지 않다는 것을 보여줍니다. 오픈소스 Pi는 read, write, edit, bash라는 4개의 도구만 제공하는 단순한 구성이지만, SWE-bench Lite와 Terminal-Bench 2.0 양측에서 패러테 프론티어에 진입했습니다. 연구팀은 풍부한 기능을 갖추는 것이 성공률 향상에 직접적인 영향을 미치는 것은 아니라고 지적합니다. 실제 비용은 도구의 수뿐만 아니라, 지시문이나 도구 정의의 길이, 모델이 수행하는 호출 횟수, 생성되는 토큰 수 등의 조합으로 결정됩니다. Pi와 Codex가 기존 모델을 활용하면서 Claude Code와 동등한 성공률을 더 낮은 비용으로 달성한 것은 오픈소스 하르ネス 연구에 여지가 있음을 시사합니다. 연구자들은 프로피에타리 하르ネス에 대한 접근이나 모델과의 공동 학습이 없어도 최첨단 코딩 하르ネス에 참여할 수 있다는 의미입니다. 다만, 단순한 하르ネス가 항상 최적이라고 결정된 것은 아니라는 점을 유념해야 합니다. 이번 결과는 2개의 오픈소스 벤치마크에 한정되어 있으며, 모델이 이러한 벤치마크를 학습 시에 보았던 가능성도 있습니다. 다른 벤치마크나 실제 개발 작업에서는 더 많은 기능 가진 하르ネス가 유리할 수도 있습니다. 하르ネス의 복잡성은 기능의 많음으로 판단하는 것이 아니라, 용도에 따라 비용과 성능을 측정하고 평가해야 합니다. 더불어, 모델의 제공 원이 준비한 하르ネス를 사용한다고 해서 항상 최고 성능을 얻을 수 있다는 것을 알게 되었습니다. Anthropic의 모델과 Claude Code, OpenAI의 모델과 Codex CLI처럼, 제공원이 자사의 개발 환경에 맞게 모델을 최적화한 경우에도 그 조합이 우위였던 것은 아니었습니다. Anthropic과 OpenAI의 6개의 모델을 2개의 벤치마크에서 비교한 12가지 비교 결과에서, 최고의 성공률을 기록한 하르ネス가 모델 제공원과 다른 경우 9가지나 있었습니다. SWE-bench Lite와 Terminal-Bench 2.0에 대해 각 모델을 Pi, Codex CLI, Claude Code로 돌렸을 때 1회당 평균 토큰 비용과 성공률을 비교한 결과는 다음과 같습니다. 녹색 프레임은 모델ごとに 가장 낮은 비용과 가장 높은 성공률을 각각 나타냅니다. SWE-bench Lite에서 Claude Sonnet 4.6을 사용한 경우, Codex에서의 성공률은 68.9%이며, Claude Code의 66.7%를 상회했습니다. 양자 비용은 거의 비슷한 수준이었습니다. 또한, Terminal-Bench 2.0에서 GPT-5.6 Sol을 사용한 경우, Pi의 성공률은 83.3%이며, Codex의 78.9%를 상회했습니다. Pi의 비용은 Codex의 약 절반이었습니다.

연구팀은 이번 조사 결과에 대해 “모델의 능력이 특정 하르네스에 완전히 갇혀 있는 것이 아니라 다른 하르네스에도 적용될 수 있음을 시사한다”고 코멘트했습니다. 중요한 것은 “모델의 제공 원이 어디인가”가 아니라 “실제 작업에서 어떤 하르네스가 비용과 성공률의 균형을 가장 잘 유지할 수 있는가”인지에 달려 있다고 밝혔습니다.

[원문 보기](https://gigazine.net/news/20260917-harnesstax-ai-coding-agents/) | 출처: Gigazine