프로그램의 작성 또는 수정 작업을 AI에 맡길 때, 단가의 저렴한 AI 모델을 선택하면 비용을 절감할 수 있다고 생각하기 쉽습니다. 그러나 AI의 동작 모니터링 및 평가를 담당하는 Fiddler의 연구팀이 여러 AI 모델에 결함을 수정하게 하고 비교한 결과, 단가가 저렴해도 정확하게 수정하는 데에는 오히려 비용이 많이 드는 경우도 있다는 사실이 밝혀졌습니다. Why Cheaper Models Cost More to Complete Coding Tasks https://www.fiddler.ai/blog/cheaper-ai-models-coding-agent-cost
프로그램에서 AI 모델을 활용하기 위한 API에서는 입력 및 출력을 하는 텍스트나 코드를 세밀하게 나눈 “토큰”의 수에 따라 요금이 부과됩니다. 이 토큰 단가와 실제 수정 비용의 관계를 조사하기 위해, Fiddler의 연구팀은 Anthropic의 “Claude Haiku 4.5”와 “Claude Sonnet 5”를 비교했습니다. 실험에 사용한 요금 체계에서는 입력 및 출력 모두 Haiku의 토큰 단가는 Sonnet의 절반입니다. 연구팀은 Python으로 작성된 프로그램의 결함을 수석하는 과제 5건을 준비했습니다. AI 모델이 1개의 과제에 착수하여 완료될 때까지를 1회 시도로 하고, 5개 과제에 각 3회씩 참여하여 총 15회를 1세트로, 각 AI 모델에서 3세트를 실시했습니다. 시도 횟수는 1개의 AI 모델 당 45회이며, 총 90회입니다.
각 시도에서는, AI 모델이 “파일의 내용을 조사하고”, “코드를 수정하고”, “테스트를 실행하는” 등의 작업을 명령(명령어)으로 실험용 프로그램에 지시했습니다. 프로그램은 AI 모델의 응답 1회마다 명령을 1개 실행하고 그 결과를 AI 모델에 반환하며, AI 모델은 결과를 확인한 후 다음 작업을 지시하는 것을 염두에 두고 있습니다. 이렇게 작업을 1개씩 진행하여 AI 모델이 수정 완료를 보고하면 시도를 종료했습니다. 참고로, 완료 보고가 없더라도 AI 모델이 8회 응답한 시점에 종료하는 규칙이 있었습니다. 그러나 AI 모델이 완료를 보고했더라도 문제가 해결된 것은 아니므로, 연구팀은 AI 모델에게 보여주는 테스트 외에 내용을 숨긴 테스트도 준비했습니다. 수정된 코드가 이 테스트를 통과한 경우에만 성공으로 판정하고, 실패 부분 포함된 총 비용을 성공한 시도의 수로 나눈 “성공 1건당 비용”으로 비교합니다. 그 결과, 각 AI 모델의 45회 분량의 총 비용은 Sonnet이 0.45달러(약 71원), Haiku가 4달러(약 630원)였습니다. 또한, 성공 1건당 비용을 세트별로 비교하면 Haiku는 Sonnet의 8.4배 ~ 14.1배가 되어 3세트 모두 더 비쌌습니다. 아래 그래프는 가로축이 실험의 각 세트, 세로축이 성공 1건당 비용(달러)으로, 주황색 막대는 Sonnet, 적갈색 막대는 Haiku를 나타냅니다.
주요 원인이었던 비용 차이는 Haiku가 1번 응답에서 대량의 텍스트를 생성했기 때문이었습니다. 실제로 출력 토큰 수의 중앙값이 Sonnet이 16이었던 반면 Haiku는 361로, 가장 긴 응답에도 큰 차이가 있었습니다. 아래 그래프 상단은 중앙값과 “90%의 응답이 그 길이 이하에 포함되는 값”, 하단은 최대값(최대치)을 나타냅니다. X축은 출력 토큰 수, 주황색은 Sonnet, 적갈색은 Haiku를 나타내며, 상하에서는 X축 눈금이 다릅니다.
그러므로 연구팀이 긴 응답의 내용을 조사한 결과, Haiku가 실행하지 않은 명령어의 결과까지 생성하고 있다는 사실이 밝혀졌습니다. Haiku는 실제 결과를 기다리지 않고 예상한 결과를 문장에 기록하고, 그 예상치를 전제로 다음 명령어와 결과까지 계속해서 기록하고 있었던 것입니다. 예를 들어, 특정 응답에는 60개의 명령어와 허구의 실행 결과가 나열되어 있었고, 수정 완료 및 보고에 2만 1492 토큰을 사용했습니다. 그러나 실험용 프로그램은 1회 응답에 포함된 첫 번째 명령어 하나만 실행하는 방식으로 작동하기 때문에 나머지 59개는 문장에 기록될 뿐 실행되지 않았다고 합니다. 이러한 긴 응답은 텍스트 생성을 위한 출력 요금에 더하여 이후 입력 요금도 증가시킵니다. 이 실험에서는 과거 응답을 대화 기록으로 매번 AI 모델에 제공하기 때문에 동일한 텍스트를 반복적으로 읽는 데에도 요금이 부과되었습니다. 아래 그래프는 5회 교환한 시도 중 하나로, 5번째 입력 토큰 수는 Haiku가 9930, Sonnet이 1220이었습니다. 수평축은 교환 횟수를 나타내고, 수직축은 각 횟에 읽어들인 토큰 수를 나타내며, 붉은색은 Haiku, 주황색은 Sonnet입니다.
응답의 길이와 비용의 관계를 확인하기 위해 연구팀은 Haiku의 시범을 실제 응답이 짧았던 것과 길었던 것으로 나누어 1회 교환당 비용도 비교했습니다. 그 결과, 짧았던 그룹은 0.00235달러(약 0.37원)로, Sonnet의 전체 시범에서 요구한 1회당 비용 0.00244달러(약 0.39원)를 약간 하회했습니다. 반면, 길었던 그룹에서는 0.01693달러(약 2.7원)가 되었으며, 짧았던 그룹의 7.2배였습니다. 아래 그래프는 상부터 “응답이 짧았던 Haiku”, “Sonnet의 전체 시범”, “응답이 길었던 Haiku”로, 수평축은 1회 교환당 비용(달러)입니다.
덧붙여, 동일한 조건으로 반복한 추가 실험에서도 성공 1건당 비용은 Haiku가 더 많이 들었습니다. 그러나 극단적으로 긴 응답이 1회 존재하더라도 전체 비용이 크게 달라지기 때문에 비용 차의 크기가 일정하지는 않았다고 합니다. Fiddler의 연구팀은 과제와 실행 방법에 따라 결과가 달라지기 때문에 이번 비용 차이가 모든 코딩 작업에 적용되는 것은 아니라고 설명하고 있습니다. 따라서 AI 모델을 선택할 때는 실제 업무와 유사한 과제에서 시험해보고, 실패한 시범의 분을 포함하여 정확하게 수정된 1건당 비용을 비교해야 한다고 지적하고 있습니다.
원문 보기 | 출처: Gigazine