AI 유료로 제공되는 기업들은 고성능 모델을 높은 가격으로, 저성능 모델을 저렴한 가격으로 제공하고 있습니다. 합리적인 가격으로 AI를 사용하고 싶다면 저렴한 쪽을 사용하는 것이 좋게 보이지만, 특정 작업의 경우 고성능 모델을 사용하는 것이 결과적으로 더 저렴하게 돌아올 수 있다는 점이 나타났습니다.
The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More - 2603.23971v2.pdfhttps://arxiv.org/pdf/2603.23971
It’s Nearly Impossible to Budget for AI Spending - WSJhttps://www.wsj.com/tech/personal-tech/ai-token-spending-businesses-431ee94a
Cheaper AI Models Cost More in 32% of Tests, Study Findshttps://www.implicator.ai/cheaper-ai-models-cost-more-price-reversal-study/
스탠포드 대학교, 카네기 멜론 대학교, 캘리포니아 대학교 버클리 캠퍼스, 마이크로소프트 리서치로 구성된 연구팀은 동일한 작업을 저가 모델과 고가 모델이 어떻게 수행하는지 조사하기 위해 최첨단 AI 모델 8종류에 수학, 프로그래밍, 과학 등 6800개 이상의 작업을 실행하도록 연구를 진행했습니다. 그 결과, 32%의 경우 저가 모델의 최종 총 비용이 고가 모델보다 높아지는 현상이 확인되었습니다.
예를 들어, 고가격 모델인 “Gemini 3.1 Pro”와 저가격 모델인 “Gemini 3 Flash”에 “유튜브 동영상을 매 프레임 분석하는”이라는 작업을 주었을 때, Gemini 3.1 Pro가 85단계로 작업을 완료시킨 반면, Gemini 3 Flash는 1,000단계 이상 걸려 결국 작업을 완료하지 못했다고 합니다. 작업에 소요된 가격은 전자가 1달러(약 158엔), 후자는 14달러(약 2211엔)였습니다. 연구팀은 AI의 “생각하기 지나치게”와 “행동하기 지나치게”가 원인이라고 지적하고 있습니다. 복잡한 작업의 경우, 억(億) 단위로 추론 횟수나 행동 횟수가 늘어나게 되어, 성능이 높은 모델이 더 빠르고 저렴하게 실행될 수 있습니다. 광범위한 분야를 대상으로 한 테스트에서는 Gemini 3 Flash가 6만 토큰(トークン)을 초과하는 사고 토큰을 소비한 반면, 더 고성능인 “GPT-5.4”는 25토큰으로 해결한 사례도 있었습니다.
또한, 인공지능 모델은 동일한 작업을 항상 동일한 가격으로 실행할 수 있는 것이 아니라는 점이 밝혀지고 있습니다. 연구팀이 동일한 지시를 같은 모델에서 반복적으로 실행한 결과, 가장 높은 시도가 가장 낮은 시도의 9.7배에 달하는 경우도 있었습니다. 筆頭저자의 린자오 첸(림쩌오 첸) 氏は“가격만 보고, 어떤 모델이 저렴한지 판단해서는 안 됩니다”라고 밝혔습니다.
원문 보기 | 출처: Gigazine