# DeepSeek V4 Flash는 벤치마크 점수는 높지만 실제 작업에서는 어려움을 겪고 있다는 지적

> https://bookfactory.kr/c/news/10022
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-19T05:20:00.589Z

---

중국 AI 기업 DeepSeek은 고성능 AI 모델 “DeepSeek-V4 Flash” 및 “DeepSeek-V4 Pro”를 제공하고 있습니다. V4 Flash는 출시 이후 “저렴하면서도 고성능”이라는 평가로 이용 순위에서 꾸준히 상위권을 차지하며 인기를 모았지만, DeepSeek은 2026년 8월 6일에 가격 인상을 통보하고 있으며, 실제 에이전트 환경에서는 벤치마크 점수만큼 높은 성능을 발휘하지 못하는 사례가 있다는 지적이 있습니다. DeepSeek의 상위 등재된 V4 Flash는 실제 에이전트 작업에서 가격 상승으로 인해 어려움을 겪음 | VentureBeat https://venturebeat.com/orchestration/deepseeks-top-ranked-v4-flash-stumbles-on-real-agent-tasks-as-its-prices-surge

DeepSeek-V4 Flash는 2026년 4월 24일에 출시되었으며, 2026년 7월 31일에는 업데이트 버전인 “DeepSeek-V4-Flash-0731”이 출시되었습니다. DeepSeek-V4-Flash-0731은 총 파라미터 수 2840억, 활성 파라미터 수 130억의 MoE 모델이며, 제3자 기관인 Artificial Analysis가 실시한 인텔리전스 성능 테스트에서는 Google의 Gemini 3.6 Flash와 동등 성능으로 평가되었으며, 오픈 모델 중에서는 Kimi K3와 GLM-5.2에 이은 성능으로 평가되었습니다. 또한, 코딩 성능에서는 GLM-5.2를 상회하는 데 더불어, 에이전트 성능에서는 Gemini 3.6 Flash를 크게 상회하며 OpenAI의 GPT-5.6 Luna를 0.1점 상회했습니다. “DeepSeek-V4-Flash-0731”이 출시되면서 GPT-5.6 Luna보다 저렴하고 동등 성능의 오픈 모델 - GIGAZINE

DeepSeek-V4 Flash는 비용 효율성에서도 특징적이었습니다. OpenAI는 2026년 7월 31일에 GPT-5.6 시리즈의 대폭 인하를 발표했지만, 그 수 시간 후에 발표된 DeepSeek-V4 Flash는 GPT-5.6 시리즈보다 훨씬 저렴한 가격으로 설정되었습니다. 그러나 2026년 8월 6일에 DeepSeek은 사용자에게 “API 요금의 대폭 인상”을 통보했습니다. 요금 인상의 이유는 설명되지 않았지만, 일부에서는 “DeepSeek은 전례 없는 수요 급증에 대응하고 있다”고 합니다. 또한, 수요 급증으로 인해 모델의 추론 속도가 간헐적으로 극단적으로 느려지는 사례도 보고되었습니다. DeepSeek이 API 요금의 대폭 인상을 예고하고, 저가 전략으로 인한 수요 급증이 배경에 있음을 – GIGAZINE

이런 DeepSeek-V4 Flash의 성능에 대해, 공식 발표의 벤치마크만큼 뛰어나지 않을 가능성이 제기되고 있습니다. AI 에이전트용 플랫폼인 “Composio”는 DeepSeek-V4 Flash를 이용하여 4개의 에이전트 하르ネス에서 30개의 에이전트 작업을 수행한 결과를 발표했습니다. 작업은 Gmail, GitHub, Slack, Google Sheets와 같은 실제 도구를 교차하는, 난이도가 높은 다단계 작업이 의도적으로 설정되었습니다.

딥시크 V4 플래시를 클로드 코드, 코드엑스, 오픈코드, 오미파(Oh My Pi) 4가지 에이전트 하셀릿에서 30가지 에이전트 태스크를 실행했습니다. 각 하셀릿마다 성공률, 비용, 속도 측면에서 승리했습니다. 🧵🧵🧵

결과적으로 총 240회 실행 중 129회가 성공했으며, 테스트한 모든 하셀릿에서 정상적으로 완료된 워크플로우는 30건 중 단 6건에 불과했습니다.

다음은 30가지 태스크에 대한 성공률입니다.
- 오미파(Oh My Pi): 17/30
- 클로드 코드(Claude Code): 16/30
- 코드엑스(Codex): 16/30
- 오픈코드(OpenCode): 14/30
무려 7가지 태스크가 사용한 하셀릿에 따라 성공 또는 실패했습니다. pic.twitter.com/OLuy6jCBQl

또한, 다음은 성공한 태스크별 추정 비용입니다. 가장 비싼 하셀릿조차도 0.2달러(약 32엔) 이하로 떨어졌으며, 성공률이 낮다는 점을 고려해도 비용 효율이 우수하다고 할 수 있지만, 딥시크의 가격 인상으로 인해 달라질 수 있다고 컴포지오(Composio)는 지적했습니다.

성공한 태스크당 추정 비용(실행 시 API 가격 기준):
- 오픈코드(OpenCode): $0.073
- 코드엑스(Codex): $0.081
- 오미파(Oh My Pi): $0.103
- 클로드 코드(Claude Code): $0.195
가장 비싼 하셀릿조차도 $0.20 미만으로 유지되었지만, 딥시크의 가격 인상으로 인해 달라질 수 있습니다. pic.twitter.com/RXyZWzTZnw

DeepSeek-V4 Flash는 에이전트 기반 벤치마크 점수에서도 높은 결과를 기록하고 있지만, 실제 높은 난이도의 작업에서는 성공률이 낮아졌습니다. AI와 사이버 보안을 전문으로 하는 작가인 타린 플럼브 氏は、「이 격차는 엔터프라이즈 환경에서 모델의 성공 여부를 좌우하는 것이 모델의 Raw 능력 자체가 아닌, 여러 시스템과 작업을 연계시키는 ‘오케스트레이션’이기 때문입니다.”라고 지적했습니다. 같은 모델이라도 실행 환경이 되는 하르ネス, 툴 구성, 캐시 동작, 재시도, 프로바이더 스택에 따라 결과가 크게 다릅니다. 기술 분석가 카미 레비 氏は, DeepSeek가 가격 인상 후에도 OpenAI, Anthropic, Google, xAI 등의 경쟁 모델과 비교했을 때 “가격 면에서 훨씬 저렴”하다고 언급하면서 에이전트 AI로서의 능력을 적절하게 배치하는 중요성을 설파했습니다. 예를 들어 배치 처리와 같은 작업은 고도의 지능을 필요로 하는 것이 아니라 정형적이고 반복적인 경우가 많으므로, 더 저렴하고 효율적인 모델을 사용하는 것이 적절합니다. 레비 氏は“기업은 기존의 제품을 전면적으로 대체하는 것이 아니라, 특정 워크로드에 대한 솔루션으로, 고성능 추론 엔진을 고려할 수 있습니다.”라고 밝혔습니다. 글로벌 기술 조사 및 컨설팅 기업인 Greyhawk Research에 소속된 산치트 비르 고기아 氏は “중요한 것은 AI 모델의 성능이 기업이 실제로 운영하는 워크플로우에 충분히 대응할 수 있는지 여부이며, 모든 벤치마크에서 상위권에 랭크되는 것이 아니라는 점입니다. 기업은 어떤 모델, 하르ネス, 프로바이더 조합이 가장 안전하고 저렴하게 작업을 완료할 수 있는지를 판단해야 합니다.”라고 말했습니다.

[원문 보기](https://gigazine.net/news/20260819-deepseek-v4-flash-agent/) | 출처: Gigazine