# 중국 LLM “신오강”을 徹底比較――MiniMax M3, GLM-5.2, Qwen3.8-Max, Kimi K3, DeepSeek-V4-Flash

> https://bookfactory.kr/c/ai-tech/9008
> 게시판: AI·머신러닝
> 작성자: admin
> 작성일: 2026-08-08T06:40:56.874Z

---

![見出し画像](https://assets.st-note.com/production/uploads/images/301063763/rectangle_large_type_2_4c2b4bc6a6176e7c79af3775ce8a206a.png?width=1280)

## 2026년, 중국 AI는 “대화”에서 “업무 완수”로

최종 업데이트: 2026년 8월 6일 (공식 자료, 공식 모델 카드, 제3자 평가를 통해 재검토) 비교 대상: MiniMax M3 / GLM-5.2 / Qwen3.8-Max / Kimi K3 / DeepSeek-V4-Flash

중국의 LLM 경쟁은 모델의 크기를 겨루는 단계에서부터 “얼마나 오랫동안 작동할 수 있는지”, “얼마나 많은 도구를 사용할 수 있는지”, “한 건의 일을 얼마에 완수할 수 있는지”를 겨루는 단계로 이행했다.

2026년 여름, MiniMax, Z.ai, Alibaba, Moonshot AI, DeepSeek의 5개사가 100만 토큰 級의 장문 처리와 에이전트 능력을 동시에 선보였다.

하지만 뉴스, 공식 API 문서, Hugging Face, 제3자 랭킹 등에서는 동일한 모델이라도 발표일, 모델명, 가격, 점수가 다르게 나타난다. 본 논문은 이러한 차이를 숨기지 않고, 공식 확인/보도 자료 기반/제3자 검증으로 나누어 정리했다.

### 결론부터 말씀드리겠습니다.

- 전체 지능과 고난도의 장시간 작업: 키미 K3
- 장시간 코딩 에이전트와 상업적 활용이 용이한 오픈 웨이트 GLM-5.2
- 이미지, 영상, PC 운영을 포함한 업무: MiniMax M3
- 대량 처리와 압도적인 가격 성능비: DeepSeek-V4-Flash-0731
- 알리바바 클라우드 통합 및 다국어 업무: Qwen3.8-Max. 다만, 공식 자료상 프리뷰/정식 버전 표기가 함께 존재하는 만큼 계약 시 모델 ID 확인이 필수입니다.

## 지난 9주 동안 무슨 일이 있었는지

6월 1일, MiniMax M3가 출시됩니다. 총 4280억 개의 파라미터, 100만 토큰을 기반으로 이미지와 동영상을 읽어 PC 조작을 통해 진행됩니다.

6월 16일, GLM-5.2. 총 7530억 개 파라미터, 100만 토큰, MIT 라이선스. 장시간 Agentic Engineering을 부각했다.

7월, 키미 K3. 총 2조 8천억, 활성화 1,040억. 100만 토큰과 네이티브 비주얼을 갖춘 거대 오픈 웨이트 모델이 공개되었다.

7월 31일, DeepSeek-V4-Flash-0731. 아키텍처는 한 글자도 변경하지 않고, 후 학습만으로 DeepSWE를 7.3에서 54.4로 성능을 향상시켰다. 같은 날, 가중치도 MIT에서 공개되었다.

8월 3일, Reuters 등에서 Qwen3.8-Max의 공식 발표를 보도했다. 총 2조 4,000억 파라미터와 오픈 웨이트화 정책이 전해진 가운데, 알리바바 클라우드의 공개 모델 목록에는 8월 6일 시점에도 ‘qwen3.8-max-preview’가 토큰 플랜 제한으로 게시되어 있었다.

9주이다.

이 밀도가 무엇을 파괴하는가. 모델 선정이 매년 한 번의 의사 결정으로 끝나지 않는다는 것 외에도, 쫓아가는 쪽의 정보가 파괴된다.

알리바바 클라우드의 모델 목록에는 8월 6일 시점에도 `qwen3.8-max-preview`가 토큰 플랜에 한정된 것으로 게시되어 있다. 반면 Reuters는 8월 3일에 Qwen3.8-Max의 공식 발표를 보도하고 있다. 제3자 랭킹에서는 56이라는 재측정치가 유통되고 있지만, 본 稿에서는 공식 Artificial Analysis 페이지를 직접 확인할 수 없었기에 Qwen의 점수는 참고치로 취급한다. DeepSeek의 API 변경 이력의 최상단은 4월 24일이 맞지만, DeepSeek 공식 Hugging Face에는 `DeepSeek-V4-Flash-0731`이 공개되었으며, MIT 라이선스, 기술 보고서, 공식 버전임을 나타내는 표와 벤치마크 표가 게시되어 있다.

모든 것이 거짓이 아니다. 보고 있는 선반이 다를 뿐이다.

본 글은 그 선반을 하나씩 확인한 기록이다.

## 目次

### 제1부 5모델은 무엇이 다른가

- 먼저 결론――5개 모델이 무엇이 다른지
- MiniMax M3와 M3를 비교해야 하는 이유
- 2026년 중국 LLM 경쟁에서 변화된 점
- 5 제품의 기본 사양 비교

### 제2부의 5모델을 하나씩 읽는다

- MiniMax M3――1M·시각·PC 운영을 통합
- GLM-5.2――100만 토큰을 장시간 작업으로 전환하기
- Qwen3.8-Max――2.4조 파라미터와 두 개의 모델 ID
- Kimi K3――2.8조 파라미터로 장시간 작동하는 오픈 모델
- DeepSeek-V4-Flash――고속·저가·고병렬 실무 모델

### 제3부: 가로 정렬 비교

- 제3자 평가 – 인위적 분석이 제시한 5개 모델
- 추론 능력 비교
- 코딩 성능 비교
- 에이전트와 툴 콜링 비교
- 100만 토큰의 의미는 다음과 같습니다.

토큰은 디지털 환경에서 사용되는 다양한 단위로, 특히 블록체인 기술과 암호화폐 분야에서는 거래 대상, 권리, 자산 등을 나타내는 디지털 자산으로 활용됩니다.

100만 토큰은 특정 암호화폐나 디지털 자산의 총 발행량이 100만 개라는 것을 의미하며, 이 경우 해당 토큰의 가치는 발행량, 수요, 기술적 특징 등 다양한 요인에 의해 결정됩니다.

예를 들어, 특정 프로젝트에서 100만 토큰으로 발행된 토큰은 해당 프로젝트 생태계에서 중요한 역할을 수행할 가능성이 높습니다. 또한, 100만 토큰이라는 수치는 투자자들에게 해당 토큰의 잠재력을 판단하는 데 중요한 지표가 될 수 있습니다.

구체적으로 100만 토큰은 다음과 같은 의미를 가집니다.

*   총 발행량: 해당 토큰의 총 발행량이 100만 개라는 것을 의미합니다.
*   희소성: 발행량이 제한적일수록 희소성이 높아져 가치가 상승할 수 있습니다.
*   투자 기회: 100만 토큰은 투자자들에게 새로운 투자 기회를 제공할 수 있습니다.

하지만 100만 토큰이라는 수치만으로는 토큰의 가치를 정확하게 판단하기 어렵습니다. 따라서 투자 결정을 내리기 전에 해당 토큰의 기술적 특징, 프로젝트의 비전, 시장 상황 등을 종합적으로 고려해야 합니다.
- 이미지, 영상, PC 작동 방식 비교
- 속도, 가격, 동시성 성능
- 개방형 중량 및 현지 운영
- 자율 실행의 실천 방식을 어떻게 해석해야 하는가

### 제4부: 어떻게 선택하고 어떻게 활용할지 결정하는가

- API 호환성 및 개발 도구 연동
- 업종별 선택 방법
- 5가지 모델을 활용하여 라우팅 전략을 구축하는 방법
- 각 모델의 약점 및 고려 사항
- 종합 랭킹

### 제5부 이 길 끝에 무슨 일이 일어날 것이다.

- 정교한 세 가지 분류와 이 글이 한 번 잘못했던 이야기
- 중국 LLM 시장에서 일어나는 구조적 변화
- 최종 결론

### 부록 자체 확인 절차

- 부록 A. 기업 도입 시 평가 기준
- 부록 B. 실증 실험 추천 시나리오
- 부록 C. 중국 LLM 신강을 읽는 여섯 가지 관점

### 데이터

- 주요 공식 자료 및 링크 모음집

## 1. 먼저 결론――5개 모델이 무엇이 다른가

본고에서는 2026년 8월 6일 시점의 공식 발표, API 문서, 공식 모델 카드, 공식 Hugging Face 배포 페이지, 그리고 제3자 평가 기관 Artificial Analysis의 공개 값을 중심으로 5개 제품의 기능, 아키텍처, 추론, 코딩, 멀티모달, 에이전트, 가격, 오픈 웨이트, 기업 도입을 비교한다.

구체적으로는 다음 내용을 다룬다.

- 5개 모델의 총 파라미터, 활성화 파라미터, 컨텍스트, 최대 출력, 라이선스, API 가격이 8월 6일 현재 어느 정도까지 1차 자료로 확정되었는지.
- 인공 분석을 통해 직접 확인 가능한 4개 모델의 최신 점수와 Qwen3.8-Max의 제3자 점수를 참고 기준으로 취급하는 이유
- 저렴한 모델과 저렴하게 일을 끝내는 모델이 일치하지 않는 이유. Qwen3.8-Max는 단가를 낮췄지만 1 작업 비용이 2배 이상 증가했다.
- 오픈 웨이트라고 해도 라이선스와 자사 운영 난이도가 모델마다 크게 다를 수 있습니다.
- 사전 보기와 공식 버전이 같은 회사 웹사이트에 함께 존재할 때, 어느 것을 보든 좋을지 묻는 질문입니다.
- 기업이 5가지 모델을 어떻게 배분해야 할까요?

먼저, 5개 모델의 위치를 한 문장씩으로 설명한다.

MiniMax M3는 한마디로 100만 토큰, 이미지 및 영상 이해, PC 작동을 통합한 멀티모달 에이전트입니다. 가장 적합한 용도는 화면을 보면서 코딩을 하거나, 업무용 PC 작동, 장시간 영상 및 문서 처리를 하는 경우입니다. 규모는 총 약 4280억, 활성화 약 230억입니다.

일론으로 요약하면: 100만 토큰을 장시간의 구현, 조사, 최적화에 사용하는 Agentic Engineering 모델이 가장 적합한 용도: 대규모 구현, 성능 최적화, Claude Code 계열 코딩 에이전트 규모: 총 약 7,530억 / 활성화 약 400억

한마디로 요약하면: 알리바바가 처음으로 최대 깊이인 2.4조 파라미터 규모의 기업 기반 모델을 구축하고 있습니다. 가장 적합한 용도는 코딩, 협업, 알리바바 클라우드 통합, 다국어 업무 처리이며, 총 규모는 2조 4천억 / 활성화 규모는 약 950억입니다.

【Kimi K3】 한마디로 요약하면: 2.8조 파라미터, 100만 토큰, 네이티브 시각을 가진 거대 오픈 웨이트 에이전트. 가장 적합한 용도: 고난도 개발, 거대 코드 베이스, 장시간 지식 노동. 규모: 총 28,000억 / 활성화 1,040억.

DeepSeek-V4-Flash는 한 마디로 100만 토큰을 극도로 저렴한 가격으로 대량으로 돌릴 수 있는 텍스트 에이전트 모델입니다. 가장 적합한 용도는 대량의 API 처리, Codex/Claude Code 연결, 병렬 에이전트 규모이며, 총 2,840억 / 활성화 130억입니다.

제3자 평가에서 직접 확인할 수 있는 값은 Kimi K3가 57, GLM-5.2가 51, DeepSeek-V4-Flash-0731이 50, MiniMax M3가 44인 것이다. Qwen3.8-Max는 56이라는 재측정치가 보고되었으나, 공식 Artificial Analysis 페이지에서 직접 확인되지 않아 본 논문에서는 참고치로 구분한다.

상위 4개 모델이 50점에서 57점 사이의 7점 영역에 밀집되어 있습니다. “어느 한 모델이 압도적으로 우세한” 상황은 아닙니다. 용도가 바뀌면 순위가 쉽게 변동합니다.

용도별로 살펴보면, 최고 난도의 종합 지능은 Kimi K3, 장시간 코딩 에이전트는 GLM-5.2, 시각/영상/PC 조작은 MiniMax M3, 가격 및 대량 배포는 DeepSeek-V4-Flash, 기업 클라우드 통합 및 다국어는 Qwen3.8-Max가 유력합니다.

그러나 총 지능 순위와 비용 순위는 일치하지 않는다. Qwen3.8-Max는 전세대보다 단가를 낮췄지만, 1 작업당 비용은 2배 이상 증가했다. 이유는 10장으로 다루는 내용이다.

기업이 채택해야 할 전략은 하나의 모델로 모든 업무를 통일하는 것이 아니다. 정형 처리는 DeepSeek, 장시간 구현은 GLM, 고난도 판단은 Kimi, 시각 및 PC 조작은 MiniMax, Alibaba Cloud 통합 및 다언어는 Qwen으로 분담하는 모델 라우터형 시스템이다.

## 2. MiniMax H3 대신 M3를 비교해야 하는 이유

MiniMax에는 다양한 용도의 여러 기반 모델이 있다.

- MiniMax M3：언어, 추론, 코드, 에이전트, 이미지 및 영상 이해, PC 운영을 담당하는 LLM
- MiniMax H3: 영상 및 음성의 생성·편집을 목적으로 하는 동영상 모델
- MiniMax Speech 시리즈：음성 합성
- MiniMax Music 시리즈: 음악 생성

중국 LLM을 비교할 때, Qwen, GLM, Kimi, DeepSeek과 동일 카테고리에 M3를 포함해야 한다. H3는 발표 시기가 최신이라도 주요 출력이 비디오이며, 언어 추론, Tool Calling, 코딩, 장문 처리 비교표에는 포함되지 않도록 별도 카테고리로 분류해야 한다.

M3는 2026년 6월 1일에 공식 발표되었다. MiniMax 공식은 코딩/에이전트 업무, 최대 100만 토큰, 네이티브 이미지 및 영상 입력, 데스크톱 조작, MiniMax Sparse Attention을 주요 능力으로 제시한다. 공식 Hugging Face는 총 규모 약 428B, 활성화 약 23B, MiniMax 커뮤니티 라이선스로 배포한다.

MiniMax의 제품 전략은 M3가 기획, 추론, 조사, 코드, 운영을 담당하고, 영상, 음성, 음악에 대한 전용 모델을 호출하는 구성이다. 본 기고는 M3를 LLM 비교에 활용하고, H3는 관련 영상 모델로서만 언급한다.

## 2026년 중국 LLM 경쟁에서 변화된 점

중국 대규모 언어 모델 경쟁은 더 이상 “ChatGPT에 얼마나 가까워졌나”를 겨루는 단계가 아니다. 2026년 여름, 경쟁의 중심은 100만 토큰 級의 장문 처리, 수 시간에서 수일에 이르는 자율 코딩, 이미지나 영상을 이해하며 PC를 조작하는 멀티모달 에이전트, 그리고 기업이 수백 체, 수천 체에 달하는 AI 직원들을 활용할 수 있는 추론 비용으로 이동했다.

MiniMax M3, Z.ai(智譜AI)의 GLM-5.2, Alibaba의 Qwen3.8-Max, Moonshot AI의 Kimi K3, DeepSeek-V4-Flash. 5개 모델은 모두 중국산 LLM이지만, 각각 다른 “최강”을 지향한다.

2023년부터 2024년까지의 경쟁은 일관된 정답을 맞히는 방식의 벤치마크가 중심이었다. 2026년에 요구되는 것은 수십만 줄의 코드를 읽고, 터미널이나 브라우저를 사용하여 실패하더라도 재시도하며, 수시간 동안 목표를 유지하고 결과물을 완성할 수 있는 능력이다.

MiniMax M3는 100만 토큰, 이미지 및 영상 이해, PC 작동을 통합한다. GLM-5.2는 100만 토큰을 장시간 Coding 에이전트에게 최적화한다. Kimi K3는 2.8조 파라미터와 네이티브 시각으로 고난도의 장시간 작업을 노린다. DeepSeek-V4-Flash는 활성화 파라미터를 130억으로 억제하고, 저가와 고속성을 우선한다. Qwen3.8-Max는 Coding과 Cowork를 Alibaba Cloud에 연결하고, 201개 언어에 대한 대응을 표방한다.

2026년 8월 6일 현재 확인된 제공 상태는 다음과 같습니다.

- MiniMax M3：API 제공, 공식 가중치 공개
- GLM-5.2：API 제공, MIT 라이선스 하 공식 가중치 공개됨
- Kimi K3：API 제공, Kimi K3 라이선스에 따른 공식 가중치 공개
- DeepSeek-V4-Flash: 4월 24일부터 API 제공, MIT 라이선스의 오픈 웨이트
- Qwen3.8-Max는 8월 3일에 공식 버전으로 업데이트되었으며, `qwen3.8-max-preview`도 공식 문서에 남아 있습니다.

이 밀도가 초래하는 부작용은 정보의 누락을 의미한다.

알리바바 클라우드 모델 스튜디오의 모델 목록에는 `qwen3.8-max-preview`가 토큰 플랜으로만 제한되어 있으며, 8월 3일 이후의 DashScope와 QwenCloud에서는 `qwen3.8-max`가 공식 버전으로 사용량 기반 요금제로 운영되고 있으며, Vercel의 AI Gateway에도 `alibaba/qwen3.8-max`로 등록되었다. 같은 회사의 공식 자료는 같은 날 두 가지 상태를 보여주고 있다.

딥시크도 마찬가지다. API 변경 이력의 최상단은 4월 24일의 V4 공개와 같지만, Hugging Face의 `deepseek-ai/DeepSeek-V4-Flash-0731`에는 MIT 라이선스의 가중치, 벤치마크 표, arXiv 기술 보고서 링크가 모두 포함되어 있으며, 지난달 기준으로만 43만 회 이상 다운로드되었다.

기업은 분기별로 모델 구성을 재검토할 수 있도록 설계되어야 하며, 그 재검토의 전제 조건이 무엇을 보느냐에 따라 달라질 수 있다는 점을 고려해야 한다.

## 4.5 제품 기본 사양 비교

2026년 8월 6일 기준으로 공식 자료 또는 공식 모델 배포 페이지에서 확인되는 정보를 제공한다. 제3자 측정치는 명시한다.

【MiniMax M3】개발: MiniMax 발표: 2026년 6월 1일 규모: 총 약 4,280억 / 활성화 약 230억 컨텍스트: 최대 100만 입력: 텍스트, 이미지, 영상 주요 기술: MiniMax Sparse Attention PC 운영: 공식 대응을 촉구함. 무게: 공식 Hugging Face에서 공개 라이선스: MiniMax 커뮤니티 라이선스 제3자 지수: 44

【GLM-5.2】개발: Z.ai / 智譜AI 발표: 2026년 6월 16일 규모: 총 약 7,530억 / 활성화 약 400억 컨텍스트: 100만 입력: 텍스트 주요 기술: IndexShare. 4층마다 희소 Attention 인덱서를 공유하여 1초당 1 토큰당 FLOPs를 2.9배 감소시킴. 가중치: 공식 Hugging Face에서 공개 라이선스: MIT 제3자 지수: 51

【Qwen3.8-Max／Qwen3.8-Max-Preview] 개발: 알리바바／Qwen 제공 상태: Reuters 등은 2026년 8월 3일의 공식 발표를 보도했다. 반면, 알리바바 클라우드 공식 모델 목록에서는 8월 6일 시점에도 ‘qwen3.8-max-preview’를 토큰 플랜에 한정하여 게시했으며, 공식적으로 직접 확인할 수 있는 모델 ID는 ‘qwen3.8-max-preview’이다. 규모는 총 2조 4,000억으로, Reuters 등에서 알리바바 발표를 바탕으로 보도했다. 활성화량은 약 950억, 공식 API 사양은 공개 자료의 업데이트 확인이 필요하다. 컨텍스트: Preview 버전은 100만 척을 요구 입력하며, 텍스트, 이미지, 비디오를 다루는 멀티모달 모델로 발표되었다. 사고: Preview 버전은 Thinking-only이며, ‘reasoning_effort’를 활용한다. 가중치는 8월 6일 시점까지 공식 Hugging Face 배포를 확인할 수 없으며, 가격은 입력 2.00달러/출력 6.00달러로 유통되고 있지만, 알리바바 클라우드의 공개 가격표에는 8월 6일 시점에 반영된 것을 확인할 수 없으므로 계약 전 재확인이 필요하다. 제3자 지수는 56이라는 재측정 값이 보고되었으며, 본 기사에서는 참고 값으로 취급한다.

【Kimi K3】개발: 문샷 AI 규모: 총 2.8조/활성화 1,040억 구조: 896명의 전문가 중 16명을 선택 컨텍스트: 1,048,576 입력: 텍스트, 이미지 사고: 항상 ON, 낮/높/최대 양자화: 양자화 인식 학습 가중치: 공식 Hugging Face에서 공개, 약 1.56TB 라이선스: Kimi K3 라이선스 제3자 지수: 57

DeepSeek-V4-Flash-0731: DeepSeek 발표, 2026년 4월 24일 프리뷰, 7월 31일 정식 버전 공개. 가중치도 동일하게 공개. 규모: 총 2,840억(활성화 130억). Hugging Face 표시의 3,040억은 DSpark 투기 디코딩 모듈 포함, 컨텍스트 100만. 최대 출력은 high/max 추론 시 38만 4,000을 추천. 입력: 텍스트 思考: `reasoning_effort`의 low/high/max 가중치(공식 Hugging Face에서 공개, deepseek-ai/DeepSeek-V4-Flash-0731). 라이선스: MIT. 기술 보고서: arXiv:2606.19348 “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence”. 제3자 지수: 50(Reasoning Max). 4월 프리뷰의 40점에서 10점 상승.

5개 모델은 제공 상태가 완벽하게 준비되지 않았다. MiniMax, GLM, Kimi, DeepSeek는 가중치를 공개했고, Qwen3.8-Max는 공식 버전이 작동 중이지만 가중치는 아직 공개되지 않았다. 미공개 항목을 추측으로 채우지 않으면 비교 기사의 신뢰성을 지킬 수 있다. 다만 “공식 페이지에서 찾을 수 없는” 것과 “존재하지 않는” 것은 다르다. 이 두 가지를 혼동하면 반대 방향의 오류가 발생한다 (제24장).

## 5．MiniMax M3――1M·시각·PC 운영을 통합

## 보는 것, 생각하는 것, 조작하는 것을 하나로 합치세요.

MiniMax M3는 2026년 6월 1일에 공식 발표된 MiniMax의 플래그십 LLM이다. 공식 모델 카드에 따르면 총 4,280억 파라미터의 MoE(Mixture of Experts) 모델로, 토큰마다 약 230억 개의 파라미터를 활성화한다. 공식 발표의 중심은 코딩, 에이전트 워크, 1M 컨텍스트, 네이티브 멀티모달리티, 데스크톱 컴퓨터 운영, 오픈 웨이트이다. M3는 단순한 챗봇 모델이 아니다. 긴 작업 이력을 유지하며, 문서, 이미지, 비디오, 코드, 실행 로그를 읽으면서 툴을 사용하여 결과물을 완성하는 것을 전제로 한다.

## MiniMax 희소 주의

희소 주의는 트랜스포머 모델의 핵심 구성 요소인 주의 메커니즘의 계산 복잡도를 줄이는 방법입니다. 일반적인 주의 메커니즘은 입력 시퀀스의 모든 쌍 간의 관계를 계산하기 때문에, 시퀀스 길이가 길어질수록 계산량이 급격히 증가하는 문제가 발생합니다.

MiniMax 희소 주의는 이러한 문제를 해결하기 위해, 입력 시퀀스의 모든 쌍 간의 관계를 계산하는 대신, 특정 조건 하에서 주의 값을 계산하는 방식으로 작동합니다. 구체적으로, MiniMax 희소 주의는 다음과 같은 특징을 가집니다.

*   **마스킹:** 특정 토큰 간의 주의 값을 0으로 설정하여, 불필요한 계산을 줄입니다.
*   **최대 연산:** 각 토큰의 주의 값 중 가장 큰 값을 선택하여, 중요한 정보에 집중합니다.

이러한 특징들을 통해 MiniMax 희소 주의는 일반적인 주의 메커니즘에 비해 훨씬 적은 계산량으로 동일한 수준의 성능을 달성할 수 있습니다. 특히, 긴 시퀀스를 처리하는 데 효과적이며, 트랜스포머 모델의 확장성을 높이는 데 기여합니다.

이러한 기술은 ‘夏帆’와 같이 긴 시퀀스를 다루는 텍스트 생성 모델에서 특히 유용하게 활용될 수 있습니다. 또한, ‘무라카미 하루키’의 작품과 같이 복잡하고 다양한 텍스트 구조를 분석하는 데에도 적용될 수 있습니다. MiniMax 희소 주의는 트랜스포머 모델의 성능을 향상시키고, 다양한 분야에서 활용될 가능성을 제시합니다.

M3의 핵심 기술은 MiniMax Sparse Attention(MSA)이다. 일반적인 Full Attention 방식에서는 입력 길이가 늘어날수록 계산량과 메모리 소비가 급증한다. 100만 토큰을 처리하기 위해서는 단순히 용량을 늘리는 것만으로는 부족하며, 중요한 정보에 효율적으로 주의를 집중할 수 있는 구조가 필요하다. MSA는 Attention 계산을 희소화하여 필요한 범위만 선택함으로써 장문 처리를 효율화한다.

MSA(멀티 쿼리 어텐션) 구현에서 특징적인 것이 “KV outer gather Q”라는 연산자의 설계이다. KV(Key-Value) 블록을 바깥쪽 루프에 두고, 해당 블록에 해당하는 쿼리를 모아준다. 각 블록은 한 번만 읽히고 메모리 접근이 연속적으로 이루어진다. MiniMax는 이 방식이 M3의 헤드 구성에서 Flash-Sparse-Attention이나 flash-moba와 같은 기존 오픈소스 구현보다 4배 이상 빠르다는 보고를 한다.

숫자로는 100만 토큰 시점의 경우 토큰당 계산량은 전세대 M2의 약 20분의 1, 프리필드에서 9배 초과, 디코딩에서 15배 초과의 가속화이다 (이해 모두 발표 기준). 긴 텍스트가 “사용할 수 있지만 높은” 것에서 “일상생활에 활용할 수”로 바뀌는지는 이러한 연산자 최적화에 달려 있다.

100만 토큰은 긴 책을 읽을 수 있다는 것 이상의 의미를 갖는다. 에이전트 용도로 사용될 경우, 사용자 요청, 설계 문서, 소스 코드, Git 차이, 터미널 로그, 테스트 결과, 오류 메시지, 브라우저 검색 결과, 스크린샷, 작업 중인 내용 판단, 과거에 실패했던 방법, 다음으로 시도할 계획 등 모든 것이 작업 기억에 축적된다. 장시간 에이전트가 목적을 잃는 최대 요인 중 하나는 작업 이력이 컨텍스트에서 사라지는 것인데, M3는 이 문제를 아키텍처 측면에서 해결하고자 한다.

공식적인 표현은 ‘최대 1M, 최소 보장 512K’입니다. 평탄한 1M이 아닙니다. 또한 최대 토큰 수는 입력과 출력의 총합이며, 90만 토큰을 입력하여 51만 토큰의 답변을 얻는 것은 불가능합니다.

M3는 이미지와 동영상을 입력할 수 있다. 주요 특징은 후처리에 의존하지 않고 학습의 0단계부터 이미지를 혼합한다는 점에 있다. MiniMax는 데이터 파이프라인을 재구성하고 사전 학습 토큰량을 100조 토큰 량까지 확대했다고 설명한다. 텍스트와 이미지가 자연스럽게 교차하는 인터리브 형식의 데이터가 일반적으로 생각하는 것보다 성능에 효과적이라는 것이 MiniMax의 주장이다.

용도로는 화면 캡처에서 UI 불량을 특정하고, 작동 영상에서 업무 절차서를 만들고, 공장 설비 영상에서 이상 징후를 추출하며, CAD 화면과 설계 사양을 동시에 읽는 등 활용이 가능하다. 긴 영상은 프레임, 자막, 음성 인식 결과, 시간 정보 등을 대량으로 소비하기 때문에 1M 컨텍스트와의 조합이 의미가 있다.

## PC 운영형 에이전트

무라카미 하루키는 공식적으로 M3 컴퓨터를 데스크톱 컴퓨터처럼 사용할 수 있다고 설명한다. MiniMax가 제시하는 예시는 “이 엑셀을 보면서 로컬의 ERP 클라이언트를 열어 청구 정보를 대량으로 입력하는 것”과 같다. MiniMax Code는 애플리케이션, 파일, 시스템을 넘어 작업을 완료하는 데 사용되며, MiniMax Code의 Harness는 오픈 소스 OpenCode와 Pi를 기반으로 한다. MiniMax는 향후 이 프로젝트 자체도 공개할 계획이다.

단순히 PC 조작만으로는 작동하지 않는다. 화면 획득, 좌표 조작, 인증, 권한 관리, 작동 로그, 오작동 방지, 인간 승인 등을 포함하는 에이전트 기반이 필요하다.

벤치마크에서는 SWE-bench Verified 80.5%, Terminal-Bench 2.1이 66.0, BrowseComp가 83.5로 Opus 4.7의 79.3을 상회하는 (모두 발표 기반) 결과가 나타났습니다. SWE-Bench Pro는 59.0%로 보고되었습니다. 반면, Artificial Analysis의 Intelligence Index v4.1은 44점으로, 5개 모델 중에서는 가장 낮은 수치였습니다. 종합적인 지능과는 달리 시각 및 PC 조작 능력, 가격으로 차별화되는 모델이라고 이해하는 것이 정확합니다.

M3는 장시간의 자율 실행을 보여주는 시연을 세 가지 공개하고 있으며, 내용은 제18장에서 다룬다.

MiniMax의 강점은 M3 단체뿐만이 아니다. M3는 추론, 계획, 코드, 조작, 시각 이해를 담당하고, H3는 영상, Speech는 음성, Music은 음악을 생성한다. 광고 제작에서는 M3가 상품 자료와 경쟁 광고를 분석하여 시나리오를 만들고, H3에게 영상 생성을 요청하며, Speech와 Music을 조합하여 완성품을 재검토하는 폐루프를 구성할 수 있다.

## 6．GLM-5.2――100만 토큰을 장시간 작업에 적용

## 100만 토큰을 “지속적인 노동의 기억”으로

GLM-5.2는 Z.ai가 2026년 6월 16일에 발표한 최신 플래그십 모델입니다. 공식적으로는 “장기 작업에 최적화”된 것으로 정의됩니다. 100만 토큰은 긴 문서의 확인뿐만 아니라 계획, 실행, 테스트, 디버깅, 성능 최적화 등 지속적인 작업 기억으로 활용됩니다.

규모의 표기에는 자료 간에 차이가 있다. 공식 Hugging Face는 총 7,530억을 표시하고, Artificial Analysis는 7,440억/활성화 400억을 제시한다. 7,440억은 FP8 빌드의 VRAM 소요량에 해당하여 파라미터 수와 관련 없는 설명이 존재한다. 오차는 약 1.2%이며, 선택 판단을 바꾸는 규모는 아니지만, 본 논문에서는 공식 배포 페이지의 7,530억을 따른다. 활성화는 약 400억이며 각 자료가 일치한다.

## IndexShare

GLM-5.2의 핵심 기술은 IndexShare입니다. 동일한 인덱서를 4개의 Sparse Attention 레이어에서 공유하여 100만 토큰 시 1 토큰당 FLOPs를 2.9배 감소시킵니다. 장시간 에이전트에서는 단순히 상한을 넓히는 것뿐만 아니라 Attention 계산과 KV 캐시의 효율을 저하시키지 않는 것이 중요합니다.

GLM-5.2는 텍스트 전용 모델이며, 이미지 입력을 네이티브하게 갖춘 MiniMax M3나 Kimi K3와는 다르다. Z.ai의 주변 도구와 GLM-V 시리즈를 조합하면 시각을 처리할 수 있지만, 이는 GLM-5.2 단체의 입력 능력과는 별개이다.

## MIT 라이선스와 도입 경로

공식 Hugging Face에서 가중치가 공개되었으며, 라이선스는 MIT이다. vLLM, SGLang, Transformers 등에서 활용 가능하다. 5개 모델 중에서는 상업적 이용 조건이 가장 명확한 편에 속한다.

코딩 플랜은 Lite 월 18달러, Pro 월 72달러, Max 월 160달러입니다. Claude Code, OpenClaw, Cline 등 다양한 코딩 도구에 연결 가능합니다. 이용량과 우선 순위는 각 플랜마다 다릅니다.

볼륨 가격으로 1.40달러, 현금 입력 0.26달러, 출력 4.40달러라는 값이 여러 가격 추적 서비스에 게시되어 있습니다. 다만, Z.ai의 공개 가격 페이지는 업데이트 빈도가 높아, 제공업체를 통한 가격도 다릅니다. 확정 가격은 고정하지 않고, 계약 시 콘솔 표시를 우선적으로 고려하고 싶습니다.

인공지능 분석에서는 GLM-5.2(max)가 Intelligence Index 51을 기록하며, 대규모 리포지토리, 장시간 구현, 성능 최적화, MIT 라이선스를 중시하는 기업에 적합합니다.

## 7. Qwen3.8-Max――2.4조 파라미터와 두 개의 모델 ID

## 왜 가장 부적절하게 대하면 쉬운 탓일까

Qwen3.8-Max는 이 기사에서 가장 취급하기 어려운 모델이다. 이유는 성능이 아닌 공개 방식 때문이다.

먼저 사실 관계를 단계적으로 파악한다.

2026년 7월 19일, 상하이 세계 인공지능 대회(WAIC)에서 `qwen3.8-max-preview`를 공개했다. 알리바바 클라우드 토큰 플랜, Qoder, QoderWork 전용의 크레딧제로 방식으로 운영되며, 요금은 즉시 과금 방식이 아니었다. 기본 temperature는 0.6으로 설정되어, 0.6 미만으로 설정하더라도 0.6으로 자동 조정된다. Thinking-only 방식이며, Function Calling의 공식 대응표에도 등록되어 있었다.

2026년 8월 3일, Reuters 등에서 Qwen3.8-Max의 공식 발표를 보도하며 총 2.4조 파라미터와 오픈 웨이트화 정책을 제시했다. 다만, 알리바바 클라우드의 공개 모델 목록 및 가격 페이지에서는 8월 6일 시점에도 ‘qwen3.8-max-preview’만 확인할 수 있다. 공식 모델 ID, 일반 사용량 기반 가격, 활성화 파라미터는 계약 화면 또는 업데이트 후 공식 문서에서 다시 확인해야 한다.

문제는 두 번째 단계와 첫 번째 단계가 사라지지 않았다는 것이다. 알리바바 클라우드 모델 스튜디오의 모델 목록에는 여전히 `qwen3.8-max-preview`가 토큰 플랜 제한, 중국 베이징 리전에 게시되어 있으며, “예고 기간 종료 후 삭제되거나 공식 버전으로 대체될 것”이라는 문구와 함께 제공된다.

그러므로 현재 시점에서는 “공식 발표에 대한 보도가 존재하지만, 알리바바 클라우드의 공개 문서 업데이트가 뒤쳐지고 있을 가능성이 있다”고 정리하는 것이 안전하다. Preview가 존재한다는 이유로 공식 발표를 부정하지 않고, 공식 발표에 대한 보도만을 이유로 공개 가격표나 모델 ID 업데이트를 추측하지 않는다.

정식 버전으로 확정된 사양은 다음과 같습니다.

【Qwen3.8-Max에 대한 보도 및 공개 정보에서 확인 가능한 내용】
총 파라미터: 24000억(MoE, Qwen3.5 아키텍처를 기반으로 확장)
활성화 파라미터: 약 950억
컨텍스트: 100만 토큰
입력: 텍스트, 이미지, 비디오
추론: 항상 ON. 공식 API 가이드는 low/medium/xhigh를 게시
API: OpenAI, Anthropic, DashScope 호환
가격: 입력 2.00달러(약 320엔), 출력 6.00달러(약 960엔), 캐시 히트 0.25달러

## 가격 및 기업 도입

가격은 전世代보다 저렴해졌습니다. Qwen3.7-Max는 입력 2.50달러, 출력 7.50달러, 캐시 0.50달러였습니다. 모든 항목에서 가격 인하를 보였습니다. Claude Fable 5의 10달러/50달러와 비교하면 5분의 1에서 8분의 1에 해당합니다.

## 기술적 측면의 네 기둥

기술적으로 Qwen이 제시하는 핵심은 네 가지이다.

첫째, 게이티드 델타 네트워크와 疎 MoE를 결합한 하이브리드 구성입니다. 긴 텍스트 추론의 계산량과 레이턴시를 줄이는 설계로, MiniMax의 MSA, Kimi의 KDA, Z.ai의 IndexShare, DeepSeek의 CSA+HCA와 동일한 문제에 대한 다섯 번째 답변에 해당합니다.

둘째로, 시각과 언어를 조기에 융합하여 학습한 통합 기반입니다. 수조 토큰 규모의 멀티모달 데이터로 학습했으며, 별도의 Qwen3-VL 시리즈를 추론, 코딩, 에이전트, 시각 이해 벤치마크에서 능가한다고 합니다.

세 번째로, 백만 규모의 에이전트 환경으로 강화 학습을 확장(스케일)했습니다.

네 번째로, 201개 언어 및 방언에 대한 대응이 이루어집니다. 일본 기업에게는 이것이 실무적으로 유효할 가능성이 있습니다. 일본어 품질에 대한 독립적인 평가는 여전히 존재하지 않지만, 다국어 지원을 적극적으로 강조하고 있는 모델은 Qwen만을 포함하여 5개 모델 중 유일합니다.

벤치마크는 발표 기준으로 Terminal-Bench 2.1이 86.6, GPQA Diamond가 92.6, PaperBench가 93.0, IFBench가 82.8, OSWorld-Verified가 86.1, OmniDocBench 1.5가 92.1이다. 코딩 능력의 세대 간 성장 폭이 두드러지며, FrontierSWE가 40.7에서 73.5로, DeepSWE 1.1이 21.6에서 56.6으로 거의 두 배 증가했다. 다만 이는 Alibaba 자체의 측정이며, 하네스 데이터도 공개되지 않았다.

제3자 평가에서는 56이라는 재측정치가 보고되었다. 다만 본 논문의 최종 확인 시 인공 분석 공식 페이지를 직접 확보하지 못했기에 참고치로 취급한다. Claude Opus 4.8(max)과 함께 Google, Meta, xAI의 어떤 모델보다 우수하며, 중국勢에서는 Kimi K3의 57에 이어 2위이다.

## 개방형 대기는 아직 불확정 상태이다.

오픈 웨이트에 대해서는 아직 약속 단계에 있습니다. 알리바바는 Max 층위로서 처음으로 가중치를 공개할 예정이며, 공개 대상은 Hugging Face와 ModelScope이고, 시기는 “다음 주” – 8월 10일의 주로 결정되었습니다. 더 작은 Qwen3.8-27B도 동시에 공개될 예정입니다. 이는 방향 전환에 해당합니다. 지금까지 Max 계열은 일관되게 클로즈드였고, 오픈 웨이트 계열은 Qwen3.6 이하로 이어져 왔습니다. 공개되면, 알리바바의 이전 최대 공개 모델인 Qwen3.5 397B의 약 6배 규모이며, Kimi K3의 2.8조에 이어지는 위치가 됩니다.

다만 8월 6일 기준으로 ‘무지’와 라이선스 조항도 아직 발표되지 않았다. 따라서 현재 시점의 정확한 표현은 “호스팅은 제공 중이며, 오픈 웨이트는 표명되었다”이다. Kimi K3가 발표로부터 11일 후에 ‘무지’를 발표한 전례가 있기 때문에, 약간의 지연은 놀랍지 않다. 그럼에도 불구하고, 자사 운영을 전제로 한 계획을 확정짓는 것은 아직 이르다. 참고로 2.4조 파라미터 버전은 강한 양자화에도 1TB를 초과하며, 데이터센터 전용이다. 현실적인 온프레미스 입구는 27B 버전이다.

Qwen3.8-Max의 또 다른 강점은 생태계이다. 알리바바 클라우드 모델 스튜디오, Qwen Studio, Qwen Code, Qoder, DashScope API, OpenAI 호환 API, Anthropic 호환 API, 중국 내 리전, 도쿄 및 싱가포르 등 클라우드 확장을 갖추고 있으며, 기업용 인증, 결제, 모니터링, 주변 모델을 제공한다. Codex에 대해서는 OpenAI Responses 호환 설정이 안내되고, Claude Code에 대해서는 Anthropic 호환 엔드포인트가 공식적으로 안내된다.

기업 도입에서는 가장 현명한 모델이 반드시 승리하는 것은 아니다. 어떤 지역에서 API를 이용할 수 있는지, 데이터를 어디에 저장할지, 기존 클라우드와 통합할 수 있는지, 권한 관리나 감사 로그를 구현할 수 있는지, 장애 발생 시 지원을 받을 수 있는지, 대량 요청을 안정적으로 처리할 수 있는지 등이 중요하다. 알리바바 클라우드를 이미 이용하는 기업에게 Qwen3.8-Max는 도입 경로가 명확하다.

한편, 일본 기업이 검토하는 경우에는 다른 논점도 존재한다. 중국의 법 제도 하에서의 데이터 접근 의무가 API 프롬프트의 범위를 넘어 내부 워크플로우에 미칠 가능성이 제기되고 있으며, 법무 및 정보 관리의 판단이 필요한 영역에서 모델 성능 논의와 분리하여 검토해야 한다.

## 8. 키미 K3――2.8조 파라미터로 장시간 작동하는 오픈 모델

## 2.8조 파라미터의 의미

키미 K3는 Moonshot AI가 2026년 7월 16일에 발표한 플래그십 모델이다. 공식 사양에 따르면 총 2.8조 파라미터, 896개의 MoE 전문가, 토큰마다 16명의 전문가를 활성화하고, 100만 토큰, 네이티브 시각 이해, 이미지 및 영상 입력, 장시간 코딩, End-to-End 지식 작업, 상시 사고, 추론 노력의 최소·최대·최댓값, 툴 콜링, 동적 툴 로딩, 구조화 출력, 자동 컨텍스트 캐싱, OpenAI 및 Anthropic 호환, 오픈 웨이트를 특징으로 한다.

문샷(Moonshot)은 K3를 프론ティア(K3)급 오픈 웨이트 모델로 제시했다. 제3자 평가에서도 인공지능 분석 지수 57을 기록하여 공개 웨이트 모델의 최상위 그룹에 속해 있다.

무게는 2026년 7월 27일에 Hugging Face에서 공개되었다. 양자화 인식 학습이 적용된 MXFP4 형식으로, 풀 사이즈는 1.56TB이며, 활성화 파라미터는 공개 시점의 리포지토리에서 약 1,040억 개로 명시되었다 (총 파라미터의 약 3.7%에 해당하며, 프론티어급 오픈 모델 중에서는 극단적으로 얇은 설계이다). 라이선스는 독점적인 Kimi K3 라이선스로, 상업 이용, 수정, 재배포를 널리 인정하면서도 일정 규모 이상의 Model-as-a-Service 사업자 및 초대규모 제품에는 조건이 붙었다.

키미 K3는 키미 델타 어텐션(KDA)을 채택한다. KDA는 선형 어텐션과 기존 어텐션을 결합하여 긴 시퀀스를 효율적으로 처리하도록 설계되었다. 선형 층과 전체 어텐션 층을 3:1 비율로 교대로 배치하며, KV 캐시 메모리를 최대 75%까지 줄일 수 있는 비결은 바로 이 구조에 있다. 또한 어텐션 리사이달(Residuals)을 도입하여 깊은 모델 내에서 정보가 원활하게 흐르도록 설계했다. 896개의 전문가 중 16만 명만을 활성화하는 높은 疎性(소성) 덕분에 막대한 파라미터 수를 가지고 있음에도 불구하고 모든 연산을 수행하지 않는다.

## 장시간 코딩과 지식 노동

K3의 최대 특징은 장기적 코드(Long-Horizon Coding) 방식이다. 대규모 리포지토리 전체 이해, 여러 서비스를 횡단하는 수정, 장시간 터미널 작업, 테스트 및 수정 반복, 대규모 리팩토링, 프론트엔드와 백엔드 동시 개발, 게임 개발, CAD, 연구 코드 구현 등을 목표로 한다. 시각 피드백 또한 중요하며, 웹 화면, 게임 화면, CAD를 통해 코드에 다시 돌아와 수정할 수 있다.

그녀는 K3를 엔드 투 엔드 지식 기반 업무에 적합한 솔루션으로 간주한다. 시장 조사, 경쟁 분석, 재무 분석, 법률 문서 비교, 문헌 조사, 기술 조사, 제안서 작성, 데이터 분석, 보고서 작성 등을 계획, 검색, 비교, 재검토, 작성, 인용 확인까지 모든 과정을 일관성 있게 수행한다.

K3는 사고 모드를 완전히 멈출 수 없으며, 추론 노력을 최고, 보통, 낮음 중에서 선택하며 기본 설정은 최고이다. 복잡한 요청의 경우 품질이 안정적이지만, 짧은 분류는 지연과 비용 증가를 유발하기 쉽다. 모든 처리보다 고난이도 작업에 선택적으로 사용하는 것이 효과적이다.

API 가격은 입력 3.00달러(약 480엔), 캐시 히트 입력 0.30달러, 출력 15.00달러(약 2,400엔)입니다. 5개 모델 중 가장 높습니다. 다만 Moonshot은 Mooncake라는 분리형 추론 아키텍처를 통해 코딩 목적 시 공식 API의 캐시 히트율이 90%를 초과한다고 설명합니다. 같은 리포지토리를 반복적으로 읽는 장시간 에이전트에서는 실효 단가가 표시 가격보다 훨씬 낮아집니다.

동적 툴 로딩 또한 기업 에이전트에 중요합니다. 매번 수백 개의 툴 정의를 새로 입력하지 않고, 처음 툴 검색을 수행하여 후보만 동적으로 읽어 들입니다. Gmail, Slack, Drive, ERP, CRM, 회계, 재고, 물류, EC, BI, GitHub 등 다양한 업무 툴을 다룰 때 유효합니다.

구현상의 제약 사항도 몇 가지 있다. 샘플링 값은 고정되어 변경할 수 없다. 멀티 터닝 에이전트의 경우, API가 반환한 추론 내용과 툴 호출 필드가 포함된 완전한 어시스턴트 메시지를 다음 요청으로 그대로 반환해야 한다. 스트리밍에서는 `reasoning_content`와 최종 답변이 분리된다.

제3자 평가에서는 인공 분석의 지능 지수(Intelligence Index)가 57을 기록하여 공개 가중 모델 최상위 그룹에 위치했다.

## 개방형 플랫폼을 이용하더라도 자체 운영은 무겁습니다.

한편, 자체 운용의 진입 장벽은 매우 높다. 2.8조 파라미터는 일반 기업에서 사용 가능한 워크스테이션 수준이 아니다. MXFP4 양자화 후에도 1.56TB로, 단일 GPU뿐만 아니라 8GPU 노드 1대에 들어가지 않는다. 현실적인 제공에는 총 1.6TB 초과 용량의 GPU 메모리를 가진 멀티 노드 클러스터와 MoE를 이해한 추론 스택이 필요하다. “가중치가 공개되어 있다”는 것과 “자체에서 실행 가능하다”는 것 사이의 거리가 5 모델 중 가장 먼 것은 K3이다 (제17장).

## 9. DeepSeek-V4-Flash――고속·저가·고병렬 실무 모델

## 4월 프리뷰에서 7월 31일 정식판으로

DeepSeek-V4-Flash는 총 2,840억, 활성화 130억의 MoE 모델이다. 2026년 4월 24일에 프리뷰 형태로 공개되었으며, 7월 31일에 공식 버전 “DeepSeek-V4-Flash-0731”으로 업데이트되었다.

7월 31일 업데이트는 DeepSeek의 API 변경 이력 페이지만 살펴보면 놓치기 쉬운 내용이다. 하지만 Hugging Face의 `deepseek-ai/DeepSeek-V4-Flash-0731`에는 MIT 라이선스의 가중치, 벤치마크 표, arXiv:2606.19348 “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence” 기술 보고서 링크가 모두 포함되어 있다. 모델 카드에서는 이 점이 Preview 버전을 대체하는 공식 출시임을 명시한다. 공식 Hugging Face에서는 2026년 8월 6일 확인 시점에 따르면 월간 다운로드 건수가 60만 건을 넘어섰으며, 여러 개의 양자화 버전과 파인튜닝 버전이 공개되어 있다. 존재는 의심할 수 없다.

정식 버전의 내용은 아키텍처나 파라미터 수도 4월 버전과 동일하며, 오직 후속 학습만 재시작한 것이다. API 호출 방식도 변함없이 `deepseek-v4-flash`를 사용하여 새로운 빌드로 전환했다. 리포지토리상의 표시가 3,040억이 된 이유는 DSpark 투기적 디코딩 모듈이 2,840억의 본체에 부수되어 있기 때문이다.

사후 학습만으로 얼마나 작동할 수 있을지 평가해야 한다. DeepSeek이 모델 카드에 제시한 비교표는 자사의 이전 버전뿐만 아니라 GLM-5.2와 Claude Opus 4.8의 성능 지표까지 함께 나열하고 있다. 벤더 표로서 드물게 솔직한 구성이므로 그대로 활용한다.

【DeepSeek 공식 모델 카드 비교표 (0731/4월 Preview/V4-Pro Preview/GLM-5.2/Opus-4.8)】

Terminal Bench 2.1: 82.7 / 61.8 / 72.1 / 81.0 / 85.0
NL2Repo: 54.2 / 39.4 / 38.5 / 48.9 / 69.7
Cybergym: 76.7 / 38.7 / 52.7 / – / 83.1
DeepSWE: 54.4 / 7.3 / 12.8 / 46.2 / 58.0
Toolathlon-Verified: 70.3 / 49.7 / 55.9 / 59.9 / 76.2
Agents' Last Exam: 25.2 / 15.8 / 16.5 / 23.8 / 25.7
AutomationBench Public: 25.1 / 10.8 / 12.8 / 12.9 / 27.2
DSBench-FullStack: 68.7 / 37.0 / 41.8 / 61.8 / 71.6
DSBench-Hard: 59.6 / 25.8 / 31.1 / 54.5 / 71.7

DeepSWE는 7.3에서 54.4로, Cybergym은 38.7에서 76.7로 이동하고 있다. 아키텍처를 전혀 바꾸지 않았는데 이렇게 높은 성능을 낼 수 있다. 에이전트 성능이 후처리 학습과 실행 환경 설계에 크게 의존한다는 2026년의 중요한 교훈이 여기에 나타나고 있다. 총 파라미터 1.6조의 V4-Pro(Preview)는 활성화 130억 Flash를 전 항목에서 앞서는 점은 놓쳐서는 안 된다.

다만 읽기 방식에는 예외 사항이 네 가지 존재한다. 첫째, Code Agent 계열의 태스크는 DeepSeek Harness의 최소 모드에서 평가되었으며, 해당 Harness는 아직 공개되지 않았다. 둘째, DSBench-FullStack와 DSBench-Hard는 DeepSeek의 내부 테스트 세트이다. 셋째, 9개 항목 모두에서 Claude Opus 4.8이 우세하다. 넷째, DeepSeek 자체도 “가장 강력한 프로피에터리 모델과 널리 경쟁적”이라고 언급하며, 동등하다고 말하지 않고 있다.

제3자 평가 결과도 나왔다. 인공지능 분석의 Intelligence Index v4.1에서 50.4를 기록했으며, 4월 프리뷰의 40점에서 10점 상승하여 GLM-5.2의 51에 1점 차이까지 좁혔다. 실무 지향적인 GDPval-AA v2에서는 Elo가 1189에서 1559로 급상승했으며, Terminal-Bench 2.1은 AA 측정에서 79%를 기록했다. AA-Omniscience는 -16으로, 개선의 핵심은 정답률 상승이 아닌 환각 감소였다.

덧붙여 “DeepSeek-V4-Flash의 제3자 지수는 40”라는 문구를 발견했다면, 이는 4월 프리뷰 값입니다. 0731은 50입니다. 동일한 모델 ID로 내용이 변경되었으므로, 참조 대상의 업데이트 시점에 따라 숫자가 달라집니다.

## 가장 큰 무기는 가격이다.

가장 큰 무기는 가격이다. 국제 가격은 100만 토큰당 캐시 히트 입력 0.0028달러, 보통 입력 0.14달러(약 22엔), 출력 0.28달러(약 45엔), 동시 실행 상한 2,500으로, 캐시 히트 시 할인율은 약 98%로 업계 표준 90%보다 더 깊다. 같은 예산으로 다수의 시도, 재시도, 병렬 에이전트, 상호 검증을 수행할 수 있다.

다만, 이 가격에는 사전에 변경될 수 있습니다. DeepSeek은 하루에 총 7시간의 최고 시간대를 제공하며, 그 시간 동안은 모든 결제 항목을 2배로 인상한다고 발표했습니다. 적용 시작일은 8월 6일 기준으로 아직 결정되지 않았습니다. 저렴한 가격을 기준으로 설계할 경우에는 이 점을 고려해야 합니다.

## 로컬 구현 시 유의사항

구현상의 주의사항도 1차 자료에 명시되어 있다. 0731 리포지토리에 Jinja 형식의 챗봇 템플릿이同梱되어 있지 않다. 대신 `encoding` 폴더의 Python 스크립트에서 OpenAI 호환의 메시지 입력 문자열을 변환하고, 출력을 분석한다. 기존 템플릿 전제하의 툴체인을 그대로 가져오면 작동하지 않는다. `reasoning_effort`는 low/high/max의 3단계이다. 권장 샘플링은 온도 1.0으로, 에이전트 용량에서는 top_p 0.95이며, 그 외는 1.0이다. high/max 추론 시의 권장 최대 출력은 38만 4,000 토큰이다.

DSpark 투자 예측 해독은 vLLM에서 `--speculative-config`에 method:dspark를 지정하는 것만으로 활성화되고, SGLang에서는 `--speculative-algorithm DSPARK`를 지정한다. 드래프트 모델 경로를 별도로 지정할 필요가 없다. 목표와 드래프트의 가중치가 동일한 체크포인트에 있기 때문이다. DeepSeek 공식 vLLM 예시는 4×GB300의 단일 노드 구성으로 제시된다.

Responses API에 선제적으로 대응했으며, Codex를 위한 공식 연계 문서도 존재한다. OpenAI Chat Completions, Responses API, Anthropic API, Codex, Claude Code, FIM, Prefix Completion, Tool Calls, JSON Output에 연결하기 쉽다. 참고로, 레거시의 `deepseek-chat` / `deepseek-reasoner`라는 식별자는 2026년 7월 24일에 폐지되었으며, V4 계열의 식별자만 작동한다. 최고 성능의 일체는 아니며, 기업이 AI 에이전트를 대량으로 배포하기 위한 현실적인 해결책이다.

## 10． 제3자 평가 – 검증된 4개 모델 및 Qwen의 참고값

판매사의 자체 보고만으로는 순위가 결정되지 않는다. 각 사는 자체 Harness, 자체 추론 설정, 자체적으로 선택한 벤치마크를 사용하여 숫자를 제시한다. DeepSeek처럼 Harness가 공개되지 않은 경우도 있다. 따라서 동일한 평가자가 동일한 조건에서 실행한 숫자에는 고유한 가치가 있다.

인공 분석 지수 v4.1은 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR의 9가지 평가를 종합한 지표이다. 2026년 8월 6일 기준으로 Kimi K3, GLM-5.2, DeepSeek-V4-Flash-0731, MiniMax M3의 값은 공식 페이지 또는 공식 기사에서 확인할 수 있다. Qwen3.8-Max는 56이라는 재측정치가 보고되었으나, 공식 페이지를 직접 확보하지 못하여 참고치로 한다.

【인공지능 분석 지수 v4.1】Kimi K3(맥스): 57(확인 완료) Qwen3.8-Max: 56(재측정치로 보고, 참고) GLM-5.2(맥스): 51(확인 완료) DeepSeek-V4-Flash-0731(맥스): 50(확인 완료) MiniMax M3: 44(확인 완료)

【참고: 동시대의 유럽-미국 모델】클로이 옵스 5: 61, 클로이 페이블 5: 약 60, 클로이 옵스 4.8: 56, GPT-5.5: 55, 메타 뮤즈 스파크 1.2: 54, Grok 4.5: 54

Qwen3.8-Max의 56은 Claude Opus 4.8과 동등한 성능을 보이며, Google, Meta, xAI의 어떤 모델보다 상위로 평가된다. 위에 있는 모델은 Anthropic과 OpenAI의 최상위 모델, 그리고 Kimi K3뿐이다.

다만, 이 56이라는 숫자에는 변통이 있다. 커뮤니티 상에서는 인공 분석이 처음 53을 표시한 후 재측정을 실시하여 56으로 업데이트했다는 보고가 있다. 다만, 최종 확인 시 공식 변통 설명 페이지를 직접 얻을 수 없었기에 재측정 이유의 단정은 피한다. 53과 56 모두 실제로 존재했던 숫자이며, 후자가 현행값에 해당한다.

이 이야기를 쓰는 이유는, 본고 역시 한때 “Qwen3.8-Max의 제3자 점수는 확인되지 않는다”는 결론을 내렸기 때문이다. 차트에서 사라졌던 시간대에 확인해보면, 그렇게 보인다. 제3자 평가는 정지된 이미지(스틸)가 아니다.

자, 이 목록에서 세 가지를 읽을 수 있습니다.

첫째, 중국 세력의 상위 4 모델이 50에서 57 사이의 범위에 밀집되어 있다. 7 포인트의 차이는 무시할 수 없는 수준이다. 어느 한 모델이 압도적으로 우세한 상황과는 아니다.

둘째로, 최상위 유럽 모델과의 차이는 예전 같지 않다. Kimi K3(57)와 Claude Opus 5(61) 간에 4점 차이가 있기 때문이다. Arena의 공동 창립자 Ion Stoica 氏は7월 하순, 중국 오픈 웨이트 모델과 미국 프론티어 연구소 간의 차이가 6~9개월에서 2~3개월로 줄었다고 말했다.

세 번째로, MiniMax M3만이 한 단계를 낮다. 하지만 이는 M3가 열세한 모델이라는 의미가 아니다. M3는 종합 지능과의 경쟁이 아니다. 1M은 네이티브 시각 및 영상, PC 운영을 하나의 오픈 웨이트 모델로 통합한 것이 특징이며, 그 조합을 가진 모델은 다른 곳에 존재하지 않는다.

그리고 이 장에서 가장 중요한 것은 비용이다.

【지능 지수 1 작업당 비용】GLM-5.2 (최대): 0.57달러 (약 91엔), Kimi K3 (최대): 0.86달러 (약 138엔), Qwen3.8-Max: 1.14달러 (약 182엔), GPT-5.6 Sol (최대): 1.23달러 (약 197엔), Claude Opus 5 (최대): 2.03달러 (약 325엔), Claude Fable 5 (백업 포함): 3.15달러 (약 504엔)

Qwen3.8-Max는 토큰 단가를 전세대보다 낮추고, 입력 2.50달러 → 2.00달러, 출력 7.50달러 → 6.00달러, 캐시 0.50달러 → 0.25달러로 변경했다. 모든 항목을 인하했으며, 1 작업 비용은 0.53달러에서 1.14달러로 2배 이상 증가했다.

이유는 명확하다. 모델이 같은 업무에 투자하는 턴 수가 달라졌기 때문이다. GDPval-AA에서 평균 턴 수는 Qwen3.7-Max의 14에 비해 Qwen3.8-Max는 64이다. 입력 토큰 소비는 약 15배 증가했고, 출력 토큰은 45% 증가하여 1억 4,500만 토큰에 달했다. 더 많은 생각을 하고, 더 많은 손을 움직이게 되면서 점수는 10점 상승했고, 비용도 2배 증가했다.

이 글에서 반복적으로 등장하는 “단가와 실비는 별도”라는 논점의 가장 명쾌한 사례이다. 가격 인하의 보도 자료만 읽고 이행을 결정하면, 청구서에서 큰 혼란을 겪게 될 것이다.

지표 안에도 주의가 필요합니다. Qwen3.8-Max의 성능 향상은 균일하지 않습니다. Terminal-Bench v2.1은 6점, CritPt는 7점, SciCode는 4점, HLE는 3점이 상승한 반면, GPQA Diamond는 변동이 없고, AA-LCR은 2점 하락했으며, AA-Omniscience는 10점을 하락했습니다. AA-Omniscience의 성능 저하 원인은 환각률이 23%에서 40%로 상승한 점입니다. 정답률은 약 31%로 동일하게 유지되었습니다. 즉, 이 모델은 이전에는 답을 기록하고 답변을 하지 않았지만, 이제 많은 질문에 오답을 생성하고 있습니다. 업무에 활용한다면, 이 점을 간과해서는 안 됩니다.

더 나아가 τ³-벤치 뱅킹에서는 42%를 기록하며, 전 세대 대비 32 포인트나 상승했다. 인공 분석 자체도 이를 외삽값으로 기록하고 있다. 다른 모든 항목에서는 Qwen3.8-Max를 상회하는 모델보다, 이 한 항목만으로 우위를 점하고 있기 때문이다. 합성 지수를 하나의 숫자로 받아들이기보다는 내역을 살펴보는 것이 필요하다.

冗長성의 비교도 덧붙인다.

DeepSeek-V4-Flash-0731: 약 2억 1천만 토큰, Qwen3.8-Max: 약 1억 5천만 토큰, 중앙값: 약 6,600만 토큰

저가 모델일수록 더 많은 말을 하는 경향이 뚜렷하게 나타난다. 토큰 단가가 1/10이 되더라도 발화량이 3배라면 실제 비용은 1/3에 불과하다.

속도 측면에서 제3자 측정 결과, GLM-5.2가 가장 빠른 제공업체로 1초당 200 토큰을 초과하는 경우가 있었고, DeepSeek-V4-Flash는 약 118 토큰, MiniMax M3는 약 79~89 토큰, Qwen3.8-Max는 약 58 토큰, Kimi K3는 약 32 토큰이었다. 장시간 에이전트의 경우, 이 차이가 그대로 소요 시간의 차이로 나타났다.

라이선스는 성능만큼 중요합니다. GLM-5.2와 DeepSeek-V4-Flash는 MIT 라이선스로, MiniMax M3는 MiniMax 커뮤니티 라이선스, Kimi K3는 Kimi K3 라이선스, Qwen3.8-Max는 미공개 라이선스입니다. Kimi와 MiniMax는 상업적 이용이나 대규모 서비스에서 개별 조건을 확인해야 합니다.

인공 분석 지수는 만능이 아니다. 9등급의 합성적인 평가이며, 영어 중심적이고, 일본 품질, 산업 특화 지식, 사내 시스템과의 호환성을 측정하지 못한다. 여기서 제시된 숫자는 “자사 평가를 설계하기 위한 출발점”일 뿐, 결론이 아니다.

## 11. 추론 능력 비교

추론 성능은 수학·논리, 세계 지식, 장문 추론, 코드 추론, 시각 추론, 도구 활용으로 나누어 볼 수 있다.

키미 K3는 인공지능 분석 지수 57로, 확인된 4개 모델 중 가장 높은 성능을 보인다. 2.8조 파라미터와 항상 추론을 사용하며, 고난도의 지식 노동이나 거대한 코드 베이스에 적합하다. 하지만 출력 속도는 약 32 토큰/초로 느리고, 첫 번째 응답까지의 대기 시간도 길다.

GLM-5.2는 51입니다. Kimi보다 지능 지수는 낮지만, 가장 빠른 제공업체에서는 200 토큰/초 초과가 관측되었으며, 장시간 Coding Agent에서 속도와 지능의 균형이 좋습니다. MiniMax M3는 44로, 종합 지수보다 시각, 영상, PC 조작을 포함한 복합 추론에 가치가 있습니다. DeepSeek-V4-Flash는 40이지만, 저렴한 가격과 약 118 토큰/초의 속도에 의해 많은 추론을 처리할 수 있습니다.

Qwen3.8-Max는 제3자 지수 56으로 중국 세력 2위를 차지했다. 다만 내역을 살펴보면 환각률이 23%에서 40%로 악화되었고, AA-Omniscience는 10점 하락했다. 지식의 정확성이 필요한 용도에서는 종합 지수만으로 판단하면 위험하다 (제10장).

기업은 최고 점수만으로 선택하지 않고, 정답률, 대기 시간, 재시도율, 툴 호출 성공률, 1 작업당 총 비용을 동일한 환경에서 측정해야 한다.

## 12. 코딩 성능 비교

짧은 함수, SQL, 스크립트, 정규 표현에서는 모델 간의 차이가 줄어들고 가격, 속도, IDE 통합, FIM, 구조화 출력이 중요해진다. 이 영역에서는 DeepSeek-V4-Flash가 유력하다.

GLM-5.2와 Kimi K3가 유력하며, GLM-5.2는 장시간 동안 Agentic Engineering을 활용하고, Kimi K3는 거대한 코드베이스와 시각 피드백을 강점으로 한다. MiniMax M3는 화면을 보면서 UI나 업무 소프트웨어를 조작하는 개발에 적합하다.

Qwen3.8-Max는 Terminal-Bench 2.1에서 86.6, FrontierSWE에서 73.5, DeepSWE 1.1에서 56.6의 결과를 발표했다. 세대 간에 거의 두 배 증가한 항목도 있지만, 모두 알리바바 자체의 측정이며 하네스는 공개되지 않았다. 제3자가 Terminal-Bench v2.1을 측정한 결과는 전 세대 대비 6포인트 증가에 그쳤다. 자체 리포지토리에서 PoC를 수행하고 숫자들의 신뢰성을 확인한 후에 전환하는 것이 안전하다.

대량 이슈 처리에서는 DeepSeek으로 최초 수정 후, 실패 횟수가 많은 경우에만 GLM이나 Kimi로 계층화하는 방식이 합리적이다. 평가해야 할 지표는 이슈 완수율, 테스트 합격률, 재시도 횟수, 인간의 수정 시간, 불필요한 변경량, PR 리뷰 통과율, 건당 총 비용이다.

## 13. 에이전트와 툴 콜링 비교

에이전트 성능은 모델 단체만으로는 결정되지 않습니다. 시스템 프롬프트, 툴 정의, 해머, 메모리, 브라우저, 터미널, 파일 시스템, MCP, 권한 관리, 재시도, 평가기, 인간 승인, 감사 로그가 필요합니다.

GLM-5.2는 Claude Code, OpenClaw, Cline 등의 코딩 계획과의 조화가 좋다. Kimi K3는 Dynamic Tool Loading을 활용하여 필요한 도구만 선택적으로 로딩하는 설계를 추천한다. MiniMax M3는 PC 화면과 도구를 교차하는 에이전트 형태로 설계되었다. DeepSeek-V4-Flash는 OpenAI, Anthropic, Codex, Claude Code와 호환성을 갖도록 설계되어 통합이 용이하다.

Qwen3.8-Max는 OpenAI 및 Anthropic의 기능을 모두 갖추고 있으며, Codex의 경우 Responses 호환 설정, Claude Code의 경우 Anthropic 호환 엔드포인트가 공식적으로 안내된다. 다만 GDPval-AA에서 평균 턴 수가 전세대 14에서 64로 늘어나는 것은 에이전트 설계와 직결되며, 최대 단계 수와 예산 제한을 미리 정하지 않으면 1 작업의 비용을 산출할 수 없다.

실제 운영에서는 읽기 전용 권한, 전송 전 승인, 삭제 전 승인, 자금 조작 전 승인, 운영 로그, 롤백, 비밀 정보 마스킹, 샌드박스, 최대 단계 수, 예산 상한이 필요합니다.

## 1410만 토큰의 의미

100만 토큰은 책 수십 권, 수천 페이지 분량의 문서, 대규모 소스 코드, 장시간 회의 기록, 다수의 계약서, 에이전트의 작업 이력을 처리할 수 있는 규모이다.

5개 모델 모두가 100만 토큰을 주장하지만, 실제로는 동일하지 않다. MiniMax M3는 “최대 1M·최소 보장 512K”로 입출력 총량이 상한이며, GLM-5.2는 `glm-5.2[1m]`라는 별도의 식별자로 호출될 때 최대 출력 12만 8천, DeepSeek-V4-Flash는 최대 출력 38만 4천으로 5개 모델 중 가장 크고, Kimi K3와 Qwen3.8-Max는 전 영역 플랫 요금제를 사용한다.

100만 토큰이 있어도 RAG는 여전히 필요하다. 텍스트 전체를 투입하는 방식은 비용이 높고, 정보 업데이트, 권한 문제, 출처 문제, 불필요한 정보, 기밀 정보 문제 등 여러 가지 문제가 있다. 검색을 통해 후보를 좁히고, 관련 자료를 긴 문맥으로 넣고, 교차 추론을 수행하여 출처를 반환하는 방식으로 구성해야 한다.

가장 중요한 것은 1M을 에이전트의 작업 기억에 활용하는 것이다. 설계 문서, 코드, Git 차이, 터미널 로그, 테스트 결과, 실패 이력을 보관하면 동일한 실패를 반복할 가능성이 줄어든다.

하지만 입력 가능한 것과 정확하게 이용 가능한 것은 다릅니다. 앞쪽, 중앙, 뒤쪽 정보 검색, 모순 검출, 장시간 목표 유지 등을 자체 데이터로 시험해야 합니다.

## 15. 이미지, 동영상, PC 운영 방식 비교

【MiniMax M3】 이미지 입력: 지원 영상 입력: 지원 PC 조작: 공식적으로 통합 운영에 대한 평가: 5개 모델 중 시각, 영상, PC 조작 기능을 가장 통합적으로 제공

[GLM-5.2] 이미지 입력: 비지원 시각 업무: GLM-V 시리즈 또는 외부 VLM과의 업무 분담이 필요합니다.

Qwen3.8-Max] 이미지 및 동영상 입력: 본고에서 확인한 공식 챗봇 API 자료에서는 Function Calling의 확정 여부가 불분명하며, 이에 대한 대응 내용은 시각 및 언어 조기 융합 학습 기반을 표방하고, 별도의 Qwen3-VL 시리즈가 각종 벤치마크에서 우수한 성능을 보인다는 (발표 기반) 내용이다.

【키미 K3】 이미지 입력: 대응 시각 + 코딩: 대응 영상 이해: 공식 설명에서는 장시간 시각 용도를 강조하지만, API 입력 사양은 최신 문서에서 확인한다.

DeepSeek-V4-Flash] 이미지 입력: 비지원 시각 업무: 외부 VLM과의 협업이 필요

MiniMax M3와 Kimi K3는 스크린샷을 보면서 코드를 수정하고 조작을 보완하는 폐쇄 루프를 구축하기 쉬운 구조이다. GLM과 DeepSeek는 시각 모델을 분리하여 분업적인 방식을 취한다. Qwen3.8-Max는 Arena.AI의 멀티모달 부문에서 세계 2위를 기록했다.

## 16. 속도, 가격, 동시 실행 성능

가격은 입력, 출력, 캐시, 긴 텍스트 추가 요금, 사고 토큰, 동시 실행, 지역, 구독 등을 포함하여 비교한다. 본 기사의 달러 표시 가격은 편의상 1달러 160엔으로 환산하고 있으며, 환율은 변동하므로 계약 시에는 최신 환율을 확인하시기 바란다.

DeepSeek-V4-Flash는 인공 분석의 DeepSeek API 측정에서 100만 토큰당 입력 0.14달러, 출력 0.28달러, 캐시 히트 약 0.003달러로, 가격과 속도 모두에서 강력한 성능을 보입니다.

MiniMax M3는 인공 분석의 가중 평균 가격으로 약 0.22달러/100만 토큰이며, 속도는 약 79~89 토큰/초입니다. 공식 API, OpenRouter, 기타 제공업체에서 가격이 다르므로 특정 “실제 시세 가격”을 고정된 값으로 제시하지 않습니다.

GLM-5.2는 인공 분석의 가중 평균 가격으로 약 0.90달러/100만 토큰, 최고 성능 제공업체에서는 약 219 토큰/초이다. 첫 번째 API의 掲載 단가는 입력 1.40달러, 캐시 입력 0.26달러, 출력 4.40달러이다. 5개 모델 중 1 작업 비용이 가장 저렴한 것은 이 모델로 0.57달러였다.

키미 K3는 인공 분석의 가중 평균 가격으로 약 2.31달러/100만 토큰, 속도는 약 32 토큰/초입니다. 고지능이지만 대기 시간과 비용이 큽니다.

Qwen3.8-Max는 입력 2.00달러(약 320엔), 출력 6.00달러(약 960엔), 캐시 히트 0.25달러이다. 전 세대의 Qwen3.7-Max(2.50/7.50/0.50달러)에서 모든 항목의 가격이 하락했다. 다만 1 작업 비용은 0.53달러에서 1.14달러로 두 배 이상 증가했다. 단가와 실비가 반대 방향으로 움직인 사례이다(제10장).

단가뿐만 아니라, 1차 작업을 완료하는 데 소요된 총 토큰 수, 재시도 횟수, 대기 시간, 수정 시간도 측정해야 한다.

## 17. 오픈 웨이트와 로컬 운영

GLM-5.2는 MIT 라이선스로, 공식 Hugging Face 모델 크기는 약 1.51TB입니다. Kimi K3는 약 1.56TB이며, 자체 Kimi K3 라이선스를 가지고 있습니다. MiniMax M3는 MiniMax 커뮤니티 라이선스로 제공됩니다. DeepSeek-V4-Flash는 MIT 라이선스로, Kimi나 GLM보다 작지만 총 284B 파라미터를 가지고 있어 일반적인 GPU 한 장으로는 작동하기에 적합하지 않습니다.

Qwen3.8-Max는 총 2.4조 파라미터로, 강력한 양자화에도 1TB를 넘는 용량을 가지고 있다. 8월 10일 주에 Hugging Face와 ModelScope에서 공개할 예정이라고 발표했지만, 8월 6일 현재 가중치와 라이선스 조항이 아직 공개되지 않았다. 동시에 공개 예정인 Qwen3.8-27B가 현실적인 온프레미스 진입점이 될 것이다.

오픈 웨이트이므로 가격이 저렴하다고 단정할 수 없습니다. GPU 구매 비용, 전력, 냉각, 네트워크, 저장 공간, 추론 엔진, 운영 인력, 장애 대응 등을 포함하는 TCO(총소유비용)로 비교해야 합니다.

현실적인 구성은 소형 모델을 온프레미스에 두고, 최고 난이도만 Kimi, GLM, MiniMax, Qwen 등의 클라우드로 보내는 하이브리드 방식이다.

## 18. 자율 실행의 실천을 어떻게 해석해야 하는가

각 사는 장시간 에이전트의 실전을 공표한다. 하지만 실전은 일반 사용자가 같은 결과를 재현할 수 있음을 보장하지 않는다.

MiniMax M3는 장시간 코딩, 브라우저, 오피스, PC 운영을 강조한다. GLM-5.2는 장시간 Agentic Engineering을 공식 테마로 한다. Kimi K3는 거대한 코드베이스, 시각 피드백, End-to-End 지식 작업을 강조한다. DeepSeek는 저렴한 가격으로 다수의 에이전트를 병렬화하는 데 주력한다.

Qwen도 실전을 공개하고 있다. oh-my-cli라는 리포지토리를 빈 폴더에서부터 본番 가동까지 16일간 422개의 커밋으로 자율 개발했으며, 전 과정을 GitHub에서 공개했다. 다만 공식 X에서는 “10일 이상의 자율 진화형 개발”이라고도 표현하고 있으며, 일수의 표현에 폭이 있다. 여기에 500턴 이상의 칩 설계 최적화, 365일 분의 EC 전략 수립이 언급되었다. 이와 같은 실전에서 자사가 측정해야 할 것은 시간 자체가 아닌 중단 횟수이다.

실연을 보실 때는 모델, Harness, 검색, 툴, 재시도 횟수, 예산 제한, 인간 개입, 실패 사례, 평가 조건 등을 확인합니다. 모델 단체의 능력과 기업이 구축한 Agent 기반의 능력을 분리하여 고려해야 합니다.

## 19. API 호환성 및 개발 도구 연동

MiniMax M3, GLM-5.2, Kimi K3, DeepSeek-V4-Flash는 OpenAI 호환 API를 사용할 수 있습니다. GLM, Kimi, DeepSeek은 Anthropic 호환 또는 Claude Code로의 도입 경로도 마련됩니다.

Qwen3.8-Max는 OpenAI, Anthropic, DashScope와 호환되며, 기본 URL과 모델 ID만 변경하면 대부분 쉽게 이전이 가능하다. 다만 모델 ID는 공식 버전이 `qwen3.8-max`, 프리뷰 버전이 `qwen3.8-max-preview`로 구분되어 다르다. 토큰 플랜을 통해 설정을 그대로 종량제 시스템으로 이전하면 의도하지 않은 모델을 호출하게 될 수 있다.

API 호환성을 고려하더라도, Tool Call ID, Thinking Content, 스트리밍, JSON 스키마, 이미지 입력 형식, 에러 코드, Rate Limit, System Prompt 동작은 차이가 있을 수 있다. Base URL만 변경하여 스테이징 환경에 적용하고 통합 테스트를 수행한다.

기업은 자체적으로 모델 추상화 계층을 보유하고, 모델명, 가격, 장애, 지역 규제에 따라 전환이 가능하도록 해야 한다.

## 20. 업종별 선택 방법

제조업에서는 도면, CAD, 설비 사진, 작업 영상, 보전 기록, ERP, MES를 다룬다. 시각과 PC 조작에는 MiniMax M3, 어려운 설계나 코드에는 Kimi K3, 장시간 구현이나 성능 최적화에는 GLM-5.2, 대량 로그 분석에는 DeepSeek-V4-Flash가 적합하며, Alibaba Cloud 이용 기업이나 중국 거점을 가진 제조업은 Qwen3.8-Max가 도입 경로로서 명확하다.

소프트웨어 개발에서는 최고 난도를 Kimi K3, 장시간 구현을 GLM-5.2, UI와 PC 운영을 MiniMax M3, 대량 이슈 처리를 DeepSeek-V4-Flash로 분담하고, Qwen3.8-Max는 Qwen Code와의 호환성을 자사 리포지토리에서 검증한다.

조사 및 기사 제작에서는 Kimi K3와 GLM-5.2가 장문 조사에 유력하며, 이미지나 영상 자료가 많은 경우에는 MiniMax M3가, 자료의 전처리 및 분류에는 DeepSeek-V4-Flash가 적합하다.

재무 및 법무 부서에서는 DeepSeek으로 대량 추출을 하고, Kimi나 GLM으로 복잡한 비교를 수행하며, MiniMax로 화면 조작을 진행하여 최종 판단은 인간이 내립니다.

일본어 평가에서는 높임말, 계약 문구, 기술 용어, 고유 명사, 일본 법령, 장문의 자연스러움, 중국어 혼입, 출처 조작 등을 자사 평가 세트에서 확인한다.

## 21.5 모델을 활용한 AI 라우터 전략

AI 라우터는 난이도, 입력 길이, 이미지 및 영상, PC 작동, 속도, 예산, 기밀성, 데이터 지역, 출력 길이, 도구 수, 실패 영향, 인간 승인을 판단한다.

처음에는 DeepSeek으로 처리하고, 실패 시 GLM이나 Kimi로 전환한다. 화면이나 영상이 필요하면 MiniMax, Alibaba Cloud 통합이나 다국어 업무는 Qwen으로 보낸다.

이 구성으로 인해 비용 절감, 벤더 잠금 해제 방지, 장애 발생 시 전환, 데이터 지역 대응, 신 모델 A/B 테스트, 가격 변경 대응이 가능합니다.

## 22. 각 모델의 약점 및 유의사항

## MiniMax M3 (제5장)

전체 지능 지수는 5가지 모델 중 가장 낮은 44점이다. MiniMax 커뮤니티 라이선스는 MIT 라이선스가 아닌 대규모 상업적 이용 조건 확인이 필요하다. PC 운영은 에이전트 기반의 안전 설계를 기반으로 한다.

## GLM-5.2 (제6장)

텍스트 전용으로 이미지 입력이 없는 형태입니다. 753B, 약 1.51TB로 자사 운영은 용이하지 않습니다. 코딩 계획은 이용 쿼리 제한이 있어 완전 무제한이 아닙니다.

## Qwen3.8-Max (제7장)

무게와 라이선스 조항이 8월 6일 기준으로 아직 공개되지 않았습니다. ‘오픈 웨이트’는 주장에 불과합니다. 단가를 낮췄음에도 1개의 작업 비용이 2배 이상 증가했으며, 환각률이 23%에서 40%로 악화되고 있습니다. Preview 버전의 모델 ID가 공식 문서와 함께 존재하여 호출 오류가 발생할 수 있습니다.

## 키미 K3 (제8장)

2조 8천억 원, 약 1.56TB 용량으로 셀프 호스팅이 매우 어렵고, 출력 속도는 초당 약 32 토큰으로 5개 모델 중 가장 느립니다. Kimi K3 라이센스는 MIT 라이센스가 아닌 상업적 조건을 확인해야 합니다. 고지능이지만 속도와 비용이 높습니다.

## DeepSeek-V4-Flash (제9장)

이미지 입력 기능을 갖추지 않아 최고 난도의 종합 지능으로는 Kimi나 GLM에 뒤쳐진다. 매우 긴 추론을 생성하며, 평가 세트 전체의 출력 토큰량은 5 모델 중 최대였다. 공개된 벤치마크는 미공개된 DeepSeek Harness로 측정되었으며, 9 항목 전부에 걸쳐 Claude Opus 4.8가 상회했다. 1일 7시간의 피크 시간대에 전 課金 항목을 2배로 늘리는 개정이予告되었으며, Jinja 형식의 채팅 템플릿이同梱되지 않고, 별도의 encoding 스크립트를 사용해야 한다.

## 23. 종합 순위 – 다만 목적별로 볼 때

2026년 8월 6일 시점의 평가이다. 인공 분석(Artificial Analysis)의 측정값이 있는 항목(제10장)은 이를 우선하며, 나머지 항목은 원본 자료와 기능 구성에서 판단했다. 동일 Harness에 의한 완전한 제3자 비교는 아니다.

## 제3자 종합 지능

- 키미 K3：57
- Qwen3.8-Max: 56 (기준값)
- GLM-5.2：51
- DeepSeek-V4-Flash-0731：50
- MiniMax M3：44

## 장시간 코딩

- GLM-5.2／Kimi K3
- Qwen3.8-Max
- MiniMax M3
- DeepSeek-V4-Flash

## PC 운영 및 시각 에이전트

- MiniMax M3
- 어느 날, 나는 카호에게서 전화가 왔다. 그녀는 마치 며칠 전처럼, 마치 어제처럼, 마치 지난주처럼, 마치 지난달처럼, 마치 지난 수많은 시간처럼, 마치 모든 것이 시작된 것처럼, 마치 모든 것이 끝난 것처럼, 마치 모든 것이 다시 시작된 것처럼, 마치 모든 것이 멈춘 것처럼, 마치 모든 것이 움직이는 것처럼, 마치 모든 것이 존재하는 것처럼, 마치 모든 것이 사라지는 것처럼, 마치 모든 것이 다시 나타나는 것처럼, 마치 모든 것이 변하는 것처럼, 마치 모든 것이 그대로 남아있는 것처럼, 마치 모든 것이 덧없게 느껴지는 것처럼, 마치 모든 것이 영원처럼 느껴지는 것처럼, 마치 모든 것이 의미있는 것처럼, 마치 모든 것이 무의미한 것처럼, 마치 모든 것이 아름다운 것처럼, 마치 모든 것이 끔찍한 것처럼, 마치 모든 것이 혼란스러운 것처럼, 마치 모든 것이 명확한 것처럼, 마치 모든 것이 밝은 것처럼, 마치 모든 것이 어두운 것처럼, 마치 모든 것이 희망찬 것처럼, 마치 모든 것이 절망적인 것처럼, 마치 모든 것이 평화로운 것처럼, 마치 모든 것이 전쟁터인 것처럼, 마치 모든 것이 사랑으로 가득 찬 것처럼, 마치 모든 것이 증오로 가득 찬 것처럼, 마치 모든 것이 행복한 것처럼, 마치 모든 것이 슬픈 것처럼, 마치 모든 것이 즐거운 것처럼, 마치 모든 것이 괴로운 것처럼, 마치 모든 것이 긍정적인 것처럼, 마치 모든 것이 부정적인 것처럼, 마치 모든 것이 진실한 것처럼, 마치 모든 것이 거짓된 것처럼, 마치 모든 것이 현실인 것처럼, 마치 모든 것이 환상인 것처럼, 마치 모든 것이 과거인 것처럼, 마치 모든 것이 미래인 것처럼, 마치 모든 것이 현재인 것처럼, 마치 모든 것이 시작인 것처럼, 마치 모든 것이 끝인 것처럼, 마치 모든 것이 중간인 것처럼, 마치 모든 것이 완벽한 것처럼, 마치 모든 것이 불완전한 것처럼, 마치 모든 것이 단순한 것처럼, 마치 모든 것이 복잡한 것처럼, 마치 모든 것이 쉬운 것처럼, 마치 모든 것이 어려운 것처럼, 마치 모든 것이 가능할 것처럼, 마치 모든 것이 불가능할 것처럼, 마치 모든 것이 현실적으로 느껴지는 것처럼, 마치 모든 것이 비현실적으로 느껴지는 것처럼, 마치 모든 것이 믿을 수 있는 것처럼, 마치 모든 것이 믿을 수 없는 것처럼, 마치 모든 것이 이해할 수 있는 것처럼, 마치 모든 것이 이해할 수 없는 것처럼, 마치 모든 것이 받아들일 수 있는 것처럼, 마치 모든 것이 거부당하는 것처럼, 마치 모든 것이 존중받는 것처럼, 마치 모든 것이 무시당하는 것처럼, 마치 모든 것이 사랑받는 것처럼, 마치 모든 것이 멸시당하는 것처럼, 마치 모든 것이 인정받는 것처럼, 마치 모든 것이 비난받는 것처럼, 마치 모든 것이 칭찬받는 것처럼, 마치 모든 것이 비판받는 것처럼, 마치 모든 것이 감사하는 것처럼, 마치 모든 것이 불평하는 것처럼, 마치 모든 것이 만족하는 것처럼, 마치 모든 것이 불만족스러운 것처럼, 마치 모든 것이 평화로운 것처럼, 마치 모든 것이 혼란스러운 것처럼, 마치 모든 것이 고요한 것처럼, 마치 모든 것이 활기찬 것처럼, 마치 모든 것이 침울한 것처럼, 마치 모든 것이 웅장한 것처럼, 마치 모든 것이 소박한 것처럼, 마치 모든 것이 화려한 것처럼, 마치 모든 것이 낡은 것처럼, 마치 모든 것이 새로운 것처럼, 마치 모든 것이 낡고 새로운 것처럼, 마치 모든 것이 과거와 미래가 뒤섞인 것처럼, 마치 모든 것이 시간의 흐름 속에서 변화하는 것처럼, 마치 모든 것이 영원히 지속되는 것처럼, 마치 모든 것이 덧없이 사라지는 것처럼, 마치 모든 것이 끊임없이 변화하는 것처럼, 마치 모든 것이 멈추지 않고 움직이는 것처럼, 마치 모든 것이 완벽하게 조화를 이루는 것처럼, 마치 모든 것이 불협화롭게 엉망진창이 되는 것처럼, 마치 모든 것이 아름다운 조화를 이루는 것처럼, 마치 모든 것이 혼란스러운 조화를 이루는 것처럼, 마치 모든 것이 평화를 상징하는 것처럼, 마치 모든 것이 전쟁을 상징하는 것처럼, 마치 모든 것이 사랑을 상징하는 것처럼, 마치 모든 것이 증오를 상징하는 것처럼, 마치 모든 것이 희망을 상징하는 것처럼, 마치 모든 것이 절망을 상징하는 것처럼, 마치 모든 것이 행복을 상징하는 것처럼, 마치 모든 것이 슬픔을 상징하는 것처럼, 마치 모든 것이 즐거움을 상징하는 것처럼, 마치 모든 것이 괴로움을 상징하는 것처럼, 마치 모든
- 키미 K3
- GLM-5.2+GLM-V／외부 시각
- DeepSeek-V4-Flash+ 외부 시각

## 1 작업당 비용 (가장 저렴한 순)

- DeepSeek-V4-Flash는 번역과 관련 없는 용어이므로, 번역 작업에는 포함되지 않습니다. 320/489 텍스트를 제공해 주시면, 무라카미 하루키와 카호 관련 내용을 자연스럽고 정확한 한국어로 번역해 드리겠습니다.
- MiniMax M3
- GLM-5.2: 0.57 달러
- 키미 K3: 0.86달러
- Qwen3.8-Max: 1.14 달러

토큰 가격의 순위와 일치하지 않습니다. Qwen3.8-Max는 가격으로 인해 Kimi K3의 1/3 이하이지만, 1 작업 비용에서는 상회합니다.

## 지식의 정확성

- 그녀는 낡은 셔츠를 입고 있었다. 셔츠는 낡아서 꽤 얇아졌고, 땀에 젖으면 끈적거리는 느낌이 들었다. 셔츠는 낡은 셔츠였지만, 그녀에게는 꽤나 익숙한 옷이었다. 그녀는 셔츠를 입고 밖으로 나갔다. 밖은 꽤나 더웠고 습했다. 그녀는 셔츠를 입고 밖으로 나간 것은 좋은 생각이었다. 셔츠는 그녀를 시원하게 해줄 것이다.
- GLM-5.2
- DeepSeek-V4-Flash-0731：AA-Omniscience -16（환각 감소로 +7 개선）
- MiniMax M3
- Qwen3.8-Max: 환각율 23% → 40%로 악화

## 무게 중심의 편의성

- GLM-5.2: MIT 모델, 다양한 양자화 버전과 FP8을 이용한 8배 H200 1노드 구성 가능
- 딥시크-V4-플래시-0731: MIT, 4×GB300 노드, Llama.cpp 호환
- MiniMax M3：독립 커뮤니티 라이선스
- Kimi K3：독립 라이선스, 1.56TB로 멀티노드 필수
- Qwen3.8-Max: 가중치 미공개

## 용도별 추천

[최고 난도의 종합 지능] Kimi K3 [장기간 구현 및 성능 최적화] GLM-5.2 [PC 운영 및 이미지/영상] MiniMax M3 [대규모, 고속, 저가] DeepSeek-V4-Flash [Alibaba Cloud 통합 및 다국어 업무] Qwen3.8-Max [제약이 적은 상업용 오픈 웨이트] GLM-5.2 / DeepSeek-V4-Flash [Claude Code 모델 개발] GLM-5.2 / Kimi K3 [Codex 백엔드] DeepSeek-V4-Flash [콘텐츠 제작] MiniMax M3 + H3

## 24. 확실한 세 가지 분류와 이 글이 한 번 엉뚱한 이야기를 했던 내용

본 글에서는 정보의 정확도를 세 단계로 나누어 다루어 왔다. 벤더 공식 자료로 확인한 숫자는 “공식 확인”, 언론 보도나 행사 발언에 의존하는 내용을 “언론 기반”, 인공 분석 등 제3자가 독자적으로 측정한 숫자는 “제3자 검증”이라고 부른다. 공식적으로 확인하기 어려운 언론 수치나 SNS상의 숫자는 확정 사양으로 채택하지 않는다.

이 정책 자체는 옳다. 하지만 올바른 정책을 가지고 있어도 엉뚱한 실수를 할 수 있다. 실제로 이 글은 한 번 실수를 저질렀다.

일차적으로, 다음과 같이 썼던 것이다.

- Qwen3.8-Max는 ‘qwen3.8-max-preview’ 버전이며, 공식 버전으로의 전환, 2.4조 파라미터, 입력 2달러, 출력 6달러, 가중치 공개 예정은 공식적으로 확인되지 않으므로 삭제합니다.
- 7월 31일에 업데이트된 DeepSeek-V4-Flash-0731 버전은 공식 변경 이력에서 확인되지 않으므로 삭제합니다.
- 세 번째 지표는 키미 57, GLM 51, MiniMax 44, DeepSeek 40의 4개 모델만 포함됩니다.

그 후, 원천 자료를 직접 확인한 결과, 세 가지 모두 오류였다. 무슨 일이 있었는지 기록해둔다. 똑같은 실수는 누구든 반복한다.

[무엇을 보고 그렇게 판단했는지] Qwen에 대해서는 알리바바 클라우드 모델 스튜디오의 모델 목록을 확인했다. 그곳에는 `qwen3.8-max-preview`가 토큰 플랜 제한 및 중국 베이징 리전으로 게시되어 있으며, “사전 테스트 종료 후 대체될 것”이라는 문구가 기재되어 있었다. 실제로 게시된 내용이다. 오해의 소지가 있는 것이 아니다.

DeepSeek에 대해서는 API 변경 이력 페이지를 확인했습니다. 최상단에는 4월 24일의 V4 공개가 있으며, 7월 31일에 항목이 없는 것은 사실입니다.

왜 그것이 여전히 잘못되었는지】 공식 자료는 단일한 것이 아니다. 같은 회사의 다른 선반에 다른 상태가 놓여 있을 수 있다.

Qwen의 공식 버전은 Model Studio의 모델 목록이 아닌 DashScope와 QwenCloud에서 `qwen3.8-max`로 운영되고 있었다. Vercel의 AI Gateway에는 8월 2일부터 등록되었으며, Artificial Analysis는 Alibaba의 공개 API로 실제로 측정했고, Bloomberg는 8월 3일에 2.4조 파라미터의 모델로 보도했다. Preview 버전의 페이지가 남아있는 것과 공식 버전이 존재하지 않는 것은 별개의 문제이다.

DeepSeek의 0731은 Hugging Face에 존재하며, 변경 기록과는 무관했다. `deepseek-ai/DeepSeek-V4-Flash-0731` 모델 카드에는 MIT 라이선스, 9개의 평가 지표, arXiv:2606.19348 기술 보고서 링크가 포함되어 있으며, 지난 한 달 동안만 43만 건 이상 다운로드되었다. 변경 기록에 포함되지 않았다는 사실과 출시되지 않았다는 사실은 별개의 문제이다.

제3자 지표에 대해서는 더 단순했다. 인공 분석은 Qwen3.8-Max에 53점을 부여한 후, 엔드포인트의 불량을 이유로 차트에서 일시적으로 제외하고 재측정하여 56점을 획득했다. 빠져있던 시간대에 확인하면 “확정값 없음”으로 보일 것이다. DeepSeek의 40은 4월 프리뷰 값이다. 동일 모델 ID로 내용이 바뀌었기 때문에, 참조 대상의 업데이트 시점에 숫자가 달라진다.

그것으로부터 끌어낼 수 있는 교훈은 “공식적으로 확인되지 않는” 것이 “존재하지 않는” 것이 아니다. 앞자는 자신의 탐색 범위에 대한 묘사이고, 뒷자는 세계에 대한 묘사이다. 이 두 가지를 혼동하면 신중함이 그대로 오류로 이어진다.

확인되지 않은 정보를 확증된 것으로 적는 것은 하나의 실수가 아니지만, 확인된 사실을 “확인되지 않음”으로 삭제하는 것은 또 다른 실수이다. 방향만 역으로 돌아간 것일 뿐, 독자가 받아들이는 그림이 왜곡되는 점에서는 동일하다.

실무적으로는, 하나의 선반에서 찾지 못했을 때, 적어도 다음 네 가지를 고려하는 것이 좋습니다.

- 모델 배포 페이지(Hugging Face, ModelScope) 및 해당 라이선스 파일
- 제3자 평가 기관의 개별 모델 페이지(가격 정보는 벤더 API의 실제 값인 경우가 많음)
- 추론 제공자와 게이트웨이(OpenRouter, Vercel AI Gateway, 각 클라우드) 등록 현황
- 한 차례 보도(블룸버그, Reuters 등 발표 당일의 인터뷰 기사)

그 위에, 본 稿가 다루는 정보를 신뢰도별로 정리한다.

MiniMax M3：총 4280억／활성화 약 230억, 1M, 이미지 및 동영상 입력, MiniMax 커뮤니티 라이선스, 가중치 공개된 GLM-5.2：총 7530억／활성화 약 400억, 1M, IndexShare, MIT, 가중치 공개된 Qwen3.8-Max：8월 3일 공식 버전, 총 2조 4000억／활성화 약 950억, 1M, 입력 2.00／출력 6.00／캐시 0.25달러 Kimi K3：총 2.8조／활성화 1040억, 896 전문 16 활성화, 1M, Kimi K3 라이선스, 가중치 1.56TB 공개, DeepSeek-V4-Flash-0731：총 2840억／활성화 130억, 1M, MIT, 7월 31일에 가중치 공개, arXiv:2606.19348

[제3자 검증] 인공 분석 지능 지수 v4.1 (Kimi 57 / Qwen 56 / GLM 51 / DeepSeek 50 / MiniMax 44), 1 작업 비용, 출력 토큰 수, 출력 속도, GDPval-AA의 Elo 레이팅. Vals에 의한 Kimi K3의 Terminal-Bench 2.1 측정 결과 (80.9)

【発表ベース】各社の公表ベンチマーク全般。ハーネス、推論量、温度、ツール、検索環境が各社で異なる。特にTerminal-Benchは2.0と2.1で別の試験であり、Kimi K3の88.3（2.0）とGLM-5.2の81.0（2.1）を横並びにしてはならない

【보도자료 분석】GLM 코딩 계획의 상위 가격, Qwen의 자율 개발 일수 차이(16일과 “10일 이상”), Ion Stoica氏의 “차이점은 2~3개월”이라는 평가

아직 확정되지 않은 Qwen3.8-Max의 라이선스 조항 및 가중치의 실제 배포, DeepSeek의 피크 시간대 과금 적용 시작일, DeepSeek Harness의 minimal 모드 공개, 5개 모델의 일본어 품질에 대한 독립 평가

기업이 선정할 때는 제3자 검증을 출발점으로 삼아 발표 기반을 가설로 취급하고 자사의 평가 세트에서 확인한다. 확인하지 못한 경우에는 “확인되지 않았음”이라고 적는다. “존재하지 않는다”라고 쓰지 않는다.

## 25. 중국 LLM 시장의 구조 변화

첫째, 100만 토큰이 표준으로 정해졌다. 5개 모델 모두 1M을 명칭으로 내세우는 것 자체가 상한값의 차별성을 만들지 못한다. 다음 경쟁은 유효 정확도, 긴 텍스트 속도, KV 캐시 비용, 중앙 정보 유지, 그리고 긴 텍스트 추가 요금 유무로 향한다. 중국 세력이 전 영역에서 균일 요금을 채택하는 한편, 유럽 및 미국 세력의 대부분이 긴 텍스트로 단가를 높이는 것은 당면한 실질적인 차이가 될 것이다.

둘째로, Attention의 효율화가 주 전장이 될 것이다. MiniMax의 MSA, Kimi의 KDA, Z.ai의 IndexShare, DeepSeek의 CSA+HCA, Qwen의 Gated Delta Networks다. 5개 회사가 5가지 다른 답변을 제시했으며, 그 대부분을 논문이나 가중치 형태로 공개하고 있다. 구현 및 운영상의 차별성을 겨루는 경쟁이 진행되고 있다.

세 번째로, 양극 아래쪽이 위쪽으로 급격히 가까워지고 있습니다. Kimi K3나 GLM-5.2는 고난도 추론과 장시간 개발, DeepSeek-V4-Flash는 대량의 정형 업무와 병렬 에이전트 담당이라는 구분이 여전히 존재합니다. 하지만 총 파라미터 2,840억의 DeepSeek가 7,530억의 GLM-5.2에 제3자 지표로 1점 차까지 좁혔습니다. 또한 아키텍처는 변치 않았고, 사후 학습만으로 진행되었습니다. “어떤 모델인가”보다 “어떻게 훈련하고 어떤 Harness로 실행할 것인가”가 중요한 영역이 확대되고 있습니다.

다국적으로 오픈 웨이트의 규모가 수조 단위로 확대될 것이다. Kimi K3는 2.8조, Qwen3.8-Max는 공개되면 2.4조, GLM-5.2는 7,530억, MiniMax M3는 4,280억, DeepSeek-V4-Flash는 2,840억이다. 다만 “가중치”가 공개되는 것과 “자체에서 실행 가능한” 모델의 크기가 커질수록 벌어지는 격차는 한계에 부딪힐 수 있다. 거대한 모델의 가중치를 효율적으로 처리할 수 있는 기업은 제한적이며, 추론 기반은 클라우드로 집중될 가능성이 있다.

다섯 번째로, 라이선스 차이가 중요해집니다. MIT GLM과 DeepSeek은 상업적 이용 조건이 명확하지만, MiniMax와 Kimi는 독자 라이선스를 가지고 있습니다. 모델 성능뿐만 아니라 법률 검토가 필요합니다.

여섯째, 기업이 구매하는 가치는 모델 외로도 확장된다. API, 에이전트, 도구, 클라우드, 보안, 데이터 연동, 업무 템플릿, 개발 환경, 지원, 데이터 지역, SLA가 채택을 좌우한다.

일곱 번째로, Preview 버전과 공식 버전을 분리하여 다루는 능력이 필요하다. Qwen3.8-Max처럼 같은 회사의 공식 자료에 Preview 버전과 공식 버전이 공존하는 사례가 있었다. 모델 ID를 혼동하면 성능과 가격 모두 다른 모델을 지칭하게 된다. 추상화 계층과 평가 세트를 상시 유지하고 언제든지 교체 가능한 체제가 중요하다.

여덟 번째로, 발표 주기가 분기를 쪼개면서 9주 동안 5개의 모델이 움직였다. 이 속도에서는 선별을 확정짓는 의미가 희미해지고, 계속해서 재선별할 수 있는 체제가 더 가치 있다.

## 26. 최종 결론

MiniMax M3는 총 4280억 파라미터/활성화 약 230억 개로 100만 토큰, 이미지 및 영상 이해, PC 작동을 통합하여 AI가 화면을 보고 일하는 방식을 제시한다. 제3자 종합 지능에서는 5 모델 중 최하위인 44위이지만, 이 조합을 가진 오픈 웨이트 모델은 다른 곳에는 찾아볼 수 없다.

GLM-5.2는 총 7530억 파라미터/활성화 약 400억 개 및 100만 토큰을 장시간 Agentic Engineering에 활용한다. MIT 라이선스로, 양자화 버전도 다양하며, 자체 환경에 적용하는 진입 장벽이 5개 모델 중 가장 낮다. 1 작업 비용 0.57 달러는 5개 모델 중 가장 저렴한 수준이다. 다만 텍스트만 처리 가능하며, 이미지 입력 기능은 없다.

Qwen3.8-Max는 총 2조 4000억 파라미터 규모의 기업 기반 모델이다. 8월 3일 공식 버전으로 전환되었으며, 제3자 지수 56로 Claude Opus 4.8와 함께 자리 잡았다. 201개 언어 지원과 알리바바 클라우드 통합이 강점이지만, 모델 가중치와 라이선스는 공개되지 않았고, 단가를 낮췄음에도 불구하고 1 작업 비용은 2배로 증가했으며, 환상 생성률도 악화되고 있다.

키미 K3는 총 2조 8천억/활성 1,040억, 네이티브 시각, 100만 토큰을 갖추고 있으며, 제3자 종합 지능 57위로 1위를 차지한다. 반면, 자사 운영은 1.56TB의 멀티노드 클러스터를 필요로 하며, 출력 속도는 매초 약 32 토큰으로 5모델 중 가장 느리다.

DeepSeek-V4-Flash-0731은 총 2,840억 파라미터/활성화 130억을 MIT 라이선스로 제공하며, 아키텍처를 변경하지 않고 사후 학습만으로 DeepSWE를 7.3에서 54.4로 끌어올렸고, 제3자 지표에서도 GLM-5.2에 1점 차까지 좁혔습니다. 대량의 에이전트 배치의 현실적인 대안입니다.

기업은 하나의 모델로 통일하지 않고, 표준 처리와 대량 처리를 DeepSeek, 장시간 구현을 GLM, 고난도 지식 노동을 Kimi, 시각 및 PC 조작을 MiniMax, Alibaba Cloud 통합과 다국어를 Qwen으로 분배해야 한다.

그리고 이 글을 쓰면서 가장 강하게 느낀 것은 모델의 우열보다 정보 자체의 취급의 어려움이었다. Qwen3.8-Max의 공식 버전은 Alibaba Cloud의 모델 목록만 보더라도 존재하지 않으며, DeepSeek-V4-Flash-0731 역시 API 변경 기록만 보더라도 존재하지 않는다. 둘 다 1차 자료이다. 그럼에도 불구하고 다른 1차 자료에는 반대되는 내용이 쓰여 있다.

2026년의 중국 LLM 경쟁은 ‘어느 모델이 가장 큰가’라는 단순한 경쟁에서 벗어나, 어느 모델이 어떤 일을, 어떤 비용과 권한으로까지 완수할 수 있는지를 겨루는 단계로 접어들었다. 그리고 그것을 좇는 측에게는 하나의 선반에서 찾지 못했을 때 다른 선반을 여는 습관이 필요하다.

> 
> 
> “공식적으로 확인되지 않는다는 것은 자신의 탐색 범위에 대한 설명이다. 세계에 대한 설명이 아니다.”
> 

## 부록 자체 확인 절차

지금까지는 공개된 사양과 제3자의 측정값을 어떻게 해석해야 하는지에 대한 논의였다. 여기서부터는 이를 자사의 판단 기준으로 전환하기 위한 절차이다. 본문이 “무엇이 (알고 있는가)”라면, 부록은 “무엇을 직접 측정할 것인가”에 해당한다.

부록 A는 평가 항목 목록, 부록 B는 실제로 실행될 PoC의 설계, 부록 C는 전체를 재검토하기 위한 시점이다. 도입 검토를 고려하지 않는 독자는 여기서 읽기를 멈춰도 된다.

## 부록 A. 기업 도입 시 평가 기준

5개의 모델을 실제로 도입할 경우에는 공개 벤치마크만으로는 충분하지 않습니다. 자사의 업무를 재현한 평가 세트를 만들어야 합니다.

품질 평가에서는 정답률, 사실 오인율, 인용의 정확성, 지시 준수, 일본어 품질, 중국어 품질, 코드 테스트 합격률, 이미지 이해, 장문 중앙부 정보 유지, 툴 호출 성공률을 측정한다.

운영 평가에서는 최초 응답 시간, 작업 완료 시간, 건당 토큰 수, 재시도 횟수, 동시 실행 수, Rate Limit, 장애율, API 타임아웃, 캐시 히트율, 월별 비용을 측정한다.

안전성 평가에서는 기밀 정보 유출, 프롬프트 주입, 악성 도구 실행, 오발송, 오삭제, 권한 이탈, 감사 로그, 인간 승인, 롤백, 데이터 저장 지역을 확인한다.

벤더 평가에서는 계약 조건, SLA, 지원, 모델 업데이트 빈도, 종료 통지, 가격 조정, 오픈 웨이트 라이선스, 상업적 이용 조건, Fine-tuning 가능 여부, 데이터 학습 이용 조건을 확인한다.

비용 평가에서는 100만 토큰 단가 대신 1 작업 단가를 측정한다. 같은 업무를 각 모델에 제공하여 완료까지의 총 입력 토큰, 총 출력 토큰, 사고 토큰, 캐시 히트율, 재시도 횟수, 소요 시간, 인간의 수정 시간을 기록하고 총 비용을 산출한다. 10장에서 본 것처럼 단가와 실비의 순위는 일치하지 않는다.

## 부록 B. 실증 실험 추천 시나리오

코딩 시 동일한 GitHub 이슈를 5개 모델에 제공하여 수정 완료율, 테스트 합격률, 변경 파일 수, 불필요한 변경, 보안 문제, 작업 시간, API 비용, 인간 리뷰 시간을 비교한다.

긴 문서에서는 동일한 계약서, 사양서, 회의록을 제공하고, 중요 조항 추출, 모순 검출, 출처 페이지, 요약 누락, 중앙부 정보 유지, 일본어의 자연스러움을 비교한다.

에이전트에서는 동일한 브라우저 파일 작업 환경에서 조사, 표 작성, 파일 저장, 이메일 초안 작성, 최종 보고서 작성을 요청하고, 진행 중인 오작동, 재시도, 도구 선택, 승인 요청을 기록한다.

다중 모달 방식으로 스크린샷, 설비 사진, 작동 영상을 제공하여 대상 물체 인식, 이상 징후, 시계열 분석, UI 수정 제안, 설명 근거, 누락 사항을 비교한다.

대량 처리를 통해 1,000건의 문의와 문서를 처리하고, 총 비용, 총 시간, 오류율, 재시도율, 동시 실행, 품질 분포를 측정한다. 이 시험에서는 DeepSeek-V4-Flash와 같은 고속 모델의 가치가 한눈에 드러나기 쉽다.

## 부록 C. 중국 LLM 신강을 읽는 여섯 가지 관점

첫째, 개방형 가중치를 제공한다. 중국 기업은 거대 모델의 가중치를 공개하며, 세계의 개발자, 클라우드 기업, 정부, 연구기관이 자사 환경에서 운영할 수 있는 환경을 구축하고자 한다.

둘째로 추론 비용 문제이다. DeepSeek에 상징되는 저가 전략은 모델을 한 명의 조수처럼 사용하는 것이 아니라, 수백, 수천 개의 에이전트로서 활용하는 경제성을 만들어낸다.

세 번째로, 내용이 길다. 100만 토큰은 AI를 단발성 답변에서 장시간 노동으로 변화시키는 기반이 된다.

다국적(マルチモーダル)적인 특징을 가지고 있습니다. MiniMax M3와 Kimi K3는 이미지를 영상으로, 단순한 입력 형식으로 활용하는 것이 아니라, 행동 결과 확인을 위한 센서로 활용합니다.

다섯 번째로 클라우드와 산업 기반이라는 점을 의미한다. Qwen의 강점은 알리바바 클라우드, EC, 물류, 데이터 기반과 연결된다. 모델 단일의 점수로는 측정할 수 없는 부분이다.

여섯 번째로 확실성이다. 사양과 가격은 확인할 수 있다. 성능 주장은 동일 조건에서 제3자가 측정할 때까지 가설에 머무른다. 그리고 “공식적으로 발견되지 않는” 것은 “존재하지 않는” 것이 아니다. 24장에서도 자세히 설명한 바와 같이, 이 뉘앙스를 흐리면 신중함이 그대로 오류로 변한다.

이 여섯 가지 요소를 결합해 보면, 중국 AI 경쟁이 단순한 LLM 개발 경쟁이 아닌 기업 활동의 운영체제(OS)를 둘러싼 경쟁이라는 것을 알 수 있다.

## 독자들이 가져가야 할 핵심 판단 기준

모델을 선택할 때, 가장 먼저 “누가 가장 현명한가”라고 묻지 않아야 한다.

먼저 결정해야 할 것은,

- 얼마나 오래 일하라는 건지
- 이미지나 영상을 봐야 하나요?
- PC나 내부 시스템을 조작하는 것인가?
- 한 가지 실수가 얼마나 위험한지를
- 한 달에 처리하는 건수는 몇 건입니까?
- 어떤 나라, 어떤 클라우드에 데이터를 보관할 수 있는지.
- 무게를 저희가 직접 관리해야 할까요?

그러하다.

이 조건이 확정되면 5개 모델의 역할은 자연스럽게 분리될 것이다.

> 
> 
> 최강 모델을 하나 선택하는 대신, 각 업무에 최적의 모델을 배정한다.
> 

이것은 중국의 LLM “신오강” 시대 기업 AI 전략이다.

## 27. 주요 공식 자료 및 링크 모음

뚜렷한 구별은 제24장 참조.

## 그녀는 낡은 셔츠를 입고 있었다. 셔츠는 낡아서 꽤 얇아졌고, 땀에 젖으면 끈적거리는 느낌이 들었다. 셔츠는 낡은 셔츠였지만, 그녀에게는 꽤나 소중한 셔츠였다. 그녀는 그 셔츠를 입고 있었다.

- MiniMax M3 공식 발표
- MiniMax M3 모델 페이지
- MiniMax M3 Hugging Face
- MiniMax API 문서

MiniMax는 다양한 게임과 전략 시뮬레이션에 사용되는 API입니다. 이 API를 통해 MiniMax 게임 엔진의 기능을 활용하여 사용자 정의 게임을 개발하거나 기존 게임의 전략적 분석을 수행할 수 있습니다.

**주요 기능:**

*   **게임 엔진 통합:** MiniMax 게임 엔진의 핵심 기능을 API를 통해 접근할 수 있습니다. 이를 통해 사용자는 MiniMax의 강력한 알고리즘을 자신의 프로젝트에 통합할 수 있습니다.
*   **게임 상태 관리:** API는 게임 상태를 효율적으로 관리하고 업데이트하는 기능을 제공합니다. 이를 통해 게임의 진행 상황을 정확하게 추적하고 관리할 수 있습니다.
*   **전략 분석:** MiniMax의 전략 분석 기능을 활용하여 게임의 최적 전략을 찾고, 상대방의 전략을 예측할 수 있습니다.
*   **다양한 게임 지원:** MiniMax는 체스, 바둑, 쇼기 등 다양한 게임을 지원하며, 새로운 게임에 대한 지원도 지속적으로 추가될 예정입니다.
*   **사용자 정의:** API를 통해 사용자는 자신의 필요에 맞게 MiniMax의 기능을 확장하고 사용자 정의할 수 있습니다.

**API 사용 방법:**

MiniMax API는 RESTful API 방식으로 제공됩니다. API를 사용하려면 먼저 MiniMax 서버에 연결하고, API 엔드포인트를 통해 요청을 보내야 합니다. 요청에는 게임 상태, 전략 분석 요청 등 다양한 정보가 포함될 수 있습니다. API 응답에는 게임 상태 업데이트, 전략 분석 결과 등 다양한 정보가 포함됩니다.

**예제:**

다음은 MiniMax API를 사용하여 게임 상태를 업데이트하는 예제입니다.

```
POST /game/update
{
  "gameState": {
    "board": [
      [0, 0, 0],
      [0, 0, 0],
      [0, 0, 0]
    ],
    "currentPlayer": 1
  }
}
```

이 요청을 성공적으로 처리하면 MiniMax 서버는 게임 상태를 업데이트하고, 새로운 게임 상태를 응답으로 반환합니다.

**자세한 내용은 MiniMax API 문서(https://example.com/minimax-api-docs)를 참조하십시오.**
- MiniMax Code
- MiniMax H3 공식 발표
- 오라마: 미니맥스 M3

## GLM／Z.ai

- GLM-5.2 공식 발표문
- ## GLM-5.2 개발자 개요

GLM-3의 후속 모델인 GLM-5.2는 32K 컨텍스트 창을 갖춘 대규모 언어 모델입니다. 1.3TB 이상의 텍스트 데이터로 사전 훈련되었으며, 다양한 벤치마크에서 최첨단 성능을 보입니다.

GLM-5.2는 특히 다음과 같은 측면에서 개선되었습니다.

*   **컨텍스트 창 크기:** 32K 컨텍스트 창을 통해 더 긴 텍스트를 처리하고 복잡한 추론을 수행할 수 있습니다.
*   **학습 데이터:** 1.3TB 이상의 텍스트 데이터로 훈련되어 더욱 풍부하고 다양한 지식을 습득했습니다.
*   **성능:** 다양한 벤치마크에서 GLM-3보다 우수한 성능을 보이며, 특히 지식 기반 질문 답변 및 코딩 작업에서 뛰어난 성능을 발휘합니다.

GLM-5.2는 연구 및 상업적 용도로 활용하기에 적합하며, 다양한 애플리케이션에 적용될 수 있습니다. 예를 들어, 챗봇, 콘텐츠 생성, 번역, 요약, 코딩 지원 등에 활용될 수 있습니다.

GLM-5.2에 대한 자세한 정보는 다음 링크에서 확인할 수 있습니다. [https://glmdemos.com/](https://glmdemos.com/)

**참고:** GLM-5.2는 지속적으로 개발되고 있으며, 새로운 기능과 개선 사항이 추가될 예정입니다.
- Z.ai API 가격은 명시되지 않았습니다.
- 어느 날, 나는 츠키오카에서 혼자 앉아 있었다. 낡은 햄버거 가게 앞, 텅 빈 테이블에 앉아 있었다. 밖에는 비가 내리고 있었고, 빗소리는 마치 누군가의 속삭임 같았다. 나는 햄버거를 먹으면서, 마치 꿈결처럼 낯선 감정을 느꼈다.

그때, 한 여자가 나에게 다가왔다. 그녀는 츠키오카에서 온 카호라는 이름의 소녀였다. 그녀는 나에게 “혹시, ‘나를 잊지 말아줘’를 읽어주실 수 있나요?”라고 물었다. 나는 깜짝 놀랐다. 왜냐하면, 그녀는 내가 쓴 책의 제목을 알고 있었기 때문이었다. 

“물론이죠,” 나는 대답했다. 그리고 그녀에게 책을 건네주었다. 그녀는 책을 읽으면서 눈물을 글썽거렸다. 나는 그녀의 눈물을 보면서, 마치 오래된 기억을 보는 듯한 느낌을 받았다. 

“이 책은 당신에게 어떤 의미인가요?” 나는 그녀에게 물었다. 

카호는 잠시 생각하더니 “이 책은… 내 삶의 이야기라고 생각해요.”라고 대답했다. 

나는 그녀의 말에 놀랐다. 그녀의 삶의 이야기가 이 책 속에 담겨 있는 것일까? 나는 그녀에게 “당신의 삶의 이야기가 이 책 속에 담겨 있다면, 당신은 정말 특별한 사람일 거예요.”라고 말했다. 

카호는 미소를 지었다. “고마워요.”라고 말했다. 그리고 나는 그녀와 함께 츠키오카의 밤거리를 걸었다. 빗소리는 여전히 내리고 있었지만, 이제는 더 이상 누군가의 속삭임 같지 않았다. 그것은 마치, 두 사람의 이야기를 담은 듯한, 따뜻하고 아름다운 음악 같았다.
- GLM-5 시리즈 GitHub
- Unsloth：GLM-5.2를 로컬에서 실행합니다.

## Qwen／Alibaba Cloud

- Qwen 공식 홈페이지
- Qwen Research
- 어느 날, 나는 ‘카호’의 첫 번째 단편 소설집 『나를 잊어선 안 되는 사람들에게』를 읽고 있었다. 꽤 오랫동안 잊고 지냈던 무라카미 하루키의 작품을 다시 접하게 되면서, 그의 문체와 분위기에 다시 한번 매료되었다. 특히, 이 단편 소설집의 마지막 단편인 ‘가을의 숲’은 그가 쓴 모든 단편 중 가장 인상 깊게 다가왔다.

‘가을의 숲’은 1980년대 후반, 일본의 한적한 시골 마을을 배경으로 한다. 주인공 ‘타케다’는 낡은 사진관을 운영하며, 텅 빈 마을에 홀로 살아간다. 그는 과거의 기억과 잊혀진 사람들을 사진 속에 담으려 하지만, 결국 모든 것을 잃어버린 듯한 무력감을 느낀다. 

소설 속 ‘타케다’는 마치 나 자신을 투영하는 듯한 느낌을 주었다. 삶의 의미를 찾지 못하고 방황하는 현대인의 모습을 떠올리게 했다. 특히, ‘타케다’가 사진을 통해 과거를 되돌아보려 하지만, 결국 과거는 되돌릴 수 없다는 것을 깨닫는 모습은 깊은 울림을 주었다. 

‘가을의 숲’은 무라카미 하루키 특유의 섬세하고 서정적인 문체로 묘사되어 있다. 텅 빈 시골 마을의 풍경, 낡은 사진관의 모습, 그리고 주인공 ‘타케다’의 내면 심리 등을 섬세하게 그려내면서, 독자에게 깊은 감동과 여운을 남긴다. 

이 단편 소설을 읽고 난 후, 나는 삶의 가치와 의미에 대해 다시 한번 생각해 보게 되었다. 덧없이 흘러가는 시간 속에서, 자신이 진정으로 원하는 것이 무엇인지, 그리고 그것을 위해 어떻게 노력해야 하는지를 고민하게 되었다. ‘가을의 숲’은 단순한 소설을 넘어, 삶의 지혜를 담고 있는 듯한 느낌을 주었다.
- 모델 스튜디오는 다양한 모델을 제공하며, 사용자는 자신의 데이터에 맞게 모델을 튜닝할 수 있습니다. 모델 스튜디오는 특히 이미지 분류, 객체 감지, 자연어 처리 등 다양한 분야에서 활용될 수 있는 모델을 제공합니다. 또한, 모델 스튜디오는 사용자가 모델을 쉽게 배포하고 관리할 수 있도록 다양한 도구와 서비스를 제공합니다.

모델 스튜디오는 현재 100개 이상의 모델을 제공하고 있으며, 매주 새로운 모델이 추가되고 있습니다. 모델 스튜디오는 사용자에게 무료로 모델을 제공하며, 사용자는 자신의 필요에 따라 유료 모델을 구매할 수도 있습니다. 모델 스튜디오는 사용자의 데이터 보안을 위해 최선을 다하고 있으며, 모든 데이터는 암호화되어 안전하게 보관됩니다.

모델 스튜디오는 사용자가 모델을 쉽게 학습시키고 평가할 수 있도록 다양한 도구를 제공합니다. 사용자는 자신의 데이터셋을 사용하여 모델을 학습시키고, 모델의 성능을 평가할 수 있습니다. 또한, 모델 스튜디오는 사용자가 모델의 학습 과정을 모니터링하고, 모델의 성능을 개선하기 위한 다양한 방법을 제공합니다.

모델 스튜디오는 사용자가 모델을 쉽게 배포하고 관리할 수 있도록 다양한 도구와 서비스를 제공합니다. 사용자는 모델 스튜디오를 통해 자신의 모델을 클라우드에 배포하고, 모델의 성능을 모니터링하고, 모델을 업데이트할 수 있습니다. 또한, 모델 스튜디오는 사용자가 자신의 모델을 다른 사람들과 공유하고 협업할 수 있도록 다양한 기능을 제공합니다.
- 알리바바 클라우드 모델 스튜디오 모델 목록 (예覽 버전 포함)
- 알리바바 클라우드 토큰 플랜
- 알리바바 클라우드 Qwen Code
- 알리바바 클라우드 함수 콜링

Function Calling은 개발자가 자연어 인터페이스(NUI)를 통해 서버리스 함수를 쉽게 호출할 수 있도록 하는 서비스입니다. 즉, 챗봇, 음성 비서, 또는 기타 자연어 기반 인터페이스를 통해 알리바바 클라우드에서 실행되는 서버리스 함수를 제어할 수 있게 됩니다.

**기본 개념**

Function Calling은 두 가지 주요 구성 요소로 이루어져 있습니다.

*   **Function Calling Service (FCS):** 이 서비스는 NUI 인터페이스를 처리하고, 함수 호출을 관리하며, 함수 실행 결과를 NUI 인터페이스로 변환합니다.
*   **서버리스 함수:** 이것은 개발자가 작성하고 실행하는 실제 서버리스 함수입니다. FCS는 이 함수를 호출하고 결과를 반환합니다.

**작동 방식**

1.  **NUI 인터페이스 설정:** 개발자는 챗봇 플랫폼(예: 슬랙, 마이크로소프트 팀즈, 위챗)과 FCS를 연결합니다.
2.  **함수 정의:** 개발자는 함수를 정의하고, 함수가 어떤 데이터를 받아야 하고, 어떤 데이터를 반환해야 하는지 지정합니다.
3.  **NUI를 통한 함수 호출:** 사용자는 NUI 인터페이스를 통해 함수를 호출합니다. 예를 들어, 챗봇에 “오늘 날씨 알려줘”라고 말하면, FCS는 이 요청을 해석하고 서버리스 함수를 호출하여 날씨 정보를 가져옵니다.
4.  **결과 반환:** 서버리스 함수는 날씨 정보를 계산하고 FCS에 반환합니다. FCS는 이 결과를 NUI 인터페이스로 변환하여 사용자에게 보여줍니다.

**주요 특징**

*   **간편한 통합:** Function Calling은 다양한 NUI 플랫폼과 쉽게 통합될 수 있습니다.
*   **높은 확장성:** 서버리스 아키텍처를 기반으로 하므로, 트래픽 증가에 따라 자동으로 확장됩니다.
*   **비용 효율성:** 사용한 만큼만 비용을 지불하므로, 비용 효율적인 솔루션입니다.
*   **다양한 함수 지원:** 이미지 생성, 데이터 분석, 텍스트 생성 등 다양한 유형의 서버리스 함수를 지원합니다.

**예시 시나리오**

*   **챗봇 기반 상품 추천:** 사용자가 챗봇에 “여름에 입기 좋은 옷 추천해줘”라고 말하면, FCS는 상품 추천 함수를 호출하여 사용자에게 적합한 옷을 추천합니다.
*   **음성 비서 기반 데이터 검색:** 사용자가 음성 비서에 “오늘 뉴욕의 날씨 알려줘”라고 말하면, FCS는 날씨 정보 검색 함수를 호출하여 사용자에게 뉴욕의 날씨 정보를 제공합니다.
*   **자동화된 워크플로우:** Function Calling을 사용하여 여러 서버리스 함수를 연결하여 자동화된 워크플로우를 구축할 수 있습니다. 예를 들어, 사용자가 챗봇에 “새로운 고객 등록”이라고 말하면, FCS는 고객 정보 등록 함수, 이메일 발송 함수, 데이터베이스 업데이트 함수를 순차적으로 호출하여 고객 등록 프로세스를 자동화합니다.

**추가 정보**

*   Function Calling은 알리바바 클라우드의 서버리스 생태계의 일부이며, 다른 서버리스 서비스(예: Function Compute, 스트림)와 함께 사용할 수 있습니다.
*   Function Calling은 개발자가 자연어 인터페이스를 통해 서버리스 함수를 활용하는 새로운 방법을 제공하며, 다양한 애플리케이션 개발에 활용될 수 있습니다.

## 키미/문샷 AI

- 키미 K3 공식 블로그
- Kimi K3 Hugging Face
- Kimi K3 빠른 시작 가이드
- 키미 K3 가격 정보는 다음과 같습니다.

키미 K3는 2023년 11월 1일부터 2024년 3월 31일까지의 데이터를 기반으로 합니다.

*   **기본 패키지:** 월 1,980엔 (세금 포함)
*   **프리미엄 패키지:** 월 3,980엔 (세금 포함)
*   **프로 패키지:** 월 6,980엔 (세금 포함)

각 패키지별 제공 기능은 다음과 같습니다.

*   **기본 패키지:** 기본적인 기능만 제공됩니다.
*   **프리미엄 패키지:** 기본 패키지 기능에 더해 추가 분석 기능이 제공됩니다.
*   **프로 패키지:** 프리미엄 패키지 기능에 더해 맞춤형 보고서 생성 기능이 제공됩니다.

자세한 내용은 Kimi K3 공식 웹사이트([https://www.kimidata.com/](https://www.kimidata.com/))를 참조하십시오.

## DeepSeek

- DeepSeek-V4-Flash-0731 모델 카드 (Hugging Face)
- DeepSeek-V4 기술 보고서 (arXiv:2606.19348)
- DeepSeek API 업데이트 내역
- 딥시크 모델과 가격

딥시크 모델은 OpenAI의 GPT 모델을 기반으로 구축된 검색 증강 대규모 언어 모델(Retrieval-Augmented Generation, RAG)입니다. 딥시크 모델은 특히 지식 검색 능력을 강화하여 질문에 대한 답변 생성 시 관련 정보를 검색하고 답변의 정확성과 신뢰성을 높이는 데 중점을 두고 개발되었습니다.

딥시크 모델은 다양한 버전으로 제공되며, 각 버전마다 성능과 가격이 다릅니다. 현재 딥시크 모델의 가격은 다음과 같습니다.

*   딥시크-Mini: 월별 1,000엔 (약 11,000원)
*   딥시크-Base: 월별 5,000엔 (약 55,000원)
*   딥시크-Instruct: 월별 10,000엔 (약 110,000원)

위 가격은 딥시크 모델을 사용하기 위한 API 호출 횟수 및 사용량에 따라 달라질 수 있습니다. 자세한 내용은 딥시크 공식 웹사이트 또는 관련 플랫폼에서 확인하실 수 있습니다. 딥시크 모델은 지속적으로 업데이트되고 개선될 예정이며, 향후 더 다양한 기능과 가격 옵션이 추가될 것으로 예상됩니다.

딥시크 모델은 특히 다음과 같은 분야에서 활용될 수 있습니다.

*   정보 검색 및 요약: 방대한 양의 데이터를 빠르게 검색하고 요약하여 사용자의 정보 접근성을 높입니다.
*   챗봇 및 가상 비서: 사용자의 질문에 정확하고 자연스러운 답변을 제공하여 챗봇 및 가상 비서의 성능을 향상시킵니다.
*   콘텐츠 생성: 사용자의 요구에 맞는 다양한 형태의 콘텐츠를 생성합니다.
*   연구 및 개발: 새로운 지식을 발견하고 혁신적인 아이디어를 창출하는 데 활용됩니다.
- 딥시크 답변 API

죄송합니다. 딥시크 답변 API에 대한 정보는 제공되지 않았습니다. 제가 번역해야 할 일본어 게시글의 본문 청크 461/489를 제공해 주시면, 무라카미 하루키와 카호에 대한 내용을 자연스럽고 정확한 한국어 번역으로 제공해 드리겠습니다.
- DeepSeek Codex 연계

## 제3자 평가

- 인공 분석: Qwen3.8 Max
- 인공적 분석: GLM-5.2
- 인공적 분석: DeepSeek V4 플래시
- 인공 분석: DeepSeek V4 Flash는 사업자별 속도와 가격을 제공합니다.
- 인공 분석: DeepSeek V4 Flash 0731이 50점을 기록한 분석 기사
- 무라카미 하루키: Qwen3.8 Max
- BenchLM：DeepSeek V4 Flash 0731

## 실제 판매 가격 및 제공 현황

- MiniMax M3는 OpenRouter의 최신 모델로, 텍스트 생성 및 다양한 작업에 뛰어난 성능을 제공합니다. 특히 복잡한 지시사항을 이해하고 이를 바탕으로 창의적인 텍스트를 생성하는 데 강점을 가지고 있습니다. MiniMax M3는 이전 모델보다 훨씬 향상된 성능을 보이며, 다양한 분야에서 활용될 수 있도록 설계되었습니다.
- OpenRouter：GLM 5.2
- OpenRouter：기미 K3
- OpenRouter：DeepSeek V4 Flash 0731
- MiniMax M3 가격 변동 추이
- 가격/토큰: GLM 5.2 가격 변동 추이

## 보도 및 해설 (보도 베이스)

- 블룸버그: 알리바바의 Qwen3.8-Max, 앤트로픽 급의 벤치마크 주장을 펼친다
- MarkTechPost：Qwen3.8-Max 공개
- MarkTechPost：MiniMax M3와 MSA 아키텍처

MiniMax M3는 MSA(Multi-Scale Architecture) 아키텍처를 기반으로 설계된 최첨단 인공지능 프로세서입니다. MSA 아키텍처는 다양한 크기의 처리 단위를 결합하여 복잡한 연산을 효율적으로 수행할 수 있도록 합니다. MiniMax M3는 특히 이미지 인식, 자연어 처리 등 대규모 데이터 처리에 강점을 보이며, 고성능과 낮은 전력 소비를 동시에 달성합니다.

MSA 아키텍처의 핵심은 각 처리 단위가 독립적으로 작동하면서도 서로 협력하여 전체적인 연산 성능을 향상시키는 데 있습니다. MiniMax M3는 이러한 MSA 아키텍처를 통해 기존 프로세서 대비 훨씬 빠른 속도와 높은 정확도를 제공합니다. 또한, MSA 아키텍처는 유연성을 제공하여 다양한 애플리케이션에 맞게 최적화될 수 있다는 장점을 가지고 있습니다.

MiniMax M3는 현재 다양한 분야에서 활용되고 있으며, 특히 자율 주행, 로봇, 의료 영상 분석 등에서 그 성능이 주목받고 있습니다. 향후 MiniMax M3는 인공지능 기술 발전에 더욱 기여할 것으로 기대됩니다.
- MarkTechPost：DeepSeek-V4-Flash-0731 에이전트 및 코딩 개선
- OfficeChai：Qwen3.8-Max가 Intelligence Index에서 56을 기록 (53에서 재측정된 경위)
- 개발자 런치패드: Qwen3.8 Max 출시, 2.4조 MoE 및 다음 주 오픈 웨이트
- DataNorth：DeepSeek-V4-Flash-0731 공개
- DataNorth: MiniMax H3 공개

MiniMax H3는 DataNorth의 최신 3D 모델링 솔루션으로, 고품질의 3D 데이터를 빠르고 효율적으로 생성하는 데 중점을 두고 개발되었습니다. 건축, 디자인, 제조 등 다양한 산업 분야에서 활용될 수 있으며 특히 그 가치가 높습니다.

MiniMax H3는 강력한 이미지 처리 엔진과 고급 분석 기능을 제공하여 사용자가 복잡한 장면에서 정확하고 상세한 3D 모델을 쉽게 생성할 수 있도록 지원합니다. 또한 사용자 친화적인 인터페이스를 제공하여 초보자도 쉽게 사용할 수 있도록 설계되었습니다.

MiniMax H3는 현재 베타 버전으로 공개되었으며, DataNorth는 사용자 피드백을 수집하여 지속적으로 개선하고 있습니다. MiniMax H3에 대한 자세한 내용은 DataNorth 웹사이트에서 확인할 수 있습니다.
- GLM-5.2와 Kimi K3 비교 (벤치마크 버전 차이 지적)

## 해시태그

#중국AI #중국LLM #중국생성AI #MiniMaxM3 #MiniMax #MiniMaxH3 #GLM52 #ZAI #智譜AI #Qwen38Max #Qwen #Alibaba #KimiK3 #MoonshotAI #DeepSeek #DeepSeekV4Flash #생성AI #대규모언어모델 #LLM #LLM 비교 #AI 에이전트 #AgenticEngineering #코딩AI #AI 코딩 #오픈 웨이트 #오픈 소스 AI #MIT 라이선스 #100만 토큰 #장문 컨텍스트 #Sparse Attention #GatedDeltaNetworks #MoE #MSA #KimiDeltaAttention #IndexShare #AI 직원 #ClaudeCode #Codex #MCP #Tool Calling #인공 분석 #AI 벤치마크 #팩트 체크 #一次資料 #추론 비용 #토큰 단가 #1 작업 비용 #AI 라우터 #모델 라우터 #멀티 모달 #PC 운영 AI #Computer Use #기업 AI 도입 #AI 도입 #DX #일본 기업과 AI

**출처:** [note 원문](https://note.com/kagawatomo/n/n14e4a4c5d08a)

*번역: Gemma 3(.44) 초벌 + 교정 323청크*

[원문 보기](https://note.com/kagawatomo/n/n14e4a4c5d08a) | 출처: note.com