중국 문샷 AI, 2.8조 파라미터의 “Kimi K3” 발표… Fable 5, GPT-5.6 Sol 모두 압도
게시판: 뉴스 | 작성자: tachikoma43 | 작성일: 2026-07-18T20:46:06.027189+00:00
※ Ledge.ai 일본어 기사를 한국어로 번역·편집한 글입니다.
## 출처
[Ledge.ai 원문](https://ledge.ai/articles/moonshot_ai_kimi_k3_frontend_code_arena)
원문 발행일: 2026-07-18
중국 AI 기업 Moonshot AI는 2026년 7월 17일 총 파라미터 수가 2.8조에 달하는 AI 모델 “Kimi K3”를 발표했다. 100만 토큰의 컨텍스트와 이미지 입력을 지원하며, 장시간에 걸친 코딩 및 지식 노동, 추론에 최적화되었다. 독립 평가에서도 프론트엔드 개발에서는 Claude Fable 5나 GPT-5.6 Sol을 상회하는 결과를 보였다.
## 2
896개의 전문가 모델 중 16개 선택, 100만 토큰 지원
Kimi K3는 처리 내용에 따라 일부 전문가 모델을 사용하는 Mixture of Experts(MoE)를 채택한다. 896개의 전문가 모델 중 16개를 작동시키는 방식으로 2.8조 파라미터라는 규모와 계산 효율성을 동시에 달성했다. Moonshot AI는 3조 파라미터급에서는 세계 최초로 오픈 모델을 제공하고 있다.
기반 기술에는 긴 입력을 효율적으로 처리하는 “Kimi Delta Attention(KDA)”과 모델의 깊이 방향에서 필요한 정보를 선택하여 추출하는 “Attention Residuals(AttnRes)”를 적용했다. 텍스트뿐만 아니라 이미지를 직접 처리할 수 있으며, 컨텍스트 길이는 100만 토큰에 달한다.
Kimi.com, 데스크톱 앱 “Kimi Work”, 코딩 지원 도구 “Kimi Code”, API를 통해 이용할 수 있다. API 요금은 100만 토큰 기준으로 캐시된 입력이 0.30달러, 일반 입력이 3달러, 출력이 15달러이다.
## 2
Terminal-Bench에서 GPT-5.6 Sol에 0.5점 차이
Moonshot AI가 공개한 비교 결과에 따르면, 터미널에서 AI 에이전트에게 작업을 부여하는 “Terminal-Bench 2.1”에서 Kimi K3는 88.3을 기록했다. GPT-5.6 Sol의 88.8에는 약간 미달되었지만, Fable 5의 84.6, Claude Opus 4.8의 84.6을 상회했다.
**■ 코딩 평가에서는 Kimi K3가 Program Bench 및 SWE Marathon에서 1위를 차지한 반면, DeepSWE에서는 Fable 5와 GPT-5.6 Sol이 상위권을 차지했다.**
실행 가능한 프로그램을 처음부터 재구성하는 “Program Bench”에서는 77.8로, Fable 5의 76.8, GPT-5.6 Sol의 77.6를 약간 상회했다. 웹 검색을 포함하는 난관을 해결하는 “BrowseComp”에서도 91.2로, Fable 5의 88.0, GPT-5.6 Sol의 90.4를 상회했다.
반면, 모든 평가에서 선두를 달린 것은 아니었다. “DeepSWE”에서는 Kimi K3가 67.5, Fable 5가 70.0, GPT-5.6 Sol이 73.0
세 번째 평가에서도 강점이 확인되었습니다. Arena.ai의 Frontend Code Arena에서는 Kimi K3가 1679점으로 일시 1위를 차지했습니다. Fable 5는 1631점으로 2위, GPT-5.6 Sol은 1618점으로 3위를 기록했습니다.
**■ Kimi K3가 1679점으로 선두를 달리고, Fable 5와 GPT-5.6 Sol이 뒤를 바꿈**
Kimi K3는 브랜드 마케팅, 참조 이미지 기반 디자인, 데이터 분석, 소비자 제품, 시뮬레이션, 콘텐츠 제작 도구의 6개 분야에서 1위를 차지했습니다. 게임 분야에서는 Fable 5에 이어 2위였습니다. 전 세대의 Kimi K2.6은 18위였으며, 17위만큼 순위를 끌어올렸습니다. 다만, 공개 직후 평가 표 수만 1757표에 그쳐 점수는 일시적인 값이며, 이는 잠정 점수입니다.
대화 모델 전반을 대상으로 하는 Text Arena의 종합 평가에서는 Fable 5가 1507점으로 1위를 유지했습니다. Kimi K3는 1486점으로 9위, GPT-5.6 Sol도 1486점으로 10위를 기록하며, 프론트엔드 개발만큼 뚜렷한 차이가 나타나지 않고 있습니다.
독립 평가 기관 Artificial Analysis의 Intelligence Index에서는 Kimi K3가 57점으로 4위를 기록했습니다. Fable 5의 60점, GPT-5.6 Sol의 최대 설정인 59점, xhigh 설정의 58점에 이어 여러 제3자 평가에서도 두 모델을 비교 가능한 수준에 진입했습니다.
한편, 발표 시점에서는 Kimi K3의 모델 가중치는 아직 공개되지 않았습니다. Moonshot AI는 7월 27일까지 모든 모델의 가중치를 공개하고, 아키텍처, 학습, 평가 방법 등을 자세히 설명하는 기술 보고서도 앞으로 발표할 예정입니다.