프랑스 AI 기업 미스트랄(Mistral)이 총 파라미터 수가 1조(조)를 초과하는 새로운 AI 모델 “미스트랄 Large 4”를 2026년 10월 6일에 발표했습니다. 미스트랄 Large 4는 “Le Chonk”라는 애칭을 가진 멀티모달 모델이며, 미스트랄에 따르면 그 성능은 “중국 기업이 개발하는 유력한 오픈 웨이트 모델에 필적한다”고 합니다. Introducing Mistral Large 4 | Mistral https://mistral.ai/news/mistral-large-4/ Mistral Large 4 - Mistral AI | Mistral Docs https://docs.mistral.ai/models/mistral-large-4-0
미스트랄 Large 4, 즉 Le Chonk• 1TB 파라미터, 기본적으로 멀티모달. 49B 활성. 미국 또는 유럽에서 집계된 벤치마크를 기준으로 최상의 오픈 웨이트 모델입니다.• 사이버 방어, 제조, 금융을 포함한 핵심 워크로드에서 최첨단 성능을 보이며, 폐쇄형 프론티어 모델보다 시각적 기반 측면에서 우수합니다.• 유럽에서 전 과정(end-to-end) 제작되었으며, 당사 자체 Mistral Cloud 인프라를 통해 유럽에서 배포 가능합니다.• API를 통해 오늘부터 모든 사용자에게 제공 중. 사이버 보안 파트너와 비공개적으로 협업 중. 오픈 웨이트 출시 예정일은 10월 말.
Mistral Large 4는 여러 전문 모델 중 필요한 부분만 선택하여 실행하는 Mixture-of-Experts (MoE) 아키텍처를 채택하고 있습니다. 총 파라미터 수는 1.05조이지만, 추론 시 사용되는 활성 파라미터 수는 490억이며, 16억 파라미터의 이미지 인코더를 갖추고 있습니다. 이 메커니즘을 통해 1조 건 이상의 파라미터 수를 가지고 있음에도 불구하고, 추론할 때마다 모든 것을 실행할 필요가 없습니다.
텍스트와 이미지를 처리할 수 있는 네이티브 멀티모달 모델로, 100만 토큰의 컨텍스트 윈도우를 지원합니다. 코딩, 추론, 도구를 사용하는 AI 에이전트, 사이버 보안, 과학, 수학, 재무, 법률, 이미지 이해 등을 1개의 모델로 처리할 수 있도록 설계되었습니다. 학습 데이터의 상당 부분을 다국어 데이터가 차지하며, EU의 모든 공용어 포함 160 이상의 언어에 대응합니다. Mistral은 특히 중국 기업이 개발하는 오픈 웨이트 모델에 대한 경쟁력을 강조하고 있습니다. Le Chonk는 소프트웨어 개발 능력을 평가하는 DeepSWE v1.1에서는 61.7%, 소프트웨어 리포지토리의 내용을 이해하고 질문에 답하는 SWE-Atlas-QnA에서는 59.4%를 기록했습니다. 또한, 터미널을 조작하여 복잡한 작업을 수행하는 Terminal-Bench 4에서는 28.3%였습니다. 이들을 모은 Coding Agent Index는 49.8%로, DeepSeek V4 Pro 0813이나 Qwen3.8 Max를 상회한다고 Mistral이 설명하고 있습니다.
미스트랄은 서지 AI와 공동으로 생성한 코드를 프로의 평가자에게 모델명을 가린 상태에서 5단계로 평가받는 테스트를 실시했습니다. 미스트랄 Large 4의 평가는 3.74점으로, 클로드 Opus 5의 4.22점에는 닿지 않았지만, GLM-5.3의 3.60점, 키미 K3의 3.59점, GLM-5.2의 3.40점을 상회하여 비교한 5모델 중 2위를 차지하고 있습니다.
툴을 사용하면서 장시간에 걸쳐 작업 진행을 하는 “AI 에이전트”로서의 성능도 강화되었습니다. Gmail, Google Sheets, Slack, Salesforce 등 사용하는 657종의 업무 워크플로우를 평가하는 AutomationBench에서 59.9%를 기록했으며, 키미 K3, MiMo-V2.6-Pro, DeepSeek V4 Pro를 상회했습니다. 스프레드시트나 슬라이드, PDF 등 생성하는, 장시간에 걸쳐 지식 노동을 평가하는 AA-Briefcase에서는 1393 Elo를 기록했으며, DeepSeek V4 Pro를 상회하고 있습니다.
사이버 보안 또한 핵심 분야 중 하나입니다. 실제 존재하는 소프트웨어의 취약점을 AI가 발견하고 수정할 수 있는지를 조사하는 인공지능 사이버 지표(Artificial Analysis Cyber Index)는 세계 상위 5모델에 진입했습니다. 중국 이외에서 개발된 오픈 웨이트 모델을 훨씬 능가한 것으로 평가됩니다. 이 평가에 포함된, 오픈 소스 소프트웨어의 실제 존재하는 취약성을 재현하여 수정하는 테스트에서는 82%의 성공률을 기록했습니다. Mistral에 따르면, 평가 대상 모델 중 최고의 성적을 달성했습니다. 또한, 보안 경진대회를 모티브로 한 40문제를 풀는 Cybench에서는 문제의 93%를 해결했습니다. Mistral은 일부의 폐쇄형 모델은 보안 기능에 의해 취약성 재현을 거부하기 때문에 같은 테스트에서 성적이 거의 0%에 가깝게 나오는 경우도 있다고 설명합니다.
이미지 이해 성능 또한 기존의 Mistral 모델에서 크게 강화되었습니다. 일반적인 사진에 더하여 문서, 그래프, 공학 도면, 거대한 위성 이미지 등을 분석할 수 있습니다. 이미지 내의 특정 객체나 영역을 찾는 “비주얼 그라운딩”에도 대응합니다. 고밀도인 이미지에서 대상물을 특정하는 Dense 200에서는 42%를 기록했으며, Mistral의 평가에서는 GPT-6 Astra의 41.5%를 약간 상회했습니다.
과학 분야에서는 물리학, 수학, 재료 과학, 생물학 등의 복잡한 과학 계산을 코드로서 구현하는 능력을 SciCode-Verified로 측정하여, 오픈 웨이트 모델로서 최고 수준의 성능을 기록했다는 Mistral의 설명입니다. 물리 시뮬레이션 및 데이터 분석에도 대응합니다. 여러 개의 고도한 계산 절차를 요구하는, 양자 화학의 Hartree-Fock 시뮬레이션을 한 번의 지시로 생성하는 예도 제시되었습니다. 금융 및 법률의 벤치마크에서도 높은 성능이 보고되었습니다. Mistral에 따르면, 제3자 평가 기관 vals.ai의 금융 및 법률 관련 평가에서는 GPT-6 Astra를 상회했습니다. Harvey AI의 Legal Agent Benchmark에서도 비교 대상의 오픈 모델을 상회합니다. 실제 금융 및 회계 업무를想定하여, 스프레드시트의 작성 및 편집 능력을 조사하는 FinWorkBench에서도 높은 성능을 보였다고 합니다.
모델의 안전성 또한 평가되고 있습니다. 외부의 텍스트 등에 내재된 악의적인 명령으로 AI의 동작을 가로채는 “간접 프롬프트 주입(Prompt Injection)”에 대한 저항성을 조사하는 Lakera의 B3 AI Security Benchmark에서는 공격의 93.3%에 저항했습니다. 안전성 및 책임감 있는 응답을 평가하는 KORA Benchmark에서는 최고 2점 중 1.691점을 기록했습니다. Mistral Large 4는 유럽에 위치한 Mistral의 자사 데이터 센터에서 3800기(基)의 NVIDIA Grace Blackwell GPU를 사용하여 처음부터 학습되었습니다. 기사 작성 시점에 제공되는 Public Preview 또한 동일한 인프라에서 가동되고 있습니다. Mistral은 기업이나 정부가 특정 외부 AI 사업자에 의존하지 않는 “AI 주권(AI Sovereignty)”을 중시하며, Mistral의 인프라에서 학습부터 제공까지 수행하고 있으며, 향후에는 사설 클라우드나 온프레미스에서도 운영될 수 있음을 중요한 특징으로 두고 있습니다. 기사 작성 시점에서는 Mistral Large 4는 Public Preview로서 API를 통해 이용할 수 있습니다. 다만, 모델 가중치(Weight)는 아직 일반 공개되지 않았습니다. Mistral은 2026년 10월 말까지 가중치를 공개할 예정입니다. 그 때까지는 사이버 보안 기업이나 심사된 파트너, 정부 기관 등과 실환경에서 레드 팀(Red Teaming)을 수행하여 안전성을 검증할 것이라고 밝혔습니다. Mistral에 따르면, Public Preview에서 제공하는 모델의 강화 학습(Reinforcement Learning)은 기사 작성 시점에서도 계속되고 있으며, 성능은 아직 포화되지 않았다고 합니다. 가중치 공개 시에는 아키텍처의 상세 내용 및 추가적인 벤치마크, 학습 후 조정(Fine-tuning) 기술도 공개할 예정이며, 앞으로 개발할 특화형(Specialized) 및 최적화 모델의 기반으로도 활용할 수 있을 것으로 보입니다.
원문 보기 | 출처: Gigazine