중국의 알리바바 산하 Qwen 팀이 2조 4000억 파라미터를 갖춘 새로운 플래그십 AI 모델 “Qwen3.8-Max”를 발표했습니다. 텍스트, 이미지, 비디오를 처리할 수 있는 멀티모달 모델로, 소프트웨어 개발이나 문서 작성과 같은 실무 능력이 크게 강화되었으며, 일부 벤치마크에서는 Anthropic의 최상위 모델인 Claude Fable 5를 상회한 것으로 나타났습니다. Qwen3.8-Max: 코딩과 협업을 위한 새로운 기준 - GIGAZINE Qwen3.8-Max는 2026년 7월에 출시될 예정이었으며, 알리바바는 “Qwen3.8”의 오픈 모델화를 예고하며, Claude Fable 5에 이어 2.4조 파라미터 규모의 대형 모델을 공개했습니다.
Qwen3.8-Max는 필요한 전문 네트워크만 선택하여 작동시키는 Mixture-of-Experts(MoE) 방식을 채택하고 있습니다. 총 파라미터 수는 2조 4000억 개이지만, 추론 시 사용되는 활성 파라미터는 950억 개로 설정되어 있어, 거대한 모델의 능력을 유지하면서 계산량을 줄이는 설계입니다. 처리할 수 있는 컨텍스트는 최대 100만 토큰 규모이며, 대규모 소스 코드 한 묶음, 엄청난 양의 업무 문서, 긴 시간의 비디오 등을 처리할 수 있습니다. 내부 구성은 최대 입력 길이가 일반적인 경우 약 99만 1000 토큰, 사고 모드 활성화 시 약 98만 3000 토큰, 최대 출력 길이가 13만 1000 토큰로 설정되어 있습니다.
Qwen3.8-Max는 이미지나 비디오를 단순히 이해하는 것뿐만 아니라, 시각 정보를 기반으로 지속적으로 행동하고 결과물을 생성하는 멀티모달 에이전트로서의 능력도 강화되었습니다. 예를 들어, 화면이나 문서, 차트 등을 읽어가는 동안 웹 검색, 이미지 검색, 코드 실행 등의 도구를 조합하여 정보 수집, 분석, 조작, 생성까지 일련의 작업을 진행할 수 있습니다.
Qwen팀은 Qwen3.8-Max로 멀티모달 AI가 “세상을 이해하는” 단계에서, 시각을 통해 현실의 작업에 적극적으로 관여하는 단계로 진화했다고 주장합니다. 또한, 코딩과 “협업(Cowork)” 즉, 인간과 협력하여 장시간의 작업을 진행하는 능력에 중점을 둔 모델이라고 강조합니다.
더불어, Qwen팀은 Qwen3.8-Max가 인간의 개입 없이 장기간 소프트웨어 개발을 지속할 수 있다는 점을 강조합니다. 약 16일간의 완전 자율 운영을 통해 Qwen3.8-Max가 담당한 저장소에는 265건의 커밋, 127건의 풀 리퀘스트, 151건의 이슈가 축적되었으며, AI가 지속적으로 문제를 발견하고 코드를 수정 및 확장해 나가는 능력이 입증되었다고 보고합니다.
또한, Qwen팀은 Qwen3.8-Max에 연구 논문을 재현시키고, 그 논문의 방법을 능가하는 방법을 탐색하는 실험을 진행했습니다. 대상은 LLM 학습에 사용하는 대량의 데이터에서 모델이 판단에 혼동을 느끼는 “어려운 분기점”을 많이 포함하는 예인 “Unified Data Selection for LLM Reasoning” 연구입니다. Qwen3.8-Max에는 논문과 GPU만 제공되었고, 데이터 처리, 학습, 평가를 위한 코드나 실험 환경을 처음부터 구축해야 했습니다.
실험 결과, Qwen3.8-Max는 약 125시간 동안 자율적으로 작업하며 약 7600줄의 코드를 작성하고 1100회 이상의 운영과 33회의 GPU 학습을 수행했습니다. 처음 약 37시간 동안 논문의 주요 6가지 결과를 재현한 후, 나머지 약 88시간 동안 “가설 생성, 구현, GPU를 이용한 실험, 분석, 재시도”라는 루프를 반복하며 4라운드 동안 18건의 개선안을 검토했습니다. 그 결과, 어려운 분기점 수를 활용하는 독자적인 선택 방식에 도달하여, 수학 벤치마크인 AIME24에서 논문의 재현 결과인 49.58%를 2.71 포인트 상회하는 52.29%로 끌어올렸다고 보고되었습니다.
더욱이, Qwen 팀은 Alibaba Cloud의 콘테스트 “WWW2025 멀티모달 대화 의도 인식 챌린지”에 Qwen3.8-Max을 참가시켜 인간 526팀과 경쟁시켰습니다. Qwen3.8-Max은 24시간 이내에 텍스트용 BERT, MacBERT, RoBERTa와 이미지용 Qwen2.5-VL-7B 등을 결합한 시스템을 자율적으로 구축하여 45회의 제출을 통해 정확률을 0.600에서 0.853까지 향상시켰습니다. 그 결과, 526팀 중 458팀을 상회하여 상위 13%에 랭크되었으며, 평가 결과를 바탕으로 기법을 수정하면서 단시간에 성능을 끌어올리는 능력을 보여주었다고 Qwen 팀은 설명했습니다. 참고로, 이 결과는 Claude Fable 5와 거의 동등했습니다.
또한, Qwen 팀은 장기 운영 중 경험에서 학습하는 능력을 조사하기 위해 Alibaba 산하의 이커머스 플랫폼인 Taobao(淘宝)와 Tmall(天猫)의 익명화된 실 데이터를 기반으로 한 365일간의 이커머스 운영 시뮬레이션 “E-Commerce Bench”에서도 Qwen3.8-Max을 평가했습니다. 그 결과, Qwen3.8-Max은 10만 위안(약 210만 원)의 초기 자금을 41만 6252원(약 874만 원)까지 늘리고 4.16배의 수익을 달성하여 2위의 GLM 5.2를 38%나 앞섰으며, 전세대 Qwen3.7-Max를 152% 상회했습니다. 특히 2000회 이상의 교환을 통해 동일한 공급처와의 협상 방법을 개선하고 지속적으로 공급 가격을 낮춘 점을 통해 과거 경험을 활용하여 전략을 업데이트할 수 있다고 Qwen 팀은 설명했습니다.
Qwen 팀이 공개한 벤치마크에서는 Qwen3.8-Max는 코딩 및 장기 작업에서 전세대 대비 현저하게 성능을 향상시켰습니다. Terminal-Bench 2.1에서는 86.6을 기록하여 Claude Fable 5와 Claude Opus 4.8의 84.6를 상회한 반면, GPT-5.6 Sol의 88.8에는 도달하지 못했습니다. 또한, SWE-bench Pro는 67.7, FrontierSWE는 73.5로 Claude Fable 5를 하회했지만, DeepSWE 1.1은 전세대 21.6에서 56.6, JobBench는 31.3에서 53.4로 크게 향상되었습니다. 논문 재현, 지시 추종, 멀티모달 분야에서도 높은 점수를 기록했으며, PaperBench에서는 93.0, IFBench에서는 82.8로 모두 Claude Fable 5를 상회했습니다. GPQA Diamond에서는 Claude Fable 5와 동일한 92.6, RealWorldQA에서는 88.0, MMMU-Pro에서는 82.3, OSWorld-Verified에서는 86.1을 기록했으며, Parametric CAD Bench는 91.5, OmniDocBench 1.5는 92.1이었습니다. 반면, Humanity's Last Exam은 43.6, Toolathlon Verified는 72.5에 그쳤으며, Qwen 팀의 비교에서는 이미지 이해 및 문서 처리 능력이 강점을 보였지만, 복잡한 추론, 툴 활용, 기존 코드 수정에서는 Claude Fable 5가 우세한 항목이 여전히 많다고 했습니다.
Qwen팀은 강화 학습의 규모를 확대해 나감에 따라 내부 및 공개 벤치마크 점수가 지속적으로 향상되었다고 설명하지만, 규모를 확대한다고 해서 성능이 반드시 향상되는 것은 아니라고 덧붙였습니다. Qwen3.8-Max는 Qwen Chat이나 Alibaba Cloud의 Model Studio 등에서 이용할 수 있습니다. API 요금은 입력 100만 토큰당 2달러(약 310원), 출력 100만 토큰당 6달러(약 930원)로 책정되었으며, 캐시된 입력을 사용하는 경우 100만 토큰당 0.25달러(약 39원)입니다.
또한, Qwen3.8-Max는 함수 호출, 구조화 출력, 배치 처리, 문장의 흐름을 생성하는 프리픽스 보완, 미세 조정에 대응합니다. Responses API에서는 코드 실행, 웹 검색, 웹 페이지에서 정보 추출, 이미지 검색 등의 내장 도구를 활용할 수 있습니다. 참고로, Alibaba는 Qwen3.8-Max를 다음 주(2026년 8월 제3주)에 오픈 모델로 공개할 계획이라고 발표했으며, 보다 작은 “Qwen3.8-27B” 모델 가중치도 공개할 예정입니다. 2400억 파라미터의 Qwen3.8-Max를 자체적으로 운영하려면 대규모 데이터 센터 환경이 필요하지만, 270억 파라미터 버전은 일반적인 GPU 환경에서도 도입하기 쉬운 모델입니다.
????Qwen3.8-Max를 만나보세요 – 지금까지 개발한 모델 중 가장 강력한 모델입니다. 다음 주에 Qwen3.8-Max의 오픈 가중치가 공개되고, Qwen3.8-27B도 여러분을 위해 오픈 가중치로 공개될 예정입니다!????2.4T 파라미터로 코딩 및 협업의 새로운 기준을 제시하는 Qwen3.8-Max:- 자율 코딩: 10일 이상… pic.twitter.com/e3YFj2hqcT
원문 보기 | 출처: Gigazine