# 알리바바, 2.4조 파라미터의 “Qwen3.8-Max” 발표, 10일 초의 자율 코딩, Max 급 최초의 오픈 웨이트화로 향해

> https://bookfactory.kr/c/news/8815
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-03T23:39:26.897Z

---

알리바바 클라우드의 Qwen 팀은 2026년 8월 3일(중국 시간)에 최신 AI 모델 “Qwen3.8-Max”를 공식 발표했다. 총 파라미터 수는 2.4조로, 추론 시에는 950억 파라미터가 가동되는 Mixture of Experts(MoE) 모델이 된다. 코딩, 전문 업무, 장기간에 걸친 AI 에이전트 태스크, 이미지 및 동영상의 이해 능력을 강화했다.

Qwen 팀은 이 모델을 Qwen 시리즈에서 지금까지 가장 고성능한 모델로 평가하고 있다. QwenCloud를 통해 이용할 수 있으며, 다음 주에는 모델 가중치를 공개할 예정이다.

## 2.4조 파라미터의 MoE, 최대 100만 토큰의 텍스트 맥락에 대응

Qwen3.8-Max는 여러 전문적인 네트워크에서 처리해야 하는 부분을 선택하여 가동시키는 MoE 구성에 채택한다. 모델 전체에서는 2.4조 파라미터를 가지지만, 1회의 추론에서 가동되는 파라미터 수는 950억이 된다.

입력은 텍스트, 이미지, 동영상에 대응하며, 텍스트를 출력한다. QwenCloud의 모델 페이지에서는 최대 100만 토큰의 컨텍스트, 외부 툴을 호출하는 Function Calling, 구조화 출력, 웹 검색, 컨텍스트 캐시 등에 대한 지원도 안내하고 있다.

Qwen 팀은 시각 정보를 단순히 인식하는 것뿐만 아니라, 태스크의 계획, 실행, 결과의 검증까지 일련의 과정을 이용할 수 있다고 설명한다. 장대한 문서나 동영상을 분석하고, 중간에 얻은 결과를 다음 처리 단계에 반영하는 장기 태스크도 고려하고 있다.

## 10일이 넘는 자율 코딩, 법무 및 금융 등의 전문 업무도

Qwen 팀은 Qwen3.8-Max의 중점 영역으로 “Coding”과 “Cowork”를 제시한다.

Coding에서는 10일이 넘는 기간에 걸쳐 소프트웨어 개발을 자율적으로 진행하고, 프로젝트를 완성까지 이끌 수 있다고 한다. 짧은 코드를 생성하는 것뿐만 아니라, 장기적인 계획을 세우고 실행 결과를 확인하면서 작업을 지속하는 능력을 강화했다.

Cowork는 소프트웨어 개발에 한정되지 않고, 인간이 담당해 왔던 전문 업무를 AI 에이전트로서 처리하는 능력을 의미한다. QwenCloud의 모델 페이지에서는 법무, 금융, 디자인 등 수백 종류의 전문 태스크를 처리하고, 하나의 대화 안에서 실무에 이용 가능한 결과물을 만들 수 있다고 설명하고 있다.

또한, 200페이지가 넘는 재무 자료나 복잡한 PDF에 대해, 텍스트뿐만 아니라 그래프와 문서 구조를 함께 분석할 수 있다고 한다.

## 약 550번의 시도에서 인간 팀의 87%를 상회

Qwen 팀은 Qwen3.8-Max를 “WWW 2025 Multimodal Dialogue Intent Recognition Challenge”에 참여시킨 사례도 공개했다.

동 모델에는 1개의 GPU, 36개의 vCPU, 440GiB의 메모리, 최대 24시간이라는 조건이 주어졌다. 이미지와 언어를 조합한 모델의 미세 조정이나, 여러 모델에 의한 앙상블 등, 약 550번의 시도에 걸쳐 점진적으로 방법을 변경한 결과, 최종 점수는 0.853에 달했다.

Qwen 팀에 따르면, 이 성적은 참여한 인간 526팀 중 458팀을 상회하며, 전체의 87%보다 높은 결과였다고 한다.

Qwen3.8-Max가 시도를 거듭하고, WWW 2025의 멀티모달 대화 의도 인식 태스크에서 점수를 0.853까지 높인 과정

## PaperBench 및 OSWorld 등에서 비교 대상의 최고치

Qwen 공식 블로그에 게재된 벤치마크 비교 결과, 연구 성과 재현 능력을 평가하는 “PaperBench”에서 93.0, 컴퓨터 작동 능력을 측정하는 “OSWorld-Verified”에서 86.1을 기록했다.

이 외에도, 신체적 요소를 수반하는 추론을 평가하는 “ERQA”에서 77.8, 시각 인식을 측정하는 “PerceptionBench”에서 63.5, 장시간 영상의 이해 능력을 평가하는 “LVBench”에서 81.8의 최고치를 기록했으며, 그림에 제시된 비교 대상 중에서 가장 높은 값을 나타냈다.

한편, 소프트웨어 개발 능력을 측정하는 “SWE-Pro”, “FrontierSWE”, 전문 업무를 평가하는 “CoworkBench” 등에서는 다른 사의 모델이 Qwen3.8-Max를 상회하는 항목도 있었다. 공개된 수치는 Qwen 팀에 의한 평가이며, 모델마다 사용한 AI 에이전트 기반과 평가 조건이 다를 가능성도 고려해야 한다.

큐원팀은 다음 주에 Qwen3.8-Max 모델 가중치를 공개할 계획이다. Qwen-Max 클래스에서 모델 가중치를 공개하는 것은 처음이며, 보다 소규모인 “Qwen3.8-27B” 모델도 오픈 가중치로 제공할 방침을 보이고 있다.

[원문 보기](https://ledge.ai/articles/alibaba_qwen3_8_max_2_4_trillion_parameters) | 출처: Ledge.ai