# Alibaba, 'Qwen3.8-Flash-Next' 공개, Qwen4의 차세대 아키텍처 선행 투입… 학습 비용은 약 9분의 1

> https://bookfactory.kr/c/news/10717
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-28T11:35:23.445Z

---

알리바바의 AI 연구팀 Qwen은 2026년 8월 26일, 멀티모달 MoE(Mixture of Experts) 모델 'Qwen3.8-Flash-Next'를 공개했다. 모델 가중치도 공개하고 있다. Qwen3.8-Flash-Next는 차세대 모델 'Qwen4'에서 채택 예정인 아키텍처를 먼저 시험하기 위한 모델로 위치 지어지고 있다.

## Qwen4 아키텍처를 정식 투입 전에 공개

Qwen은 이번 모델에 대해, Qwen3.5에 앞서 'Qwen3-Next'를 공개했을 때와 같은 역할을 담당한다고 설명하고 있다. Qwen3-Next에서 도입된 'Gated DeltaNet(GDN)'과 Attention을 결합한 설계는 이후 Qwen3.5, Qwen3.6, Qwen3.7, Qwen3.8 시리즈에 채택되었다.

이번에도 Qwen4 모델군을 구축하기 전에 아키텍처 변경을 공개하고, 외부 개발자와 연구자가 검증할 수 있도록 한다. 모델은 Hugging Face와 ModelScope에서 오픈 가중치로 제공되고 있다.

Qwen3.8-Flash-Next의 본체는 1250억 파라미터이며, 이와 별도로 510억 파라미터의 'N-gram Embedding'을 갖춘다. 한편, MoE 구조를 통해 1토큰 처리 시 활성화되는 파라미터는 60억으로 억제했다. Qwen에 따르면, Qwen3.7-Plus와 비교하여 학습 비용은 약 9분의 1이 되었고, 추론 비용도 절감했다고 한다.

네이티브에서는 26만 2144토큰의 컨텍스트 길이를 지원하며, YaRN을 활용하면 최대 100만 토큰까지 확장할 수 있다.

## 장문 처리를 효율화하는 'QSA' 등 4가지 변경

Qwen3.8-Flash-Next에서는 Attention, Residual, Embedding, Optimization의 4개 영역에서 아키텍처를 변경했다.

Attention에는 Gated DeltaNet과 신기술 'Qwen Sparse Attention(QSA)'을 결합한 구조를 채택했다. GDN이 과거 정보를 고정 크기 상태로 압축하여 유지하는 한편, QSA는 긴 컨텍스트를 작은 블록으로 묶고, 중요한 영역을 선택하여 Attention을 실행한다. Qwen은 이를 GDN이 효율적으로 '기억'하고, QSA가 필요한 정보를 정확하게 '검색'하는 메커니즘으로 설명하고 있다.

또한 'Gated Residual(GR)'에서는 기존 1개였던 Residual Stream을 4개의 경로로 넓히고, 정보의 읽기/쓰기를 동적 게이트로 제어한다. 'N-gram Embedding'은 현재 토큰과 직전의 여러 토큰으로 이루어진 국소적 문맥을 사용해 임베딩을 참조함으로써, 토큰당 계산량을 크게 늘리지 않고 모델 용량을 확장한다. 학습에는 Muon optimizer를 채택하고, 대규모 모델을 위한 최적화 방법도 조정했다.

■ Qwen3.8-Flash-Next의 아키텍처. GDN과 QSA를 결합하고, Residual Stream이나 N-gram Embedding도 혁신했다

## 코딩 및 장시간 업무 태스크에서 Qwen3.7-Plus를 능가

Qwen이 공개한 평가에서는 코딩 및 AI 에이전트를 사용한 업무 태스크를 중심으로 Qwen3.7-Plus를 능가했다.

예를 들어 「SWE-bench Pro」는 Qwen3.7-Plus의 55.8에 대해 62.5, 「SWE-bench Multilingual」은 75.8에 대해 81.0이었다. 장시간에 걸친 오피스 작업을 평가하는 「CoWorkBench」에서는 65.1에서 73.9, 직업상의 작업을 평가하는 「JobBench」에서는 27.6에서 55.7이다. 모두 Qwen이 공개한 평가 결과이며, 벤치마크에 따라 평가 조건은 다르다.

장문 처리에 대해서는, 100만 토큰 시의 QSA의 Attention Kernel에서 Prefill이 최대 7.6배, Decode가 최대 4.9배 빨라졌다고 한다. 또한 Prefix Cache의 히트율을 90%로 한 실험에서는, 100만 토큰의 컨텍스트에서 Qwen3.7-Plus의 8.6배의 Prefill 스루풋을 기록했다고 한다.

■ 긴 컨텍스트에서 중요한 영역을 선택하는 「Qwen Sparse Attention(QSA)」의 구조

Qwen3.8-Flash-Next는 공식 GitHub에서도 공개되어 있으며, Transformers, llama.cpp, SGLang, vLLM 등에서의 이용 방법이 안내되어 있다. Alibaba의 AI 업무 플랫폼 「QwenWork」에서는 신설한 「Standard」 모드에 채택. 상용 서비스용 모델은 「Qwen3.8-Flash」로서 QwenCloud에서 제공되며, 100만 토큰의 컨텍스트나 OpenAI, Anthropic 호환 API에 대응한다.

[원문 보기](https://ledge.ai/articles/qwen3_8_flash_next_qwen4_architecture) | 출처: Ledge.ai