# Qwen3.8-Omni-Flash 출시, Gemini 3.8 Flash에 뒤지지 않는 음성 및 영상 처리 성능을 달성

> https://bookfactory.kr/board/news/17744
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-09-18T23:25:35.842Z

---

중국 주요 기술 기업인 알리바바가 개발 중인 AI 모델 Qwen 시리즈에 차세대 네이티브 오므니몰랄 모델 “Qwen3.8-Omni-Flash”가 추가되었습니다. 비디오 편집, 음악 비디오 제작, 영화 제작, 오디오 비주얼 요약, 실시간 대화 등 워크플로우 전체에서 뛰어난 성과를 실현하고 있습니다. Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery. https://qwen.ai/blog?id=qwen3.8-omni-flash Qwen3.8-Omni-Flash는 100만 토큰의 컨텍스트 윈도우를 지원하며, 동일 크기의 텍스트만으로 구성된 모델과 동등한 텍스트 성능을 유지하면서 오므니몰랄 기능을 대폭 개선한 AI 모델입니다.

알리바바는 “Qwen3.8-Omni-Flash는 데이터 컨텍스트 에이전트 환경을 스케일링함으로써 Gemini 3.8 Flash와 유사한 음성 및 영상 성능과 Gemini 3.8 Flash를 상회하는 전체적인 음성 성능을 달성했습니다.”라고 설명했습니다.

“이러한 발전은 음성과 영상이 지각 입력에서 에이전트가 환경을 이해하고 추론하며 작업을 수행하기 위한 핵심 미디어로 진화하고 있음을 의미합니다.”라고 설명했습니다.

음성 인식 및 음성 생성에 대한 지원 언어는 다음과 같습니다.

음성 인식: 74개 언어(아프리카네스어, 아랍어, 아스트루리아스어, 아제르바이잔어, 바스크어, 벨라루스어, 벵골어, 보스니아어, 불가리아어, 광동어, 카탈루냐어, 세부아노어, 중국어, 크로아티아어, 체코어, 덴마크어, 네덜란드어, 영어, 에스페란토어, 에스토니아어, 필리핀어, 핀란드어, 프랑스어, 갈리시아어, 조지아어, 독일어, 그리스어, 히브리어, 힌디어, 헝가리어, 아이슬란드어, 인도네시아어, 인터링가어, 이탈리아어, 일본어, 자와어, 칸나다어, 카자흐어, 한국어, 키르기스어, 링가라어, 라트비아어, 리투아니아어, 마케도니아어, 말레이어, 말라야람어, 말타어, 마오리어, 마라티어, 몽골어, 노르웨이어 부크몰, 노르웨이어 니노슈크, 오리야어, 페르시아어, 폴란드어, 포르투갈어, 판잡어, 루마니아어, 러시아어, 세르비아어, 슬로바키아어, 슬로베니아어, 스페인어, 스와힐리어, 스웨덴어, 타지크어, 타밀어, テル구어, 태국어, 터키어, 우크라이나어, 우르두어, 위구르어, 베트남어) 음성 생성: 29개 언어(중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어, 태국어, 인도네시아어, 아랍어, 베트남어, 터키어, 핀란드어, 폴란드어, 힌디어, 네덜란드어, 체코어, 우르두어, 타가로그어, 스웨덴어, 덴마크어, 히브리어, 아이슬란드어, 말레이어, 노르웨이어, 페르시아어) 또한, Qwen3.

29종의 벤치마크에서 평균 점수는 Qwen3.5-Omni-Plus보다 25% 이상 향상되었지만, 음성 입력 1시간당 API 가격은 98% 초과, 음성과 영상의 입력 1시간당 가격은 93% 초과도 저렴해졌습니다. 더불어, 음성 및 영상 에이전트 코딩, 장기 태스크에 관한 벤치마크에서는 WildClawBench-MM에서 Qwen3.5-Omni-Plus에서 36.5 증가한 “71.0”, UniClawBench에서도 “69.6”라는 높은 점수를 기록했습니다. 장쇄 음성 및 음성·영상 이해, 음성·영상의 추론, 음성·영상의 자막, 다중 화자 인식과 같은 핵심 기능도 크게 향상되었습니다. 예를 들어, 장쇄 음성의 이해 능력을 평가하는 벤치마크인 LongAudioSpan에서는 “82.7”, 멀티모달 모델의 음성·영상 협조 추론 능력을 평가하는 벤치마크인 OmniVideoBench에서는 “63.4”, 영상 자막 생성에 있어서 지시 추종 능력을 평가하는 벤치마크인 OmniCap-IF에서 “28.2”, 중국어의 다중인·다중 채널 회의 음성의 텍스트 인식 벤치마크인 AliMeeting에서 “89.7”를 기록했습니다. 여러 벤치마크 테스트에서 Gemini 3.8 Flash를 상회했습니다.

8-Omni-Flash는 Qianwen AI에서 이용 가능합니다.

기업급 AI 대규모 언어 모델 서비스 플랫폼 - 천원AI 플랫폼 https://www.qianwenai.com/ 음성과 영상은 에이전트를 현실 세계의 생산성 시나리오에 포함시키는 데 중요한 미디어입니다.

그러나 동시에 새로운 시스템 수준의 과제도 야기한다고 알리바바는 설명합니다.

그 과제는 “장쇄의 음성이나 영상은, 횟수별 추론 처리에서 저장·전송·처리 비용이 발생한다”는 것입니다.

기존의 에이전트 하르니스 프레임워크는 이러한 다중 모달리티를 네이티브하게 지원하지 않으며, 오믹적 이해와 엔드투엔드 태스크 실행을 결합하는 워크플로우는 아직 초기 단계에 있다고 알리바바는 지적했습니다.

이러한 과제에 대처하기 위해서는 모델 하르네스 툴과 런타임 환경이 함께 발전해나가야 합니다.

따라서, 알리바바는 Qwen-MM-Plugins를 더욱 확장하여, 장쇄의 음성·영상에 대한 온디맨드 지각, 툴 사용, 워크플로우 실행 기능을 추가했습니다.

또한, Qwen3.8-Omni-Flash-Realtime API를 기반으로 설계된 포괄적인 오픈소스 하르네스 Qwen-Live Harness를 오픈소스화했습니다.

다만, 기사 작성 시점에서는 Qwen-Live Harness의 GitHub 페이지는 404 에러로 표시되지 않습니다.

[원문 보기](https://gigazine.net/news/20260918-qwen-3-8-omni-flash/) | 출처: Gigazine