Alibaba의 Qwen 팀이 9월 18일 Qwen3.8-Omni-Flash를 공개했다. 텍스트·이미지·오디오·비디오를 모두 입력받고, 파일에서 어느 부분을 들여다볼지 스스로 정하는 옴니모달 모델이다. Qwen의 공개 포스트에 따르면 이 선별적 접근은 OmniVideoBench 정확도를 63.4에서 67.8로 끌어올리면서 토큰 사용량은 145,736에서 79,117로 줄였다. 토큰을 약 45.7% 덜 쓰고 더 나은 답을 내놓은 셈이다.
핵심 요약
- 에이전틱 인지 방식은 영상을 처음부터 끝까지 읽을 때보다 토큰을 약 45.7% 덜 쓰면서 OmniVideoBench 정확도를 63.4에서 67.8로 높였다.
- 29개 평가에서 Qwen3.5-Omni-Plus 대비 평균 25% 이상 앞섰고, WildClawBench-MM은 71.0(+36.5점), AliMeeting 화자 분리 오류율은 88.1%에서 3.4%로 떨어졌다.
- 최근 Qwen의 주요 공개와 달리 이 모델은 가중치 배포 없이 API로만 제공된다. 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.47달러다.
에이전틱 인지가 바꾸는 것
기존 비디오 모델은 답이 3분짜리 구간에 들어 있어도 파일을 처음부터 끝까지 읽어들인다. Qwen 연구진이 설명하는 순서는 정반대다. 모델은 질문에서 출발해 어느 구간을 보고 들을지 정한 뒤, 거친 탐색에서 정밀 탐색으로 몇 차례 훑으며 근거를 모은다.
한 시간짜리 영상에 연산을 고르게 흩뿌리는 대신, 답이 담긴 장면에 연산이 집중된다. 효율이 핵심인데 정확도까지 함께 올랐다. 덜 읽는 기법치고는 드문 결과다.
벤치마크 성적표 읽기
Qwen은 29개 평가에서 이전 멀티모달 주력 모델 Qwen3.5-Omni-Plus 대비 평균 25% 이상 개선됐다고 밝혔다. 상승 폭이 가장 큰 영역은 에이전틱 과제다. WildClawBench-MM이 36.5점 오른 71.0, UniClawBench가 69.6을 기록했고 AgenticVBench는 22.3점 올랐다.
기본 인지 성능도 움직였지만, Qwen은 대부분을 절대 점수가 아닌 상승 폭으로 제시했다. OmniVideoBench는 에이전틱 인지를 적용하지 않은 정적 모드에서 63.4로 9.6점 올랐고, LongAudioSpan은 긴 오디오 이해에서 8.3점, OmniCap-IF는 캡션 내용 구조와 지시 이행에서 각각 8.5점과 14.1점 상승했다. 가장 극적인 변화는 다화자 중국어 회의록 작성이다. AliMeeting 화자 분리 오류율은 88.1%에서 3.4%로, 전사 오류율은 89.6%에서 17.2%로 내려갔다. Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고 전체 오디오 성능은 그보다 앞선다고 설명한다. 모든 수치는 자체 측정이며, 공개 시점까지 독립 평가는 없었다.
가격과 구동 환경
QwenCloud의 가격은 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.47달러이고 암묵적 캐시 적중은 100만 토큰당 0.016달러다. Qwen은 Qwen3.5-Omni-Plus와 비교해 시간당 오디오 입력 비용이 98% 이상, 시청각 입력 비용이 93% 이상 낮아졌다고 밝혔다.
컨텍스트 윈도는 100만 토큰이다. QwenCloud 기준 최대 입력 991K, 출력 131K이며 추론 길이는 262K로 제한된다. 비디오는 URL로 최대 2시간·2GB까지 받아 초당 15프레임으로 샘플링하고, 2채널 스테레오와 4채널 공간 음향을 지원한다. 음성 인식은 74개 언어와 39개 중국어 방언을 다룬다. 서빙 리전은 베이징·싱가포르·홍콩·도쿄·프랑크푸르트·버지니아 6곳이다.
닫힌 모델, 열린 배관
모델 자체는 API 전용이다. 기반 구조인 Qwen3.8-Flash-Next는 Alibaba Qwen이 2026년 8월 가중치를 공개한 아키텍처지만, 이번에는 같은 선택을 되풀이하지 않��다. 출력은 텍스트뿐이라 음성 생성이 필요한 개발자는 Qwen3.5-Omni로 안내된다.
대신 주변 도구는 열었다. Qwen-MM-Plugins는 Apache-2.0으로 배포되며 Claude Code, Codex, Gemini CLI, Qwen Code 등 여러 하네스용 설치 마법사를 제공하고, 각 기능을 스킬과 선택형 MCP 서버 형태로 노출한다. 함께 발표된 Qwen-Live Harness는 공개 직후까지 저장소가 404를 반환하고 있었다.
에이전트 개발자에게 갖는 의미
플러그인 계층은 Qwen이 무엇을 병목으로 보는지 드러낸다. 대부분의 에이전트 하네스는 메인 모델에 오디오를 직접 넣지 못하고, 플러그인을 설치해도 오디오는 여전히 API를 거친다. 모델은 닫아두고 연결 조직만 오픈소스로 푼 선택은, 오디오와 비디오를 에이전트의 평범한 입력으로 만드는 데서 채택이 온다는 판단에 가깝다. Qwen의 평판을 만든 오픈웨이트 공개와는 다른 자세다. 내려받을 수 있는 모델로 이름을 알린 연구소가 내놓은 API 전용 옴니 모델을 개발자들이 받아들일지는 아직 미지수다.
자주 묻는 질문
Qwen3.8-Omni-Flash는 오픈소스인가?
아니다. QwenCloud, Alibaba Cloud Model Studio, Qwen Studio를 통한 호스팅 API로만 제공되며 공개 시점에 가중치는 배포되지 않았다. 기반 아키텍처인 Qwen3.8-Flash-Next는 2026년 8월 오픈웨이트로 나왔지만, 그렇다고 이 옴니 모델을 자체 호스팅할 수 있는 것은 아니다.
음성을 생성할 수 있나?
표준 API에서는 불가능하다. Qwen3.8-Omni-Flash는 오디오와 비디오를 입력받지만 출력은 텍스트뿐이고, Alibaba 문서는 음성 합성이 필요한 개발자에게 Qwen3.5-Omni를 쓰라고 안내한다. 실시간 대화용으로는 별도의 리얼타임 변형이 공개 시점에 언급됐다.
Gemini 3.8 Flash와 비교하면 어떤가?
Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고 전체 오디오 성능은 앞선다고 주장한다. 이 비교는 Alibaba가 29개 벤치마크에서 자체 수행한 측정에서 나온 것이며, 공개 시점까지 제3자의 독립 검증은 발표되지 않았다.






