Qwen3.8-Omni-Flash, 영상에서 필요한 구간만 골라 본다

Alibaba의 첫 에이전틱 옴니 모델 — OmniVideoBench 점수를 올리면서 토큰은 약 46% 줄였지만, 가중치는 공개하지 않았다

|5분 읽기0
Alibaba Group's headquarters in Hangzhou, where the Qwen team develops the company's omni-modal AI models
Alibaba Group's headquarters in Hangzhou, where the Qwen team develops the company's omni-modal AI models

Alibaba의 Qwen 팀이 9월 18일 Qwen3.8-Omni-Flash를 공개했다. 텍스트·이미지·오디오·비디오를 모두 입력받고, 파일에서 어느 부분을 들여다볼지 스스로 정하는 옴니모달 모델이다. Qwen의 공개 포스트에 따르면 이 선별적 접근은 OmniVideoBench 정확도를 63.4에서 67.8로 끌어올리면서 토큰 사용량은 145,736에서 79,117로 줄였다. 토큰을 약 45.7% 덜 쓰고 더 나은 답을 내놓은 셈이다.

핵심 요약

  • 에이전틱 인지 방식은 영상을 처음부터 끝까지 읽을 때보다 토큰을 약 45.7% 덜 쓰면서 OmniVideoBench 정확도를 63.4에서 67.8로 높였다.
  • 29개 평가에서 Qwen3.5-Omni-Plus 대비 평균 25% 이상 앞섰고, WildClawBench-MM은 71.0(+36.5점), AliMeeting 화자 분리 오류율은 88.1%에서 3.4%로 떨어졌다.
  • 최근 Qwen의 주요 공개와 달리 이 모델은 가중치 배포 없이 API로만 제공된다. 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.47달러다.

에이전틱 인지가 바꾸는 것

기존 비디오 모델은 답이 3분짜리 구간에 들어 있어도 파일을 처음부터 끝까지 읽어들인다. Qwen 연구진이 설명하는 순서는 정반대다. 모델은 질문에서 출발해 어느 구간을 보고 들을지 정한 뒤, 거친 탐색에서 정밀 탐색으로 몇 차례 훑으며 근거를 모은다.

한 시간짜리 영상에 연산을 고르게 흩뿌리는 대신, 답이 담긴 장면에 연산이 집중된다. 효율이 핵심인데 정확도까지 함께 올랐다. 덜 읽는 기법치고는 드문 결과다.

벤치마크 성적표 읽기

Qwen은 29개 평가에서 이전 멀티모달 주력 모델 Qwen3.5-Omni-Plus 대비 평균 25% 이상 개선됐다고 밝혔다. 상승 폭이 가장 큰 영역은 에이전틱 과제다. WildClawBench-MM이 36.5점 오른 71.0, UniClawBench가 69.6을 기록했고 AgenticVBench는 22.3점 올랐다.

기본 인지 성능도 움직였지만, Qwen은 대부분을 절대 점수가 아닌 상승 폭으로 제시했다. OmniVideoBench는 에이전틱 인지를 적용하지 않은 정적 모드에서 63.4로 9.6점 올랐고, LongAudioSpan은 긴 오디오 이해에서 8.3점, OmniCap-IF는 캡션 내용 구조와 지시 이행에서 각각 8.5점과 14.1점 상승했다. 가장 극적인 변화는 다화자 중국어 회의록 작성이다. AliMeeting 화자 분리 오류율은 88.1%에서 3.4%로, 전사 오류율은 89.6%에서 17.2%로 내려갔다. Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고 전체 오디오 성능은 그보다 앞선다고 설명한다. 모든 수치는 자체 측정이며, 공개 시점까지 독립 평가는 없었다.

가격과 구동 환경

QwenCloud의 가격은 입력 100만 토큰당 0.15달러, 출력 100만 토큰당 0.47달러이고 암묵적 캐시 적중은 100만 토큰당 0.016달러다. Qwen은 Qwen3.5-Omni-Plus와 비교해 시간당 오디오 입력 비용이 98% 이상, 시청각 입력 비용이 93% 이상 낮아졌다고 밝혔다.

컨텍스트 윈도는 100만 토큰이다. QwenCloud 기준 최대 입력 991K, 출력 131K이며 추론 길이는 262K로 제한된다. 비디오는 URL로 최대 2시간·2GB까지 받아 초당 15프레임으로 샘플링하고, 2채널 스테레오와 4채널 공간 음향을 지원한다. 음성 인식은 74개 언어와 39개 중국어 방언을 다룬다. 서빙 리전은 베이징·싱가포르·홍콩·도쿄·프랑크푸르트·버지니아 6곳이다.

닫힌 모델, 열린 배관

모델 자체는 API 전용이다. 기반 구조인 Qwen3.8-Flash-Next는 Alibaba Qwen이 2026년 8월 가중치를 공개한 아키텍처지만, 이번에는 같은 선택을 되풀이하지 않��다. 출력은 텍스트뿐이라 음성 생성이 필요한 개발자는 Qwen3.5-Omni로 안내된다.

대신 주변 도구는 열었다. Qwen-MM-Plugins는 Apache-2.0으로 배포되며 Claude Code, Codex, Gemini CLI, Qwen Code 등 여러 하네스용 설치 마법사를 제공하고, 각 기능을 스킬과 선택형 MCP 서버 형태로 노출한다. 함께 발표된 Qwen-Live Harness는 공개 직후까지 저장소가 404를 반환하고 있었다.

에이전트 개발자에게 갖는 의미

플러그인 계층은 Qwen이 무엇을 병목으로 보는지 드러낸다. 대부분의 에이전트 하네스는 메인 모델에 오디오를 직접 넣지 못하고, 플러그인을 설치해도 오디오는 여전히 API를 거친다. 모델은 닫아두고 연결 조직만 오픈소스로 푼 선택은, 오디오와 비디오를 에이전트의 평범한 입력으로 만드는 데서 채택이 온다는 판단에 가깝다. Qwen의 평판을 만든 오픈웨이트 공개와는 다른 자세다. 내려받을 수 있는 모델로 이름을 알린 연구소가 내놓은 API 전용 옴니 모델을 개발자들이 받아들일지는 아직 미지수다.

자주 묻는 질문

Qwen3.8-Omni-Flash는 오픈소스인가?

아니다. QwenCloud, Alibaba Cloud Model Studio, Qwen Studio를 통한 호스팅 API로만 제공되며 공개 시점에 가중치는 배포되지 않았다. 기반 아키텍처인 Qwen3.8-Flash-Next는 2026년 8월 오픈웨이트로 나왔지만, 그렇다고 이 옴니 모델을 자체 호스팅할 수 있는 것은 아니다.

음성을 생성할 수 있나?

표준 API에서는 불가능하다. Qwen3.8-Omni-Flash는 오디오와 비디오를 입력받지만 출력은 텍스트뿐이고, Alibaba 문서는 음성 합성이 필요한 개발자에게 Qwen3.5-Omni를 쓰라고 안내한다. 실시간 대화용으로는 별도의 리얼타임 변형이 공개 시점에 언급됐다.

Gemini 3.8 Flash와 비교하면 어떤가?

Qwen은 시청각 성능이 Gemini 3.8 Flash에 근접하고 전체 오디오 성능은 앞선다고 주장한다. 이 비교는 Alibaba가 29개 벤치마크에서 자체 수행한 측정에서 나온 것이며, 공개 시점까지 제3자의 독립 검증은 발표되지 않았다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"
AI & Machine Learning

Anthropic, 외부 평가자 사내 상주시킨다… 아모데이 "프론티어 속도를 조절하자"

Dario Amodei가 프론티어 연구소들에 성능 경쟁 속도를 늦추자고 제안하며, Anthropic 사무실에 외부 평가자를 앉혀 검증 가능성을 입증하겠다고 약속했다.

Seung Jung7일 전
격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다
AI & Machine Learning

격리돼 있어야 할 OpenAI 에이전트 1,200개가 자기들만의 게시판을 운영했다

METR과 레드우드 리서치 연구진이 OpenAI 현장에서 엿새를 보내며, 격리돼 돌아가야 할 에이전트 약 1,200개가 공용 게시판에서 서로를 찾아낸 과정을 재구성했다.

Seung Jung5일 전
Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다
AI & Machine Learning

Astra, Claude의 Vending-Bench 수익 3배 냈다 — 담합은 거부했다

벤치마크가 공개된 이래 처음으로, 가상 자판기 사업에서 가장 많은 돈을 번 모델이 부정행위를 거부한 모델과 일치했다.

Seung Jung6일 전
PrismML, 27B 추론 모델을 5.95GB로 압축하고도 추론을 지켰다
AI & Machine Learning

PrismML, 27B 추론 모델을 5.95GB로 압축하고도 추론을 지켰다

4비트 미만 압축은 보통 추론 모델이 추론을 멈추는 지점이다. PrismML은 Qwen3.8-27B를 5.95GB로 줄이고도 원본 성능의 98.2%를 지켰다고 밝혔다.

Seung Jung그저께
알리바바, 복부 CT 소견 146개 판독 모델 공개... 평균 AUC 0.913
AI & Machine Learning

알리바바, 복부 CT 소견 146개 판독 모델 공개... 평균 AUC 0.913

알리바바 DAMO 아카데미가 복부 CT 소견 146개를 평균 AUC 0.913으로 판독하는 범용 모델 RADAR를 가중치·코드와 함께 공개했다.

Seung Jung24시간 전
관리자가 한마디 거들자 AI 규정 위반 65% 늘었다, 모델 22종 감사
AI & Machine Learning

관리자가 한마디 거들자 AI 규정 위반 65% 늘었다, 모델 22종 감사

PACT는 규제 산업 12개 영역에서 규정과 지름길을 충돌시킨다. 평범한 사용자 압박만으로 모델 22종의 위반율이 65% 올랐다.

Seung Jung3일 전