Alibaba的Qwen團隊於9月18日發布Qwen3.8-Omni-Flash,這是一款可接收文字、圖像、音訊與影片的全模態模型,並且能自行判斷檔案中哪些片段值得細看。根據Qwen的發布文章,這種選擇性做法讓OmniVideoBench的準確率從63.4提升到67.8,同時把token消耗從145,736降到79,117,等於少用約45.7%的token卻給出更好的答案。
重點摘要
- 代理式感知讓Qwen3.8-Omni-Flash的OmniVideoBench準確率從63.4升到67.8,使用的token比從頭到尾讀完整段影片少約45.7%。
- 在29項評測中,該模型平均領先Qwen3.5-Omni-Plus超過25%,WildClawBench-MM達71.0(+36.5分),AliMeeting的語者分離錯誤率從88.1%降到3.4%。
- 與Qwen近期多數重點發布不同,這款模型只提供API、不釋出權重,輸入每百萬token 0.15美元,輸出每百萬token 0.47美元。
代理式感知改變了什麼
傳統影片模型即使答案只藏在三分鐘的片段裡,也會把整個檔案從頭讀到尾。Qwen的研究人員描述的是相反的順序:模型從問題出發,決定要看與要聽哪些片段,再以由粗到細的多次掃描蒐集證據。
算力落在真正承載答案的畫面上,而不是平均攤在一小時的影片裡。效率才是重點,而準確率是隨之上升而非被犧牲——對一個「讀得更少」的技術來說相當罕見。
benchmark成績單怎麼看
Qwen表示,該模型在29項評測中平均領先上一代多模態旗艦Qwen3.5-Omni-Plus超過25%。漲幅最大的落在代理任務:WildClawBench-MM達71.0,上升36.5分;UniClawBench為69.6;AgenticVBench提升22.3分。
基礎感知能力也有變化,不過Qwen多以分數增幅而非絕對成績呈現。OmniVideoBench在未啟用代理式感知的靜態模式下為63.4,提升9.6分;LongAudioSpan在長音訊理解上升8.3分;OmniCap-IF在字幕內容結構與指令遵循上分別上升8.5分與14.1分。變動最劇烈的是多人中文會議的轉寫:AliMeeting的語者分離錯誤率從88.1%降到3.4%,轉寫錯誤率從89.6%降到17.2%。Qwen將自家的視聽表現定位為接近Gemini 3.8 Flash,整體音訊表現則勝過它。所有數字都是自行回報,發布當下並無獨立評測。
價格與執行環境
QwenCloud的定價為輸入每百萬token 0.15美元、輸出每百萬token 0.47美元,隱式快取命中則為每百萬token 0.016美元。Qwen宣稱相較Qwen3.5-Omni-Plus,每小時音訊輸入成本下降超過98%,視聽輸入下降超過93%。
脈絡視窗為一百萬token;QwenCloud標示最大輸入991K、輸出131K,推理長度上限262K。影片可透過URL接收最長兩小時、2GB的檔案,取樣最高每秒15幀,支援雙聲道立體聲與四聲道空間音訊。語音辨識涵蓋74種語言與39種中文方言。服務部署於北京、新加坡、香港、東京、法蘭克福與維吉尼亞六個區域。
封閉的模型,開放的管線
模型本身只提供API。它建構在Qwen3.8-Flash-Next架構上,Alibaba Qwen曾在2026年8月釋出該架構的權重,但這次沒有重複同樣的做法。輸出僅限文字,需要語音生成的開發者會被導回Qwen3.5-Omni。
真正開放的是周邊工具。Qwen-MM-Plugins以Apache-2.0授權釋出,附有針對Claude Code、Codex、Gemini CLI、Qwen Code等harness的引導式安裝程式,將每項能力包裝成skill並附上選用的MCP伺服器。同時發布的Qwen-Live Harness,在上線後不久其儲存庫仍回傳404。
對代理開發者的意義
外掛層透露了Qwen認定的瓶頸所在。多數代理harness無法把音訊原生餵給主模型,因此即使裝了外掛,音訊仍得繞道API。把連接組織開源、模型本身留在封閉狀態��等於押注採用率來自讓音訊與影片成為代理的日常輸入——這與替Qwen建立聲譽的開放權重發布是不同的姿態。以可下載模型聞名的實驗室推出僅限API的全模態模型,開發者買不買單仍是未知數。
常見問題
Qwen3.8-Omni-Flash是開源的嗎?
不是。它只透過QwenCloud、Alibaba Cloud Model Studio與Qwen Studio以託管API形式提供,發布時並未釋出權重。其基礎架構Qwen3.8-Flash-Next確實在2026年8月以開放權重釋出,但這不代表這款全模態模型可以自行部署。
它能生成語音嗎?
標準API不行。Qwen3.8-Omni-Flash接收音訊與影片,但只輸出文字;Alibaba的文件建議需要語音合成的開發者改用Qwen3.5-Omni。發布時另有提及一個供即時對話使用的realtime版本。
跟Gemini 3.8 Flash相比如何?
Qwen宣稱視聽表現接近Gemini 3.8 Flash,整體音訊表現則在其之上。這些比較來自Alibaba自行在29項benchmark上的評測,發布當時尚未有第三方獨立測試結果公開。






