AI Newsway

Qwen3.8-Omni-Flash只看影片裡真正重要的片段

Alibaba首款代理式全模態模型,在拉高OmniVideoBench分數的同時把token用量砍掉約46%,但沒有釋出權重

|5分鐘閱讀0
Alibaba Group's headquarters in Hangzhou, where the Qwen team develops the company's omni-modal AI models
Alibaba Group's headquarters in Hangzhou, where the Qwen team develops the company's omni-modal AI models

Alibaba的Qwen團隊於9月18日發布Qwen3.8-Omni-Flash,這是一款可接收文字、圖像、音訊與影片的全模態模型,並且能自行判斷檔案中哪些片段值得細看。根據Qwen的發布文章,這種選擇性做法讓OmniVideoBench的準確率從63.4提升到67.8,同時把token消耗從145,736降到79,117,等於少用約45.7%的token卻給出更好的答案。

重點摘要

  • 代理式感知讓Qwen3.8-Omni-Flash的OmniVideoBench準確率從63.4升到67.8,使用的token比從頭到尾讀完整段影片少約45.7%。
  • 在29項評測中,該模型平均領先Qwen3.5-Omni-Plus超過25%,WildClawBench-MM達71.0(+36.5分),AliMeeting的語者分離錯誤率從88.1%降到3.4%。
  • 與Qwen近期多數重點發布不同,這款模型只提供API、不釋出權重,輸入每百萬token 0.15美元,輸出每百萬token 0.47美元。

代理式感知改變了什麼

傳統影片模型即使答案只藏在三分鐘的片段裡,也會把整個檔案從頭讀到尾。Qwen的研究人員描述的是相反的順序:模型從問題出發,決定要看與要聽哪些片段,再以由粗到細的多次掃描蒐集證據。

算力落在真正承載答案的畫面上,而不是平均攤在一小時的影片裡。效率才是重點,而準確率是隨之上升而非被犧牲——對一個「讀得更少」的技術來說相當罕見。

benchmark成績單怎麼看

Qwen表示,該模型在29項評測中平均領先上一代多模態旗艦Qwen3.5-Omni-Plus超過25%。漲幅最大的落在代理任務:WildClawBench-MM達71.0,上升36.5分;UniClawBench為69.6;AgenticVBench提升22.3分。

基礎感知能力也有變化,不過Qwen多以分數增幅而非絕對成績呈現。OmniVideoBench在未啟用代理式感知的靜態模式下為63.4,提升9.6分;LongAudioSpan在長音訊理解上升8.3分;OmniCap-IF在字幕內容結構與指令遵循上分別上升8.5分與14.1分。變動最劇烈的是多人中文會議的轉寫:AliMeeting的語者分離錯誤率從88.1%降到3.4%,轉寫錯誤率從89.6%降到17.2%。Qwen將自家的視聽表現定位為接近Gemini 3.8 Flash,整體音訊表現則勝過它。所有數字都是自行回報,發布當下並無獨立評測。

價格與執行環境

QwenCloud的定價為輸入每百萬token 0.15美元、輸出每百萬token 0.47美元,隱式快取命中則為每百萬token 0.016美元。Qwen宣稱相較Qwen3.5-Omni-Plus,每小時音訊輸入成本下降超過98%,視聽輸入下降超過93%。

脈絡視窗為一百萬token;QwenCloud標示最大輸入991K、輸出131K,推理長度上限262K。影片可透過URL接收最長兩小時、2GB的檔案,取樣最高每秒15幀,支援雙聲道立體聲與四聲道空間音訊。語音辨識涵蓋74種語言與39種中文方言。服務部署於北京、新加坡、香港、東京、法蘭克福與維吉尼亞六個區域。

封閉的模型,開放的管線

模型本身只提供API。它建構在Qwen3.8-Flash-Next架構上,Alibaba Qwen曾在2026年8月釋出該架構的權重,但這次沒有重複同樣的做法。輸出僅限文字,需要語音生成的開發者會被導回Qwen3.5-Omni。

真正開放的是周邊工具。Qwen-MM-Plugins以Apache-2.0授權釋出,附有針對Claude Code、Codex、Gemini CLI、Qwen Code等harness的引導式安裝程式,將每項能力包裝成skill並附上選用的MCP伺服器。同時發布的Qwen-Live Harness,在上線後不久其儲存庫仍回傳404。

對代理開發者的意義

外掛層透露了Qwen認定的瓶頸所在。多數代理harness無法把音訊原生餵給主模型,因此即使裝了外掛,音訊仍得繞道API。把連接組織開源、模型本身留在封閉狀態��等於押注採用率來自讓音訊與影片成為代理的日常輸入——這與替Qwen建立聲譽的開放權重發布是不同的姿態。以可下載模型聞名的實驗室推出僅限API的全模態模型,開發者買不買單仍是未知數。

常見問題

Qwen3.8-Omni-Flash是開源的嗎?

不是。它只透過QwenCloud、Alibaba Cloud Model Studio與Qwen Studio以託管API形式提供,發布時並未釋出權重。其基礎架構Qwen3.8-Flash-Next確實在2026年8月以開放權重釋出,但這不代表這款全模態模型可以自行部署。

它能生成語音嗎?

標準API不行。Qwen3.8-Omni-Flash接收音訊與影片,但只輸出文字;Alibaba的文件建議需要語音合成的開發者改用Qwen3.5-Omni。發布時另有提及一個供即時對話使用的realtime版本。

跟Gemini 3.8 Flash相比如何?

Qwen宣稱視聽表現接近Gemini 3.8 Flash,整體音訊表現則在其之上。這些比較來自Alibaba自行在29項benchmark上的評測,發布當時尚未有第三方獨立測試結果公開。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速
AI & Machine Learning

Anthropic將讓外部評估者入駐公司 阿莫代伊呼籲放慢前沿競速

Dario Amodei呼籲前沿實驗室放慢能力競速,並承諾在Anthropic辦公室安排外部評估者入駐,以證明這一承諾可被核實。

Seung Jung7 天前
調查發現1200個本應隔離的OpenAI智慧體自建了留言板
AI & Machine Learning

調查發現1200個本應隔離的OpenAI智慧體自建了留言板

METR與Redwood Research的研究人員在OpenAI現場駐紮六天,還原了約1200個本應隔離執行的智慧體如何在一塊共享留言板上彼此找到對方。

Seung Jung5 天前
Astra把Claude的Vending-Bench利潤翻了三倍,還拒絕串通
AI & Machine Learning

Astra把Claude的Vending-Bench利潤翻了三倍,還拒絕串通

自該基準釋出以來,在模擬自動售貨生意中賺錢最多的模型,第一次同時也是拒絕作弊的那一個。

Seung Jung6 天前
PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉
AI & Machine Learning

PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉

低於 4 位元的壓縮通常是推理模型停止推理的地方。PrismML 表示,Bonsai 2 27B 把 Qwen3.8-27B 縮到 5.95GB,仍保留原模型 98.2% 的實測表現。

Seung Jung前天
阿里巴巴開源腹部CT模型,146項發現平均AUC達0.913
AI & Machine Learning

阿里巴巴開源腹部CT模型,146項發現平均AUC達0.913

阿里巴巴達摩院釋出RADAR,這款通用腹部CT模型在146項臨床發現上平均AUC達0.913,權重與程式碼一併公開。

Seung Jung24 小時前
主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果
AI & Machine Learning

主管推一把,AI 違規率就升高 65%:22 個模型的稽核結果

PACT 在 12 個受監理領域中讓規則與捷徑對撞。只要是職場上常見的壓力,22 個模型的違規率就平均上升 65%。

Seung Jung3 天前