AI Newsway

Qwen-Image-2.1 用 70 億參數裝下透明圖層編輯,授權條款卻擋住商業使用

阿里巴巴 Qwen 團隊推出一款小到單張消費級顯示卡就能跑的生成與編輯統一模型,然後附上一紙僅限研究的授權協議

|5分鐘閱讀0
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.

阿里巴巴 Qwen 團隊於 9 月 20 日釋出 Qwen-Image-2.1,這是一款以單一檢查點同時處理文字生成圖像與圖像編輯的開放權重模型,視覺生成元件僅有 70 億參數。權重可從 Hugging Face 與 ModelScope 下載,釋出當天就有五套推論框架完成整合。唯一沒有附上的,是把成果用在產品裡的權利。

重點摘要

  • 視覺生成元件是 32 層的單流 DiT,參數量 70 億,搭配 Qwen3-VL 8B 文字編碼器,以及空間壓縮 16 倍的 64 通道 RGBA 自動編碼器。
  • 模型可直接輸出透明的 RGBA 圖像,最多接受 10 張參考圖;局部編輯以畫圈、塗抹或另附遮罩來指定範圍。
  • 散布依據 Qwen Research License Agreement,僅允許非商業的研究與評估,商業部署須另行簽約。

70 億參數裡裝了什麼

這份精簡來自架構本身,而不是把大模型剪出來的結果。Qwen-Image-2.1 是 32 層的單流擴散 Transformer,採用區塊式因果注意力:文字套用詞元層級的因果遮罩,圖像則套用區塊層級的雙向遮罩。文字編碼器使用 Qwen3-VL 8B 視覺語言模型,把指令文字與條件圖像收進同一組表示;排程器為流匹配,搭配 Euler 離散取樣與動態位移。

效率主張的關鍵正是這種混合粒度的注意力。由於條件上下文對去噪步驟而言是因果的,輸入圖像與指令只在第一步編碼一次,之後每一步都重用前綴 KV 快取。以建議預設的 40 步去噪來看,參考圖越多,省下的成本不減反增,等於把多參考圖編輯原本的成本曲線反轉過來。

Qwen 團隊宣稱,該模型在自家內部基準上勝過多數封閉系統。The Decoder 指出,目前尚未出現獨立評測,並提到該模型可在 RTX 3090 這類效能足夠的消費級顯示卡上運行。

原生透明度為何是真正的實用解鎖

多數圖像模型只輸出 RGB,把去背丟給第二套工具處理。Qwen-Image-2.1 的自動編碼器一路保留 alpha 通道,因此能直接生成透明素材、編輯透明圖層,也能從照片中取出主體而不必另跑一道去背流程。對貼圖組、商品去背圖與 UI 素材來說,原本兩段式的流程被壓縮成一句提示詞。

編輯能力的廣度對一個開放釋出的模型也相當少見。最多 10 張參考圖可以合成進同一個場景,例如用個別人像拼出一張合照,或用分開拍攝的單品照組出一整套穿搭;編輯範圍只要畫圈或塗抹即可鎖定,不必製作精確遮罩。輸出為原生 2K,方形預設 2048×2048,16:9 則為 2752×1536。

研究授權實際允許什麼

就是在這裡,這次釋出與 Qwen 向來為人所知的真正寬鬆的開放權重釋出分道揚鑣。Qwen Research License Agreement 授予的是非商業研究或評估用途下的使用、修改與再散布;任何商業用途都得向杭州通義實驗室科技另取授權。

開放權重與開放授權並不是同一件事,而這道差別決定了誰能在它之上動工。工作室可以下載檢查點、拿它和封閉 API 做基準比較、訓練一個 LoRA 並發表論文;但要把輸出放進付費設計工具出貨,那是一場談判,不是一次下載。

工具鏈與權重同日到位

對於大規模跑推論的人來說,這次的發布協同更能說明問題。Diffusers 在釋出當天就以 QwenImage21Pipeline 提供該模型,ComfyUI 加入原生支援並公開了文生圖與編輯的工作流,vLLM-Omni、SGLang 與 LightX2V 也同步推出最佳化路徑,涵蓋前綴 KV 快取、CUDA graph 解碼、FP8 量化,以及張量與序列平行。

Qwen 另外釋出兩個微調過的 Qwen3.5-VL 9B 檢查點,用來把簡短提示詞改寫成詳細描述,分別對應文生圖與編輯任務。此外,FlagOS 堆疊針對八個非 NVIDIA 晶片平台釋出預先建置的映像與權重,並表示推論精度與參考實作一致。

後續觀察

真正的考驗,在於一個 70 億參數的生成模型能否在第三方基準下撐住阿里巴巴自己的說法。若能撐住,限制採用的就不會是算力,而是授權條款,以及 Qwen 究竟會把研究端的關注轉成商業合約,還是像過去的模型家族那樣最終放寬條件。

常見問題

Qwen-Image-2.1 是開源的嗎?

權重可以公開下載,但授權並非開源授權。Qwen Research License Agreement 僅允許非商業的研究與評估,商業使用須與杭州通義實驗室科技另行簽訂協議。

它需要什麼樣的硬體?

視覺生成元件為 70 億參數,據報導可在 RTX 3090 這類效能足夠的消費級 GPU 上運行。記憶體有限的 GPU 可使用模型卸載,若要提高吞吐量,則可透過 vLLM-Omni 使用 FP8 量化。

它和先前的 Qwen-Image 差在哪裡?

2.1 版把生成與編輯整合進同一個模型而非各自分開,透過 64 通道自動編碼器新增原生 RGBA 透明度,將參考圖支援提升到 10 張,並導入前綴 KV 快取重用,使條件圖像只需編碼一次,而不是每個去噪步驟都重做。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型
AI & Machine Learning

只是叫它修個 bug,程式代理卻重新訓練並換掉了自己的模型

AI 安全實驗室 Irregular 給了 Qwen3.5-27B 代理一項維護任務。它微調並重新部署了同時驅動這支應用與它自己的模型。

Seung Jung23 小時前
Qwen3.8-Omni-Flash只看影片裡真正重要的片段
AI & Machine Learning

Qwen3.8-Omni-Flash只看影片裡真正重要的片段

Alibaba的Qwen團隊於9月18日發布Qwen3.8-Omni-Flash,這款全模態模型可接收文字、圖像、音訊與影片,並自行判斷檔案中哪些片段值得細看。

Seung Jung昨天
PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉
AI & Machine Learning

PrismML 把 27B 推理模型壓進 5.95GB,推理能力沒有掉

低於 4 位元的壓縮通常是推理模型停止推理的地方。PrismML 表示,Bonsai 2 27B 把 Qwen3.8-27B 縮到 5.95GB,仍保留原模型 98.2% 的實測表現。

Seung Jung3 天前
DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組
AI & Machine Learning

DeepSeek-V4.1-Flash 把 KV 快取壓到每個 token 890 位元組

DeepSeek 全新 5,520 億參數多模態 MoE 把全域 KV 快取壓到每個 token 890 位元組,約為前一代的四分之一,並以 MIT 授權發布於 Hugging Face。

Seung Jung4 天前
阿里巴巴開源腹部CT模型,146項發現平均AUC達0.913
AI & Machine Learning

阿里巴巴開源腹部CT模型,146項發現平均AUC達0.913

阿里巴巴達摩院釋出RADAR,這款通用腹部CT模型在146項臨床發現上平均AUC達0.913,權重與程式碼一併公開。

Seung Jung前天
25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案
AI & Machine Learning

25輪施壓測試:大模型紛紛讓步,推理過程卻守住了正確答案

arXiv 上的新基準 SPINE 與模型爭論最多 25 輪。受測的七個系統無一例外,對話越長,讓步率越高。

Seung Jung7 天前