阿里巴巴 Qwen 團隊於 9 月 20 日釋出 Qwen-Image-2.1,這是一款以單一檢查點同時處理文字生成圖像與圖像編輯的開放權重模型,視覺生成元件僅有 70 億參數。權重可從 Hugging Face 與 ModelScope 下載,釋出當天就有五套推論框架完成整合。唯一沒有附上的,是把成果用在產品裡的權利。
重點摘要
- 視覺生成元件是 32 層的單流 DiT,參數量 70 億,搭配 Qwen3-VL 8B 文字編碼器,以及空間壓縮 16 倍的 64 通道 RGBA 自動編碼器。
- 模型可直接輸出透明的 RGBA 圖像,最多接受 10 張參考圖;局部編輯以畫圈、塗抹或另附遮罩來指定範圍。
- 散布依據 Qwen Research License Agreement,僅允許非商業的研究與評估,商業部署須另行簽約。
70 億參數裡裝了什麼
這份精簡來自架構本身,而不是把大模型剪出來的結果。Qwen-Image-2.1 是 32 層的單流擴散 Transformer,採用區塊式因果注意力:文字套用詞元層級的因果遮罩,圖像則套用區塊層級的雙向遮罩。文字編碼器使用 Qwen3-VL 8B 視覺語言模型,把指令文字與條件圖像收進同一組表示;排程器為流匹配,搭配 Euler 離散取樣與動態位移。
效率主張的關鍵正是這種混合粒度的注意力。由於條件上下文對去噪步驟而言是因果的,輸入圖像與指令只在第一步編碼一次,之後每一步都重用前綴 KV 快取。以建議預設的 40 步去噪來看,參考圖越多,省下的成本不減反增,等於把多參考圖編輯原本的成本曲線反轉過來。
Qwen 團隊宣稱,該模型在自家內部基準上勝過多數封閉系統。The Decoder 指出,目前尚未出現獨立評測,並提到該模型可在 RTX 3090 這類效能足夠的消費級顯示卡上運行。
原生透明度為何是真正的實用解鎖
多數圖像模型只輸出 RGB,把去背丟給第二套工具處理。Qwen-Image-2.1 的自動編碼器一路保留 alpha 通道,因此能直接生成透明素材、編輯透明圖層,也能從照片中取出主體而不必另跑一道去背流程。對貼圖組、商品去背圖與 UI 素材來說,原本兩段式的流程被壓縮成一句提示詞。
編輯能力的廣度對一個開放釋出的模型也相當少見。最多 10 張參考圖可以合成進同一個場景,例如用個別人像拼出一張合照,或用分開拍攝的單品照組出一整套穿搭;編輯範圍只要畫圈或塗抹即可鎖定,不必製作精確遮罩。輸出為原生 2K,方形預設 2048×2048,16:9 則為 2752×1536。
研究授權實際允許什麼
就是在這裡,這次釋出與 Qwen 向來為人所知的真正寬鬆的開放權重釋出分道揚鑣。Qwen Research License Agreement 授予的是非商業研究或評估用途下的使用、修改與再散布;任何商業用途都得向杭州通義實驗室科技另取授權。
開放權重與開放授權並不是同一件事,而這道差別決定了誰能在它之上動工。工作室可以下載檢查點、拿它和封閉 API 做基準比較、訓練一個 LoRA 並發表論文;但要把輸出放進付費設計工具出貨,那是一場談判,不是一次下載。
工具鏈與權重同日到位
對於大規模跑推論的人來說,這次的發布協同更能說明問題。Diffusers 在釋出當天就以 QwenImage21Pipeline 提供該模型,ComfyUI 加入原生支援並公開了文生圖與編輯的工作流,vLLM-Omni、SGLang 與 LightX2V 也同步推出最佳化路徑,涵蓋前綴 KV 快取、CUDA graph 解碼、FP8 量化,以及張量與序列平行。
Qwen 另外釋出兩個微調過的 Qwen3.5-VL 9B 檢查點,用來把簡短提示詞改寫成詳細描述,分別對應文生圖與編輯任務。此外,FlagOS 堆疊針對八個非 NVIDIA 晶片平台釋出預先建置的映像與權重,並表示推論精度與參考實作一致。
後續觀察
真正的考驗,在於一個 70 億參數的生成模型能否在第三方基準下撐住阿里巴巴自己的說法。若能撐住,限制採用的就不會是算力,而是授權條款,以及 Qwen 究竟會把研究端的關注轉成商業合約,還是像過去的模型家族那樣最終放寬條件。
常見問題
Qwen-Image-2.1 是開源的嗎?
權重可以公開下載,但授權並非開源授權。Qwen Research License Agreement 僅允許非商業的研究與評估,商業使用須與杭州通義實驗室科技另行簽訂協議。
它需要什麼樣的硬體?
視覺生成元件為 70 億參數,據報導可在 RTX 3090 這類效能足夠的消費級 GPU 上運行。記憶體有限的 GPU 可使用模型卸載,若要提高吞吐量,則可透過 vLLM-Omni 使用 FP8 量化。
它和先前的 Qwen-Image 差在哪裡?
2.1 版把生成與編輯整合進同一個模型而非各自分開,透過 64 通道自動編碼器新增原生 RGBA 透明度,將參考圖支援提升到 10 張,並導入前綴 KV 快取重用,使條件圖像只需編碼一次,而不是每個去噪步驟都重做。






