アリババのQwenチームは9月20日、Qwen-Image-2.1を公開しました。テキストからの画像生成と画像編集を単一のチェックポイントで扱う公開重みモデルで、視覚生成コンポーネントのパラメータは70億にとどまります。重みはHugging FaceとModelScopeから入手でき、公開初日に5つの推論スタックへの統合が出そろいました。含まれていないのは、それらを製品で使う権利です。
要点
- 視覚生成コンポーネントは7Bパラメータの32層シングルストリームDiTで、Qwen3-VL 8Bのテキストエンコーダと、空間圧縮16倍の64チャンネルRGBAオートエンコーダを組み合わせています。
- モデルは透過RGBA画像をそのまま出力し、リファレンス画像を最大10枚まで受け付けます。部分的な編集は円を描く、塗る、あるいは別途マスクを与えることで指定します。
- 配布はQwen Research License Agreementに基づき、非商用の研究と評価のみを認めます。商用展開には別途契約が必要です。
70億パラメータに収まっているもの
このコンパクトさは大きなモデルを削った結果ではなく、構造そのものに由来します。Qwen-Image-2.1は32層のシングルストリーム拡散トランスフォーマーで、ブロック単位の因果アテンションを用い、テキストにはトークン単位の因果マスク、画像にはチャンク単位の双方向マスクをかけます。テキストエンコーダにはQwen3-VL 8Bの視覚言語モデルを使い、指示文と条件画像を一つの表現にまとめます。スケジューラはフローマッチングで、オイラー離散サンプリングと動的シフトを併用します。
効率の主張を支えているのが、この粒度を混ぜたアテンションです。条件コンテキストがノイズ除去ステップに対して因果的であるため、入力画像と指示文は最初のステップで一度だけエンコードされ、以降のステップはプレフィックスKVキャッシュを再利用します。推奨デフォルトである40ステップのノイズ除去では、リファレンス画像が増えるほど削減効果は小さくなるどころか大きくなり、複数リファレンス編集における通常のコスト曲線を反転させます。
Qwenチームは、自社の内部ベンチマークで多くのクローズドなシステムを上回ったと主張しています。The Decoderは、独立した評価がまだ出ていないと指摘したうえで、RTX 3090のような高性能なコンシューマー向けカードで動作すると伝えました。
ネイティブ透過が実務で効く理由
多くの画像モデルはRGBを出力し、背景の除去は別のツールに任せます。Qwen-Image-2.1はオートエンコーダがアルファチャンネルを保持するため、透過素材を直接生成し、透過レイヤーを編集し、写真から被写体を切り出すのに別のマッティング処理を必要としません。ステッカーセット、商品の切り抜き、UI素材といった用途では、2段階の工程が1つのプロンプトに畳み込まれます。
編集機能の幅も、公開モデルとしては異例の広さです。最大10枚のリファレンス画像を1つのシーンに合成でき、個別のポートレートから集合写真を組み立てたり、別々に撮った衣類の写真から一式のコーディネートを構成したりできます。編集対象は精密なマスクを作らずとも、円を描くか塗りつぶすことで指定できます。出力はネイティブ2Kで、正方形は2048×2048、16:9では2752×1536が既定です。
研究ライセンスが実際に認める範囲
ここで今回の公開は、Qwenが知られてきた本当に寛容な公開重みのリリースと道を分けます。Qwen Research License Agreementが認めるのは、非商用の研究または評価を目的とした使用、改変、再配布です。商用に関わるものは、杭州通義実験室科技との個別ライセンスが必要になります。
公開された重みと開かれたライセンスは同じではなく、この違いが誰がこのモデルの上に作れるかを決めます。スタジオがチェックポイントを入手し、クローズドなAPIと比較評価し、LoRAを学習させて論文を出すことはできます。その出力を有料のデザインツールに載せて提供するのは、ダウンロードではなく交渉の話です。
ツール群も重みと同日に届いた
大規模に推論を回す側にとっては、この同時公開のほうが示唆的でした。Diffusersは公開当日にQwenImage21Pipelineとしてモデルを利用可能にし、ComfyUIはテキストから画像および編集のワークフローを公開してネイティブ対応を加えました。vLLM-Omni、SGLang、LightX2Vはいずれも、プレフィックスKVキャッシュ、CUDAグラフによるデコード、FP8量子化、テンソル並列およびシーケンス並列を網羅する最適化経路を同時に提供しています。
Qwenは、短いプロンプトを詳細な記述に書き換えるQwen3.5-VL 9Bのファインチューニング済みチェックポイントも2つ公開しました。テキストから画像用と編集用に分かれています。別途、FlagOSスタックはNVIDIA以外の8つのチップ基盤向けにビルド済みイメージと重みを配布し、推論精度はリファレンス実装と一致すると説明しています。
今後の見通し
注目すべき試金石は、7Bの生成モデルが第三者のベンチマークでもアリババ自身の主張に耐えるかどうかです。耐えるのであれば、普及を縛るのは計算資源ではなくライセンスになります。Qwenが研究段階の関心を商用契約に転換するのか、それとも過去のモデル系列と同じようにいずれ条件を緩めるのかが焦点です。
よくある質問
Qwen-Image-2.1はオープンソースですか
重みは公開されており誰でも入手できますが、ライセンスはオープンソースライセンスではありません。Qwen Research License Agreementが認めるのは非商用の研究と評価で、商用利用には杭州通義実験室科技との個別契約が必要です。
どの程度のハードウェアが必要ですか
視覚生成コンポーネントは7Bパラメータで、RTX 3090のような高性能なコンシューマー向けGPUで動作すると報じられています。メモリが限られるGPU向けにモデルのオフロードに対応し、スループットを上げる場合はvLLM-Omni経由のFP8量子化が利用できます。
従来のQwen-Imageと何が違いますか
バージョン2.1は生成と編集を分けず1つのモデルに統合し、64チャンネルのオートエンコーダでネイティブなRGBA透過を追加し、リファレンス画像の対応枚数を10枚に引き上げ、プレフィックスKVキャッシュの再利用によって条件画像をノイズ除去の各ステップではなく一度だけエンコードするようにしました。






