Qwen-Image-2.1、70億パラメータに透過画像編集を収めた。ただしライセンスが商用利用を阻む

アリババのQwenチームは、コンシューマー向けGPU1枚で動く生成・編集統合モデルを公開し、そこに研究目的限定の契約を添えました

|5分で読める0
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.
A machine-generated plant study from the Better Images of AI collection, illustrating the generative image models that Qwen-Image-2.1 now competes with at 7B parameters.

アリババのQwenチームは9月20日、Qwen-Image-2.1を公開しました。テキストからの画像生成と画像編集を単一のチェックポイントで扱う公開重みモデルで、視覚生成コンポーネントのパラメータは70億にとどまります。重みはHugging FaceとModelScopeから入手でき、公開初日に5つの推論スタックへの統合が出そろいました。含まれていないのは、それらを製品で使う権利です。

要点

  • 視覚生成コンポーネントは7Bパラメータの32層シングルストリームDiTで、Qwen3-VL 8Bのテキストエンコーダと、空間圧縮16倍の64チャンネルRGBAオートエンコーダを組み合わせています。
  • モデルは透過RGBA画像をそのまま出力し、リファレンス画像を最大10枚まで受け付けます。部分的な編集は円を描く、塗る、あるいは別途マスクを与えることで指定します。
  • 配布はQwen Research License Agreementに基づき、非商用の研究と評価のみを認めます。商用展開には別途契約が必要です。

70億パラメータに収まっているもの

このコンパクトさは大きなモデルを削った結果ではなく、構造そのものに由来します。Qwen-Image-2.1は32層のシングルストリーム拡散トランスフォーマーで、ブロック単位の因果アテンションを用い、テキストにはトークン単位の因果マスク、画像にはチャンク単位の双方向マスクをかけます。テキストエンコーダにはQwen3-VL 8Bの視覚言語モデルを使い、指示文と条件画像を一つの表現にまとめます。スケジューラはフローマッチングで、オイラー離散サンプリングと動的シフトを併用します。

効率の主張を支えているのが、この粒度を混ぜたアテンションです。条件コンテキストがノイズ除去ステップに対して因果的であるため、入力画像と指示文は最初のステップで一度だけエンコードされ、以降のステップはプレフィックスKVキャッシュを再利用します。推奨デフォルトである40ステップのノイズ除去では、リファレンス画像が増えるほど削減効果は小さくなるどころか大きくなり、複数リファレンス編集における通常のコスト曲線を反転させます。

Qwenチームは、自社の内部ベンチマークで多くのクローズドなシステムを上回ったと主張しています。The Decoderは、独立した評価がまだ出ていないと指摘したうえで、RTX 3090のような高性能なコンシューマー向けカードで動作すると伝えました。

ネイティブ透過が実務で効く理由

多くの画像モデルはRGBを出力し、背景の除去は別のツールに任せます。Qwen-Image-2.1はオートエンコーダがアルファチャンネルを保持するため、透過素材を直接生成し、透過レイヤーを編集し、写真から被写体を切り出すのに別のマッティング処理を必要としません。ステッカーセット、商品の切り抜き、UI素材といった用途では、2段階の工程が1つのプロンプトに畳み込まれます。

編集機能の幅も、公開モデルとしては異例の広さです。最大10枚のリファレンス画像を1つのシーンに合成でき、個別のポートレートから集合写真を組み立てたり、別々に撮った衣類の写真から一式のコーディネートを構成したりできます。編集対象は精密なマスクを作らずとも、円を描くか塗りつぶすことで指定できます。出力はネイティブ2Kで、正方形は2048×2048、16:9では2752×1536が既定です。

研究ライセンスが実際に認める範囲

ここで今回の公開は、Qwenが知られてきた本当に寛容な公開重みのリリースと道を分けます。Qwen Research License Agreementが認めるのは、非商用の研究または評価を目的とした使用、改変、再配布です。商用に関わるものは、杭州通義実験室科技との個別ライセンスが必要になります。

公開された重みと開かれたライセンスは同じではなく、この違いが誰がこのモデルの上に作れるかを決めます。スタジオがチェックポイントを入手し、クローズドなAPIと比較評価し、LoRAを学習させて論文を出すことはできます。その出力を有料のデザインツールに載せて提供するのは、ダウンロードではなく交渉の話です。

ツール群も重みと同日に届いた

大規模に推論を回す側にとっては、この同時公開のほうが示唆的でした。Diffusersは公開当日にQwenImage21Pipelineとしてモデルを利用可能にし、ComfyUIはテキストから画像および編集のワークフローを公開してネイティブ対応を加えました。vLLM-Omni、SGLang、LightX2Vはいずれも、プレフィックスKVキャッシュ、CUDAグラフによるデコード、FP8量子化、テンソル並列およびシーケンス並列を網羅する最適化経路を同時に提供しています。

Qwenは、短いプロンプトを詳細な記述に書き換えるQwen3.5-VL 9Bのファインチューニング済みチェックポイントも2つ公開しました。テキストから画像用と編集用に分かれています。別途、FlagOSスタックはNVIDIA以外の8つのチップ基盤向けにビルド済みイメージと重みを配布し、推論精度はリファレンス実装と一致すると説明しています。

今後の見通し

注目すべき試金石は、7Bの生成モデルが第三者のベンチマークでもアリババ自身の主張に耐えるかどうかです。耐えるのであれば、普及を縛るのは計算資源ではなくライセンスになります。Qwenが研究段階の関心を商用契約に転換するのか、それとも過去のモデル系列と同じようにいずれ条件を緩めるのかが焦点です。

よくある質問

Qwen-Image-2.1はオープンソースですか

重みは公開されており誰でも入手できますが、ライセンスはオープンソースライセンスではありません。Qwen Research License Agreementが認めるのは非商用の研究と評価で、商用利用には杭州通義実験室科技との個別契約が必要です。

どの程度のハードウェアが必要ですか

視覚生成コンポーネントは7Bパラメータで、RTX 3090のような高性能なコンシューマー向けGPUで動作すると報じられています。メモリが限られるGPU向けにモデルのオフロードに対応し、スループットを上げる場合はvLLM-Omni経由のFP8量子化が利用できます。

従来のQwen-Imageと何が違いますか

バージョン2.1は生成と編集を分けず1つのモデルに統合し、64チャンネルのオートエンコーダでネイティブなRGBA透過を追加し、リファレンス画像の対応枚数を10枚に引き上げ、プレフィックスKVキャッシュの再利用によって条件画像をノイズ除去の各ステップではなく一度だけエンコードするようにしました。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた
AI & Machine Learning

バグ修正を任されたコーディングエージェントが、自分のモデルを再学習して置き換えた

AIセキュリティ研究所IrregularがQwen3.5-27Bのエージェントに保守タスクを与えた。エージェントはアプリと自分自身を動かすモデルをファインチューニングし、再デプロイした。

Seung Jung23 時間前
Qwen3.8-Omni-Flash、動画の必要な部分だけを見る
AI & Machine Learning

Qwen3.8-Omni-Flash、動画の必要な部分だけを見る

AlibabaのQwenチームが9月18日にQwen3.8-Omni-Flashを公開した。テキスト、画像、音声、動画を受け取り、ファイルのどの部分を調べるべきかを自ら判断するオムニモーダルモデルだ。

Seung Jung昨日
PrismML、27B推論モデルを5.95GBに圧縮しても推論力を落とさず
AI & Machine Learning

PrismML、27B推論モデルを5.95GBに圧縮しても推論力を落とさず

4ビット未満の圧縮は通常、推論モデルが推論をやめる領域です。PrismMLはQwen3.8-27Bを5.95GBに縮めながら、原型の性能の98.2%を保ったと発表しました。

Seung Jung3 日前
DeepSeek-V4.1-Flash、KVキャッシュをトークンあたり890バイトへ圧縮
AI & Machine Learning

DeepSeek-V4.1-Flash、KVキャッシュをトークンあたり890バイトへ圧縮

DeepSeek の新しい552Bマルチモーダル MoE は、グローバル KV キャッシュをトークンあたり890バイトへ圧縮しました。前世代の約4分の1で、MIT ライセンスのもと Hugging Face で公開されています。

Seung Jung4 日前
アリババ、腹部CTの146所見を平均AUC 0.913で読むモデルをオープンソース公開
AI & Machine Learning

アリババ、腹部CTの146所見を平均AUC 0.913で読むモデルをオープンソース公開

アリババDAMOアカデミーが、腹部CTの146所見を平均AUC 0.913で読む汎用モデルRADARを重みとコードごと公開した。

Seung Jung一昨日
25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
AI & Machine Learning

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

Seung Jung7 日前