GPT Image 2.5:画像生成とSketchを検証
GPT Image 2.5がChatGPT Images 2.5の基盤に。無料アカウントでSketchの画像生成とコメント編集を試しました。APIのトークン単価はGPT Image 2と同額です。
記事を読む →
Qwen Image 2.1は、Alibaba(アリババ)が2026年9月20日に公開した、オープンウェイトの新しい画像生成モデルです。生成と編集を1つのモデルでこなし、その中心には70億パラメータ(7B)の画像生成器があります。透過PNGをネイティブに出力でき、編集では参照画像を最大10枚まで受け付け、解像度はネイティブ2Kです。QwenがHugging Faceで公開しているデモなら無料で試せます。引っかかるのはライセンスで、認められているのは非商用利用だけです。
私は9月25日に3つのテストをしました。透過背景の商品写真、文字の多いポスター、そして画像編集で、どれもQwen公式のHugging Faceデモを使っています。切り抜きは見せかけではなく、本物の透過でした。小さな文字のほうは、まだそこまで来ていません。
生成と編集は1つのモデルが担います。70億パラメータの画像生成器に、ビジョン言語モデルのQwen3-VL 8Bを組み合わせた構成で、Qwen3-VLがテキストの指示と、渡した画像を読み取ります。このコンパクトな設計をQwenが初めて打ち出したのは2月のQwen-Image-2.0ですが、当時はAlibabaのAPI経由でしか使えませんでした。2.1はこの設計で初めてダウンロードできるバージョンで、画像生成器の規模は2025年8月に出た初代Qwen-Image(200億パラメータ)のおよそ3分の1です。
いちばんの目玉は透過です。テキストから通常の画像も透過(RGBA)画像も直接生成でき、透過レイヤーをそのまま編集でき、写真から被写体を抜き出して背景を消すこともできます。土台になっているのは、Qwenが2025年12月に出したQwen-Image-Layeredです。編集では参照画像を最大10枚まで使え、特定の範囲を円で囲む、ブラシで塗る、別途マスクを用意する、のいずれかの方法で指定できます。Qwenによれば、編集を重ねても人物や商品の見た目は保たれ、タイポグラフィ、ポートレートのライティング、細部の描写も従来より向上しています。
Qwenが出しているのは画像モデルだけではありません。昨年12月には3秒の音声で声をクローンできるモデルも登場しています。
まずはQwenがいちばん力を入れている機能から試しました。頼んだのは、水滴のついたコールドブリューのボトルにクラフト紙のラベルが付いた画像です。プロンプトには、透過画像向けにQwen自身が推奨している言い回しを使いました。
This is an RGBA image with transparency. A glass bottle of cold-brew coffee with condensation droplets and a kraft-paper label reading “NORTH ROAST”, three coffee beans beside it. The image has alpha channel and the background is transparent.
日本語にすると、「NORTH ROAST」と書かれたクラフト紙ラベル付きの、水滴がついたコールドブリューのガラス瓶と、その横に3粒のコーヒー豆。アルファチャンネル付きで背景は透明、という内容です。
返ってきたのはデモの既定サイズである1024x1024のPNGで、本物のアルファチャンネルが付いていました。画面のおよそ4分の3が透明で、ラベルには誤字なくNORTH ROASTと入り、水滴の質感もよくできています。
切り抜きの具合を見るため、濃いネイビーの背景と砂色の背景に重ねてみました。砂色の上では、スタジオで撮った商品写真にしか見えません。
ネイビーの上では、欠点が1つはっきり見えます。中身のないボトルの首が薄いグレー一色になっていることです。モデルがガラスを透明のまま残さず、後ろに白いスタジオの背景があるかのように描いてしまったためです。拡大すると底の下に白っぽい細い縁も残っていますが、通常のサイズではまず気づきません。
ステッカー、アイコン、明るいページに載せる商品の切り抜きなら非常に優秀で、背景を消す作業がひと手間省けます。ガラス製品や、暗いレイアウトに使う予定のものは、使う前に縁を確認してください。

Qwenは文字の描画も改善したとしているので、3行の文字が入ったポスターを頼みました。
A risograph-style concert poster that reads “Harbour Lights Jazz Night”, “Friday 17 October, 20:00”, “Café Aurora, London”, two-colour teal and orange ink, grainy paper texture.
リソグラフ風のコンサートポスターに「Harbour Lights Jazz Night」「Friday 17 October, 20:00」「Café Aurora, London」の3行を入れ、ティールとオレンジの2色インクに粒子の粗い紙の質感、という内容です。
こちらはきれいに仕上がりました。見出し、日付と時刻、「Café Aurora, London」のどれも綴りが正しく、アクセント記号も入っています。2色刷りのリソグラフらしい雰囲気もよく出ています。
ただし、毎回こうなるわけではありません。同じポスターを最後の行だけ別の都市にして試した1回目は、時刻が20:00ではなく10:00になり、都市名も崩れていました。見出しは任せてよくても、印刷に回す前には小さな行を1つ残らず読んでください。

編集では、透過のボトルを渡して、日の差し込むカフェの木のテーブルに置き、後ろの壁にはジャズのポスターを貼るよう頼みました。ボトルとラベルは元のまま残す、という条件付きです。
ボトル、ラベル、3粒の豆は変わらずに戻ってきて、窓からの光もテーブルに落ちる影も自然です。今回はガラスの首がちゃんと透けていて、奥の壁が見えます。
一方、壁のポスターの文字は、それらしく見えるだけで意味をなしていません。1回目のポスターで見えたのと同じ、小さな文字の弱さがここでも出ています。
最大10枚の画像を扱えるQwenのメインのデモには、その朝はキューが満杯で何度も断られました。そのため私のテストは、1回に1枚ずつ編集するQwenのもう1つのHugging Faceデモで行っています。つまり、10枚を使った編集はまだ試せていません。

Qwen Image 2.1は、Qwen Research License Agreementのもとで配布されています。Apache 2.0で公開され、商用利用も認められていた初代Qwen-Imageからは一歩後退した形です。新しいライセンスはロイヤリティフリーでの利用を認めていますが、対象は非商用目的に限られ、その非商用とは研究または評価のことだと定義されています。それを超える用途には、Alibabaから別途商用ライセンスを受ける必要があり、申請はライセンスファイルに記載されたアドレスへのメールで行います。
お金を払ってこの制限を回避できるQwen Image 2.1 APIもありません。Alibaba Cloud Model StudioにあるAlibabaの有料画像APIが提供しているのはqwen-image-3.0とqwen-image-3.0-proで、このモデルではありません。
ライセンスには、モデルが生成した画像についての個別の定めがありません。そのため私なら、クライアントワーク、広告、販売する予定のものはすべて商用利用とみなし、先にAlibabaに問い合わせます。
いますぐ販売できる画像が必要なら、Higgsfieldの無料プランでも、生成物はすでに商用利用できます。
Higgsfield独自の画像モデルSoul 2.0は無料プランでも使えます。無料を含むすべてのプランで、生成物を商用利用できます。
Higgsfieldを無料で試す →ウェイト全体のダウンロードは33.1GBです。公開初日からComfyUIが対応しており、テキストから画像を作るワークフローと画像編集のワークフローも既成のものが用意されています。Diffusers、vLLM-Omni、SGLang、LightX2Vも初日から対応しました。ROCm経由でAMD RadeonのGPUでも動くので、Nvidiaに縛られることもありません。
画像モデルと合わせて、QwenはQwen3.5-VLをベースにしたプロンプト書き換えモデルも2つ公開しました。短いプロンプトを詳細なものに膨らませるモデルで、1つは生成向け、もう1つは編集向けに調整されています。中国本土にいる人なら、wuli.artでQwen Image 2.1の全機能を無料で使えます。ローカルで動くオープンウェイトの動画モデルを探しているなら、8月にLTX-2.5を取り上げています。
Qwenはリリースに合わせて、独自のベンチマーク「Qwen-Image-Bench」を公開しました。スコアは独立したテストの結果ではなく、Qwen自身の主張として読んでください。このベンチマークで2.1は、GoogleのNano Banana 2.0とOpenAI(オープンAI)のGPT Image 1.5をわずかに上回り、OpenAIのGPT Image 2.5とGPT Image 2、そしてQwen自身のクローズドモデルQwen Image 3 Proには届いていません。
Qwenがリリースと同時に公開したベンチマーク、Qwen-Image-Benchの総合スコアから一部を抜粋。
| モデル | Qwen-Image-Benchスコア |
|---|---|
| GPT Image 2.5 (Sunburst) | 67.01 |
| GPT Image 2 | 64.69 |
| Qwen Image 3 Pro | 62.36 |
| Qwen Image 2.1 | 60.28 |
| Nano Banana 2.0 | 59.82 |
| GPT Image 1.5 | 59.65 |
| FLUX 2 Max | 55.33 |
| Qwen Image 2512 | 52.06 |
ダウンロードして自分のマシンで動かせるモデルとしては、なかなかの顔ぶれと肩を並べています。
ステッカー、アイコン、商品の切り抜きを作るなら、無料のデモを試してみてください。ただし公開する前に、ガラス部分を暗い背景の上で確認しましょう。
高性能なGPUがあり、ローカルで動く画像モデルを探しているなら、ComfyUIが初日から対応していて、出発点になる既成のワークフローもそろっています。
有償の仕事に使う画像が必要なら、このライセンスではカバーされません。先にAlibabaに商用ライセンスを申請するか、規約ですでに商用利用が認められているツールを使ってください。
はい。Qwen Image 2.1は無料でダウンロードでき、Qwenが公開している2つのHugging Faceデモでも無料で試せます。ただし混雑する時間帯は、デモが順番待ちになることがあります。私も2026年9月25日のテストはすべて支払いなしで行いました。とはいえ研究用のライセンスで配布されているため、無料だからといって商用利用まで自由なわけではありません。
Qwen Image 2.1は、既定のQwen Research Licenseのもとでは商用利用できません。認められているのは研究または評価目的だけです。商用利用にはAlibabaの別ライセンスが必要で、有料の2.1 APIもありません。Alibabaの有料APIが提供しているのはqwen-image-3.0です。ライセンスには生成画像についての個別条項がないため、有償の仕事は商用利用として扱うか、無料プランでも商用利用が認められているHiggsfieldのようなツールを使ってください。なお、2025年8月に出た初代Qwen-ImageはApache 2.0で公開され、商用利用が認められていました。
Qwenが推奨する言い回しを使います。「This is an RGBA image with transparency. [作りたいものの説明] The image has alpha channel and the background is transparent.」のように書くと、本物のアルファチャンネルを持つPNGが出力されます。私のテストでは切り抜きはきれいでしたが、ガラス部分は暗い背景の上で確認が必要です。
Qwen Image 2.1ではネイティブの透過対応が加わり、RGBA画像を直接生成・編集できるようになりました。編集1回につき最大10枚の参照画像も使えます。2026年2月にQwen-Image-2.0がAlibabaのAPI経由で導入したコンパクトな設計、つまり70億パラメータの画像生成器を持つ1つのモデルで生成と編集をこなし、ネイティブ2Kで出力する構成を受け継いでおり、この設計がオープンウェイトになったのは2.1が初めてです。2025年8月の初代Qwen-Imageは、画像生成器が200億パラメータでした。Qwenによれば、タイポグラフィ、ポートレートのライティング、細部の描写も向上しています。
できます。ウェイトは公開されていて、フルモデルで33.1GBです。ComfyUIとDiffusersが公開初日から対応しているほか、vLLM-Omni、SGLang、LightX2Vも初日から対応し、AMD RadeonのGPUもROCm経由で対応しています。ただし高性能なGPUが必要です。
Qwenは、中国のAlibaba(Alibaba CloudのQwenチーム)が開発しているAIモデルのシリーズです。画像モデルのQwen Image 2.1は、2026年9月20日にオープンウェイトで公開されました。