GPT Image 2.5 : Sketch ChatGPT testé, API inchangée
GPT Image 2.5 alimente ChatGPT Images 2.5. J'ai testé Sketch et les commentaires sur un compte gratuit ; les tarifs API restent identiques à GPT Image 2.
Lire l'article →
Contient des liens d'affiliation
Qwen Image 2.1 est le nouveau modèle d’image en poids ouverts d’Alibaba, sorti le 20 septembre 2026. Un seul modèle génère et modifie les images, construit autour d’un générateur d’image de 7 milliards de paramètres. Il crée des PNG transparents nativement, accepte jusqu’à 10 images de référence pour une modification, produit en 2K natif, et vous pouvez l’essayer gratuitement dans les démos Hugging Face de Qwen. Le hic, c’est la licence, qui n’autorise que l’usage non commercial.
J’ai fait trois tests le 25 septembre : une photo produit transparente, une affiche chargée en texte et une modification, le tout via la démo Hugging Face officielle de Qwen. Les découpes sont à la hauteur. Les petits caractères, pas encore.
Un seul modèle gère à la fois la génération et la modification. Un générateur d’image de 7 milliards de paramètres est associé à Qwen3-VL 8B, un modèle vision-langage qui lit vos instructions textuelles et les images que vous lui donnez. Qwen a introduit cette architecture compacte avec Qwen-Image-2.0 en février, mais uniquement via l’API d’Alibaba. La version 2.1 en est la première déclinaison téléchargeable, et son générateur d’image fait environ un tiers de celui du Qwen-Image original d’août 2025, qui comptait 20 milliards de paramètres.
La transparence est l’argument phare. Le modèle génère des images normales ou transparentes (RGBA) directement à partir de texte, modifie les calques transparents et peut extraire un sujet d’une photo en supprimant l’arrière-plan. Cela s’appuie sur Qwen-Image-Layered, que Qwen a publié en décembre 2025. La modification accepte jusqu’à 10 images de référence, et vous pouvez cibler une zone précise avec un cercle, un trait de pinceau ou un masque séparé. Qwen affirme que les personnes et les produits restent reconnaissables d’une modification à l’autre, et que la typographie, l’éclairage de portrait et les détails fins se sont tous améliorés par rapport aux versions précédentes.
Les images ne sont pas la seule chose que Qwen propose. Son modèle de clonage vocal en 3 secondes est arrivé en décembre dernier.
J’ai commencé par ce que Qwen met le plus en avant. J’ai demandé une bouteille de cold brew avec de la condensation et une étiquette en papier kraft, en utilisant la formulation recommandée par Qwen pour les images transparentes :
This is an RGBA image with transparency. A glass bottle of cold-brew coffee with condensation droplets and a kraft-paper label reading “NORTH ROAST”, three coffee beans beside it. The image has alpha channel and the background is transparent.
Le résultat est un PNG en 1024x1024, la taille par défaut de la démo, avec un vrai canal alpha. Environ les trois quarts de l’image sont transparents, l’étiquette affiche NORTH ROAST sans faute, et les gouttes de condensation sont convaincantes.
Pour voir comment la découpe se comporte, je l’ai posée sur un fond bleu marine foncé et un fond couleur sable. Sur le sable, on dirait une vraie photo produit de studio.
Sur le fond marine, un défaut saute aux yeux. Le col vide de la bouteille est gris pâle uni, parce que le modèle a peint le verre comme s’il y avait un fond de studio blanc derrière, au lieu de le laisser transparent. En zoomant fort, on voit aussi un mince liseré pâle sous la base, mais il passe inaperçu à taille normale.
Pour les autocollants, les icônes et les découpes produit sur des pages claires, c’est excellent, et ça vous évite une étape de suppression d’arrière-plan. Pour le verre, ou tout ce qui est destiné à une mise en page sombre, vérifiez les bords avant de l’utiliser.

Qwen affirme que le rendu du texte s’est amélioré, alors j’ai demandé une affiche avec trois lignes de texte :
A risograph-style concert poster that reads “Harbour Lights Jazz Night”, “Friday 17 October, 20:00”, “Café Aurora, London”, two-colour teal and orange ink, grainy paper texture.
Celle-ci est ressortie impeccable. Le titre, la date et l’heure, et « Café Aurora, London » sont tous bien orthographiés, accent compris, et le rendu risographie à deux encres fonctionne.
Mais ce n’est pas systématique. Mon premier essai sur la même affiche, avec une autre ville sur la dernière ligne, a imprimé l’heure en 10:00 au lieu de 20:00 et écorché le nom de la ville. Donc faites confiance aux titres, mais relisez chaque petite ligne avant l’impression.

Pour la modification, j’ai fourni la bouteille transparente et demandé de la poser sur une table de café en bois baignée de soleil, avec une affiche de jazz au mur derrière, en gardant la bouteille et son étiquette telles quelles.
La bouteille, l’étiquette et les trois grains de café sont restés inchangés, et la lumière de la fenêtre et l’ombre sur la table sont convaincantes. Cette fois, le col en verre est transparent, et on voit le mur à travers.
Sur l’affiche au mur, en revanche, le texte est factice : la même faiblesse sur les petits caractères que lors de mon premier essai d’affiche.
La démo principale de Qwen, celle qui accepte jusqu’à 10 images, m’a refoulé à plusieurs reprises ce matin-là avec une file d’attente pleine, si bien que mes essais sont passés par la seconde démo Hugging Face de Qwen, qui modifie une image à la fois. Je n’ai donc pas encore testé la modification à 10 images.

Qwen Image 2.1 est distribué sous le Qwen Research License Agreement, un recul par rapport au Qwen-Image original, publié sous Apache 2.0 et autorisant l’usage commercial. La nouvelle licence accorde une licence sans redevance, mais uniquement à des fins non commerciales, et définit le non-commercial comme la recherche ou l’évaluation. Tout ce qui dépasse ce cadre nécessite une licence commerciale séparée auprès d’Alibaba, à demander par e-mail à l’adresse indiquée dans le fichier de licence.
Il n’existe pas non plus d’API payante Qwen Image 2.1 pour contourner la restriction. L’API image payante d’Alibaba, sur Alibaba Cloud Model Studio, propose qwen-image-3.0 et qwen-image-3.0-pro, pas ce modèle.
La licence ne dit rien de spécifique sur les images générées par le modèle, donc je traiterais le travail pour des clients, la publicité et tout ce que vous comptez vendre comme un usage commercial, et je demanderais d’abord à Alibaba.
Si vous avez besoin d’images à vendre dès aujourd’hui, le forfait gratuit de Higgsfield autorise déjà l’usage commercial de vos résultats.
Le modèle d'image maison de Higgsfield, Soul 2.0, est disponible sur le forfait gratuit, et vous pouvez utiliser vos résultats commercialement sur tous les forfaits, gratuit compris.
Essayez Higgsfield gratuitement →Les poids complets représentent un téléchargement de 33,1 Go, avec une prise en charge dès le premier jour dans ComfyUI, workflows prêts à l’emploi pour le texte-vers-image et la modification d’image inclus, ainsi que Diffusers, vLLM-Omni, SGLang et LightX2V. Le modèle tourne sur les GPU AMD Radeon via ROCm, donc vous n’êtes pas enfermé chez Nvidia.
En plus du modèle d’image, Qwen a publié deux modèles de réécriture de prompts, construits sur Qwen3.5-VL, qui développent un prompt court en un prompt détaillé, l’un réglé pour la génération et l’autre pour la modification. Si vous êtes en Chine continentale, wuli.art propose gratuitement toutes les fonctionnalités de Qwen Image 2.1. Si vous cherchez plutôt de la vidéo locale en poids ouverts, j’ai couvert LTX-2.5 en août.
Qwen a publié son propre benchmark, Qwen-Image-Bench, en même temps que la sortie, donc considérez ces scores comme une revendication de Qwen plutôt qu’un test indépendant. Sur ce benchmark, la 2.1 se place juste devant Nano Banana 2.0 de Google et GPT Image 1.5 d’OpenAI, et derrière GPT Image 2.5 et GPT Image 2 d’OpenAI, ainsi que Qwen Image 3 Pro, le modèle fermé de Qwen.
Scores globaux sélectionnés issus de Qwen-Image-Bench, le benchmark publié par Qwen avec cette sortie.
| Modèle | Score Qwen-Image-Bench |
|---|---|
| GPT Image 2.5 (Sunburst) | 67,01 |
| GPT Image 2 | 64,69 |
| Qwen Image 3 Pro | 62,36 |
| Qwen Image 2.1 | 60,28 |
| Nano Banana 2.0 | 59,82 |
| GPT Image 1.5 | 59,65 |
| FLUX 2 Max | 55,33 |
| Qwen Image 2512 | 52,06 |
C’est une belle place pour un modèle que vous pouvez télécharger et faire tourner sur votre propre machine.
Si vous faites des autocollants, des icônes ou des découpes produit, essayez la démo gratuite. Vérifiez le verre sur fond sombre avant de livrer quoi que ce soit.
Si vous avez un GPU suffisamment puissant et voulez un modèle d’image local, ComfyUI le prend en charge depuis le premier jour et propose des workflows prêts à l’emploi pour démarrer.
Si vous avez besoin d’images pour un travail rémunéré, cette licence ne vous couvre pas. Demandez d’abord une licence commerciale à Alibaba, ou utilisez un outil dont les conditions autorisent déjà l’usage commercial.
Oui, Qwen Image 2.1 est gratuit à télécharger et gratuit à essayer dans les deux démos Hugging Face de Qwen, même si les démos peuvent avoir une file d'attente aux heures de pointe. J'ai fait tous mes tests le 25 septembre 2026 sans rien payer. Gratuit ne veut pas dire gratuit pour un usage commercial, cependant, car le modèle est distribué sous licence de recherche.
Pas sous la Qwen Research License par défaut, qui couvre uniquement la recherche ou l'évaluation. L'usage commercial nécessite une licence séparée auprès d'Alibaba, et il n'existe pas d'API payante pour la 2.1 : l'API payante d'Alibaba propose qwen-image-3.0 à la place. La licence ne prévoit aucune clause distincte pour les images générées, donc traitez le travail rémunéré comme un usage commercial, ou utilisez un outil comme Higgsfield, dont le forfait gratuit autorise déjà l'usage commercial.
Utilisez la formulation recommandée par Qwen : 'This is an RGBA image with transparency. [votre description] The image has alpha channel and the background is transparent.' Le résultat est un PNG avec un vrai canal alpha. Dans mon test, la découpe était nette, mais le verre mérite une vérification sur fond sombre.
Qwen Image 2.1 ajoute la transparence native, donc il génère et modifie directement des images RGBA, et accepte jusqu'à 10 images de référence par modification. Il conserve l'architecture compacte introduite par Qwen-Image-2.0 en février 2026 via l'API d'Alibaba, un seul modèle pour la génération et la modification avec un générateur d'image de 7 milliards de paramètres et une sortie en 2K natif, et c'est la première version de cette architecture en poids ouverts. Le Qwen-Image original d'août 2025 avait un générateur de 20 milliards de paramètres. Qwen affirme que la typographie, l'éclairage de portrait et les détails fins se sont tous améliorés.
Oui, les poids sont ouverts, 33,1 Go pour le modèle complet. ComfyUI et Diffusers le prennent en charge dès le premier jour, ainsi que vLLM-Omni, SGLang et LightX2V, et les GPU AMD Radeon sont pris en charge via ROCm. Il vous faudra un GPU suffisamment puissant.