Qwen-Image-2.1 : 7B sur votre poste, transparence native, et la licence qui bloque la production
Le 20 septembre 2026, Alibaba a mis en ligne les poids de Qwen-Image-2.1 sur Hugging Face et ModelScope. En une phrase : un modèle d’image de 7 milliards de paramètres qui génère et retouche dans le même moteur, produit des images à fond transparent, et accepte jusqu’à 10 images de référence pour composer une scène.
Pour une équipe marketing, IT ou création, la promesse est concrète : vos visuels se fabriquent sur une machine que vous contrôlez, sans que vos photos produit, vos mannequins ou vos lieux partent chez un fournisseur cloud. Avec un astérisque de taille, et c’est le sujet de cet article : la licence publiée avec les poids interdit l’usage commercial.
Chez Beemm (Guic, Samy, Jaja, Frat) on a lu le blog officiel de Qwen, la fiche du modèle, le texte intégral de la licence, et le retour non sponsorisé d’un des premiers testeurs (la vidéo “I Got Early Access to Qwen-Image-2.1” du 20 septembre 2026). Voici ce que le modèle sait faire, où il est encore battu, et sous quelles conditions vous pouvez le mettre en production.
Ce que Qwen-Image-2.1 change dans une chaîne de production
Un modèle 7B qui tient sur du matériel courant
Le composant de génération visuelle pèse 7B de paramètres, répartis sur 32 couches DiT en flux unique, avec deux optimisations qui baissent le coût de calcul : une attention à granularité mixte et une réutilisation du cache KV sur le préfixe. L’encodeur de texte est un modèle séparé, et il n’a pas besoin de résider en VRAM en même temps que le générateur d’images.
Concrètement, vous n’avez pas besoin d’une ferme de GPU pour tester. Les générations précédentes de la famille Qwen Image tournaient déjà en quantification 4 ou 8 bits sur des cartes de 16 à 24 Go, et le champ Matériel du dépôt officiel mentionne désormais le support AMD Radeon en plus de NVIDIA. La barrière d’entrée n’est plus le budget GPU, elle est devenue une question d’organisation.

Sortie brute du modèle, 1536 × 1024, seed 892424831. L'image illustre le cas d'usage visé — un poste qui produit ses visuels sans les envoyer à un service tiers — et non une capture d'écran de l'interface.
Générer et retoucher dans le même modèle
C’est le point qui économise le plus de temps au quotidien. Le même modèle fait du texte vers image et de l’édition d’image. Vous ne passez plus d’un outil de génération à un outil de retouche : vous demandez “change le fond, garde le produit, ajoute le logo à gauche” et le modèle traite la demande, y compris sur des annotations dessinées au cercle, au pinceau ou via un masque séparé.
Le modèle préserve aussi l’identité des personnes et des produits entre l’entrée et la sortie. Pour une marque, c’est exactement ce qu’on attend d’une chaîne de visuels : le même flacon, le même visage, dans un décor différent.
Le détourage natif, la vraie nouveauté pour vos équipes
Qwen-Image-2.1 génère nativement des images avec canal alpha, donc des PNG à fond transparent. Il édite aussi des calques transparents, et il sait extraire un sujet d’une photo pour en faire un calque RGBA réutilisable dans vos compositions.

Sortie brute, 1024 × 1024, fichier RGBA non retouché : 72 % des pixels sont à alpha 0 (751 373 sur 1 048 576). Le détourage vient du modèle, sans masque ni outil externe. Le webp servi ici conserve le canal alpha d'origine.
C’est l’annonce la moins spectaculaire et la plus utile. Le détourage manuel de packs produit, d’objets ou de personnes reste un poste de coût invisible dans beaucoup de services marketing. Le testeur de la vidéo le résume bien : il utilisait ChatGPT Images pour détourer ses fonds, et pouvoir le faire en local change sa journée.

Deux fonctions en une seule génération : fond transparent conservé (53 % des pixels à alpha 0) et libellé produit écrit par le modèle, sans incrustation. Ici le texte court sort sans faute — le rendu typographique dépend beaucoup de la longueur et du contexte. C'est le cas d'usage qui parle le plus à un service marketing, et celui qu'il faut chiffrer et encadrer avant la mise en production.
Jusqu’à 10 images de référence : votre produit, votre mannequin, votre lieu
Le modèle accepte jusqu’à 10 images de référence dans une même génération. Vous pouvez combiner un personnage issu d’une image, un produit issu d’une autre, et un décor, puis demander une scène cohérente. Dans la vidéo, la démonstration est parlante : une petite fille animée et des chiots sur un griffon, deux images sans rapport, fusionnées en une scène où la fille monte le griffon.
Pour un service qui produit des visuels à volume, cela veut dire arrêter de re-briefer un décor à chaque déclinaison : vous constituez une bibliothèque de références et vous la réutilisez.
Ce qu’un des premiers testeurs a observé
Un testeur indépendant, en accès anticipé et sans sponsorisation déclarée, a comparé Qwen-Image-2.1 à Krea 2 (le modèle d’image open-weights de Krea, publié en juin 2026, qui était son modèle local de référence) et à ChatGPT Images. Ses constats sont nuancés, et c’est ce qui les rend utiles.
La qualité brute avantage Qwen
Sur toute la série d’échantillons, Qwen gagne sur la résolution, la finesse des détails et le rendu des textures : un rayon d’épicerie, une licorne sous un arc-en-ciel, un portrait d’homme âgé. Le testeur va jusqu’à dire qu’il changerait ce modèle pour son pipeline d’upscaling, tant la sortie gagne en définition sur l’entrée.

Rendu typographique brut, 1536 × 1024, seed 791314656. Le modèle écrit correctement le nom du modèle, puis se trompe sur le mot suivant (« transpareence »). Sortie publiée telle quelle : c'est exactement ce type de défaut qu'un banc d'essai doit mesurer avant une mise en production.
La fidélité au prompt reste à Krea 2
Deux cas où l’avantage s’inverse. Sur un “Elon Musk en sombrero”, Krea 2 produit un visage qui ressemble plus au sujet. Sur la licorne, Qwen livre un cheval avec une corne de costume là où Krea produit une vraie licorne. La qualité d’image est meilleure chez Qwen, la conformité au sujet chez Krea 2. C’est une nuance à connaître avant de remplacer un modèle qui marche chez vous.
L’édition : très fort sur la qualité, inégal sur les détails
Sur un même prompt d’édition (ajouter des yeux bleus et un mot sur une photo), Qwen a exécuté la consigne mais avec des yeux qui sonnent faux, là où ChatGPT Images fait mieux sur ce détail précis. En revanche, la sortie gagne en résolution et en piqué. Le testeur note aussi que ces écarts se corrigent probablement par le prompt, la comparaison ayant été faite en un seul essai identique pour tous les modèles.
| Épreuve |
Qwen-Image-2.1 |
Krea 2 (référence locale) |
| Détail, textures, résolution |
Meilleur sur tous les échantillons |
Battu sur la finesse |
| Ressemblance au sujet demandé |
Battu (cheval à corne, visage moins fidèle) |
Meilleur sur la conformité |
| Édition d’une photo |
Consigne exécutée, détails à revoir |
Bon sur les yeux, lettrage moins soigné |
| Détourage et fond transparent |
Opérationnel sur photo |
Non testé dans la même vidéo |
| Combinaison de références |
Scène composite réussie |
Non testé dans la même vidéo |
L’astérisque que la plupart des reprises ont sauté
Ce que dit le texte exact
La licence publiée avec les poids est la Qwen Research License Agreement, datée du 20 septembre 2026. Deux passages suffisent à comprendre le cadre :
- la licence est accordée “FOR NON-COMMERCIAL PURPOSES ONLY”, et “Non-Commercial” y est défini comme un usage de recherche ou d’évaluation ;
- “You shall not use the Materials for any commercial purpose without obtaining a separate commercial license from us”, avec une demande à adresser à Alibaba pour obtenir cette licence.
C’est un changement notable pour la famille. La première génération de Qwen-Image était publiée sous licence Apache 2.0, qui autorise l’usage commercial sans négociation. Qwen-Image-2.1 passe à un régime de recherche.
Ce que ça interdit concrètement
Si vous utilisez Qwen-Image-2.1 pour produire des visuels qui servent votre activité (campagnes, fiches produit, réseaux sociaux, présentations client), vous êtes dans un usage commercial. La licence ne le couvre pas telle quelle. Le risque n’est pas théorique pour un grand groupe : vos directions juridiques et achats demandent systématiquement la chaîne de droits d’un modèle avant de l’intégrer à une chaîne de production, et une licence de recherche est un refus par défaut, pas une zone grise à exploiter.
Ce qui reste possible sans licence commerciale
L’évaluation en interne, la comparaison avec vos modèles actuels, les tests de faisabilité et la recherche restent couverts. C’est loin d’être inutile : c’est exactement la phase où vous décidez si le sujet mérite un budget. Simplement, la démonstration qui impressionne votre comité ne suffit pas à lancer la production.
Trois voies pour l’exploiter légalement en entreprise

1. Le banc d’essai, tout de suite et sans engagement
Installez le modèle sur un poste équipé d’un GPU, faites tourner vos cas réels (détourage de pack produit, déclinaison de visuels, extraction de sujets depuis vos photos existantes) et mesurez. Coût : du temps interne. Bénéfice : vous savez si la qualité atteint votre seuil, et vous documentez vos résultats pour la suite.
2. La licence commerciale négociée avec Alibaba
La licence de recherche prévoit explicitement une licence commerciale séparée sur demande. Si le modèle passe votre banc d’essai, c’est le chemin propre : vous obtenez un droit d’usage, et vous négociez les conditions au lieu de les subir. Prévoyez ce sujet dès la phase de test, pas après le premier visuel publié.
3. L’API, où la licence est déjà réglée
Si votre besoin est un volume ponctuel ou si vous ne voulez pas gérer d’infrastructure GPU, les plateformes d’inférence prennent la licence sur elles et vous facturent à l’image. Vous perdez l’argument de la donnée qui ne sort pas de votre réseau, vous gagnez en simplicité et en délai.
Ce que ça fait, ce que ça ne fait pas
| Question |
Réponse |
| Générer une image depuis un texte |
Oui, jusqu’en 2048 x 2048 |
| Retoucher une photo existante |
Oui, y compris par masque ou annotation au cercle |
| Produire un fond transparent |
Oui, nativement, en génération comme en édition |
| Extraire un sujet d’une photo |
Oui, en calque RGBA réutilisable |
| Combiner plusieurs références |
Oui, jusqu’à 10 images |
| Tourner sur une machine de bureau |
Oui, modèle 7B, encodeur texte séparé |
| Servir une campagne commerciale |
Non, pas sans licence commerciale négociée |
| Remplacer ChatGPT Images ou Krea 2 partout |
Pas encore, la conformité au sujet reste à améliorer |
Ce qu’on attend encore
- Un benchmark public consolidé. Aujourd’hui, la comparaison la plus détaillée disponible est celle d’un testeur en accès anticipé, sur un panel d’images restreint. C’est une indication sérieuse, pas une mesure.
- Des chiffres de vitesse. Les poids viennent de sortir, les temps de génération par image en local ne sont pas documentés officiellement.
- Le tarif de la licence commerciale. Le texte renvoie à une négociation, sans grille publique.
- La suite de la famille. Le passage d’Apache 2.0 à une licence de recherche sur la ligne Qwen Image est un signal : pour chaque nouveau modèle, lisez la licence avant de construire dessus.
Les outils Beemm pour passer à l’action
Chez Beemm, on forme 500+ personnes et on a livré 300+ projets IA. Sur les modèles d’image, on ne s’arrête pas à la démonstration : on cadre vos cas d’usage, on teste les modèles sur vos propres visuels, et on tranche sur les droits avant que la production dépasse le pilote.
Si vous voulez savoir ce que Qwen-Image-2.1 (ou un autre modèle d’image) peut réellement produire chez vous, et à quelles conditions juridiques, parlez-en avec nous ou voyez nos formations création de contenus GenAI.
Le réflexe à retenir : testez en local ce week-end, mais ne publiez rien avant d’avoir la licence. Un modèle de 7B qui tourne sur votre poste, c’est une capacité nouvelle ; une licence de recherche, c’est un cadre qui décide si cette capacité devient un actif.
Pour aller plus loin
Ces visuels sont des sorties brutes du modèle
Les images de cet article ne viennent pas d'une banque d'images et n'ont pas été retouchées. Elles ont été générées le 21 septembre 2026 avec Qwen-Image-2.1, via la démo officielle mise en ligne par l'éditeur (Space Hugging Face Qwen/Qwen-Image-2.1), qui relaie l'API du modèle. Aucun upscale, aucun passage dans un second modèle, aucun nettoyage manuel : ce sont les fichiers tels que le modèle les a produits, convertis en webp pour le web, canal alpha conservé.
Chaque légende donne la taille du fichier d'origine et la seed utilisée, pour que vous puissiez vérifier par vous-même. Deux réserves, dans l'ordre : ces images servent à démontrer le comportement du modèle, pas de livrable client, puisque la licence Qwen Research interdit leur exploitation commerciale sans accord écrit ; et une image de démonstration ne prouve pas une chaîne de production. Un banc d'essai sur vos propres produits reste la seule mesure qui compte.
Sources
- Qwen, Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, blog officiel, 20 septembre 2026
- Hugging Face, Qwen/Qwen-Image-2.1, fiche du modèle et poids, 20 septembre 2026
- GitHub, QwenLM/Qwen-Image-2.1, dépôt officiel, licence et champ Matériel, septembre 2026
- Qwen, Qwen Research License Agreement, texte intégral daté du 20 septembre 2026
- GitHub, QwenLM/Qwen-Image, licence Apache 2.0 de la génération précédente
- Hugging Face, krea/Krea-2-Raw, fiche du modèle, publication des poids le 22 juin 2026
- Vidéo, I Got Early Access to Qwen-Image-2.1 - Amazing LOCAL AI Image Model, test non sponsorisé, 20 septembre 2026