Qwen-Image-Edit en local : ComfyUI et VRAM nécessaire
Qwen-Image-Edit est le modèle d'édition d'images ouvert d'Alibaba : on lui donne une photo et une consigne en langage naturel, il modifie l'image en conservant le reste. Il tourne en local dans ComfyUI, mais c'est un modèle de 20 milliards de paramètres, et la question qui bloque tout le monde est la même : quelle version télécharger, FP8 ou GGUF, et combien de mémoire vidéo prévoir. Ce guide suit le chemin officiel de ComfyUI, dit où lire les tailles de fichiers et les besoins en VRAM dans les sources, et liste les erreurs de nodes qui reviennent le plus souvent. Il ne couvre pas l'installation de ComfyUI elle-même, traitée dans un guide dédié.
#Pourquoi Qwen-Image-Edit, et ce que la famille contient
La famille Qwen-Image regroupe deux usages. Qwen-Image génère une image à partir d'un texte, avec un point fort reconnu dans son rapport technique : le rendu de texte dans l'image, y compris des phrases entières et des alphabets non latins. Qwen-Image-Edit part de ce même modèle pour modifier une image existante. Le dépôt GitHub QwenLM/Qwen-Image et la fiche Hugging Face Qwen/Qwen-Image-Edit distinguent deux types d'édition : l'édition sémantique, qui change le contenu ou le style en gardant l'identité du sujet, et l'édition d'apparence, qui ajoute, retire ou remplace un élément sans toucher au reste. Le modèle sait aussi corriger ou remplacer un texte dans une image en conservant la police et la mise en page.
Architecture et licence sont les deux faits à retenir avant de télécharger quoi que ce soit. Le modèle de diffusion est un transformeur multimodal (MMDiT) d'environ 20 milliards de paramètres. L'encodeur de texte n'est pas un petit CLIP : c'est Qwen2.5-VL 7B, un modèle de vision-langage complet, qui lit à la fois votre consigne et l'image d'entrée. Les deux sont publiés sous licence Apache 2.0, ce qui autorise un usage commercial des poids. Chaque pièce se télécharge séparément, et c'est cette dispersion en trois fichiers qui cause la plupart des erreurs de nodes décrites plus bas.
La lignée évolue vite. La première version de Qwen-Image-Edit a été publiée en août 2025. Une version datée 2509 a suivi en septembre 2025 : elle accepte plusieurs images d'entrée et comprend nativement des conditions de type ControlNet, comme une carte de profondeur, des contours ou une pose. Une version 2511 est arrivée fin 2025 avec une meilleure cohérence du sujet, et le modèle de génération a reçu de son côté une révision 2512. Des versions 2.x ont été annoncées en 2026. Ce guide s'appuie sur la lignée documentée pas à pas par ComfyUI, de la version d'août 2025 à la 2511 : les nodes et l'organisation des fichiers y sont les mêmes. Avant de choisir, lisez le haut du README GitHub, qui liste les versions avec leur date de publication.
#Natif, FP8 ou GGUF : quelle version de Qwen-Image-Edit télécharger
Images et vidéos IA en local, sans limite : ComfyUI, Flux, Z-Image, Wan 2.2 sur ton GPU ou ton Mac — workflows prêts à charger, cadre légal inclus.
- Espace en ligne à vie
- PDF + fichiers
- Mises à jour à vie
Trois formes du même modèle circulent, et elles ne s'utilisent pas de la même façon.
- Natif (bf16, format Diffusers)
- Le dépôt Qwen/Qwen-Image-Edit sur Hugging Face, découpé en plusieurs fichiers safetensors, prévu pour la bibliothèque Diffusers en Python. En bf16, 20 milliards de paramètres représentent environ 40 Go pour le seul transformeur, plus l'encodeur de texte. C'est la voie des scripts Python et des cartes de 48 Go ou plus, ou d'un déport partiel vers la RAM. Pas la voie ComfyUI.
- FP8 repackagé par Comfy Org
- Le dépôt Comfy-Org/Qwen-Image-Edit_ComfyUI sur Hugging Face reprend les poids en un seul fichier FP8 (format e4m3fn), avec l'encodeur de texte et le VAE découpés dans des sous-dossiers. C'est la version qu'utilisent les workflows officiels de ComfyUI. Le fichier du modèle de diffusion pèse un peu plus de 20 Go. Une variante bf16 d'environ 41 Go existe dans le même dépôt pour les cartes qui ont la place.
- GGUF communautaire
- Des conversions au format GGUF, le format des LLM quantifiés, publiées par des contributeurs comme city96, QuantStack ou Unsloth. Elles descendent à Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q3_K_M ou Q2_K, et exigent l'extension ComfyUI-GGUF. C'est l'option la plus réaliste sous 16 Go de VRAM, et la plus confortable sur Mac.
La règle de choix est simple. Carte de 24 Go : FP8 officiel, sans se poser de question. Carte de 16 Go : FP8 fonctionne grâce au déport de mémoire de ComfyUI, mais un GGUF Q6_K ou Q5_K_M évite les lenteurs. Carte de 12 Go : GGUF Q4_K_M ou en dessous. Mac Apple Silicon : GGUF, parce que ComfyUI ne calcule pas en FP8 sur Metal et déquantifie ces poids au chargement, ce qui double la mémoire occupée.
#VRAM nécessaire : où lire les chiffres et comment les interpréter
Ni le README GitHub ni la fiche Hugging Face de Qwen ne donnent de tableau « tant de VRAM pour telle carte ». La documentation ComfyUI non plus, pour ce modèle : ses tutoriels listent les fichiers à télécharger, le dossier de destination et le workflow, et donnent parfois le matériel et le temps de leurs propres essais, à prendre comme un repère et non comme une promesse. La donnée fiable, datée et vérifiable, c'est la taille de chaque fichier affichée sur sa page Hugging Face. Tout le reste s'en déduit.
- Le modèle de diffusion
- Environ 20 Go en FP8 (fichier qwen_image_edit_fp8_e4m3fn.safetensors du dépôt Comfy-Org, publié en août 2025), environ 41 Go en bf16. En GGUF, le poids se calcule : 20 milliards de paramètres multipliés par le nombre de bits par paramètre, divisé par huit. Un Q8_0 à 8,5 bits donne environ 21 Go, un Q4_K_M à 4,5 à 5 bits environ 12 Go, un Q3_K_M environ 9 à 10 Go, un Q2_K environ 7 Go. La page de chaque dépôt GGUF affiche la valeur exacte de chaque fichier.
- L'encodeur de texte
- Le fichier qwen_2.5_vl_7b_fp8_scaled.safetensors du dépôt Comfy-Org pèse environ 9,4 Go. Il n'a pas besoin de rester en VRAM pendant le débruitage : ComfyUI l'y charge pour encoder le prompt et l'image, puis le décharge si la place manque. C'est pour cela qu'un modèle de 20 Go et un encodeur de 9 Go peuvent tourner sur une carte de 24 Go.
- Le VAE
- Le fichier qwen_image_vae.safetensors fait environ 250 Mo. Négligeable en mémoire, mais indispensable, et spécifique à cette famille : un VAE de Flux ou de SDXL produit du bruit coloré.
- Les activations
- Le calcul lui-même réclame de la place en plus des poids, et davantage à grande résolution. Le workflow officiel ramène l'image d'entrée à environ un mégapixel, ce qui borne cette part. Doublez la résolution de sortie et cette marge grossit.
ComfyUI active par défaut une gestion dynamique de la VRAM, décrite dans notre guide d'installation : quand les poids dépassent la carte, une partie reste en RAM et transite à la demande. Le modèle tourne alors sur une carte de 12 ou 16 Go, mais chaque passage de l'un à l'autre coûte du temps, et la RAM système devient le vrai plafond : avec un modèle de 20 Go et un encodeur de 9 Go, 32 Go de RAM sont un minimum et 64 Go un confort. Le tableau de repères ci-dessous résume la logique, sans prétendre à une mesure.
- 24 Go et plus (RTX 3090, 4090, 5090)
- FP8 officiel au complet, encodeur FP8, image de sortie à un mégapixel sans déport. Le bf16 de 41 Go reste réservé aux cartes professionnelles de 48 Go.
- 16 Go (RTX 4080, 5080, 4060 Ti 16 Go)
- FP8 avec déport, ou GGUF Q6_K à Q5_K_M qui tiennent dans la carte avec l'encodeur déchargé entre les étapes.
- 12 Go (RTX 3060 12 Go, 4070, 5070, 5070 Ti)
- GGUF Q4_K_M ou Q3_K_M, encodeur FP8 chargé puis déchargé, 32 Go de RAM. Comptez des générations nettement plus longues qu'avec SDXL.
- 8 Go
- Possible en Q2_K ou Q3 avec déport massif, au prix d'une lenteur et d'une qualité dégradées. Pour l'édition occasionnelle seulement.
- Mac Apple Silicon
- La mémoire unifiée sert de VRAM. Un GGUF Q4_K_M de 12 Go plus l'encodeur de 9 Go demandent un Mac de 32 Go ; 48 Go et plus pour travailler sans serrer.
#Prérequis
- ComfyUI à jour
- Les nodes propres à Qwen-Image, comme TextEncodeQwenImageEdit, sont arrivés dans ComfyUI en août 2025, et ceux de la version 2509 en septembre 2025. Une installation plus ancienne les ignore et affiche des nodes rouges. Mettez à jour avant tout : Desktop se met à jour seul, l'archive portable via le script update, l'installation manuelle par git pull.
- Une carte NVIDIA de 12 Go au minimum, ou un Mac de 32 Go
- En dessous, l'édition reste faisable mais devient un exercice de patience. AMD fonctionne sous Linux avec ROCm et, depuis janvier 2026, sous Windows avec l'application Desktop.
- De la place sur le disque
- FP8 : un peu plus de 30 Go pour le trio modèle, encodeur, VAE. Ajoutez 10 à 21 Go par variante GGUF que vous essayez.
- Une installation de ComfyUI qui fonctionne déjà
- Première image produite avec SDXL ou Flux. Si ce n'est pas le cas, passez d'abord par le guide d'installation : ce guide commence au moment où ComfyUI s'ouvre sur http://127.0.0.1:8188.
#Étapes 1 et 2 : télécharger les bons fichiers et les ranger
Le chemin le plus court est la bibliothèque de modèles de workflows intégrée à ComfyUI : menu Workflow, Parcourir les modèles, catégorie Image, puis le modèle Qwen-Image-Edit, ou sa déclinaison 2509 ou 2511 selon la version qui vous intéresse. ComfyUI détecte les fichiers manquants et propose de les télécharger directement dans le bon dossier. Si vous préférez télécharger à la main, par exemple pour garder la main sur la variante choisie, voici l'organisation attendue, telle que la documente le tutoriel Qwen-Image-Edit de docs.comfy.org.
- 01Télécharger le modèle de diffusionSur Hugging Face, dépôt Comfy-Org/Qwen-Image-Edit_ComfyUI, dossier split_files/diffusion_models. Prenez le fichier FP8 correspondant à la version voulue. Vérifiez la taille affichée sur la page avant de cliquer, puis comparez-la au fichier reçu : un téléchargement coupé donne un fichier tronqué et une erreur illisible au chargement.
- 02Télécharger l'encodeur de texte et le VAEMême dépôt, dossiers split_files/text_encoders et split_files/vae. L'encodeur est commun à Qwen-Image et à toutes les versions de Qwen-Image-Edit : un seul exemplaire suffit, même si vous installez plusieurs versions du modèle. Idem pour le VAE.
- 03Ranger chaque fichier dans son sous-dossierModèle dans diffusion_models, encodeur dans text_encoders, VAE dans vae. Avec ComfyUI Desktop, le dossier models se trouve à l'emplacement choisi à l'installation, visible dans les paramètres de l'application. Un fichier déposé dans checkpoints au lieu de diffusion_models n'apparaît pas dans le node de chargement.
- 04Facultatif : le LoRA LightningLe dépôt lightx2v/Qwen-Image-Lightning publie des LoRA qui ramènent la génération à 4 ou 8 pas au lieu de 20, pour Qwen-Image comme pour Qwen-Image-Edit. Fichier dans models/loras. Les versions ultérieures du modèle d'édition ont leurs propres LoRA Lightning : prenez celui qui porte le nom de votre version.
- 05Rafraîchir ComfyUIAprès avoir copié les fichiers, cliquez sur le bouton d'actualisation de l'interface, ou rechargez la page. Les nodes de chargement relisent les dossiers à ce moment-là, pas en continu.
#Étape 3 : charger le workflow d'édition et comprendre ses nodes
Ouvrez le modèle de workflow Qwen-Image-Edit depuis la bibliothèque. Si vous avez téléchargé les fichiers à la main, ComfyUI peut proposer de les télécharger à nouveau : refusez, puis sélectionnez vos fichiers dans les nodes de chargement. Le graphe compte une dizaine de nodes, et chacun a un rôle précis.
- Load Diffusion Model
- Charge le fichier de models/diffusion_models. Le menu déroulant doit afficher votre fichier Qwen-Image-Edit ; s'il est vide, le fichier est mal rangé ou l'interface n'a pas été rafraîchie.
- Load CLIP, type qwen_image
- Charge l'encodeur Qwen2.5-VL depuis models/text_encoders. Le champ type doit valoir qwen_image. Avec un autre type, l'encodeur se charge sans erreur mais le prompt est mal interprété, et vous obtenez n'importe quoi.
- Load VAE
- Le VAE Qwen-Image. Rien d'autre.
- Load Image, puis Scale Image to Total Pixels
- Votre image à modifier, ramenée à environ un mégapixel. Ce redimensionnement n'est pas optionnel : le modèle a été entraîné à cette échelle, et une entrée beaucoup plus grande dégrade la cohérence tout en gonflant la VRAM.
- TextEncodeQwenImageEdit
- Le node propre à cette famille. Il reçoit l'encodeur, le VAE, l'image et votre consigne, et produit le conditionnement. Il y en a deux : l'un pour la consigne positive, l'autre pour la négative. Pour la version 2509 et les suivantes, le node s'appelle TextEncodeQwenImageEditPlus et accepte jusqu'à trois images.
- ModelSamplingAuraFlow et CFGNorm
- Deux nodes de réglage du débruitage, pré-réglés dans le workflow officiel, dont un décalage (shift) autour de 3. Ne les retirez pas : sans eux, les images sortent délavées ou saturées.
- KSampler, VAE Decode, Save Image
- Le débruitage, le décodage et l'enregistrement, comme dans tout workflow ComfyUI. L'image sort dans le dossier output avec le workflow complet inscrit dans le PNG.
Rédigez la consigne comme une instruction, pas comme une description d'image finale : « replace the text on the sign with OUVERT, keep the same font », « change the jacket to red leather, keep everything else », « remove the person on the left ». Le modèle comprend le chinois et l'anglais en priorité ; le français fonctionne souvent, mais l'anglais reste plus fiable sur les consignes précises. Laissez la consigne négative vide ou très courte.
#Étape 4 : les réglages, et le LoRA Lightning pour aller vite
Le workflow officiel part de 20 pas, un CFG de 2,5, l'échantillonneur euler et le planificateur simple. Ces valeurs sont un bon point de départ : le CFG de ce modèle est bas par construction, et le monter à 7 comme avec SDXL donne des images saturées et déformées. Changez d'abord la graine (seed) pour obtenir des variantes, puis le nombre de pas si le résultat manque de finesse.
- 01Première édition sans LoRALancez le workflow tel quel sur une image simple, avec une consigne courte. Regardez le terminal : la première exécution charge 30 Go de poids depuis le disque, ce qui peut prendre plusieurs minutes. Les exécutions suivantes réutilisent ce qui est en mémoire.
- 02Ajouter le LoRA LightningInsérez un node LoraLoaderModelOnly entre Load Diffusion Model et ModelSamplingAuraFlow, sélectionnez le LoRA Lightning 4 pas, force 1. Passez le KSampler à 4 pas et le CFG à 1,0 : ces LoRA sont entraînés pour fonctionner sans guidage. Le nombre de pas est divisé par cinq, donc le temps de débruitage dans la même proportion, au prix d'une perte possible de fidélité sur les détails fins et le texte, que le dépôt du LoRA ne chiffre pas.
- 03Fixer la graine pour comparerRéglez le KSampler sur une graine fixe avant de comparer deux consignes ou deux variantes de modèle. Sinon, vous attribuerez au réglage des différences qui viennent du hasard.
- 04Enchaîner plusieurs éditionsPour corriger en plusieurs passes, rechargez l'image de sortie comme nouvelle entrée. Chaque passe repasse par le VAE et perd un peu de détail : limitez-vous à deux ou trois, et gardez l'original.
#Étape 5 : la variante GGUF pour les cartes de 12 à 16 Go et les Mac
ComfyUI ne lit pas les GGUF nativement : il faut l'extension ComfyUI-GGUF de city96, disponible dans ComfyUI-Manager ou par clone Git dans le dossier custom_nodes. Elle ajoute des nodes de chargement dédiés, et la logique de rangement reste la même.
- 01Choisir la quantificationSur le dépôt GGUF retenu, par exemple city96/Qwen-Image-Edit-gguf ou QuantStack/Qwen-Image-Edit-2509-GGUF, la page liste chaque fichier avec sa taille. Prenez le plus gros qui laisse environ 2 Go de marge dans votre VRAM après déduction de la résolution visée : Q6_K ou Q5_K_M pour 16 Go, Q4_K_M pour 12 Go. Comme pour les LLM, Q4_K_M est le compromis habituel ; en dessous de Q3, les textes et les petits détails souffrent.
- 02Ranger le fichierLe GGUF du modèle de diffusion va dans models/diffusion_models, ou dans models/unet que l'extension lit aussi. L'encodeur de texte et le VAE restent ceux de l'étape 1, en safetensors.
- 03Remplacer le node de chargementDans le workflow officiel, supprimez Load Diffusion Model et mettez à sa place Unet Loader (GGUF). Reliez sa sortie model là où allait l'ancienne. Le reste du graphe ne change pas : TextEncodeQwenImageEdit, VAE, KSampler, tout fonctionne à l'identique.
- 04Garder l'encodeur en safetensorsDes GGUF de Qwen2.5-VL 7B existent, mais ceux produits pour llama.cpp sont pensés pour le dialogue et n'embarquent pas forcément la partie vision dont l'édition a besoin pour lire l'image d'entrée. Avec le fichier qwen_2.5_vl_7b_fp8_scaled.safetensors officiel, vous écartez une cause d'erreur. Ne passez à un encodeur GGUF que si le dépôt indique explicitement sa compatibilité avec Qwen-Image-Edit dans ComfyUI-GGUF.
Sur Mac, la même procédure s'applique, avec une seule différence : surveillez la pression mémoire dans le Moniteur d'activité. Quand la mémoire unifiée déborde, macOS écrit sur le SSD et chaque image prend plusieurs fois plus de temps, sans message d'erreur.
#Erreurs de nodes fréquentes avec Qwen-Image-Edit
- Nodes rouges : TextEncodeQwenImageEdit ou TextEncodeQwenImageEditPlus introuvable
- ComfyUI est trop ancien. Ces nodes font partie du cœur de ComfyUI, pas d'une extension : aucun gestionnaire ne les trouvera. Mettez ComfyUI à jour et redémarrez.
- Prompt outputs failed validation, value not in list
- Le fichier sélectionné dans un node de chargement n'existe pas dans le dossier attendu. Cela arrive quand on ouvre un workflow téléchargé dont les noms de fichiers diffèrent des vôtres. Rouvrez le menu déroulant de chaque node de chargement et choisissez votre fichier.
- Le type qwen_image n'apparaît pas dans Load CLIP
- Même cause : version de ComfyUI antérieure à août 2025. Mettez à jour.
- CUDA out of memory au début du débruitage
- Les poids dépassent la VRAM et le déport n'a pas suffi. Dans l'ordre : réduisez la résolution de sortie, passez à une quantification GGUF plus petite, fermez les autres applications qui occupent le GPU, puis essayez les options de mémoire de ComfyUI décrites dans notre guide d'installation, comme la réserve de VRAM ou la désactivation de la VRAM dynamique.
- Image de sortie faite de bruit coloré ou noire
- VAE ou encodeur d'une autre famille. Vérifiez que Load VAE pointe sur qwen_image_vae.safetensors et Load CLIP sur l'encodeur Qwen2.5-VL avec le type qwen_image.
- L'image n'est pas modifiée, ou à peine
- Consigne trop vague, ou CFG tombé à 1 sans LoRA Lightning. Remontez le CFG à 2,5 sans LoRA, reformulez la consigne en instruction directe, et vérifiez que l'image est bien reliée au node TextEncodeQwenImageEdit, pas seulement au VAE Encode.
- Le texte réécrit est faux ou illisible
- Mettez le texte voulu entre guillemets dans la consigne, en précisant de conserver la police. Les quantifications les plus agressives, Q2 et Q3, abîment d'abord cette capacité : repassez en Q4 ou en FP8 pour les éditions de texte.
- Le workflow de la version 2509 n'accepte qu'une image
- Vous avez chargé l'ancien node TextEncodeQwenImageEdit. Remplacez-le par TextEncodeQwenImageEditPlus, qui expose les entrées image1, image2 et image3.
- Unet Loader (GGUF) absent après installation de l'extension
- Dépendances Python non installées, ou ComfyUI non redémarré. Relancez pip install sur le fichier requirements.txt de l'extension dans l'environnement de ComfyUI, puis redémarrez. Le terminal affiche au démarrage la liste des extensions chargées et leurs éventuelles erreurs d'import.
#Pour aller plus loin
- Installer ComfyUI et comprendre ses options mémoire
- Desktop, portable ou manuel, dossiers de modèles, VRAM dynamique et options de ligne de commande. https://quelllm.fr/guide/comfyui-installation-guide-debutant
- Générer des images en local : le panorama
- Stable Diffusion, Flux, ComfyUI, Draw Things sur Mac : quelle option pour quel matériel. https://quelllm.fr/guide/generer-images-en-local-guide
- ControlNet : maîtriser la composition
- Pose, contours, profondeur : ce que la version 2509 de Qwen-Image-Edit intègre nativement, expliqué sur Stable Diffusion. https://quelllm.fr/guide/controlnet-guide-stable-diffusion
- VRAM : c'est quoi, et combien en faut-il
- Lire la mémoire de sa carte, comprendre le déport vers la RAM, choisir une carte. https://quelllm.fr/guide/vram-c-est-quoi-combien-pour-ia
- Sources officielles
- Dépôt GitHub QwenLM/Qwen-Image (liste des versions et dates), fiche Hugging Face Qwen/Qwen-Image-Edit (licence Apache 2.0, exemple Diffusers), dépôts Comfy-Org/Qwen-Image-Edit_ComfyUI et Comfy-Org/Qwen-Image_ComfyUI (fichiers FP8, tailles), tutoriels Qwen-Image et Qwen-Image-Edit sur docs.comfy.org (arborescence, workflows), extension github.com/city96/ComfyUI-GGUF.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.