Qwen3-VL en local : le modèle vision de référence avec Ollama
Qwen3-VL est le modèle vision-langage open-weight le plus solide à faire tourner en local en 2026. Avec Ollama, on l'installe en une commande et on lui envoie des images, des captures d'écran ou des documents scannés directement depuis le terminal ou une interface. Ce guide couvre le choix de la variante selon votre VRAM, l'installation Qwen3-VL Ollama pas à pas, des cas d'usage concrets (description d'image, OCR, lecture de tableaux) et les limites honnêtes face aux modèles cloud.
#Pourquoi Qwen3-VL en local
Un modèle vision-langage (VLM) accepte à la fois du texte et des images en entrée. Vous lui montrez une photo, une capture d'écran ou un scan, et vous lui posez une question dessus en langage naturel. Qwen3-VL, développé par l'équipe Qwen d'Alibaba, s'est imposé comme la référence open-weight pour cet usage : il combine une bonne compréhension visuelle, un OCR multilingue robuste (français inclus) et un raisonnement solide sur ce qu'il voit.
L'intérêt de le faire tourner en local est le même que pour tout LLM auto-hébergé, mais il pèse encore plus lourd ici : les images que vous analysez sont souvent sensibles — captures d'écran de travail, documents administratifs, photos de factures, pièces d'identité. Avec Qwen3-VL sur votre machine, rien ne quitte votre disque. Pas d'upload vers un cloud, pas de quota, pas d'abonnement.
- Confidentialité
- Les images restent sur votre machine. Idéal pour documents RH, médicaux, juridiques ou tout scan personnel.
- Coût nul à l'usage
- Aucun coût par image ni par token. Vous traitez 10 ou 10 000 captures sans facture qui grimpe.
- Hors-ligne
- Une fois le modèle téléchargé, tout fonctionne sans connexion internet.
- Automatisable
- L'API compatible OpenAI d'Ollama permet de scripter le traitement d'images en masse en Python ou en shell.
#Prérequis et VRAM nécessaire
Un VLM est plus gourmand qu'un modèle texte de taille équivalente : en plus des poids du modèle de langage, il charge un encodeur visuel et doit traiter les « tokens image » générés par chaque photo. Une image en haute résolution peut représenter plusieurs milliers de tokens, ce qui consomme du contexte et de la mémoire pendant l'inférence. Prévoyez donc une marge de VRAM au-delà de la simple taille des poids.
En quantification Q4_K_M (le meilleur compromis qualité/mémoire pour la plupart des usages), voici les repères d'empreinte selon la taille du modèle de langage sous-jacent. Ajoutez ~1 à 2 Go pour l'encodeur visuel et le traitement des images.
- Variante ~3-4B
- ≈ 2-3 Go de VRAM. Tient sur une RTX 3060 12 Go sans forcer, ou un Mac M-series 16 Go. Le point d'entrée pour la vision locale.
- Variante ~7-8B
- ≈ 5-6 Go de VRAM. Confortable sur RTX 3060/4070 12 Go ou RTX 4080 16 Go. Le meilleur rapport qualité/ressources pour un usage quotidien.
- Variante ~30-32B
- ≈ 19-20 Go de VRAM. Vise une RTX 4090 24 Go, une carte pro, ou un Mac à mémoire unifiée généreuse (M4 Pro/Max 32 Go et plus).
Côté logiciel, il vous faut Ollama installé (le daemon écoute par défaut sur http://localhost:11434) et une version récente qui supporte l'entrée multimodale. Une interface comme Open WebUI ou LM Studio rend l'envoi d'images plus confortable qu'en ligne de commande, mais n'est pas obligatoire.
#Choisir la bonne variante selon sa VRAM
Qwen3-VL est décliné en plusieurs tailles. Le bon réflexe n'est pas de viser la plus grosse variante que votre machine peut techniquement charger, mais celle qui laisse de la marge pour le contexte et le traitement d'images. Voici comment trancher.
- 01Vous avez 8-12 Go de VRAMPartez sur une variante 3-4B en Q4_K_M. Elle décrit correctement une image, fait de l'OCR sur du texte net et répond vite. Suffisant pour la majorité des usages simples (description, extraction de texte).
- 02Vous avez 12-16 Go de VRAMVisez une variante 7-8B en Q4_K_M ou Q5_K_M. C'est le sweet spot : nettement meilleure sur les documents complexes, les tableaux et le raisonnement visuel, tout en restant fluide.
- 03Vous avez 24 Go de VRAM ou un Mac généreuxUne variante 30-32B en Q4_K_M débloque la meilleure qualité disponible en local : lecture fiable de documents denses, tableaux multi-colonnes, raisonnement fin sur des schémas. C'est là que l'écart avec le cloud se resserre le plus.
- 04Dans le douteCommencez par la variante 7-8B. Si la qualité suffit, vous avez économisé de la VRAM ; si elle plafonne sur vos documents, montez d'un cran.
#Installer Qwen3-VL avec Ollama
L'installation tient en une commande. Ollama télécharge le modèle depuis sa bibliothèque, encodeur visuel compris, puis le rend disponible pour l'inférence. Remplacez le tag par la variante choisie à l'étape précédente.
Une fois dans la session interactive, envoyer une image se fait en indiquant son chemin dans le prompt. Ollama détecte le chemin de fichier, encode l'image et l'ajoute au contexte. Vous pouvez ensuite poser autant de questions que vous voulez dessus.
#Décrire images et captures d'écran
C'est le cas d'usage le plus immédiat. Qwen3-VL décrit le contenu d'une photo, identifie des objets, lit du texte présent dans l'image et raisonne sur ce qu'il observe. Pour les captures d'écran — interfaces, dashboards, messages d'erreur — il est particulièrement utile : il lit l'UI, repère les éléments et peut expliquer ce qui s'affiche.
- Description générale
- « Que montre cette image ? » — inventaire des éléments, ambiance, contexte. Utile pour taguer ou trier des photos.
- Lecture de capture d'écran
- Interpréter un dashboard, retranscrire un message d'erreur, expliquer une interface inconnue à partir d'une capture.
- Extraction ciblée
- « Quel est le montant total ? », « Liste les noms visibles » — le modèle isole l'information demandée plutôt que de tout décrire.
- Questions de suivi
- Une fois l'image en contexte, enchaînez les questions sans la renvoyer. Le modèle garde la référence visuelle.
#Lire des documents scannés et des tableaux
L'OCR et la compréhension de documents sont là où Qwen3-VL brille vraiment et justifie le passage à une variante 7-8B ou plus. Il ne se contente pas de retranscrire le texte : il comprend la structure (titres, colonnes, cases), ce qui permet d'extraire des données d'un tableau ou d'un formulaire dans un format propre.
- Facture ou reçu scanné
- Extraire fournisseur, date, montant HT/TTC, lignes d'articles — et demander une sortie en JSON directement exploitable.
- Tableau en image
- Reconstituer un tableau capturé en photo au format Markdown ou CSV, en préservant les lignes et colonnes.
- Document manuscrit
- L'OCR gère l'imprimé sans peine ; le manuscrit reste plus aléatoire mais fonctionne sur une écriture nette.
- Formulaire administratif
- Repérer les champs remplis et leur valeur, y compris les cases cochées.
#Automatiser via l'API
Pour traiter des images en masse — trier un dossier de captures, extraire les données de dizaines de factures — l'API d'Ollama permet de scripter tout ça. Ollama expose une API compatible OpenAI sur le port 11434, l'image étant transmise encodée en base64. Voici un exemple Python minimal.
À partir de là, une simple boucle sur un dossier vous permet de traiter tout un lot d'images et d'agréger les résultats. Comme l'inférence est locale, aucune limite de débit ne s'applique : la seule contrainte est la vitesse de votre GPU.
#Ce que la vision locale ne sait pas encore faire
Autant être honnête : Qwen3-VL en local est excellent, mais il reste des écarts avec les meilleurs modèles vision cloud, et des tâches où il faut baisser ses attentes. Connaître ces limites évite les mauvaises surprises.
- Petits détails et basse résolution
- Sur une image floue, très dense ou en basse définition, l'OCR décroche. Un scan propre et bien cadré change tout. Le modèle ne « devine » pas ce qu'il ne voit pas nettement.
- Comptage précis
- Compter exactement de nombreux objets identiques (« combien de personnes sur cette photo ? ») reste peu fiable au-delà de quelques éléments. C'est une limite connue des VLM.
- Raisonnement spatial fin
- Positions relatives exactes, mesures, géométrie précise : le modèle donne une idée, pas une réponse métrologique.
- Vidéo et temps réel
- Ollama traite des images fixes. L'analyse vidéo demande de découper en frames vous-même, sans compréhension temporelle native.
- Hallucinations visuelles
- Comme tout LLM, il peut affirmer voir un élément absent, surtout si votre question le suggère. Posez des questions neutres, pas orientées.
#Dépannage
- « Fichier introuvable » sur une image existante
- Chemin relatif mal résolu. Donnez le chemin absolu complet. Sur Windows, utilisez des slashes (C:/...) .
- Réponse lente ou saccadée
- Le modèle déborde de la VRAM et une partie tourne sur CPU. Vérifiez avec ollama ps ; si c'est le cas, descendez d'une variante ou d'une quantification.
- OCR médiocre
- Image de trop basse résolution ou quantification trop agressive. Fournissez un scan plus net et restez en Q4_K_M minimum.
- Le modèle ignore l'image
- Vous avez peut-être chargé une variante texte de Qwen par erreur. Assurez-vous que le tag contient bien -vl et que votre version d'Ollama supporte le multimodal.
- Out of memory au chargement
- La variante dépasse votre VRAM. Passez à une taille inférieure — souvenez-vous d'ajouter la marge pour l'encodeur visuel et les tokens image.
#Pour aller plus loin
Qwen3-VL s'appuie sur le même stack Ollama que le reste de vos modèles locaux. Ces guides prolongent naturellement votre setup vision :
- LLM multimodal vision en local : analyser des images avec Ollama
- Le panorama des VLM auto-hébergeables (Qwen-VL, Llama-Vision, Llama 4 Scout) pour comparer et choisir selon vos besoins.
- Installer Ollama : Windows, macOS et Linux
- Si Ollama n'est pas encore en place, le guide d'installation complet avec les prérequis GPU.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour caler la bonne empreinte mémoire de votre variante Qwen3-VL selon votre VRAM.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.