Intermédiaire 11 minQwen

Qwen3-VL en local : le modèle vision de référence avec Ollama

Qwen3-VL est le modèle vision-langage open-weight le plus solide à faire tourner en local en 2026. Avec Ollama, on l'installe en une commande et on lui envoie des images, des captures d'écran ou des documents scannés directement depuis le terminal ou une interface. Ce guide couvre le choix de la variante selon votre VRAM, l'installation Qwen3-VL Ollama pas à pas, des cas d'usage concrets (description d'image, OCR, lecture de tableaux) et les limites honnêtes face aux modèles cloud.

Par Léa B.·Màj 2026-08-06·Testé sur Windows, macOS, Linux

#Pourquoi Qwen3-VL en local

Un modèle vision-langage (VLM) accepte à la fois du texte et des images en entrée. Vous lui montrez une photo, une capture d'écran ou un scan, et vous lui posez une question dessus en langage naturel. Qwen3-VL, développé par l'équipe Qwen d'Alibaba, s'est imposé comme la référence open-weight pour cet usage : il combine une bonne compréhension visuelle, un OCR multilingue robuste (français inclus) et un raisonnement solide sur ce qu'il voit.

L'intérêt de le faire tourner en local est le même que pour tout LLM auto-hébergé, mais il pèse encore plus lourd ici : les images que vous analysez sont souvent sensibles — captures d'écran de travail, documents administratifs, photos de factures, pièces d'identité. Avec Qwen3-VL sur votre machine, rien ne quitte votre disque. Pas d'upload vers un cloud, pas de quota, pas d'abonnement.

Confidentialité
Les images restent sur votre machine. Idéal pour documents RH, médicaux, juridiques ou tout scan personnel.
Coût nul à l'usage
Aucun coût par image ni par token. Vous traitez 10 ou 10 000 captures sans facture qui grimpe.
Hors-ligne
Une fois le modèle téléchargé, tout fonctionne sans connexion internet.
Automatisable
L'API compatible OpenAI d'Ollama permet de scripter le traitement d'images en masse en Python ou en shell.

#Prérequis et VRAM nécessaire

Un VLM est plus gourmand qu'un modèle texte de taille équivalente : en plus des poids du modèle de langage, il charge un encodeur visuel et doit traiter les « tokens image » générés par chaque photo. Une image en haute résolution peut représenter plusieurs milliers de tokens, ce qui consomme du contexte et de la mémoire pendant l'inférence. Prévoyez donc une marge de VRAM au-delà de la simple taille des poids.

En quantification Q4_K_M (le meilleur compromis qualité/mémoire pour la plupart des usages), voici les repères d'empreinte selon la taille du modèle de langage sous-jacent. Ajoutez ~1 à 2 Go pour l'encodeur visuel et le traitement des images.

Variante ~3-4B
≈ 2-3 Go de VRAM. Tient sur une RTX 3060 12 Go sans forcer, ou un Mac M-series 16 Go. Le point d'entrée pour la vision locale.
Variante ~7-8B
≈ 5-6 Go de VRAM. Confortable sur RTX 3060/4070 12 Go ou RTX 4080 16 Go. Le meilleur rapport qualité/ressources pour un usage quotidien.
Variante ~30-32B
≈ 19-20 Go de VRAM. Vise une RTX 4090 24 Go, une carte pro, ou un Mac à mémoire unifiée généreuse (M4 Pro/Max 32 Go et plus).
i
GPU vs Mac Apple Silicon
Sur Mac, la mémoire unifiée sert à la fois de RAM et de VRAM : un M4 Pro 24 Go ou un M4 Max 48 Go fait tourner les grosses variantes que peu de GPU grand public atteignent. Sur PC, c'est la VRAM du GPU qui compte — si le modèle déborde, Ollama bascule une partie sur le CPU et le débit s'effondre.

Côté logiciel, il vous faut Ollama installé (le daemon écoute par défaut sur http://localhost:11434) et une version récente qui supporte l'entrée multimodale. Une interface comme Open WebUI ou LM Studio rend l'envoi d'images plus confortable qu'en ligne de commande, mais n'est pas obligatoire.

#Choisir la bonne variante selon sa VRAM

Qwen3-VL est décliné en plusieurs tailles. Le bon réflexe n'est pas de viser la plus grosse variante que votre machine peut techniquement charger, mais celle qui laisse de la marge pour le contexte et le traitement d'images. Voici comment trancher.

  1. 01
    Vous avez 8-12 Go de VRAM
    Partez sur une variante 3-4B en Q4_K_M. Elle décrit correctement une image, fait de l'OCR sur du texte net et répond vite. Suffisant pour la majorité des usages simples (description, extraction de texte).
  2. 02
    Vous avez 12-16 Go de VRAM
    Visez une variante 7-8B en Q4_K_M ou Q5_K_M. C'est le sweet spot : nettement meilleure sur les documents complexes, les tableaux et le raisonnement visuel, tout en restant fluide.
  3. 03
    Vous avez 24 Go de VRAM ou un Mac généreux
    Une variante 30-32B en Q4_K_M débloque la meilleure qualité disponible en local : lecture fiable de documents denses, tableaux multi-colonnes, raisonnement fin sur des schémas. C'est là que l'écart avec le cloud se resserre le plus.
  4. 04
    Dans le doute
    Commencez par la variante 7-8B. Si la qualité suffit, vous avez économisé de la VRAM ; si elle plafonne sur vos documents, montez d'un cran.
La quantification compte
Pour un VLM, restez sur Q4_K_M ou Q5_K_M. Descendre trop bas (Q3 et en dessous) dégrade sensiblement l'OCR et la lecture de petits caractères — précisément ce qu'on demande à un modèle vision. Si vous hésitez sur la quantification, mieux vaut une variante plus petite en Q4_K_M qu'une grosse en Q3.

#Installer Qwen3-VL avec Ollama

L'installation tient en une commande. Ollama télécharge le modèle depuis sa bibliothèque, encodeur visuel compris, puis le rend disponible pour l'inférence. Remplacez le tag par la variante choisie à l'étape précédente.

Terminal — installer et lancer
# Télécharger la variante (exemple ~8B ; adaptez le tag à votre VRAM)
ollama pull qwen3-vl:8b

# Lancer une session interactive
ollama run qwen3-vl:8b

# Vérifier ce qui est chargé et sur quel matériel (GPU/CPU)
ollama ps

Une fois dans la session interactive, envoyer une image se fait en indiquant son chemin dans le prompt. Ollama détecte le chemin de fichier, encode l'image et l'ajoute au contexte. Vous pouvez ensuite poser autant de questions que vous voulez dessus.

Session Ollama — analyser une image
>>> Décris cette image en détail : /home/moi/captures/dashboard.png

>>> Quel est le chiffre affiché en haut à droite ?

>>> Y a-t-il une alerte visible ? Résume-la.
!
Chemin absolu recommandé
Selon le système, un chemin relatif peut ne pas être résolu correctement par Ollama. En cas de « fichier introuvable » alors que l'image existe, donnez le chemin absolu complet. Sur Windows, échappez ou utilisez des slashes classiques (C:/Users/...).

#Décrire images et captures d'écran

C'est le cas d'usage le plus immédiat. Qwen3-VL décrit le contenu d'une photo, identifie des objets, lit du texte présent dans l'image et raisonne sur ce qu'il observe. Pour les captures d'écran — interfaces, dashboards, messages d'erreur — il est particulièrement utile : il lit l'UI, repère les éléments et peut expliquer ce qui s'affiche.

Description générale
« Que montre cette image ? » — inventaire des éléments, ambiance, contexte. Utile pour taguer ou trier des photos.
Lecture de capture d'écran
Interpréter un dashboard, retranscrire un message d'erreur, expliquer une interface inconnue à partir d'une capture.
Extraction ciblée
« Quel est le montant total ? », « Liste les noms visibles » — le modèle isole l'information demandée plutôt que de tout décrire.
Questions de suivi
Une fois l'image en contexte, enchaînez les questions sans la renvoyer. Le modèle garde la référence visuelle.
Un prompt précis vaut mieux qu'un prompt vague
« Décris l'image » donne une réponse générique. « Liste uniquement les erreurs affichées dans cette capture, avec leur code » donne un résultat exploitable. Comme pour un LLM texte, plus la consigne est cadrée, meilleure est la sortie — c'est encore plus vrai en vision où le modèle peut se disperser sur des détails inutiles.

#Lire des documents scannés et des tableaux

L'OCR et la compréhension de documents sont là où Qwen3-VL brille vraiment et justifie le passage à une variante 7-8B ou plus. Il ne se contente pas de retranscrire le texte : il comprend la structure (titres, colonnes, cases), ce qui permet d'extraire des données d'un tableau ou d'un formulaire dans un format propre.

Facture ou reçu scanné
Extraire fournisseur, date, montant HT/TTC, lignes d'articles — et demander une sortie en JSON directement exploitable.
Tableau en image
Reconstituer un tableau capturé en photo au format Markdown ou CSV, en préservant les lignes et colonnes.
Document manuscrit
L'OCR gère l'imprimé sans peine ; le manuscrit reste plus aléatoire mais fonctionne sur une écriture nette.
Formulaire administratif
Repérer les champs remplis et leur valeur, y compris les cases cochées.
Session Ollama — extraire un tableau en Markdown
>>> Voici un tableau scanné : /home/moi/docs/tableau-ventes.png
... Reproduis-le exactement au format Markdown, sans rien ajouter
... ni interpréter. Conserve toutes les colonnes et l'ordre des lignes.
!
Toujours vérifier les chiffres critiques
Aucun OCR local n'est fiable à 100 %. Sur des montants, des références ou des numéros, un chiffre peut être mal lu (un 8 pris pour un 6, une virgule décalée). Pour un usage comptable ou juridique, relisez systématiquement les valeurs extraites — le modèle est un accélérateur de saisie, pas une source de vérité.

#Automatiser via l'API

Pour traiter des images en masse — trier un dossier de captures, extraire les données de dizaines de factures — l'API d'Ollama permet de scripter tout ça. Ollama expose une API compatible OpenAI sur le port 11434, l'image étant transmise encodée en base64. Voici un exemple Python minimal.

Python — analyser une image par script
import base64
import requests

with open("facture.png", "rb") as f:
    img_b64 = base64.b64encode(f.read()).decode()

resp = requests.post("http://localhost:11434/api/generate", json={
    "model": "qwen3-vl:8b",
    "prompt": "Extrais fournisseur, date et montant TTC au format JSON.",
    "images": [img_b64],
    "stream": False,
})

print(resp.json()["response"])

À partir de là, une simple boucle sur un dossier vous permet de traiter tout un lot d'images et d'agréger les résultats. Comme l'inférence est locale, aucune limite de débit ne s'applique : la seule contrainte est la vitesse de votre GPU.

Demandez un format structuré
Pour l'automatisation, imposez toujours un format de sortie (JSON, CSV) dans le prompt et précisez les clés attendues. Vous éviterez d'avoir à parser du texte libre. Ajoutez « réponds uniquement avec le JSON, sans texte autour » pour faciliter le traitement en aval.

#Ce que la vision locale ne sait pas encore faire

Autant être honnête : Qwen3-VL en local est excellent, mais il reste des écarts avec les meilleurs modèles vision cloud, et des tâches où il faut baisser ses attentes. Connaître ces limites évite les mauvaises surprises.

Petits détails et basse résolution
Sur une image floue, très dense ou en basse définition, l'OCR décroche. Un scan propre et bien cadré change tout. Le modèle ne « devine » pas ce qu'il ne voit pas nettement.
Comptage précis
Compter exactement de nombreux objets identiques (« combien de personnes sur cette photo ? ») reste peu fiable au-delà de quelques éléments. C'est une limite connue des VLM.
Raisonnement spatial fin
Positions relatives exactes, mesures, géométrie précise : le modèle donne une idée, pas une réponse métrologique.
Vidéo et temps réel
Ollama traite des images fixes. L'analyse vidéo demande de découper en frames vous-même, sans compréhension temporelle native.
Hallucinations visuelles
Comme tout LLM, il peut affirmer voir un élément absent, surtout si votre question le suggère. Posez des questions neutres, pas orientées.
i
Local vs cloud : le vrai arbitrage
Les modèles vision cloud gardent l'avantage sur les cas les plus difficiles (documents très denses, raisonnement visuel complexe, comptage). Mais pour 90 % des usages courants — décrire, extraire du texte, lire un tableau net — Qwen3-VL en local fait le travail, gratuitement et sans exposer vos images. L'arbitrage se joue sur la sensibilité des données et la difficulté réelle de vos images.

#Dépannage

« Fichier introuvable » sur une image existante
Chemin relatif mal résolu. Donnez le chemin absolu complet. Sur Windows, utilisez des slashes (C:/...) .
Réponse lente ou saccadée
Le modèle déborde de la VRAM et une partie tourne sur CPU. Vérifiez avec ollama ps ; si c'est le cas, descendez d'une variante ou d'une quantification.
OCR médiocre
Image de trop basse résolution ou quantification trop agressive. Fournissez un scan plus net et restez en Q4_K_M minimum.
Le modèle ignore l'image
Vous avez peut-être chargé une variante texte de Qwen par erreur. Assurez-vous que le tag contient bien -vl et que votre version d'Ollama supporte le multimodal.
Out of memory au chargement
La variante dépasse votre VRAM. Passez à une taille inférieure — souvenez-vous d'ajouter la marge pour l'encodeur visuel et les tokens image.
Diagnostics rapides
# Le modèle est-il bien chargé et sur GPU ?
ollama ps

# Lister les modèles vision installés
ollama list

# Tester l'API en local
curl http://localhost:11434/api/tags

#Pour aller plus loin

Qwen3-VL s'appuie sur le même stack Ollama que le reste de vos modèles locaux. Ces guides prolongent naturellement votre setup vision :

LLM multimodal vision en local : analyser des images avec Ollama
Le panorama des VLM auto-hébergeables (Qwen-VL, Llama-Vision, Llama 4 Scout) pour comparer et choisir selon vos besoins.
Installer Ollama : Windows, macOS et Linux
Si Ollama n'est pas encore en place, le guide d'installation complet avec les prérequis GPU.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour caler la bonne empreinte mémoire de votre variante Qwen3-VL selon votre VRAM.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.