Accueil Catalogue Meilleur LLM local avec vision en 2026

Meilleur LLM local avec vision en 2026

Classement mis à jour le 18/08/2026

Classement des LLM open-weights capables d'analyser des images en entrée : OCR, description, VQA, analyse de graphiques, extraction de données à partir de captures d'écran. Tous auto-hébergeables.

Classement

1

🇨🇳 Qwen 3 VL 30B-A3B

Alibaba · 30B paramètres · Apache 2.0 · 262 144 tokens ctx

Vision MoE 30B/3B actifs. Sweet spot vision Qwen 3. 256k ctx.

Pourquoi ce rang Supporte les entrées image nativement. 30B paramètres pour une analyse fine.
ollama run qwen3-vl:30b
VRAM Q4
19 GB
35 GB en Q8
2

🇨🇳 LLaDA 2.0 Uni 16B

Ant Group / inclusionAI · 16B paramètres · Apache 2.0 · 8 192 tokens ctx

Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.

Pourquoi ce rang Supporte les entrées image nativement. 16B paramètres pour une analyse correcte.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
VRAM Q4
18 GB
30 GB en Q8
3

🇨🇳 Qwen 3.6 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.

Pourquoi ce rang Supporte les entrées image nativement. 27B paramètres pour une analyse correcte.
ollama run qwen3.6:27b
VRAM Q4
16 GB
29 GB en Q8
4

🇨🇳 Qwen 3.8 27B

Alibaba · 27B paramètres · Apache 2.0 · 262 144 tokens ctx

Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.

Pourquoi ce rang Supporte les entrées image nativement. 27B paramètres pour une analyse correcte.
ollama run qwen3.8:27b
VRAM Q4
16 GB
29 GB en Q8
5

🇨🇳 Qwen 3 VL 8B

Alibaba · 8B paramètres · Apache 2.0 · 262 144 tokens ctx

Vision 8B dense Qwen 3. Meilleur petit VLM Qwen génération 3.

Pourquoi ce rang Supporte les entrées image nativement. 8B paramètres pour une analyse correcte.
ollama run qwen3-vl:8b
VRAM Q4
6 GB
10 GB en Q8
6

🇺🇸 DiffusionGemma 26B-A4B Instruct

Google · 26B paramètres · Apache 2.0 · 128 000 tokens ctx

DiffusionGemma 26B (Google) : Gemma vision-langage par diffusion, instruct, 128k contexte, 15 Go VRAM Q4. Apache 2.0. Sortie juin 2026.

Pourquoi ce rang Supporte les entrées image nativement. 26B paramètres pour une analyse correcte.
# HuggingFace : google/diffusiongemma-26B-A4B-it
VRAM Q4
15 GB
28 GB en Q8
7

🇨🇳 Qwen 2 VL 7B

Alibaba · 7B paramètres · Apache 2.0 · 32 768 tokens ctx

Vision de très haut niveau. OCR multilingue excellent.

Pourquoi ce rang Supporte les entrées image nativement. 7B paramètres pour une analyse correcte.
ollama run qwen2-vl:7b
VRAM Q4
6 GB
10 GB en Q8

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence
#1 Qwen 3 VL 30B-A3B 30B 19 GB 262 144 Apache 2.0
#2 LLaDA 2.0 Uni 16B 16B 18 GB 8 192 Apache 2.0
#3 Qwen 3.6 27B 27B 16 GB 262 144 Apache 2.0
#4 Qwen 3.8 27B 27B 16 GB 262 144 Apache 2.0
#5 Qwen 3 VL 8B 8B 6 GB 262 144 Apache 2.0
#6 DiffusionGemma 26B-A4B Instruct 26B 15 GB 128 000 Apache 2.0
#7 Qwen 2 VL 7B 7B 6 GB 32 768 Apache 2.0

Méthodologie du classement

Filtre sur le tag « vision ». Score favorise les modèles récents (les VLM évoluent très vite) et les grandes tailles (détails fins mieux rendus).

Critères pris en compte :

  • Compréhension d'image
  • OCR / extraction texte
  • VQA (questions sur image)
  • Ollama / llama.cpp compatible

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Quel est le meilleur LLM open-source pour analyser des images ?

Qwen 3 VL 30B-A3B est notre #1 pour 30B paramètres. Pour une config plus légère, Qwen 2.5 VL 7B tourne très bien en 8-12 GB de VRAM.

Peut-on faire de l'OCR avec ces modèles ?

Oui — les VLM modernes savent lire du texte sur image (documents scannés, captures d'écran). Pour de l'OCR massif/industriel, DeepSeek OCR est spécialisé. Pour du texte en français manuscrit, préférez Qwen 2.5 VL qui gère bien le français.

Faut-il Ollama ou llama.cpp pour la vision ?

Les deux supportent les modèles vision (Llama 3.2 Vision, LLaVA, Qwen VL). LM Studio aussi. Utilisez l'API via -images ou le paramètre images dans Ollama.

Quelle VRAM pour un VLM correct ?

8 GB pour un 7B VL (Qwen 2.5 VL 7B), 12-16 GB pour un 11B (Llama 3.2 Vision), 40+ GB pour les gros 72B. La vision ajoute ~1-2 GB de VRAM en plus du modèle texte.

Comparatifs en tête-à-tête

Approfondissez avec nos duels détaillés des finalistes :

Pour aller plus loin