🇨🇳 Qwen 3 VL 30B-A3B
Vision MoE 30B/3B actifs. Sweet spot vision Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Classement mis à jour le 18/08/2026
Classement des LLM open-weights capables d'analyser des images en entrée : OCR, description, VQA, analyse de graphiques, extraction de données à partir de captures d'écran. Tous auto-hébergeables.
Vision MoE 30B/3B actifs. Sweet spot vision Qwen 3. 256k ctx.
ollama run qwen3-vl:30b
Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.
ollama run qwen3.8:27b
Vision 8B dense Qwen 3. Meilleur petit VLM Qwen génération 3.
ollama run qwen3-vl:8b
DiffusionGemma 26B (Google) : Gemma vision-langage par diffusion, instruct, 128k contexte, 15 Go VRAM Q4. Apache 2.0. Sortie juin 2026.
# HuggingFace : google/diffusiongemma-26B-A4B-it
Vision de très haut niveau. OCR multilingue excellent.
ollama run qwen2-vl:7b
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence |
|---|---|---|---|---|---|
| #1 | Qwen 3 VL 30B-A3B | 30B | 19 GB | 262 144 | Apache 2.0 |
| #2 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #3 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #4 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3 VL 8B | 8B | 6 GB | 262 144 | Apache 2.0 |
| #6 | DiffusionGemma 26B-A4B Instruct | 26B | 15 GB | 128 000 | Apache 2.0 |
| #7 | Qwen 2 VL 7B | 7B | 6 GB | 32 768 | Apache 2.0 |
Filtre sur le tag « vision ». Score favorise les modèles récents (les VLM évoluent très vite) et les grandes tailles (détails fins mieux rendus).
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Quel est le meilleur LLM open-source pour analyser des images ?
Qwen 3 VL 30B-A3B est notre #1 pour 30B paramètres. Pour une config plus légère, Qwen 2.5 VL 7B tourne très bien en 8-12 GB de VRAM.
Peut-on faire de l'OCR avec ces modèles ?
Oui — les VLM modernes savent lire du texte sur image (documents scannés, captures d'écran). Pour de l'OCR massif/industriel, DeepSeek OCR est spécialisé. Pour du texte en français manuscrit, préférez Qwen 2.5 VL qui gère bien le français.
Faut-il Ollama ou llama.cpp pour la vision ?
Les deux supportent les modèles vision (Llama 3.2 Vision, LLaVA, Qwen VL). LM Studio aussi. Utilisez l'API via -images ou le paramètre images dans Ollama.
Quelle VRAM pour un VLM correct ?
8 GB pour un 7B VL (Qwen 2.5 VL 7B), 12-16 GB pour un 11B (Llama 3.2 Vision), 40+ GB pour les gros 72B. La vision ajoute ~1-2 GB de VRAM en plus du modèle texte.
Approfondissez avec nos duels détaillés des finalistes :