🇺🇸 Granite 4.0 3B Vision
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Classement mis à jour le 29/08/2026
Sur un Mac 8 Go (M1/M2/M3 Air, MacBook Air M4 base, Mac mini M2 base), macOS prend ~4 Go. Il reste ~3-4 Go utilisables pour un LLM. On se limite aux modèles 1-3B en Q4_K_M pour rester fluide.
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.
ollama run granite4.1:3b
Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.
ollama run granite4.1
3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B.
# HuggingFace : HuggingFaceTB/SmolVLM2-2.2B-Instruct
Spécialiste OCR 3B MIT. Approche 'optical compression' saluée. DeepEncoder-based.
ollama run deepseek-ocr:3b
GLM-OCR (1,1B Zhipu/THUDM) : modèle vision OCR ultra-compact, ~0,6 Go VRAM Q4, 131k contexte, extraction de documents, tableaux et code. Sortie février 2026.
ollama pull glm-ocr
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur Apple M2 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | 25 tok/s · FP16 |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | 25 tok/s · FP16 |
| #3 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | 50 tok/s · FP16 |
| #4 | SmolLM3 3B | 3B | 2 GB | 128 000 | Apache 2.0 | 25 tok/s · FP16 |
| #5 | SmolVLM2 2.2B Instruct | 2.2B | 1.6 GB | 8 192 | Apache 2.0 | 30 tok/s · FP16 |
| #6 | DeepSeek-OCR | 3B | 2 GB | 8 192 | MIT | 25 tok/s · FP16 |
| #7 | GLM-OCR 1.1B | 1.1B | 0.6 GB | 131 072 | MIT | 110 tok/s · FP16 |
Comparez les prix de Mac mini M2 chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen 3.5 9B (Q4, 6,6 Go — 256k ctx) | ollama run qwen3.5:9b |
| 12 Go | RTX 3060 12 Go / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 Go) ou Gemma 4 12B (7,6 Go) | ollama run qwen3.5:9b-q8_0 |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | Devstral 24B (Q4, 14 Go) — spécialiste agent de code | ollama run devstral:24b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen 3.8 27B (Q4, 18 Go) — le « proche Copilot » | ollama run qwen3.8:27b |
| 32 Go | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 Go) — MoE rapide | ollama run qwen3.6:35b |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (Q8, 32 Go — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — c'est encore la référence sur ce cas précis. ⚠️ Qwen 3.8 : son raisonnement est réglé très haut par défaut et il « sur-réfléchit » sur des demandes simples — baisse-le à low (ou coupe-le) au premier lancement. ⚠️ Piège licence : Codestral 22B = Mistral Non-Production License → interdit pour coder au travail. Qwen 3.5/3.8, Gemma 4 et Devstral sont en Apache 2.0. 💡 Ça plante en mémoire ? Garde ~1,5 Go de VRAM libre pour le contexte, ou descends d'un cran de quantization.🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : modèles 1-4B dont Q4_K_M tient sous 4 Go (laisse 4 Go à macOS + contexte). Bonus 1-3B (peak 8 Go) et ≤ 2B (zero swap). Phi-4 Mini, Llama 3.2 3B, Gemma 4 3B dominent.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Un Mac 8 Go peut-il vraiment faire tourner un LLM ?
Oui, mais étroitement. Phi-4 Mini 3,8B Q4 (~2,3 Go) ou Llama 3.2 3B Q4 (~2 Go) tournent à 25-35 tokens/sec. macOS prend 4 Go, vous avez 2-3 Go libres — c'est tendu mais utilisable pour du chat court.
Mac mini M2 8 Go vs MacBook Air M4 16 Go ?
L'Air M4 16 Go est largement préférable : 2× la RAM permet des modèles 7-8B (Mistral, Qwen 3) bien plus capables. Le mini M2 8 Go ne dépasse pas 3B en confort. Voir Mac 16 Go.
Quelle quantif sur 8 Go ?
Q4_K_M reste le sweet spot. Q3_K_M peut faire rentrer un Mistral 7B (~3,5 Go) mais la qualité chute visiblement. Préférez un 3B Q4 bien servi à un 7B Q3 amputé.
Faut-il vraiment 16 Go pour démarrer en LLM local ?
Pour du sérieux, oui — Apple a d'ailleurs banni le 8 Go sur tous les Mac M4 en 2025. Pour du test occasionnel sur un Mac existant, le 8 Go suffit à découvrir avec des 1-3B. Voir MacBook Air M1.