🇺🇸 Granite 4.0 3B Vision
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Classement mis à jour le 18/08/2026
Sur un Mac 8 Go (M1/M2/M3 Air, MacBook Air M4 base, Mac mini M2 base), macOS prend ~4 Go. Il reste ~3-4 Go utilisables pour un LLM. On se limite aux modèles 1-3B en Q4_K_M pour rester fluide.
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.
ollama run granite4.1:3b
Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.
ollama run granite4.1
3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B.
# HuggingFace : HuggingFaceTB/SmolVLM2-2.2B-Instruct
Spécialiste OCR 3B MIT. Approche 'optical compression' saluée. DeepEncoder-based.
ollama run deepseek-ocr:3b
GLM-OCR (1,1B Zhipu/THUDM) : modèle vision OCR ultra-compact, ~0,6 Go VRAM Q4, 131k contexte, extraction de documents, tableaux et code. Sortie février 2026.
ollama pull glm-ocr
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur Apple M2 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | 25 tok/s · FP16 |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | 25 tok/s · FP16 |
| #3 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | 50 tok/s · FP16 |
| #4 | SmolLM3 3B | 3B | 2 GB | 128 000 | Apache 2.0 | 25 tok/s · FP16 |
| #5 | SmolVLM2 2.2B Instruct | 2.2B | 1.6 GB | 8 192 | Apache 2.0 | 30 tok/s · FP16 |
| #6 | DeepSeek-OCR | 3B | 2 GB | 8 192 | MIT | 25 tok/s · FP16 |
| #7 | GLM-OCR 1.1B | 1.1B | 0.6 GB | 131 072 | MIT | 110 tok/s · FP16 |
Comparez les prix de Mac mini M2 chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen2.5-Coder 7B (Q4) | ollama run qwen2.5-coder:7b |
| 12 Go | RTX 4070 / 5070 | Qwen2.5-Coder 14B (Q4) | ollama run qwen2.5-coder:14b |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | DeepSeek-Coder-V2-Lite 16B ou Qwen2.5-Coder 14B Q8 | ollama run deepseek-coder-v2:16b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen2.5-Coder 32B (Q4) — le « proche Copilot » | ollama run qwen2.5-coder:32b |
| 32 Go | RTX 5090 | Qwen2.5-Coder 32B en Q5/Q6 ou Devstral Small 2 (agentique) | ollama run devstral |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (MoE rapide) ou un 32B en Q8 | ollama run qwen3-coder:30b |
🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : modèles 1-4B dont Q4_K_M tient sous 4 Go (laisse 4 Go à macOS + contexte). Bonus 1-3B (peak 8 Go) et ≤ 2B (zero swap). Phi-4 Mini, Llama 3.2 3B, Gemma 4 3B dominent.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Un Mac 8 Go peut-il vraiment faire tourner un LLM ?
Oui, mais étroitement. Phi-4 Mini 3,8B Q4 (~2,3 Go) ou Llama 3.2 3B Q4 (~2 Go) tournent à 25-35 tokens/sec. macOS prend 4 Go, vous avez 2-3 Go libres — c'est tendu mais utilisable pour du chat court.
Mac mini M2 8 Go vs MacBook Air M4 16 Go ?
L'Air M4 16 Go est largement préférable : 2× la RAM permet des modèles 7-8B (Mistral, Qwen 3) bien plus capables. Le mini M2 8 Go ne dépasse pas 3B en confort. Voir Mac 16 Go.
Quelle quantif sur 8 Go ?
Q4_K_M reste le sweet spot. Q3_K_M peut faire rentrer un Mistral 7B (~3,5 Go) mais la qualité chute visiblement. Préférez un 3B Q4 bien servi à un 7B Q3 amputé.
Faut-il vraiment 16 Go pour démarrer en LLM local ?
Pour du sérieux, oui — Apple a d'ailleurs banni le 8 Go sur tous les Mac M4 en 2025. Pour du test occasionnel sur un Mac existant, le 8 Go suffit à découvrir avec des 1-3B. Voir MacBook Air M1.