Accueil Catalogue Meilleur LLM sur Mac avec 8 Go de mémoire unifiée en 2026

Meilleur LLM sur Mac avec 8 Go de mémoire unifiée en 2026

Classement mis à jour le 18/08/2026

Sur un Mac 8 Go (M1/M2/M3 Air, MacBook Air M4 base, Mac mini M2 base), macOS prend ~4 Go. Il reste ~3-4 Go utilisables pour un LLM. On se limite aux modèles 1-3B en Q4_K_M pour rester fluide.

Classement

1

🇺🇸 Granite 4.0 3B Vision

IBM · 3B paramètres · Apache 2.0 · 16 384 tokens ctx

VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.

Pourquoi ce rang VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Sur Apple M2 (16 GB)
FP16
6.5 GB · 25 tok/s
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B paramètres · Apache 2.0 · 131 072 tokens ctx

Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.

Pourquoi ce rang Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.
ollama run granite4.1:3b
Sur Apple M2 (16 GB)
FP16
6 GB · 25 tok/s
3

🇺🇸 Granite 4.1

IBM · 3B paramètres · Apache 2.0 · 128 000 tokens ctx

Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.

Pourquoi ce rang Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.
ollama run granite4.1
Sur Apple M2 (16 GB)
FP16
6 GB · 50 tok/s
4

🇫🇷 SmolLM3 3B

HuggingFace · 3B paramètres · Apache 2.0 · 128 000 tokens ctx

3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).

Pourquoi ce rang 3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
Sur Apple M2 (16 GB)
FP16
6 GB · 25 tok/s
5

🇫🇷 SmolVLM2 2.2B Instruct

HuggingFace · 2.2B paramètres · Apache 2.0 · 8 192 tokens ctx

VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B.

Pourquoi ce rang VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B.
# HuggingFace : HuggingFaceTB/SmolVLM2-2.2B-Instruct
Sur Apple M2 (16 GB)
FP16
4.5 GB · 30 tok/s
6

🇨🇳 DeepSeek-OCR

DeepSeek · 3B paramètres · MIT · 8 192 tokens ctx

Spécialiste OCR 3B MIT. Approche 'optical compression' saluée. DeepEncoder-based.

Pourquoi ce rang Spécialiste OCR 3B MIT. Approche 'optical compression' saluée. DeepEncoder-based.
ollama run deepseek-ocr:3b
Sur Apple M2 (16 GB)
FP16
6 GB · 25 tok/s
7

🇨🇳 GLM-OCR 1.1B

Zhipu AI · 1.1B paramètres · MIT · 131 072 tokens ctx

GLM-OCR (1,1B Zhipu/THUDM) : modèle vision OCR ultra-compact, ~0,6 Go VRAM Q4, 131k contexte, extraction de documents, tableaux et code. Sortie février 2026.

Pourquoi ce rang GLM-OCR (1,1B Zhipu/THUDM) : modèle vision OCR ultra-compact, ~0,6 Go VRAM Q4, 131k contexte, extraction de documents, tableaux et code. Sortie février 2026.
ollama pull glm-ocr
Sur Apple M2 (16 GB)
FP16
2.2 GB · 110 tok/s

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence Sur Apple M2 (16 GB)
#1 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0 25 tok/s · FP16
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 25 tok/s · FP16
#3 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0 50 tok/s · FP16
#4 SmolLM3 3B 3B 2 GB 128 000 Apache 2.0 25 tok/s · FP16
#5 SmolVLM2 2.2B Instruct 2.2B 1.6 GB 8 192 Apache 2.0 30 tok/s · FP16
#6 DeepSeek-OCR 3B 2 GB 8 192 MIT 25 tok/s · FP16
#7 GLM-OCR 1.1B 1.1B 0.6 GB 131 072 MIT 110 tok/s · FP16

Où acheter ce Mac ?

Comparez les prix de Mac mini M2 chez nos marchands partenaires (prix et stock à jour) :

Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.

Mémo gratuit

Quel modèle de code faire tourner sur TA machine ?

Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.

Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →

Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).

Méthodologie du classement

Filtre : modèles 1-4B dont Q4_K_M tient sous 4 Go (laisse 4 Go à macOS + contexte). Bonus 1-3B (peak 8 Go) et ≤ 2B (zero swap). Phi-4 Mini, Llama 3.2 3B, Gemma 4 3B dominent.

Critères pris en compte :

  • Q4_K_M ≤ 4 Go
  • Zero swap macOS
  • Tokens/sec ≥ 20
  • Contexte 2-4k utilisable

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Un Mac 8 Go peut-il vraiment faire tourner un LLM ?

Oui, mais étroitement. Phi-4 Mini 3,8B Q4 (~2,3 Go) ou Llama 3.2 3B Q4 (~2 Go) tournent à 25-35 tokens/sec. macOS prend 4 Go, vous avez 2-3 Go libres — c'est tendu mais utilisable pour du chat court.

Mac mini M2 8 Go vs MacBook Air M4 16 Go ?

L'Air M4 16 Go est largement préférable : 2× la RAM permet des modèles 7-8B (Mistral, Qwen 3) bien plus capables. Le mini M2 8 Go ne dépasse pas 3B en confort. Voir Mac 16 Go.

Quelle quantif sur 8 Go ?

Q4_K_M reste le sweet spot. Q3_K_M peut faire rentrer un Mistral 7B (~3,5 Go) mais la qualité chute visiblement. Préférez un 3B Q4 bien servi à un 7B Q3 amputé.

Faut-il vraiment 16 Go pour démarrer en LLM local ?

Pour du sérieux, oui — Apple a d'ailleurs banni le 8 Go sur tous les Mac M4 en 2025. Pour du test occasionnel sur un Mac existant, le 8 Go suffit à découvrir avec des 1-3B. Voir MacBook Air M1.

Pour aller plus loin