Accueil Catalogue Meilleur LLM sans GPU (CPU only) en 2026

Meilleur LLM sans GPU (CPU only) en 2026

Classement mis à jour le 18/08/2026

Pas de GPU ? Les LLM modernes 1-7B tournent correctement sur CPU grâce à llama.cpp et aux quantifs Q4. Il faut 8-16 GB de RAM et accepter des débits de 5-15 tokens/sec. Voici les meilleurs choix.

Classement

1

🇺🇸 Gemma 4 E2B

Google · 2B paramètres · Gemma · 128 000 tokens ctx

Gemma 4 E2B : 2B paramètres effectifs, architecture edge optimisée laptop/mobile. Multimodal text+image, 128k ctx, thinking mode configurable. Sortie avril 2026.

Pourquoi ce rang 2B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run gemma4:e2b
VRAM Q4
7 GB
13 GB en Q8
2

🇺🇸 Granite 4.0 3B Vision

IBM · 3B paramètres · Apache 2.0 · 16 384 tokens ctx

VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
# HuggingFace : ibm-granite/granite-4.0-3b-vision
VRAM Q4
2.2 GB
3.8 GB en Q8
3

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B paramètres · Apache 2.0 · 131 072 tokens ctx

Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run granite4.1:3b
VRAM Q4
2 GB
3 GB en Q8
4

🇺🇸 Granite 4.1

IBM · 3B paramètres · Apache 2.0 · 128 000 tokens ctx

Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run granite4.1
VRAM Q4
1.7 GB
3.2 GB en Q8
5

🇺🇸 Phi-4 Mini 3.8B

Microsoft · 3.8B paramètres · MIT · 128 000 tokens ctx

3.8B MIT avec function calling. MMLU 67.3, HumanEval 74.4. 200k vocab, LongRoPE.

Pourquoi ce rang 3.8B paramètres — tourne correctement sur CPU moderne (5-10 tokens/sec en Q4).
ollama run phi4-mini:3.8b
VRAM Q4
10 GB
18 GB en Q8
6

🇺🇸 Phi-4 Mini Reasoning 3.8B

Microsoft · 3.8B paramètres · MIT · 128 000 tokens ctx

Raisonneur 3.8B MIT entraîné sur traces R1. AIME24 57.5, MATH-500 94.6.

Pourquoi ce rang 3.8B paramètres — tourne correctement sur CPU moderne (5-10 tokens/sec en Q4).
ollama run phi4-mini-reasoning:3.8b
VRAM Q4
10 GB
18 GB en Q8
7

🇫🇷 SmolLM3 3B

HuggingFace · 3B paramètres · Apache 2.0 · 128 000 tokens ctx

3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
VRAM Q4
2 GB
4 GB en Q8

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence Sur GPU intégré / aucun
#1 Gemma 4 E2B 2B 7 GB 128 000 Gemma
#2 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0
#3 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0
#4 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0
#5 Phi-4 Mini 3.8B 3.8B 10 GB 128 000 MIT
#6 Phi-4 Mini Reasoning 3.8B 3.8B 10 GB 128 000 MIT
#7 SmolLM3 3B 3B 2 GB 128 000 Apache 2.0

Méthodologie du classement

Modèles ≤ 8B uniquement — au-delà, le débit CPU devient trop faible. Gros bonus aux ≤ 3B (très rapides sur CPU moderne) et aux licences permissives.

Critères pris en compte :

  • Taille ≤ 8B (idéalement ≤ 3B)
  • Débit CPU ≥ 5 tokens/sec
  • RAM requise ≤ 16 GB
  • Qualité acceptable en Q4

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Peut-on vraiment faire tourner un LLM sans GPU ?

Oui — grâce à llama.cpp + quantif Q4_K_M, un 7B tourne à 5-10 tokens/sec sur un CPU Ryzen 7 ou Apple M1. Pour de l'interactif, visez un 1-3B (30-50 tokens/sec).

Combien de RAM faut-il ?

Pour un 7B en Q4 : 8 GB de RAM minimum, 16 GB recommandés (le modèle prend ~5 GB, le reste pour OS + contexte). Pour un 3B : 6-8 GB suffisent. Pour un 1B : 4 GB.

Quel CPU pour du LLM ?

Plus il y a de cœurs et d'AVX2/AVX-512, mieux c'est. Ryzen 7/9 récents, Intel Core i7/i9 récents, Apple M1/M2/M3 — tous excellents. Privilégiez la mémoire rapide (DDR5 > DDR4) : la bande passante RAM limite souvent plus que les cœurs.

iGPU (Intel / AMD) peut-il aider ?

Marginalement — Vulkan sur iGPU donne un gain de 20-40% vs CPU seul. Pas transcendant mais à prendre. Sur Mac Apple Silicon, le GPU intégré est exploitable via Metal et fait une grosse différence (c'est le mode 'unified memory').

Pour aller plus loin