Accueil Catalogue Meilleur LLM sans GPU (CPU only) en 2026

Meilleur LLM sans GPU (CPU only) en 2026

Classement mis à jour le 02/09/2026

Pas de GPU ? Les LLM modernes 1-7B tournent correctement sur CPU grâce à llama.cpp et aux quantifs Q4. Il faut 8-16 GB de RAM et accepter des débits de 5-15 tokens/sec. Voici les meilleurs choix.

Classement

1

🇺🇸 Gemma 4 E2B

Google · 2B paramètres · Gemma · 128 000 tokens ctx

Gemma 4 E2B : 2B paramètres effectifs, architecture edge optimisée laptop/mobile. Multimodal text+image, 128k ctx, thinking mode configurable. Sortie avril 2026.

Pourquoi ce rang 2B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run gemma4:e2b
VRAM Q4
7 GB
13 GB en Q8
2

🇺🇸 Granite 4.0 3B Vision

IBM · 3B paramètres · Apache 2.0 · 16 384 tokens ctx

VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
# HuggingFace : ibm-granite/granite-4.0-3b-vision
VRAM Q4
2.2 GB
3.8 GB en Q8
3

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B paramètres · Apache 2.0 · 131 072 tokens ctx

Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run granite4.1:3b
VRAM Q4
2 GB
3 GB en Q8
4

🇺🇸 Granite 4.1

IBM · 3B paramètres · Apache 2.0 · 128 000 tokens ctx

Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.

Pourquoi ce rang 3B paramètres — tourne correctement sur CPU moderne (30-50 tokens/sec en Q4).
ollama run granite4.1
VRAM Q4
1.7 GB
3.2 GB en Q8
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B paramètres · Apache 2.0 · 16 000 tokens ctx

Fine-tune SFT « thinking » d'OLMo 3 7B : raisonnement pas-à-pas, 16k contexte, ~4,2 Go VRAM en Q4. 100% ouvert, licence Apache 2.0.

Pourquoi ce rang 7B paramètres — tourne correctement sur CPU moderne (5-10 tokens/sec en Q4).
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
VRAM Q4
4.2 GB
8 GB en Q8
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B paramètres · MIT · 128 000 tokens ctx

GLM 5.3 (Zhipu) : dense 7B spécialisé code et raisonnement, 128k contexte, ~4,1 Go VRAM Q4. Léger, tourne sur GPU 6-8 Go, licence MIT.

Pourquoi ce rang 7B paramètres — tourne correctement sur CPU moderne (5-10 tokens/sec en Q4).
ollama pull glm-5.3
VRAM Q4
4.1 GB
7 GB en Q8
7

🇺🇸 Phi-4 Mini Reasoning 3.8B

Microsoft · 3.8B paramètres · MIT · 128 000 tokens ctx

Raisonneur 3.8B MIT entraîné sur traces R1. AIME24 57.5, MATH-500 94.6.

Pourquoi ce rang 3.8B paramètres — tourne correctement sur CPU moderne (5-10 tokens/sec en Q4).
ollama run phi4-mini-reasoning:3.8b
VRAM Q4
10 GB
18 GB en Q8

Tableau comparatif

Rang Modèle Params VRAM Q4 Contexte Licence Sur GPU intégré / aucun
#1 Gemma 4 E2B 2B 7 GB 128 000 Gemma
#2 Granite 4.0 3B Vision 3B 2.2 GB 16 384 Apache 2.0
#3 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0
#4 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT
#7 Phi-4 Mini Reasoning 3.8B 3.8B 10 GB 128 000 MIT

Méthodologie du classement

Modèles ≤ 8B uniquement — au-delà, le débit CPU devient trop faible. Gros bonus aux ≤ 3B (très rapides sur CPU moderne) et aux licences permissives.

Critères pris en compte :

  • Taille ≤ 8B (idéalement ≤ 3B)
  • Débit CPU ≥ 5 tokens/sec
  • RAM requise ≤ 16 GB
  • Qualité acceptable en Q4

Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.

Questions fréquentes

Peut-on vraiment faire tourner un LLM sans GPU ?

Oui — grâce à llama.cpp + quantif Q4_K_M, un 7B tourne à 5-10 tokens/sec sur un CPU Ryzen 7 ou Apple M1. Pour de l'interactif, visez un 1-3B (30-50 tokens/sec).

Combien de RAM faut-il ?

Pour un 7B en Q4 : 8 GB de RAM minimum, 16 GB recommandés (le modèle prend ~5 GB, le reste pour OS + contexte). Pour un 3B : 6-8 GB suffisent. Pour un 1B : 4 GB.

Quel CPU pour du LLM ?

Plus il y a de cœurs et d'AVX2/AVX-512, mieux c'est. Ryzen 7/9 récents, Intel Core i7/i9 récents, Apple M1/M2/M3 — tous excellents. Privilégiez la mémoire rapide (DDR5 > DDR4) : la bande passante RAM limite souvent plus que les cœurs.

iGPU (Intel / AMD) peut-il aider ?

Marginalement — Vulkan sur iGPU donne un gain de 20-40% vs CPU seul. Pas transcendant mais à prendre. Sur Mac Apple Silicon, le GPU intégré est exploitable via Metal et fait une grosse différence (c'est le mode 'unified memory').

Pour aller plus loin