🇺🇸 Gemma 4 E2B
Gemma 4 E2B : 2B paramètres effectifs, architecture edge optimisée laptop/mobile. Multimodal text+image, 128k ctx, thinking mode configurable. Sortie avril 2026.
ollama run gemma4:e2b
Classement mis à jour le 18/08/2026
Pas de GPU ? Les LLM modernes 1-7B tournent correctement sur CPU grâce à llama.cpp et aux quantifs Q4. Il faut 8-16 GB de RAM et accepter des débits de 5-15 tokens/sec. Voici les meilleurs choix.
Gemma 4 E2B : 2B paramètres effectifs, architecture edge optimisée laptop/mobile. Multimodal text+image, 128k ctx, thinking mode configurable. Sortie avril 2026.
ollama run gemma4:e2b
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.
ollama run granite4.1:3b
Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.
ollama run granite4.1
3.8B MIT avec function calling. MMLU 67.3, HumanEval 74.4. 200k vocab, LongRoPE.
ollama run phi4-mini:3.8b
Raisonneur 3.8B MIT entraîné sur traces R1. AIME24 57.5, MATH-500 94.6.
ollama run phi4-mini-reasoning:3.8b
3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette).
# HuggingFace : HuggingFaceTB/SmolLM3-3B
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur GPU intégré / aucun |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E2B | 2B | 7 GB | 128 000 | Gemma | ✗ |
| #2 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | ✗ |
| #3 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | ✗ |
| #4 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | ✗ |
| #5 | Phi-4 Mini 3.8B | 3.8B | 10 GB | 128 000 | MIT | ✗ |
| #6 | Phi-4 Mini Reasoning 3.8B | 3.8B | 10 GB | 128 000 | MIT | ✗ |
| #7 | SmolLM3 3B | 3B | 2 GB | 128 000 | Apache 2.0 | ✗ |
Modèles ≤ 8B uniquement — au-delà, le débit CPU devient trop faible. Gros bonus aux ≤ 3B (très rapides sur CPU moderne) et aux licences permissives.
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Peut-on vraiment faire tourner un LLM sans GPU ?
Oui — grâce à llama.cpp + quantif Q4_K_M, un 7B tourne à 5-10 tokens/sec sur un CPU Ryzen 7 ou Apple M1. Pour de l'interactif, visez un 1-3B (30-50 tokens/sec).
Combien de RAM faut-il ?
Pour un 7B en Q4 : 8 GB de RAM minimum, 16 GB recommandés (le modèle prend ~5 GB, le reste pour OS + contexte). Pour un 3B : 6-8 GB suffisent. Pour un 1B : 4 GB.
Quel CPU pour du LLM ?
Plus il y a de cœurs et d'AVX2/AVX-512, mieux c'est. Ryzen 7/9 récents, Intel Core i7/i9 récents, Apple M1/M2/M3 — tous excellents. Privilégiez la mémoire rapide (DDR5 > DDR4) : la bande passante RAM limite souvent plus que les cœurs.
iGPU (Intel / AMD) peut-il aider ?
Marginalement — Vulkan sur iGPU donne un gain de 20-40% vs CPU seul. Pas transcendant mais à prendre. Sur Mac Apple Silicon, le GPU intégré est exploitable via Metal et fait une grosse différence (c'est le mode 'unified memory').