Débutant 10 minPar VRAM
Quel LLM pour 8 Go de VRAM ?
8 Go de VRAM est le standard mainstream en 2026. RTX 4060, 5050, 5060, 5060 Ti 8GB, RX 7600… une majorité de PC gaming actuels. Pour LLM, vous tenez Qwen 3.5 9B en Q4/Q5 (256k ctx, vision), Granite 4.2 8B confortablement, mais les 14B+ commencent à coincer. Ce guide est le plus consulté car il correspond à 60 % des configs LLM 2026.
#8 Go VRAM, le mainstream
→
Le sweet spot 8B-9B
8 Go vous permet les modèles 8B-9B en quantization Q4 à Q6 sans débordement. Qwen 3.5 9B Q4 (6,6 Go) + contexte 16k tient parfaitement, et Granite 4.2 8B Q5 (5,3 Go) laisse de la marge. C'est le minimum confortable 2026 pour un usage régulier.
#1. GPU concernés
- Nvidia 8 Go
- RTX 4060, 5050, 5060, 5060 Ti 8 Go, 4060 Ti 8 Go, 3070, 3070 Ti, 3060 Ti, 3050 8 Go, 2080, 2080 Super, 2070, 2060 Super.
- AMD 8 Go
- RX 7600, 7600 XT, 6600 XT, 6650 XT, 5700 XT.
- Mac unified 8 Go
- MacBook Air M1/M2 8 Go (effective ~5 Go GPU).
#2. Modèles compatibles
8 Go VRAM — modèles LLM 2026
| Modèle | Quant | VRAM | Tokens/sec (RTX 5060) |
|---|---|---|---|
| Granite 4.2 8B | Q4_K_M | 4,6 Go | 29-35 |
| Qwen 3.5 9B | Q4_K_M | 6 Go | 8-10 |
| Gemma 4 2B | FP16 | 4 Go | 32-39 |
| Qwen 3.5 4B | Q5_K_M | 3,4 Go | 32-38 |
| Qwen2.5-Coder 7B base (FIM) | Q5_K_M | 5,4 Go | 36-42 |
| Gemma 4 12B | Q4_K_M | 7,6 Go | 18-24 (tight) |
!
Pas de 14B confortable sur 8 Go
Un 14B en Q4 (~8,5 Go) déborde des 8 Go. Gemma 4 12B Q4 (7,6 Go) passe tout juste, au prix d'un contexte réduit. Pour du 14B+ vraiment confortable, il faut 12 Go+ — c'est la frontière critique 2026.
#3. Astuces 8 Go
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 — permet contexte 16k sur Granite 4.2 8B en ~6,5 Go.
- Flash Attention
- Actif par défaut sur Turing+ (RTX 20+). Gain 10-15 % sur contextes longs.
- Préférez Q5/Q6
- Sur 8 Go, Q5 (5 Go) ou Q6 (6 Go) sont confortables. Q4 (4,4 Go) inutilement bas pour cette VRAM.
- Pas de RAG multi-stage
- Embedder + reranker + LLM = ~9-10 Go. Tight.
#Upgrade conseillé
- RTX 5060 Ti 16 Go (~500 €)
- +100 % VRAM, accès Mistral Small 24B / gpt-oss 20B / Devstral 24B. Le saut LLM le plus important.
- RTX 4060 Ti 16 Go occasion (~420 €)
- Alternative budget, mêmes capacités.
- RTX 3060 12 Go occasion (~250 €)
- Si budget serré, +50 % VRAM pour 50-100 € de moins qu'une 8 Go neuve.
#Questions fréquentes
Quel est le meilleur LLM pour 8 Go de VRAM ?+
Qwen 3.5 9B Q4_K_M (le choix 8 Go 2026, 256k ctx, vision) ou Granite 4.2 8B Q5_K_M. Excellent rapport qualité/vitesse. Pour l'autocomplétion de code inline : Qwen2.5-Coder 7B base en FIM.
Peut-on tourner un 14B sur 8 Go ?+
Pas confortablement. Un 14B en Q4 (~8,5 Go) déborde. Gemma 4 12B Q4 (7,6 Go) passe tout juste avec un contexte réduit. Préférez Qwen 3.5 9B Q4 sur 8 Go.
Combien de tokens/sec pour Granite 4.2 8B sur 8 Go ?+
Variable selon GPU : RTX 4060 ≈ 22 tok/s, RTX 5060 ≈ 32 tok/s, RTX 4060 Ti ≈ 25 tok/s, RTX 3070 ≈ 26 tok/s.
8 Go suffisent pour développer une app LLM ?+
Pour prototypage et chat : oui. Pour RAG production avec embedder + reranker + 14B : non, 12-16 Go nécessaires.
8 Go en 2027-2028 — encore pertinent ?+
Oui pour 8B-9B classiques. Mais les modèles évoluent vite (Qwen 3.5, Granite 4.2, Mistral Small) — la pression vers 12-16 Go va s'accentuer. 8 Go reste viable mais plus limitant qu'aujourd'hui.
Mac M1/M2 8 Go vs PC 8 Go pour LLM ?+
Mac : 5 Go effective GPU (système prend 3 Go). Granite 4.2 8B Q4 tangent, préférez Qwen 3.5 4B. PC GPU dédié : 8 Go pleins, plus confortable.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.