Débutant 10 minPar VRAM
Quel LLM pour 12 Go de VRAM ?
12 Go de VRAM est LE sweet spot LLM en 2026. RTX 3060 12GB, 4070, 5070, RTX 3080 12GB, 3080 Ti : la frontière qui ouvre Qwen 3.5 9B en Q8, Gemma 4 12B, RAG multi-stage avec embedder + reranker. Si vous avez 12 Go, vous accédez à 90 % du catalogue LLM moderne avec qualité maximale. Ce guide définit ce que vous gagnez vs 8 Go.
#12 Go VRAM, le sweet spot 2026
→
Le palier qui change tout
12 Go = accès à Qwen 3.5 9B en Q8 (11 Go) confortable, Gemma 4 12B Q4 (7,6 Go), Granite 4.2 8B Q5 (6 Go) avec marge RAG. Aucun autre palier ne débloque autant de capacités pour un coût marginal aussi modeste.
#1. GPU concernés
- Budget (~250 €)
- RTX 3060 12 Go occasion. Champion absolu rapport perf/€.
- Milieu (~450-750 €)
- RTX 4070, 4070 Super, 4070 Ti, 5070, RX 7700 XT.
- Premium (~600-800 €)
- RTX 3080 12 Go, 3080 Ti.
#2. Modèles compatibles
12 Go VRAM — modèles LLM
| Modèle | Quant | VRAM | Verdict |
|---|---|---|---|
| Gemma 4 12B | Q4_K_M | 7 Go | ★★★★★ |
| Granite 4.2 8B | Q5_K_M | 6 Go | ★★★★★ confortable |
| Qwen 3.5 9B | Q5_K_M | 7 Go | ★★★★★ |
| Qwen 3.5 9B | Q8_0 | 11 Go | ★★★★★ qualité max |
| Gemma 4 12B | Q6_K | 10 Go | ★★★★ serré (vision) |
| Mistral Small 24B | — | 14 Go+ | ❌ déborde |
#3. RAG multi-stage en 12 Go
- Granite 4.2 8B Q4 + BGE-M3 + Reranker
- 5 Go + 2 Go + 1 Go = 8 Go. Reste 4 Go pour contexte.
- Qwen 3.5 9B Q5 + embedder + reranker
- 7 Go + 2 Go + 1 Go = 10 Go. Tight mais jouable.
- Gemma 4 12B Q4 + embedder
- 7,6 Go + 2 Go = 9,6 Go. Sans reranker, RAG simple OK.
#4. Limites des 12 Go
- Mistral Small 24B
- Q4 = 14 Go > 12 Go. Déborde. Pour 24B confortable, 16 Go nécessaires.
- Qwen 3.8 27B
- 18 Go en Q4. Inaccessible en 12 Go, visez 24 Go.
- Qwen 3.6 35B-A3B / GLM 4.7 Flash
- 19-23 Go en Q4. Hors de portée totale. Visez 24-32 Go (RTX 5090) ou Mac 64 Go+.
#Questions fréquentes
Quel est le meilleur LLM pour 12 Go de VRAM ?+
Qwen 3.5 9B en Q8_0 (11 Go) est le sweet spot — qualité max de la tranche, 256k de contexte et vision. Sinon Granite 4.2 8B Q5 pour la vitesse, Gemma 4 12B pour le multimodal. Pour du code, les spécialistes 2026 (Devstral 24B, Qwen3-Coder 30B) réclament 16-24 Go : en 12 Go, restez sur un généraliste.
12 Go suffisent en 2026 ?+
Oui pour 95 % des usages. Ouvre tout 8B-12B en Q5/Q8, RAG multi-stage. Limite uniquement à 24B+. Reste pertinent jusqu'en 2028 minimum.
Combien de tokens/sec pour Qwen 3.5 9B sur 12 Go ?+
Variable : RTX 3060 12GB = 30 tok/s, RTX 4070 = 46 tok/s, RTX 5070 = 62 tok/s. Confortable partout pour usage chat.
12 Go ou 16 Go pour LLM ?+
12 Go suffit pour 9-12B en Q5-Q8 + RAG. 16 Go ouvre Mistral Small 24B Q4, gpt-oss 20B et Devstral 24B, avec marge contexte 32k. Si budget le permet, 16 Go est meilleur long terme. Sinon, 12 Go reste excellent.
Quelle carte 12 Go choisir en 2026 ?+
Budget serré : RTX 3060 12 Go occasion (~250 €). Standard : RTX 4070 occasion (~450 €). Premium : RTX 5070 neuve (~750 €).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.