Méthodologie · mise à jour 2026
Recommandeur de quantification
Un guide qui associe votre budget VRAM exact à la quantification GGUF, GPTQ ou AWQ optimale — sans tâtonnement, sans mémoire gaspillée.
Formule de base : VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. Le multiplicateur 1,2 absorbe le cache KV et l'overhead d'activation à un contexte de 8K.
Le choix en 30 secondes
Repérez votre VRAM disponible ci-dessous, puis lisez le plus gros modèle et la quantification qui tiennent avec un contexte 8K. Chiffres basés sur les réglages par défaut de llama.cpp/Ollama, cache KV Q4_K_M.
| VRAM | GPU typique | Modèle + quant recommandés | Marge 16K |
|---|---|---|---|
| 6 Go | RTX 3060 6 Go, RTX 4050 laptop | Llama 3.2 3B Q5_K_M, ou Qwen3 7B Q3_K_M | Juste — repasser en Q4_K_S |
| 8 Go | RTX 3050 8 Go, RTX 4060, M2 8 Go | Qwen3 7B Q5_K_M, Llama 3.1 8B Q4_K_M | OK en Q4_K_M |
| 12 Go | RTX 3060 12 Go, RTX 4070 | Qwen3-Coder 14B Q5_K_M, Mistral Small 3 Q4_K_M | Bonne |
| 16 Go | RTX 4060 Ti 16 Go, RTX 5060 Ti | Qwen3 14B Q6_K, Phi-4 14B Q8_0 | Excellente |
| 24 Go | RTX 3090, RTX 4090, RTX 5080 | Qwen3-Coder 32B Q4_K_M, Llama 3.3 70B Q2_K | Tient en 32K |
| 32 Go | RTX 5090, M4 Max | Qwen3 32B Q6_K, Llama 3.3 70B Q3_K_M | Tient en 64K |
| 48 Go | RTX 6000 Ada, 2×3090 | Llama 3.3 70B Q4_K_M, Qwen3 72B Q4_K_S | Tient en 32K |
| 80 Go | H100, H200, A100 80 Go | Llama 3.3 70B Q8_0, DeepSeek V3 Lite Q4_K_M | Prêt pour la prod |
Le calcul derrière la recommandation
La quantification compresse chaque poids de FP16 (16 bits) jusqu'à 2-8 bits. Un modèle 7B en Q4_K_M utilise en moyenne ~4,5 bits/poids, soit 7 000 000 000 × 4,5 / 8 ≈ 3,94 Go. En ajoutant le cache KV (qui grandit avec le contexte et la dimension cachée), on atterrit vers 5,5 Go à 8K de contexte. Pour un contexte long, le cache KV domine largement le multiplicateur ×1,2.
Référence bits par poids
| Quant | Bits/poids effectifs | VRAM (8B) | VRAM (32B) | VRAM (70B) |
|---|---|---|---|---|
| FP16 | 16,0 | 16,0 Go | 64,0 Go | 140,0 Go |
| Q8_0 | 8,5 | 8,5 Go | 34,0 Go | 74,4 Go |
| Q6_K | 6,6 | 6,6 Go | 26,4 Go | 57,8 Go |
| Q5_K_M | 5,7 | 5,7 Go | 22,8 Go | 49,9 Go |
| Q4_K_M | 4,83 | 4,83 Go | 19,3 Go | 42,3 Go |
| Q4_K_S | 4,58 | 4,58 Go | 18,3 Go | 40,1 Go |
| Q3_K_M | 3,9 | 3,9 Go | 15,6 Go | 34,1 Go |
| Q2_K | 3,35 | 3,35 Go | 13,4 Go | 29,3 Go |
Perte de qualité : ce que disent vraiment les chiffres
Le pattern est cohérent sur les familles Llama 3.x, Qwen3 et Mistral : la falaise entre Q4_K_M et Q3_K_M est réelle, et le gain de Q5 à Q6 est presque toujours invisible en production.
| Quant | Δ MMLU vs FP16 | Δ HumanEval | Verdict |
|---|---|---|---|
| Q8_0 | -0,1 pt | -0,0 pt | Indiscernable |
| Q6_K | -0,3 pt | -0,4 pt | Quasi sans perte |
| Q5_K_M | -0,7 pt | -0,9 pt | Excellent |
| Q4_K_M | -1,5 pt | -1,8 pt | Point d'équilibre |
| Q4_K_S | -2,1 pt | -2,6 pt | Acceptable |
| Q3_K_M | -4,4 pt | -6,1 pt | Perceptible |
| Q2_K | -9,8 pt | -14,3 pt | Dernier recours |
Un 14B en Q4_K_M bat un 8B en Q8_0 sur tous les benchmarks de raisonnement et de code que nous avons suivis. Dans le doute, montez en paramètres, pas en bits.
GGUF, GPTQ ou AWQ : le bon format, pas seulement le bon nombre de bits
GGUF (llama.cpp / Ollama / LM Studio) : le défaut pour l'inférence mono-utilisateur, l'offload CPU et Apple Silicon. GPTQ : 4 bits, inférence GPU pur avec vLLM/TGI. AWQ : 4 bits, GPU pur — l'option la plus rapide en 2026 pour l'inférence par batch sur RTX 4090, RTX 5090, H100/H200.
| Cas d'usage | Meilleur format | Pourquoi |
|---|---|---|
| Mono-utilisateur, poste, style ChatGPT | GGUF Q4_K_M | Offload CPU, couches GPU partielles, tourne partout |
| Apple Silicon (M1-M4) | GGUF Q4_K_M ou MLX 4 bits | Kernels Metal, mémoire unifiée |
| API en batch, >4 utilisateurs simultanés | AWQ 4 bits sur vLLM | Meilleur débit à batch élevé |
| Ampere ancien (A100, RTX 3090) | GPTQ 4 bits ou AWQ | Les deux marchent ; benchmarker sur son usage |
Questions fréquentes
Q4_K_M est-il vraiment le point d’équilibre, ou juste populaire ?
Les deux. Sur Llama 3.x, Qwen3, Mistral et Phi-4, il perd environ 1,5 point de MMLU face au FP16 tout en utilisant ~30 % de la VRAM. Q5_K_M améliore la qualité de moins de 1 point pour 18 % de mémoire en plus — rarement rentable sauf marge libre.
Quelle VRAM pour un modèle 70B ?
En Q4_K_M, environ 42 Go pour les poids plus 6-10 Go pour un cache KV à 8K. Cela tient sur une carte 48 Go (RTX 6000 Ada) ou deux cartes 24 Go (2×RTX 3090/4090). En Q2_K, ça descend à ~30 Go, mais la qualité chute nettement.
GGUF, GPTQ ou AWQ : lequel choisir ?
GGUF pour un usage mono-utilisateur sur poste ou Apple Silicon. AWQ pour du service API en batch sur GPU Ada, Hopper ou Blackwell. GPTQ reste un choix historique qui fonctionne encore sur Ampere mais rarement le plus rapide en 2026.
Quantifier le cache KV dégrade-t-il la qualité ?
Le cache KV en Q8_0 est quasiment gratuit — pas de perte mesurable. En Q4_0, on observe une petite hausse de perplexité (~2 %) mais c'est la différence entre tenir 128K de contexte ou non sur une carte 24 Go.
Les modèles MoE comme DeepSeek V3 sont-ils différents ?
Oui. Le stockage utilise le nombre total de paramètres, donc un MoE 671B a toujours besoin de centaines de Go même en Q4. La vitesse, elle, dépend des paramètres actifs (37B pour DeepSeek V3). Ne descendez jamais sous Q4_K_M sur un MoE : le routage s'effondre en dessous.
Comment vérifier qu’une quantification tient vraiment en VRAM ?
Lancez nvidia-smi -l 1 pendant la génération de 500 tokens. Si l'usage VRAM grimpe puis se stabilise, c'est bon. S'il plafonne et que les tokens/s s'effondrent, vous débordez sur la RAM système — descendez d'un niveau de quantification ou réduisez le contexte.
Envie d'aller plus loin ? Le calculateur de VRAM chiffre le besoin exact pour votre modèle, et notre guide Q4 vs Q5 vs Q8 détaille les tests de qualité.