◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →

Méthodologie · mise à jour 2026

Recommandeur de quantification

Un guide qui associe votre budget VRAM exact à la quantification GGUF, GPTQ ou AWQ optimale — sans tâtonnement, sans mémoire gaspillée.

Formule de base : VRAM_Go = (Paramètres_Md × Bits / 8) × 1,2. Le multiplicateur 1,2 absorbe le cache KV et l'overhead d'activation à un contexte de 8K.

Le choix en 30 secondes

Repérez votre VRAM disponible ci-dessous, puis lisez le plus gros modèle et la quantification qui tiennent avec un contexte 8K. Chiffres basés sur les réglages par défaut de llama.cpp/Ollama, cache KV Q4_K_M.

VRAMGPU typiqueModèle + quant recommandésMarge 16K
6 GoRTX 3060 6 Go, RTX 4050 laptopLlama 3.2 3B Q5_K_M, ou Qwen3 7B Q3_K_MJuste — repasser en Q4_K_S
8 GoRTX 3050 8 Go, RTX 4060, M2 8 GoQwen3 7B Q5_K_M, Llama 3.1 8B Q4_K_MOK en Q4_K_M
12 GoRTX 3060 12 Go, RTX 4070Qwen3-Coder 14B Q5_K_M, Mistral Small 3 Q4_K_MBonne
16 GoRTX 4060 Ti 16 Go, RTX 5060 TiQwen3 14B Q6_K, Phi-4 14B Q8_0Excellente
24 GoRTX 3090, RTX 4090, RTX 5080Qwen3-Coder 32B Q4_K_M, Llama 3.3 70B Q2_KTient en 32K
32 GoRTX 5090, M4 MaxQwen3 32B Q6_K, Llama 3.3 70B Q3_K_MTient en 64K
48 GoRTX 6000 Ada, 2×3090Llama 3.3 70B Q4_K_M, Qwen3 72B Q4_K_STient en 32K
80 GoH100, H200, A100 80 GoLlama 3.3 70B Q8_0, DeepSeek V3 Lite Q4_K_MPrêt pour la prod

Le calcul derrière la recommandation

La quantification compresse chaque poids de FP16 (16 bits) jusqu'à 2-8 bits. Un modèle 7B en Q4_K_M utilise en moyenne ~4,5 bits/poids, soit 7 000 000 000 × 4,5 / 8 ≈ 3,94 Go. En ajoutant le cache KV (qui grandit avec le contexte et la dimension cachée), on atterrit vers 5,5 Go à 8K de contexte. Pour un contexte long, le cache KV domine largement le multiplicateur ×1,2.

Référence bits par poids

QuantBits/poids effectifsVRAM (8B)VRAM (32B)VRAM (70B)
FP1616,016,0 Go64,0 Go140,0 Go
Q8_08,58,5 Go34,0 Go74,4 Go
Q6_K6,66,6 Go26,4 Go57,8 Go
Q5_K_M5,75,7 Go22,8 Go49,9 Go
Q4_K_M4,834,83 Go19,3 Go42,3 Go
Q4_K_S4,584,58 Go18,3 Go40,1 Go
Q3_K_M3,93,9 Go15,6 Go34,1 Go
Q2_K3,353,35 Go13,4 Go29,3 Go

Perte de qualité : ce que disent vraiment les chiffres

Le pattern est cohérent sur les familles Llama 3.x, Qwen3 et Mistral : la falaise entre Q4_K_M et Q3_K_M est réelle, et le gain de Q5 à Q6 est presque toujours invisible en production.

QuantΔ MMLU vs FP16Δ HumanEvalVerdict
Q8_0-0,1 pt-0,0 ptIndiscernable
Q6_K-0,3 pt-0,4 ptQuasi sans perte
Q5_K_M-0,7 pt-0,9 ptExcellent
Q4_K_M-1,5 pt-1,8 ptPoint d'équilibre
Q4_K_S-2,1 pt-2,6 ptAcceptable
Q3_K_M-4,4 pt-6,1 ptPerceptible
Q2_K-9,8 pt-14,3 ptDernier recours
Un 14B en Q4_K_M bat un 8B en Q8_0 sur tous les benchmarks de raisonnement et de code que nous avons suivis. Dans le doute, montez en paramètres, pas en bits.

GGUF, GPTQ ou AWQ : le bon format, pas seulement le bon nombre de bits

GGUF (llama.cpp / Ollama / LM Studio) : le défaut pour l'inférence mono-utilisateur, l'offload CPU et Apple Silicon. GPTQ : 4 bits, inférence GPU pur avec vLLM/TGI. AWQ : 4 bits, GPU pur — l'option la plus rapide en 2026 pour l'inférence par batch sur RTX 4090, RTX 5090, H100/H200.

Cas d'usageMeilleur formatPourquoi
Mono-utilisateur, poste, style ChatGPTGGUF Q4_K_MOffload CPU, couches GPU partielles, tourne partout
Apple Silicon (M1-M4)GGUF Q4_K_M ou MLX 4 bitsKernels Metal, mémoire unifiée
API en batch, >4 utilisateurs simultanésAWQ 4 bits sur vLLMMeilleur débit à batch élevé
Ampere ancien (A100, RTX 3090)GPTQ 4 bits ou AWQLes deux marchent ; benchmarker sur son usage

Questions fréquentes

Q4_K_M est-il vraiment le point d’équilibre, ou juste populaire ?

Les deux. Sur Llama 3.x, Qwen3, Mistral et Phi-4, il perd environ 1,5 point de MMLU face au FP16 tout en utilisant ~30 % de la VRAM. Q5_K_M améliore la qualité de moins de 1 point pour 18 % de mémoire en plus — rarement rentable sauf marge libre.

Quelle VRAM pour un modèle 70B ?

En Q4_K_M, environ 42 Go pour les poids plus 6-10 Go pour un cache KV à 8K. Cela tient sur une carte 48 Go (RTX 6000 Ada) ou deux cartes 24 Go (2×RTX 3090/4090). En Q2_K, ça descend à ~30 Go, mais la qualité chute nettement.

GGUF, GPTQ ou AWQ : lequel choisir ?

GGUF pour un usage mono-utilisateur sur poste ou Apple Silicon. AWQ pour du service API en batch sur GPU Ada, Hopper ou Blackwell. GPTQ reste un choix historique qui fonctionne encore sur Ampere mais rarement le plus rapide en 2026.

Quantifier le cache KV dégrade-t-il la qualité ?

Le cache KV en Q8_0 est quasiment gratuit — pas de perte mesurable. En Q4_0, on observe une petite hausse de perplexité (~2 %) mais c'est la différence entre tenir 128K de contexte ou non sur une carte 24 Go.

Les modèles MoE comme DeepSeek V3 sont-ils différents ?

Oui. Le stockage utilise le nombre total de paramètres, donc un MoE 671B a toujours besoin de centaines de Go même en Q4. La vitesse, elle, dépend des paramètres actifs (37B pour DeepSeek V3). Ne descendez jamais sous Q4_K_M sur un MoE : le routage s'effondre en dessous.

Comment vérifier qu’une quantification tient vraiment en VRAM ?

Lancez nvidia-smi -l 1 pendant la génération de 500 tokens. Si l'usage VRAM grimpe puis se stabilise, c'est bon. S'il plafonne et que les tokens/s s'effondrent, vous débordez sur la RAM système — descendez d'un niveau de quantification ou réduisez le contexte.

Envie d'aller plus loin ? Le calculateur de VRAM chiffre le besoin exact pour votre modèle, et notre guide Q4 vs Q5 vs Q8 détaille les tests de qualité.