Outil · calcul instantané
Calculateur de VRAM pour LLM
Combien de mémoire GPU un LLM local demande-t-il vraiment ? Poids + cache KV + overhead, en une estimation honnête.
La règle : VRAM ≈ paramètres (Md) × octets par poids + cache KV + ~20 % d'overhead. En Q4, c'est environ 0,55-0,6 Go par milliard de paramètres ; en FP16, 2 Go par milliard. Un contexte plus long fait grossir le cache KV bien au-delà des 20 %.
Estimation = poids × (1 + 0,2 × contexte/8K). Heuristique pour modèle dense ; les modèles MoE (mixture of experts) activent moins de poids par token et peuvent se comporter mieux que leur taille ne le suggère. Gardez toujours 1-2 Go de marge pour l'OS et l'affichage.
VRAM nécessaire par taille de modèle (contexte 8K)
| Taille | Q4_K_M | Q8_0 | FP16 | Tient sur (Q4) |
|---|---|---|---|---|
| 7B | 4,9 Go | 9,0 Go | 16,8 Go | Cartes 8 Go (RTX 3050, 4060) |
| 9B | 6,3 Go | 11,6 Go | 21,6 Go | Cartes 8-12 Go |
| 14B | 9,7 Go | 18,0 Go | 33,6 Go | Cartes 12-16 Go |
| 27B | 18,8 Go | 34,7 Go | 64,8 Go | Cartes 24 Go (RTX 3090/4090) |
| 32B | 22,3 Go | 41,1 Go | 76,8 Go | Cartes 24 Go, contexte court |
| 70B | 48,7 Go | 89,9 Go | 168,0 Go | 48 Go+ ou double GPU 24 Go |
Chiffres incluant la marge de 20 % cache KV/overhead à un contexte 8K, arrondis au dixième de Go.
Et maintenant, choisir le modèle
Connaître son budget n'est que la moitié du chemin. Le configurateur matériel associe des modèles réels à votre GPU ou Mac exact ; le leaderboard des LLM locaux classe tous les modèles exécutables en local ; et les classements par palier vont droit au but : meilleur LLM pour 8 Go de VRAM, RTX 4090, Mac 16 Go. Vous hésitez entre cloud et local ? Faites le calcul avec le calculateur de coût.
Questions fréquentes
Combien de VRAM par milliard de paramètres ?
Environ 2 Go par milliard en FP16, 1,1 Go par milliard en Q8, et 0,55-0,6 Go par milliard en quantification Q4. Ajoutez ~20 % pour le cache KV et l'overhead à un contexte standard de 8K, plus pour un contexte plus long.
8 Go de VRAM suffisent-ils pour un LLM local ?
Oui. En Q4, un modèle 8-9B (environ 5-6 Go de poids) tient entièrement sur un GPU 8 Go avec de la marge pour le contexte. Voir notre classement des meilleurs LLM pour 8 Go de VRAM.
Un GPU 24 Go (RTX 3090/4090) peut-il faire tourner un modèle 32B ?
Oui, en Q4 un modèle dense 32B nécessite environ 20-22 Go, ce qui tient sur une carte 24 Go avec un contexte court. Pour un contexte long, un modèle 27B est plus prudent.
La mémoire unifiée d’un Mac compte-t-elle comme de la VRAM ?
Les Mac Apple Silicon partagent un pool unique de mémoire unifiée entre CPU et GPU : un Mac 32 Go peut donc charger des modèles plus gros qu'un GPU dédié 16 Go — mais réservez 8-10 Go pour macOS lui-même.