◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →

Outil · calcul instantané

Calculateur de VRAM pour LLM

Combien de mémoire GPU un LLM local demande-t-il vraiment ? Poids + cache KV + overhead, en une estimation honnête.

La règle : VRAM ≈ paramètres (Md) × octets par poids + cache KV + ~20 % d'overhead. En Q4, c'est environ 0,55-0,6 Go par milliard de paramètres ; en FP16, 2 Go par milliard. Un contexte plus long fait grossir le cache KV bien au-delà des 20 %.

Estimation = poids × (1 + 0,2 × contexte/8K). Heuristique pour modèle dense ; les modèles MoE (mixture of experts) activent moins de poids par token et peuvent se comporter mieux que leur taille ne le suggère. Gardez toujours 1-2 Go de marge pour l'OS et l'affichage.

VRAM nécessaire par taille de modèle (contexte 8K)

TailleQ4_K_MQ8_0FP16Tient sur (Q4)
7B4,9 Go9,0 Go16,8 GoCartes 8 Go (RTX 3050, 4060)
9B6,3 Go11,6 Go21,6 GoCartes 8-12 Go
14B9,7 Go18,0 Go33,6 GoCartes 12-16 Go
27B18,8 Go34,7 Go64,8 GoCartes 24 Go (RTX 3090/4090)
32B22,3 Go41,1 Go76,8 GoCartes 24 Go, contexte court
70B48,7 Go89,9 Go168,0 Go48 Go+ ou double GPU 24 Go

Chiffres incluant la marge de 20 % cache KV/overhead à un contexte 8K, arrondis au dixième de Go.

Et maintenant, choisir le modèle

Connaître son budget n'est que la moitié du chemin. Le configurateur matériel associe des modèles réels à votre GPU ou Mac exact ; le leaderboard des LLM locaux classe tous les modèles exécutables en local ; et les classements par palier vont droit au but : meilleur LLM pour 8 Go de VRAM, RTX 4090, Mac 16 Go. Vous hésitez entre cloud et local ? Faites le calcul avec le calculateur de coût.

Questions fréquentes

Combien de VRAM par milliard de paramètres ?

Environ 2 Go par milliard en FP16, 1,1 Go par milliard en Q8, et 0,55-0,6 Go par milliard en quantification Q4. Ajoutez ~20 % pour le cache KV et l'overhead à un contexte standard de 8K, plus pour un contexte plus long.

8 Go de VRAM suffisent-ils pour un LLM local ?

Oui. En Q4, un modèle 8-9B (environ 5-6 Go de poids) tient entièrement sur un GPU 8 Go avec de la marge pour le contexte. Voir notre classement des meilleurs LLM pour 8 Go de VRAM.

Un GPU 24 Go (RTX 3090/4090) peut-il faire tourner un modèle 32B ?

Oui, en Q4 un modèle dense 32B nécessite environ 20-22 Go, ce qui tient sur une carte 24 Go avec un contexte court. Pour un contexte long, un modèle 27B est plus prudent.

La mémoire unifiée d’un Mac compte-t-elle comme de la VRAM ?

Les Mac Apple Silicon partagent un pool unique de mémoire unifiée entre CPU et GPU : un Mac 32 Go peut donc charger des modèles plus gros qu'un GPU dédié 16 Go — mais réservez 8-10 Go pour macOS lui-même.