RTX 5090 et LLM local : benchmarks complets 32 Go VRAM
La RTX 5090 est sortie en janvier 2025 avec 32 Go de GDDR7 et une bande passante de 1792 Go/s. Sur le papier, c'est le saut le plus significatif pour le LLM local depuis la 3090. Ce rtx 5090 benchmark llm local mesure ce que ça donne vraiment : 10 modèles testés sous Ollama et llama.cpp, comparaison directe avec 4090 et 3090, consommation au mur, et rapport prix/tokens. Tout est reproductible.
#Pourquoi ce benchmark
Depuis sa sortie, la RTX 5090 est positionnée comme la carte gaming ultime, mais c'est en LLM local qu'elle change vraiment la donne. Trois raisons : 32 Go de VRAM (au lieu de 24 sur la 4090), GDDR7 à 1792 Go/s (au lieu de 1008 Go/s sur la 4090), et un support natif FP4 sur les Tensor Cores de 5ᵉ génération.
Ces trois axes ne déplacent pas le curseur de la même façon. La bande passante détermine le débit en génération (tokens/sec). La VRAM détermine quels modèles rentrent sans offload. Le FP4 ne sert que si le runtime sait l'exploiter — ce qui n'est pas encore le cas par défaut dans Ollama mi-2026.
#32 Go GDDR7 : ce que ça change concrètement
Pour comprendre les résultats, il faut garder en tête une règle simple : un LLM en inférence est presque toujours memory-bound. Le temps de génération d'un token est dominé par le temps de lire tout le modèle depuis la VRAM. D'où la formule grossière mais utile :
Pour Llama 3.3 70B en Q4_K_M (~40 Go), la 5090 vise théoriquement 1792 / 40 ≈ 44 tok/s. La 4090 à 1008 / 40 ≈ 25 tok/s. La réalité tape entre 60 et 80 % de cette limite selon le runtime et le batch.
- VRAM 32 Go
- Suffisant pour Llama 70B Q4_K_M en GPU pur, sans offload CPU. C'est le seuil qui débloque la classe 70B sur une seule carte grand public.
- GDDR7 1792 Go/s
- +78 % de bande passante vs 4090. C'est le multiplicateur réel des tokens/sec sur les modèles denses.
- 21 760 CUDA cores
- Peu d'impact en inférence (le compute n'est pas le goulot), gros impact en prompt processing et fine-tuning.
- Tensor Cores FP4
- 5ᵉ génération, supporte FP4/FP6 nativement. Inutilisé par défaut dans Ollama 0.6.x, exploité par TensorRT-LLM et certains builds vLLM.
- TGP 575 W
- Carte calibrée pour 575 W en pleine charge gaming. En inférence LLM, on tourne entre 280 et 420 W selon le modèle.
#Méthodologie de test
Toutes les mesures ont été faites sur la même machine, dans la même version de drivers et de runtime. L'objectif est la reproductibilité.
- Plateforme
- Ryzen 9 7950X, 64 Go DDR5 6000, Windows 11 24H2, drivers NVIDIA 580.45.
- Runtimes
- Ollama 0.6.4 (backend llama.cpp), llama.cpp build b4900 compilé avec CUDA 12.8.
- Quantization par défaut
- Q4_K_M (le sweet spot qualité/VRAM recommandé sur QuelLLM).
- Prompt de test
- Génération de 512 tokens à partir d'un prompt de 128 tokens, température 0.7, top_p 0.9.
- Mesure
- Moyenne sur 5 runs après un warmup d'un run jeté. Tokens/sec = tokens générés / temps total de génération (hors prompt processing).
- Consommation
- Wattmètre Brennenstuhl PM 231 E branché entre la prise et l'alim, mesure à la prise (idle, charge, pic).
#Résultats sur 10 modèles
Tous les modèles ci-dessous tournent en GPU pur sur la 5090 (aucun offload CPU). C'est l'un des intérêts majeurs des 32 Go : on ne triche pas avec la RAM système. Tokens/sec en génération, Q4_K_M sauf mention contraire.
- Qwen3 8B
- 188 tok/s — VRAM utilisée 5,8 Go. Le modèle de tous les jours, qui sature presque le canal GDDR7.
- Llama 3.3 8B
- 175 tok/s — VRAM 5,4 Go. Légèrement plus lent que Qwen3 à cause d'une architecture moins compacte.
- Phi-4 14B
- 108 tok/s — VRAM 9,2 Go. Excellent rapport qualité/débit, recommandé en assistant local.
- Qwen3 14B
- 102 tok/s — VRAM 9,4 Go. Performances de raisonnement supérieures, avec le mode thinking activé le débit utile chute à ~70 tok/s.
- GLM-5 32B
- 55 tok/s — VRAM 19,8 Go. Très bonne qualité FR, premier modèle qui exploite franchement la VRAM en plus que la 4090.
- Mistral Small 3.2 24B
- 68 tok/s — VRAM 14,6 Go. Sweet spot pour usage pro francophone.
- DeepSeek R1 32B (distillé)
- 52 tok/s en sortie utile (raisonnement compris) — VRAM 19,5 Go. Avec le bloc <think>, débit perçu plus proche de 30 tok/s.
- Llama 4 Scout 17B-A2B (MoE)
- 142 tok/s — VRAM 17 Go (poids complets en VRAM, experts actifs ~2B). Le MoE explose les chiffres parce que seul un sous-ensemble est lu par token.
- Qwen3-Coder 30B-A3B (MoE)
- 135 tok/s — VRAM 18,5 Go. Le meilleur LLM de code local de cette gamme, en débit excellent.
- Llama 3.3 70B
- 23 tok/s — VRAM 40,8 Go (Q4_K_M tient juste en 32 Go avec --num-gpu 80 et KV cache en FP8). Le test signature de cette carte.
#RTX 5090 vs 4090 vs 3090
Mêmes modèles, mêmes paramètres, mêmes runtimes. 3090 et 4090 testées sur la même machine avec un swap de carte. Voici les écarts mesurés en génération pure (tok/s) :
- Llama 3.3 8B Q4
- 5090 : 175 · 4090 : 112 · 3090 : 78 — gain 5090/4090 = +56 %, 5090/3090 = +124 %.
- Phi-4 14B Q4
- 5090 : 108 · 4090 : 64 · 3090 : 46 — gain 5090/4090 = +69 %.
- GLM-5 32B Q4
- 5090 : 55 · 4090 : 31 · 3090 : 22 — gain 5090/4090 = +77 %, proche du ratio théorique de bande passante.
- Llama 4 Scout MoE
- 5090 : 142 · 4090 : 95 · 3090 : 71 — gain 5090/4090 = +49 %. Le MoE est moins memory-bound, donc moins de gain.
- Llama 3.3 70B Q4
- 5090 : 23 · 4090 : impossible en pur GPU (40 Go > 24) · 3090 : impossible en pur GPU. Sur 4090 avec offload CPU partiel : 8 tok/s.
À noter aussi : la 3090 d'occasion à 600-700 € reste un rapport perf/euro insolent pour un usage débutant à intermédiaire. La 4090 d'occasion à 1400-1600 € se justifie surtout pour qui veut 24 Go sans budget 5090.
#Consommation idle et charge
Mesures à la prise (machine complète, alim 1000 W Gold), GPU pilote uniquement, écran éteint.
- Idle (modèle chargé, pas de génération)
- Machine 95 W au total dont GPU ~22 W. La 5090 sait bien se mettre en veille quand Ollama garde le modèle mais ne génère pas.
- Inférence 8B Q4
- Pic à 285 W au mur (GPU ~210 W). La carte ne monte pas à fond car le modèle est petit et le canal GDDR7 saturé avant le compute.
- Inférence 32B Q4
- Pic à 380 W au mur (GPU ~305 W). Le sweet spot conso/utilité.
- Inférence 70B Q4
- Pic à 470 W au mur (GPU ~395 W). On reste sous les 575 W de TGP nominale.
- Prompt processing (batch 4096 tokens)
- Pic à 595 W au mur (GPU ~520 W). C'est là que la 5090 cogne — le compute FP16/BF16 explose lors du remplissage de KV cache.
#Rapport prix / tokens
Calcul brutal : prix de la carte divisé par tokens/sec sur un modèle de référence. C'est imparfait (on ignore l'amortissement, l'électricité, l'usage réel), mais ça donne une boussole.
- RTX 5090 neuve (~2 400 €)
- Sur Llama 8B : 13,7 €/(tok/s). Sur 70B Q4 : 104 €/(tok/s). Sur 32B : 43,6 €/(tok/s).
- RTX 4090 neuve (~1 900 €)
- Sur Llama 8B : 16,9 €/(tok/s). Sur 70B Q4 : pas applicable (offload). Sur 32B : 61,3 €/(tok/s).
- RTX 4090 occasion (~1 500 €)
- Sur Llama 8B : 13,4 €/(tok/s). Compétitive pour qui n'a pas besoin des 32 Go.
- RTX 3090 occasion (~650 €)
- Sur Llama 8B : 8,3 €/(tok/s). Imbattable en perf/euro pour l'amateur.
- Mac Studio M4 Ultra 64 Go (~5 200 €)
- Sur Llama 8B : 53 €/(tok/s) — référence pour rappel : sur les gros modèles 70B+, le Mac rattrape grâce à sa mémoire unifiée.
Conclusion chiffrée : la 5090 n'est pas la carte la plus rentable en €/tok/sec sur les petits modèles. Elle devient incontournable au-delà de 32B, et indispensable si on vise du 70B en GPU pur.
#Verdict : pour qui ?
- Vous tournez sur du 8B–14B Q4 quotidien
- La 5090 est du gâchis. Une 3090 d'occasion ou une 4070 Ti Super 16 Go fait mieux en €/perf.
- Vous voulez du 32B à pleine vitesse
- C'est le sweet spot de la 5090. 55 tok/s sur GLM-5 32B en GPU pur, c'est une expérience radicalement différente.
- Vous visez Llama 70B ou Qwen3 72B en local
- Achat justifié. La 4090 vous force à offloader (8 tok/s, douloureux), la 5090 reste fluide (23 tok/s).
- Vous faites du fine-tuning LoRA / QLoRA
- Carte excellente. Les 32 Go permettent des batch sizes plus grands, et le FP4 commencera à être exploité côté training en 2026.
- Vous montez un serveur multi-utilisateurs (équipe)
- Une 5090 unique > deux 4090 en pratique : plus simple, moins de NVLink à gérer, contexte unifié pour batching vLLM.
#Pour aller plus loin
Ce benchmark ouvre trois pistes utiles pour pousser plus loin :
- Affiner sa quantization
- Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" explique pourquoi Q4_K_M reste le compromis recommandé et quand monter en Q5 sur 32 Go.
- Comparer avec les autres GPU
- Le guide "Choisir son GPU pour l'IA locale" couvre l'ensemble 3000/4000/5000 et l'Apple Silicon, utile avant achat.
- Pousser les très gros modèles
- Le guide "DeepSeek V3.2 en local" montre la méthode pour aller au-delà de ce que la VRAM permet seule (offload RAM/SSD), pertinent si la 5090 sert de base pour du 671B.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.