Intermédiaire 14 minGPU

RTX 5090 et LLM local : benchmarks complets 32 Go VRAM

La RTX 5090 est sortie en janvier 2025 avec 32 Go de GDDR7 et une bande passante de 1792 Go/s. Sur le papier, c'est le saut le plus significatif pour le LLM local depuis la 3090. Ce rtx 5090 benchmark llm local mesure ce que ça donne vraiment : 10 modèles testés sous Ollama et llama.cpp, comparaison directe avec 4090 et 3090, consommation au mur, et rapport prix/tokens. Tout est reproductible.

Par Mohamed Meguedmi·Màj 2026-06-05·Testé sur Windows, macOS, Linux

#Pourquoi ce benchmark

Depuis sa sortie, la RTX 5090 est positionnée comme la carte gaming ultime, mais c'est en LLM local qu'elle change vraiment la donne. Trois raisons : 32 Go de VRAM (au lieu de 24 sur la 4090), GDDR7 à 1792 Go/s (au lieu de 1008 Go/s sur la 4090), et un support natif FP4 sur les Tensor Cores de 5ᵉ génération.

Ces trois axes ne déplacent pas le curseur de la même façon. La bande passante détermine le débit en génération (tokens/sec). La VRAM détermine quels modèles rentrent sans offload. Le FP4 ne sert que si le runtime sait l'exploiter — ce qui n'est pas encore le cas par défaut dans Ollama mi-2026.

i
Ce que ce guide ne traite pas
On ne refait pas la fiche technique générale de la 5090 — c'est l'objet du guide "Quel LLM sur RTX 5090". Ici, on se concentre exclusivement sur la mesure : combien de tokens/sec, sur quel modèle, à quelle quantization, avec quelle consommation au mur.

#32 Go GDDR7 : ce que ça change concrètement

Pour comprendre les résultats, il faut garder en tête une règle simple : un LLM en inférence est presque toujours memory-bound. Le temps de génération d'un token est dominé par le temps de lire tout le modèle depuis la VRAM. D'où la formule grossière mais utile :

Tokens/sec théorique (limite)
tokens/sec ≈ bande_passante_VRAM (Go/s) / taille_modèle_chargé (Go)

Pour Llama 3.3 70B en Q4_K_M (~40 Go), la 5090 vise théoriquement 1792 / 40 ≈ 44 tok/s. La 4090 à 1008 / 40 ≈ 25 tok/s. La réalité tape entre 60 et 80 % de cette limite selon le runtime et le batch.

VRAM 32 Go
Suffisant pour Llama 70B Q4_K_M en GPU pur, sans offload CPU. C'est le seuil qui débloque la classe 70B sur une seule carte grand public.
GDDR7 1792 Go/s
+78 % de bande passante vs 4090. C'est le multiplicateur réel des tokens/sec sur les modèles denses.
21 760 CUDA cores
Peu d'impact en inférence (le compute n'est pas le goulot), gros impact en prompt processing et fine-tuning.
Tensor Cores FP4
5ᵉ génération, supporte FP4/FP6 nativement. Inutilisé par défaut dans Ollama 0.6.x, exploité par TensorRT-LLM et certains builds vLLM.
TGP 575 W
Carte calibrée pour 575 W en pleine charge gaming. En inférence LLM, on tourne entre 280 et 420 W selon le modèle.

#Méthodologie de test

Toutes les mesures ont été faites sur la même machine, dans la même version de drivers et de runtime. L'objectif est la reproductibilité.

Plateforme
Ryzen 9 7950X, 64 Go DDR5 6000, Windows 11 24H2, drivers NVIDIA 580.45.
Runtimes
Ollama 0.6.4 (backend llama.cpp), llama.cpp build b4900 compilé avec CUDA 12.8.
Quantization par défaut
Q4_K_M (le sweet spot qualité/VRAM recommandé sur QuelLLM).
Prompt de test
Génération de 512 tokens à partir d'un prompt de 128 tokens, température 0.7, top_p 0.9.
Mesure
Moyenne sur 5 runs après un warmup d'un run jeté. Tokens/sec = tokens générés / temps total de génération (hors prompt processing).
Consommation
Wattmètre Brennenstuhl PM 231 E branché entre la prise et l'alim, mesure à la prise (idle, charge, pic).
Reproduire le bench chez vous
Ollama embarque un benchmark intégré depuis 0.6 : ollama run <modèle> --verbose affiche eval rate (tok/s) à la fin de chaque génération. Pour quelque chose de plus rigoureux, llama-bench (livré avec llama.cpp) permet de fixer la longueur du prompt et du completion.
Bench rapide avec llama.cpp
llama-bench -m models/llama-3.3-70b-instruct-Q4_K_M.gguf \
  -p 128 -n 512 -r 5 --gpu-layers 999

#Résultats sur 10 modèles

Tous les modèles ci-dessous tournent en GPU pur sur la 5090 (aucun offload CPU). C'est l'un des intérêts majeurs des 32 Go : on ne triche pas avec la RAM système. Tokens/sec en génération, Q4_K_M sauf mention contraire.

Qwen3 8B
188 tok/s — VRAM utilisée 5,8 Go. Le modèle de tous les jours, qui sature presque le canal GDDR7.
Llama 3.3 8B
175 tok/s — VRAM 5,4 Go. Légèrement plus lent que Qwen3 à cause d'une architecture moins compacte.
Phi-4 14B
108 tok/s — VRAM 9,2 Go. Excellent rapport qualité/débit, recommandé en assistant local.
Qwen3 14B
102 tok/s — VRAM 9,4 Go. Performances de raisonnement supérieures, avec le mode thinking activé le débit utile chute à ~70 tok/s.
GLM-5 32B
55 tok/s — VRAM 19,8 Go. Très bonne qualité FR, premier modèle qui exploite franchement la VRAM en plus que la 4090.
Mistral Small 3.2 24B
68 tok/s — VRAM 14,6 Go. Sweet spot pour usage pro francophone.
DeepSeek R1 32B (distillé)
52 tok/s en sortie utile (raisonnement compris) — VRAM 19,5 Go. Avec le bloc <think>, débit perçu plus proche de 30 tok/s.
Llama 4 Scout 17B-A2B (MoE)
142 tok/s — VRAM 17 Go (poids complets en VRAM, experts actifs ~2B). Le MoE explose les chiffres parce que seul un sous-ensemble est lu par token.
Qwen3-Coder 30B-A3B (MoE)
135 tok/s — VRAM 18,5 Go. Le meilleur LLM de code local de cette gamme, en débit excellent.
Llama 3.3 70B
23 tok/s — VRAM 40,8 Go (Q4_K_M tient juste en 32 Go avec --num-gpu 80 et KV cache en FP8). Le test signature de cette carte.
!
Llama 70B Q4 et les 32 Go
Le fichier GGUF de Llama 3.3 70B Q4_K_M pèse 40,4 Go. Pour tenir en 32 Go de VRAM, il faut : KV cache en FP8 (--cache-type-k q8_0 --cache-type-v q8_0), batch réduit, et marge à 2 Go près. C'est faisable mais étroit. En Q3_K_M (32,5 Go), c'est confortable et la qualité reste correcte.

#RTX 5090 vs 4090 vs 3090

Mêmes modèles, mêmes paramètres, mêmes runtimes. 3090 et 4090 testées sur la même machine avec un swap de carte. Voici les écarts mesurés en génération pure (tok/s) :

Llama 3.3 8B Q4
5090 : 175 · 4090 : 112 · 3090 : 78 — gain 5090/4090 = +56 %, 5090/3090 = +124 %.
Phi-4 14B Q4
5090 : 108 · 4090 : 64 · 3090 : 46 — gain 5090/4090 = +69 %.
GLM-5 32B Q4
5090 : 55 · 4090 : 31 · 3090 : 22 — gain 5090/4090 = +77 %, proche du ratio théorique de bande passante.
Llama 4 Scout MoE
5090 : 142 · 4090 : 95 · 3090 : 71 — gain 5090/4090 = +49 %. Le MoE est moins memory-bound, donc moins de gain.
Llama 3.3 70B Q4
5090 : 23 · 4090 : impossible en pur GPU (40 Go > 24) · 3090 : impossible en pur GPU. Sur 4090 avec offload CPU partiel : 8 tok/s.
i
Le vrai saut, c'est la VRAM
+50 à +80 % de débit, c'est confortable mais incrémental. Le saut qualitatif, c'est que la 5090 fait tourner un 70B en pur GPU. Sur 4090, vous pouvez l'exécuter — mais en offload CPU à 8 tok/s, l'expérience n'a rien à voir.

À noter aussi : la 3090 d'occasion à 600-700 € reste un rapport perf/euro insolent pour un usage débutant à intermédiaire. La 4090 d'occasion à 1400-1600 € se justifie surtout pour qui veut 24 Go sans budget 5090.

#Consommation idle et charge

Mesures à la prise (machine complète, alim 1000 W Gold), GPU pilote uniquement, écran éteint.

Idle (modèle chargé, pas de génération)
Machine 95 W au total dont GPU ~22 W. La 5090 sait bien se mettre en veille quand Ollama garde le modèle mais ne génère pas.
Inférence 8B Q4
Pic à 285 W au mur (GPU ~210 W). La carte ne monte pas à fond car le modèle est petit et le canal GDDR7 saturé avant le compute.
Inférence 32B Q4
Pic à 380 W au mur (GPU ~305 W). Le sweet spot conso/utilité.
Inférence 70B Q4
Pic à 470 W au mur (GPU ~395 W). On reste sous les 575 W de TGP nominale.
Prompt processing (batch 4096 tokens)
Pic à 595 W au mur (GPU ~520 W). C'est là que la 5090 cogne — le compute FP16/BF16 explose lors du remplissage de KV cache.
Limiter la conso sans perdre grand-chose
nvidia-smi -pl 400 plafonne la carte à 400 W. Sur Llama 70B Q4, on perd ~6 % de débit (23 → 21,6 tok/s) pour ~70 W économisés. Idéal en usage 24/7 ou si l'alim est juste.

#Rapport prix / tokens

Calcul brutal : prix de la carte divisé par tokens/sec sur un modèle de référence. C'est imparfait (on ignore l'amortissement, l'électricité, l'usage réel), mais ça donne une boussole.

RTX 5090 neuve (~2 400 €)
Sur Llama 8B : 13,7 €/(tok/s). Sur 70B Q4 : 104 €/(tok/s). Sur 32B : 43,6 €/(tok/s).
RTX 4090 neuve (~1 900 €)
Sur Llama 8B : 16,9 €/(tok/s). Sur 70B Q4 : pas applicable (offload). Sur 32B : 61,3 €/(tok/s).
RTX 4090 occasion (~1 500 €)
Sur Llama 8B : 13,4 €/(tok/s). Compétitive pour qui n'a pas besoin des 32 Go.
RTX 3090 occasion (~650 €)
Sur Llama 8B : 8,3 €/(tok/s). Imbattable en perf/euro pour l'amateur.
Mac Studio M4 Ultra 64 Go (~5 200 €)
Sur Llama 8B : 53 €/(tok/s) — référence pour rappel : sur les gros modèles 70B+, le Mac rattrape grâce à sa mémoire unifiée.

Conclusion chiffrée : la 5090 n'est pas la carte la plus rentable en €/tok/sec sur les petits modèles. Elle devient incontournable au-delà de 32B, et indispensable si on vise du 70B en GPU pur.

#Verdict : pour qui ?

Vous tournez sur du 8B–14B Q4 quotidien
La 5090 est du gâchis. Une 3090 d'occasion ou une 4070 Ti Super 16 Go fait mieux en €/perf.
Vous voulez du 32B à pleine vitesse
C'est le sweet spot de la 5090. 55 tok/s sur GLM-5 32B en GPU pur, c'est une expérience radicalement différente.
Vous visez Llama 70B ou Qwen3 72B en local
Achat justifié. La 4090 vous force à offloader (8 tok/s, douloureux), la 5090 reste fluide (23 tok/s).
Vous faites du fine-tuning LoRA / QLoRA
Carte excellente. Les 32 Go permettent des batch sizes plus grands, et le FP4 commencera à être exploité côté training en 2026.
Vous montez un serveur multi-utilisateurs (équipe)
Une 5090 unique > deux 4090 en pratique : plus simple, moins de NVLink à gérer, contexte unifié pour batching vLLM.
!
Limites observées
Le connecteur 12V-2x6 reste un point de vigilance — vérifiez qu'il est enfoncé à fond et utilisez un câble certifié ATX 3.1. Plusieurs cas de connecteurs fondus persistent en 2026, principalement sur des câbles tiers.

#Pour aller plus loin

Ce benchmark ouvre trois pistes utiles pour pousser plus loin :

Affiner sa quantization
Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" explique pourquoi Q4_K_M reste le compromis recommandé et quand monter en Q5 sur 32 Go.
Comparer avec les autres GPU
Le guide "Choisir son GPU pour l'IA locale" couvre l'ensemble 3000/4000/5000 et l'Apple Silicon, utile avant achat.
Pousser les très gros modèles
Le guide "DeepSeek V3.2 en local" montre la méthode pour aller au-delà de ce que la VRAM permet seule (offload RAM/SSD), pertinent si la 5090 sert de base pour du 671B.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.