Quel LLM sur RTX 5090 (32 Go) ?
La RTX 5090 (janvier 2025) est la carte grand public la plus puissante jamais sortie pour l'IA locale. 32 Go de VRAM GDDR7, 1792 Go/s de bande passante, 21 760 cœurs CUDA et un support FP4 natif via les nouveaux Tensor Cores de 5ᵉ génération. Elle fait tourner Llama 3.3 70B Q4 à 22-28 tokens/seconde, un modèle réservé jusqu'ici à du multi-GPU. Ce guide couvre quels LLM installer, les benchmarks mesurés, et les optimisations spécifiques Blackwell.
#La RTX 5090 pour l'IA locale
- Architecture
- Blackwell (GB202), gravure TSMC 4NP. 92 milliards de transistors.
- VRAM
- 32 Go GDDR7 à 28 Gbps sur bus 512 bits. Bande passante 1792 Go/s (+78 % vs 4090).
- Cœurs CUDA
- 21 760. Tensor Cores 5ᵉ gen avec support FP4 natif. RT Cores 4ᵉ gen.
- TDP
- 575 W. Alim recommandée 1000 W. Connecteur 12V-2×6 (nouvelle norme).
- Prix MSRP
- 2329 € TTC au lancement (janvier 2025). Stocks fluctuants en 2026.
#1. Modèles compatibles
| Modèle | Quant | VRAM | Tokens/sec | Verdict |
|---|---|---|---|---|
| Mistral 7B | Q4_K_M | 5 Go | 130-145 | Trivial, luxe de pouvoir tenir 10 en parallèle |
| Llama 3.1 8B | Q4_K_M | 5,5 Go | 115-130 | Excellent pour chat rapide |
| Qwen 2.5 Coder 7B | Q6_K | 7 Go | 95-110 | Q6 quasi-FP16 pour du code |
| Phi-4 14B | Q5_K_M | 11 Go | 65-75 | Contexte 16k tenable |
| Qwen 2.5 14B | Q8_0 | 16 Go | 52-60 | Pleine qualité à vitesse correcte |
| Mistral Small 24B | Q6_K | 20 Go | 38-45 | Sweet spot qualité/vitesse sur 5090 |
| Qwen 2.5 32B | Q5_K_M | 23 Go | 32-38 | Reasoning rapide |
| Llama 3.3 70B | Q4_K_M | 42 Go | 22-28 | Offload partiel VRAM+RAM, usable |
| DeepSeek-R1-Distill 70B | Q4_K_M | 42 Go | 21-26 | Raisonnement, mode CoT |
| Llama 3.3 70B | IQ3_M | 30 Go | 30-36 | Tout en VRAM, qualité légèrement moindre |
#2. Installation Ollama + CUDA
La RTX 5090 nécessite les drivers NVIDIA 570+ et CUDA 12.8+. Les versions antérieures ne reconnaissent pas le GPU.
- 01Installez les drivers NVIDIA 570+ (Windows)Via GeForce Experience ou le site nvidia.com/drivers. Redémarrez.
- 02Installez CUDA 12.8+ (optionnel pour Ollama, requis pour llama.cpp from source)developer.nvidia.com/cuda-downloads. Ollama embarque sa propre version de CUDA.
- 03Installez OllamaTéléchargez depuis ollama.com/download, installer Windows ou script macOS/Linux. Ollama ≥ 0.5.x supporte Blackwell.
- 04Vérifiez la détection GPUDans un terminal : ollama run mistral puis dans une autre fenêtre : ollama ps. La colonne PROCESSOR doit indiquer 100% GPU.
#3. Benchmarks tokens/sec
Mesures effectuées sur RTX 5090 FE, driver 572.16, Windows 11 24H2, Ryzen 9 9950X, 64 Go DDR5 6400. Prompt : génération de 500 tokens, moyenne sur 5 runs.
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 | FP16 |
|---|---|---|---|---|---|
| Mistral 7B | 138 t/s | 125 t/s | 115 t/s | 95 t/s | 72 t/s |
| Llama 3.1 8B | 122 t/s | 110 t/s | 100 t/s | 82 t/s | 62 t/s |
| Phi-4 14B | 72 t/s | 65 t/s | 58 t/s | 48 t/s | — |
| Qwen 2.5 32B | 38 t/s | 35 t/s | 31 t/s | 24 t/s | — |
| Mistral Small 24B | 48 t/s | 44 t/s | 40 t/s | 32 t/s | — |
#4. Optimisations Blackwell
- NVFP4 (FP4 natif)
- Les Tensor Cores 5ᵉ gen décodent FP4 sans conversion. Gain typique : +40 % vs Q4_K_M sur modèles supportés (TensorRT-LLM 0.18+, vLLM 0.7+).
- Flash Attention v3
- Automatique dans llama.cpp master. +10-15 % sur contextes longs, -20 % de VRAM cache KV.
- KV cache quantization
- Avec -ctk q8_0 -ctv q8_0 : contexte 128k sur un 14B tient en moins de 20 Go. Perte qualité : négligeable.
- Batch parallèle
- Un serveur Ollama peut tenir 8-12 conversations concurrentes d'un 7B sans effondrer la latence. Idéal pour équipe.
#5. RTX 5090 vs 4090 vs 5080
| Critère | RTX 5090 | RTX 4090 | RTX 5080 |
|---|---|---|---|
| VRAM | 32 Go GDDR7 | 24 Go GDDR6X | 16 Go GDDR7 |
| Bande passante | 1792 Go/s | 1008 Go/s | 960 Go/s |
| Mistral 7B Q4 | 138 t/s | 110 t/s | 102 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | — |
| Prix (2026) | ~2500 € | ~1800 € occasion | ~1300 € |
| Verdict LLM | 70B accessibles | Référence 30B | Excellent 14B |
#Limites et pièges
- Consommation
- 575 W TDP sous charge sustainable. Votre alim doit pouvoir fournir ~700 W en crête. Un 750 W de qualité suffit en pratique, 1000 W recommandé pour marge.
- Connecteur 12V-2×6
- Nouveau standard. Si votre alim ATX 3.0 est ancienne, vérifiez le câble — les cas de fonte existent sur mauvaise insertion. Adaptateur fourni dans la boîte.
- Pilotes jeunes (2025)
- Certains bugs sous Linux sur kernel < 6.11 et drivers < 570.86. Mettre à jour systématiquement.
- Disponibilité
- Scalping et stock serré jusqu'à mi-2025. Achetez auprès de revendeurs officiels (LDLC, Materiel.net, TopAchat) pour éviter les faux.
#Questions fréquentes
La RTX 5090 peut-elle faire tourner Llama 3.1 70B en local ?+
Combien de tokens/seconde pour Mistral 7B sur RTX 5090 ?+
RTX 5090 ou deux RTX 4090 pour LLM ?+
Faut-il une alim 1000 W pour la RTX 5090 ?+
La RTX 5090 supporte-t-elle FP4 ?+
Peut-on faire du fine-tuning LoRA sur RTX 5090 ?+
Quelle différence de perf LLM entre RTX 5090 et H100 ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.