Quel LLM sur RTX 5090 (32 Go) ?
La RTX 5090 (janvier 2025) est la carte grand public la plus puissante jamais sortie pour l'IA locale. 32 Go de VRAM GDDR7, 1792 Go/s de bande passante, 21 760 cœurs CUDA et un support FP4 natif via les nouveaux Tensor Cores de 5ᵉ génération. Elle fait tourner les gros MoE 2026 comme Qwen 3.6 35B-A3B (23 Go) et Nemotron 3.5 Lightning 30B — cette dernière ne tient même pas sur une 4090 24 Go — plus Qwen 3.8 27B chargé à son contexte complet de 262k tokens. Ce guide couvre quels LLM installer, les benchmarks, et les optimisations spécifiques Blackwell.
#La RTX 5090 pour l'IA locale
- Architecture
- Blackwell (GB202), gravure TSMC 4NP. 92 milliards de transistors.
- VRAM
- 32 Go GDDR7 à 28 Gbps sur bus 512 bits. Bande passante 1792 Go/s (+78 % vs 4090).
- Cœurs CUDA
- 21 760. Tensor Cores 5ᵉ gen avec support FP4 natif. RT Cores 4ᵉ gen.
- TDP
- 575 W. Alim recommandée 1000 W. Connecteur 12V-2×6 (nouvelle norme).
- Prix MSRP
- 2329 € TTC au lancement (janvier 2025). Stocks fluctuants en 2026.
#1. Modèles compatibles
| Modèle | Quant | VRAM | Tokens/sec | Verdict |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 Go | 117-143 | ★★★★★ confortable |
| Devstral Small 2 24B | Q4_K_M | 14 Go | 36-44 | ★★★★★ confortable |
| Gemma 4 26B-A4B MoE | Q4_K_M | 16 Go | 54-66 | ★★★★★ confortable |
| Gemma 4 12B | Q5_K_M | 9 Go | 62-72 | Multimodal, contexte long tenable |
| GLM 4.7 Flash | Q4_K_M | 19 Go | 90-110 | ★★★★★ |
| Mistral Small 24B | Q6_K | 20 Go | 38-45 | Sweet spot qualité/vitesse sur 5090 |
| Qwen 3.6 27B | Q5_K_M | 19 Go | 29-35 | ★★★★★ |
| Nemotron 3.5 Lightning 30B-A3B | Q5_K_M | 29 Go | 117-143 | ★★★★ serré |
| Qwen 3.8 27B | Q4_K_M | 18 Go | 32-40 | Raisonnement 262k ctx (passez-le en low) |
| Granite 4.1 30B Instruct | Q5_K_M | 21 Go | 27-33 | ★★★★★ |
#2. Installation Ollama + CUDA
La RTX 5090 nécessite les drivers NVIDIA 570+ et CUDA 12.8+. Les versions antérieures ne reconnaissent pas le GPU.
- 01Installez les drivers NVIDIA 570+ (Windows)Via GeForce Experience ou le site nvidia.com/drivers. Redémarrez.
- 02Installez CUDA 12.8+ (optionnel pour Ollama, requis pour llama.cpp from source)developer.nvidia.com/cuda-downloads. Ollama embarque sa propre version de CUDA.
- 03Installez OllamaTéléchargez depuis ollama.com/download, installer Windows ou script macOS/Linux. Ollama ≥ 0.5.x supporte Blackwell.
- 04Vérifiez la détection GPUDans un terminal : ollama run qwen3.5:9b puis dans une autre fenêtre : ollama ps. La colonne PROCESSOR doit indiquer 100% GPU.
#3. Benchmarks tokens/sec
Ordres de grandeur relevés sur RTX 5090 FE, driver 572.16, Windows 11 24H2, Ryzen 9 9950X, 64 Go DDR5 6400. Prompt : génération de 500 tokens, moyenne sur 5 runs — valeurs indicatives, pas des mesures certifiées.
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 | FP16 |
|---|---|---|---|---|---|
| Granite 4.2 8B | 138 t/s | 125 t/s | 115 t/s | 95 t/s | 72 t/s |
| Qwen 3.5 9B | 122 t/s | 110 t/s | 100 t/s | 82 t/s | 62 t/s |
| Gemma 4 12B | 72 t/s | 65 t/s | 58 t/s | 48 t/s | — |
| Qwen 3.8 27B | 38 t/s | 35 t/s | 31 t/s | 24 t/s | — |
| Mistral Small 24B | 48 t/s | 44 t/s | 40 t/s | 32 t/s | — |
#4. Optimisations Blackwell
- NVFP4 (FP4 natif)
- Les Tensor Cores 5ᵉ gen décodent FP4 sans conversion. Gain typique : +40 % vs Q4_K_M sur modèles supportés (TensorRT-LLM 0.18+, vLLM 0.7+).
- Flash Attention v3
- Automatique dans llama.cpp master. +10-15 % sur contextes longs, -20 % de VRAM cache KV.
- KV cache quantization
- Avec -ctk q8_0 -ctv q8_0 : contexte 128k sur un 14B tient en moins de 20 Go. Perte qualité : négligeable.
- Batch parallèle
- Un serveur Ollama peut tenir 8-12 conversations concurrentes d'un 7B sans effondrer la latence. Idéal pour équipe.
#5. RTX 5090 vs 4090 vs 5080
| Critère | RTX 5090 | RTX 4090 | RTX 5080 |
|---|---|---|---|
| VRAM | 32 Go GDDR7 | 24 Go GDDR6X | 16 Go GDDR7 |
| Bande passante | 1792 Go/s | 1008 Go/s | 960 Go/s |
| Granite 4.2 8B Q4 | 138 t/s | 110 t/s | 102 t/s |
| Qwen 3.6 35B-A3B Q4 | 80-100 t/s | 60-75 t/s | — |
| Prix (2026) | ~2500 € | ~1800 € occasion | ~1300 € |
| Verdict LLM | Gros MoE accessibles | Référence 30B | Excellent 14B |
#Limites et pièges
- Consommation
- 575 W TDP sous charge sustainable. Votre alim doit pouvoir fournir ~700 W en crête. Un 750 W de qualité suffit en pratique, 1000 W recommandé pour marge.
- Connecteur 12V-2×6
- Nouveau standard. Si votre alim ATX 3.0 est ancienne, vérifiez le câble — les cas de fonte existent sur mauvaise insertion. Adaptateur fourni dans la boîte.
- Pilotes jeunes (2025)
- Certains bugs sous Linux sur kernel < 6.11 et drivers < 570.86. Mettre à jour systématiquement.
- Disponibilité
- Scalping et stock serré jusqu'à mi-2025. Achetez auprès de revendeurs officiels (LDLC, Materiel.net, TopAchat) pour éviter les faux.
#Questions fréquentes
Quels gros modèles la RTX 5090 fait-elle tourner que les cartes 24 Go ne tiennent pas ?+
Combien de tokens/seconde pour un petit modèle 8B (Granite 4.2, Qwen 3.5) sur RTX 5090 ?+
RTX 5090 ou deux RTX 4090 pour LLM ?+
Faut-il une alim 1000 W pour la RTX 5090 ?+
La RTX 5090 supporte-t-elle FP4 ?+
Peut-on faire du fine-tuning LoRA sur RTX 5090 ?+
Quelle différence de perf LLM entre RTX 5090 et H100 ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.