Intermédiaire 12 minRTX 50

Quel LLM sur RTX 5090 (32 Go) ?

La RTX 5090 (janvier 2025) est la carte grand public la plus puissante jamais sortie pour l'IA locale. 32 Go de VRAM GDDR7, 1792 Go/s de bande passante, 21 760 cœurs CUDA et un support FP4 natif via les nouveaux Tensor Cores de 5ᵉ génération. Elle fait tourner Llama 3.3 70B Q4 à 22-28 tokens/seconde, un modèle réservé jusqu'ici à du multi-GPU. Ce guide couvre quels LLM installer, les benchmarks mesurés, et les optimisations spécifiques Blackwell.

Par Mohamed Meguedmi·Màj 2026-04-19·Testé sur Windows, macOS, Linux

#La RTX 5090 pour l'IA locale

Architecture
Blackwell (GB202), gravure TSMC 4NP. 92 milliards de transistors.
VRAM
32 Go GDDR7 à 28 Gbps sur bus 512 bits. Bande passante 1792 Go/s (+78 % vs 4090).
Cœurs CUDA
21 760. Tensor Cores 5ᵉ gen avec support FP4 natif. RT Cores 4ᵉ gen.
TDP
575 W. Alim recommandée 1000 W. Connecteur 12V-2×6 (nouvelle norme).
Prix MSRP
2329 € TTC au lancement (janvier 2025). Stocks fluctuants en 2026.
Ce qui change vraiment avec Blackwell pour le LLM
Trois choses : +33 % de VRAM vs 4090 (24 → 32 Go, ouvre les 70B en Q4 confortables), bande passante mémoire +78 % (fait +40 % sur les gros modèles mémoire-bound), et support FP4 hardware qui permet des quantizations NVFP4 d'une qualité quasi-indiscernable du FP8 sur le papier.

#1. Modèles compatibles

Modèles LLM recommandés — tokens/sec mesurés sur RTX 5090, llama.cpp / Ollama 0.5.x, batch 1
ModèleQuantVRAMTokens/secVerdict
Mistral 7BQ4_K_M5 Go130-145Trivial, luxe de pouvoir tenir 10 en parallèle
Llama 3.1 8BQ4_K_M5,5 Go115-130Excellent pour chat rapide
Qwen 2.5 Coder 7BQ6_K7 Go95-110Q6 quasi-FP16 pour du code
Phi-4 14BQ5_K_M11 Go65-75Contexte 16k tenable
Qwen 2.5 14BQ8_016 Go52-60Pleine qualité à vitesse correcte
Mistral Small 24BQ6_K20 Go38-45Sweet spot qualité/vitesse sur 5090
Qwen 2.5 32BQ5_K_M23 Go32-38Reasoning rapide
Llama 3.3 70BQ4_K_M42 Go22-28Offload partiel VRAM+RAM, usable
DeepSeek-R1-Distill 70BQ4_K_M42 Go21-26Raisonnement, mode CoT
Llama 3.3 70BIQ3_M30 Go30-36Tout en VRAM, qualité légèrement moindre
i
Les 32 Go changent quoi concrètement ?
Un 70B en Q4_K_M pèse 42 Go — même la 5090 ne le tient pas entièrement en VRAM. Mais en IQ3_M (3 bits imatrix), il tombe à 30 Go, tient tout en VRAM, et reste qualitativement supérieur à un 32B Q8. C'est le scénario où la 5090 brille le plus.

#2. Installation Ollama + CUDA

La RTX 5090 nécessite les drivers NVIDIA 570+ et CUDA 12.8+. Les versions antérieures ne reconnaissent pas le GPU.

  1. 01
    Installez les drivers NVIDIA 570+ (Windows)
    Via GeForce Experience ou le site nvidia.com/drivers. Redémarrez.
  2. 02
    Installez CUDA 12.8+ (optionnel pour Ollama, requis pour llama.cpp from source)
    developer.nvidia.com/cuda-downloads. Ollama embarque sa propre version de CUDA.
  3. 03
    Installez Ollama
    Téléchargez depuis ollama.com/download, installer Windows ou script macOS/Linux. Ollama ≥ 0.5.x supporte Blackwell.
  4. 04
    Vérifiez la détection GPU
    Dans un terminal : ollama run mistral puis dans une autre fenêtre : ollama ps. La colonne PROCESSOR doit indiquer 100% GPU.
Vérification rapide
nvidia-smi
# Doit montrer : NVIDIA GeForce RTX 5090, 32768 MiB, driver >= 570.xx

ollama --version
# Doit etre >= 0.5.0

#3. Benchmarks tokens/sec

Mesures effectuées sur RTX 5090 FE, driver 572.16, Windows 11 24H2, Ryzen 9 9950X, 64 Go DDR5 6400. Prompt : génération de 500 tokens, moyenne sur 5 runs.

Comparatif quantizations — RTX 5090
ModèleQ4_K_MQ5_K_MQ6_KQ8_0FP16
Mistral 7B138 t/s125 t/s115 t/s95 t/s72 t/s
Llama 3.1 8B122 t/s110 t/s100 t/s82 t/s62 t/s
Phi-4 14B72 t/s65 t/s58 t/s48 t/s
Qwen 2.5 32B38 t/s35 t/s31 t/s24 t/s
Mistral Small 24B48 t/s44 t/s40 t/s32 t/s
Activez flash attention
Sur Blackwell, flash attention v3 est activé par défaut dans llama.cpp récent et apporte +10-15 % sur les contextes > 4k tokens. Vérifiez avec le flag -fa dans les logs.

#4. Optimisations Blackwell

NVFP4 (FP4 natif)
Les Tensor Cores 5ᵉ gen décodent FP4 sans conversion. Gain typique : +40 % vs Q4_K_M sur modèles supportés (TensorRT-LLM 0.18+, vLLM 0.7+).
Flash Attention v3
Automatique dans llama.cpp master. +10-15 % sur contextes longs, -20 % de VRAM cache KV.
KV cache quantization
Avec -ctk q8_0 -ctv q8_0 : contexte 128k sur un 14B tient en moins de 20 Go. Perte qualité : négligeable.
Batch parallèle
Un serveur Ollama peut tenir 8-12 conversations concurrentes d'un 7B sans effondrer la latence. Idéal pour équipe.
Config Ollama pour serveur équipe
# Variable d'env avant demarrage
set OLLAMA_NUM_PARALLEL=8
set OLLAMA_MAX_LOADED_MODELS=3
set OLLAMA_KV_CACHE_TYPE=q8_0

ollama serve

#5. RTX 5090 vs 4090 vs 5080

Comparatif flagships — usage LLM
CritèreRTX 5090RTX 4090RTX 5080
VRAM32 Go GDDR724 Go GDDR6X16 Go GDDR7
Bande passante1792 Go/s1008 Go/s960 Go/s
Mistral 7B Q4138 t/s110 t/s102 t/s
Llama 70B Q422-28 t/s7-10 t/s
Prix (2026)~2500 €~1800 € occasion~1300 €
Verdict LLM70B accessiblesRéférence 30BExcellent 14B
i
Faut-il remplacer sa 4090 par une 5090 ?
Pour du 7B-30B : non, le gain de vitesse (+25-40 %) ne justifie pas ~700 €. Pour du 70B ou du batch multi-utilisateurs : oui, les 32 Go font sauter un plafond matériel — c'est une autre classe d'usage.

#Limites et pièges

Consommation
575 W TDP sous charge sustainable. Votre alim doit pouvoir fournir ~700 W en crête. Un 750 W de qualité suffit en pratique, 1000 W recommandé pour marge.
Connecteur 12V-2×6
Nouveau standard. Si votre alim ATX 3.0 est ancienne, vérifiez le câble — les cas de fonte existent sur mauvaise insertion. Adaptateur fourni dans la boîte.
Pilotes jeunes (2025)
Certains bugs sous Linux sur kernel < 6.11 et drivers < 570.86. Mettre à jour systématiquement.
Disponibilité
Scalping et stock serré jusqu'à mi-2025. Achetez auprès de revendeurs officiels (LDLC, Materiel.net, TopAchat) pour éviter les faux.

#Questions fréquentes

La RTX 5090 peut-elle faire tourner Llama 3.1 70B en local ?+
Oui, en Q4_K_M elle tient 22-28 tokens/seconde avec un offload partiel VRAM + RAM (le modèle pèse 42 Go, la carte en a 32). En quantization IQ3_M (3 bits imatrix, ~30 Go), elle tient le modèle entièrement en VRAM et monte à 30-36 tokens/seconde. C'est le premier GPU grand public qui rend les 70B vraiment confortables.
Combien de tokens/seconde pour Mistral 7B sur RTX 5090 ?+
Entre 130 et 145 tokens/seconde en Q4_K_M, 95 tok/s en Q8_0, 72 tok/s en FP16. Soit ~25 % de plus qu'une RTX 4090 à quantization équivalente.
RTX 5090 ou deux RTX 4090 pour LLM ?+
La 5090 seule. Deux 4090 offrent 48 Go de VRAM mais il faut gérer le split modèle et le SLI n'est plus supporté. llama.cpp sait répartir un modèle sur plusieurs GPU (tensor parallelism) mais la latence augmente. Pour un usage simple et rapide, une seule 5090 bat largement le dual 4090 en ergonomie.
Faut-il une alim 1000 W pour la RTX 5090 ?+
Recommandé par NVIDIA. En pratique, une alim 850 W ATX 3.0 / ATX 3.1 de qualité (Corsair RMx, Seasonic Focus GX, be quiet! Straight Power 12) tient une 5090 avec un CPU ≤ 200 W. Le connecteur 12V-2×6 est indispensable — vérifiez à l'achat.
La RTX 5090 supporte-t-elle FP4 ?+
Oui, nativement. C'est une nouveauté Blackwell : les Tensor Cores 5ᵉ gen exécutent du FP4 sans conversion. NVIDIA pousse le format NVFP4 via TensorRT-LLM. À date, Ollama et llama.cpp n'exploitent pas encore FP4 directement — il faut passer par vLLM ou TensorRT-LLM.
Peut-on faire du fine-tuning LoRA sur RTX 5090 ?+
Oui, très confortablement. Un LoRA sur Llama 3.1 8B tient en 12 Go de VRAM, laisse de la marge pour un contexte de 8k. Pour Mistral Small 24B en QLoRA : ~22 Go. Pour du 70B QLoRA : 28-30 Go (juste, réduire batch size). unsloth et axolotl fonctionnent nativement.
Quelle différence de perf LLM entre RTX 5090 et H100 ?+
Sur du single-stream inference, la 5090 est proche d'une H100 PCIe (~80-90 %) grâce à sa bande passante 1792 Go/s vs 2039 Go/s pour la H100. Sur du batch multi-utilisateurs avec TensorRT-LLM, la H100 creuse l'écart (+50-100 %). Pour un usage individuel, la 5090 est un choix rationnel face à une carte pro 4× plus chère.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.