Intermédiaire 12 minRTX 50

Quel LLM sur RTX 5090 (32 Go) ?

La RTX 5090 (janvier 2025) est la carte grand public la plus puissante jamais sortie pour l'IA locale. 32 Go de VRAM GDDR7, 1792 Go/s de bande passante, 21 760 cœurs CUDA et un support FP4 natif via les nouveaux Tensor Cores de 5ᵉ génération. Elle fait tourner les gros MoE 2026 comme Qwen 3.6 35B-A3B (23 Go) et Nemotron 3.5 Lightning 30B — cette dernière ne tient même pas sur une 4090 24 Go — plus Qwen 3.8 27B chargé à son contexte complet de 262k tokens. Ce guide couvre quels LLM installer, les benchmarks, et les optimisations spécifiques Blackwell.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 5090 pour l'IA locale

Architecture
Blackwell (GB202), gravure TSMC 4NP. 92 milliards de transistors.
VRAM
32 Go GDDR7 à 28 Gbps sur bus 512 bits. Bande passante 1792 Go/s (+78 % vs 4090).
Cœurs CUDA
21 760. Tensor Cores 5ᵉ gen avec support FP4 natif. RT Cores 4ᵉ gen.
TDP
575 W. Alim recommandée 1000 W. Connecteur 12V-2×6 (nouvelle norme).
Prix MSRP
2329 € TTC au lancement (janvier 2025). Stocks fluctuants en 2026.
Ce qui change vraiment avec Blackwell pour le LLM
Trois choses : +33 % de VRAM vs 4090 (24 → 32 Go, ouvre les gros MoE 30-35B et Qwen 3.8 27B à contexte long, que 24 Go ne tiennent pas), bande passante mémoire +78 % (fait +40 % sur les gros modèles mémoire-bound), et support FP4 hardware qui permet des quantizations NVFP4 d'une qualité quasi-indiscernable du FP8 sur le papier.

#1. Modèles compatibles

Modèles LLM recommandés — tokens/sec, ordres de grandeur sur RTX 5090, llama.cpp / Ollama récent, batch 1
ModèleQuantVRAMTokens/secVerdict
gpt-oss 20BQ4_K_M13 Go117-143★★★★★ confortable
Devstral Small 2 24BQ4_K_M14 Go36-44★★★★★ confortable
Gemma 4 26B-A4B MoEQ4_K_M16 Go54-66★★★★★ confortable
Gemma 4 12BQ5_K_M9 Go62-72Multimodal, contexte long tenable
GLM 4.7 FlashQ4_K_M19 Go90-110★★★★★
Mistral Small 24BQ6_K20 Go38-45Sweet spot qualité/vitesse sur 5090
Qwen 3.6 27BQ5_K_M19 Go29-35★★★★★
Nemotron 3.5 Lightning 30B-A3BQ5_K_M29 Go117-143★★★★ serré
Qwen 3.8 27BQ4_K_M18 Go32-40Raisonnement 262k ctx (passez-le en low)
Granite 4.1 30B InstructQ5_K_M21 Go27-33★★★★★
i
Les 32 Go changent quoi concrètement ?
Un gros MoE comme Nemotron 3.5 Lightning 30B pèse 25 Go en Q4 : il ne tient tout simplement pas sur une carte 24 Go, mais rentre à l'aise sur la 5090. Idem pour Qwen 3.6 35B-A3B (23 Go), ou Qwen 3.8 27B chargé avec son contexte complet de 262k tokens. C'est le scénario où la 5090 brille le plus.

#2. Installation Ollama + CUDA

La RTX 5090 nécessite les drivers NVIDIA 570+ et CUDA 12.8+. Les versions antérieures ne reconnaissent pas le GPU.

  1. 01
    Installez les drivers NVIDIA 570+ (Windows)
    Via GeForce Experience ou le site nvidia.com/drivers. Redémarrez.
  2. 02
    Installez CUDA 12.8+ (optionnel pour Ollama, requis pour llama.cpp from source)
    developer.nvidia.com/cuda-downloads. Ollama embarque sa propre version de CUDA.
  3. 03
    Installez Ollama
    Téléchargez depuis ollama.com/download, installer Windows ou script macOS/Linux. Ollama ≥ 0.5.x supporte Blackwell.
  4. 04
    Vérifiez la détection GPU
    Dans un terminal : ollama run qwen3.5:9b puis dans une autre fenêtre : ollama ps. La colonne PROCESSOR doit indiquer 100% GPU.
Vérification rapide
nvidia-smi
# Doit montrer : NVIDIA GeForce RTX 5090, 32768 MiB, driver >= 570.xx

ollama --version
# Doit etre >= 0.5.0

#3. Benchmarks tokens/sec

Ordres de grandeur relevés sur RTX 5090 FE, driver 572.16, Windows 11 24H2, Ryzen 9 9950X, 64 Go DDR5 6400. Prompt : génération de 500 tokens, moyenne sur 5 runs — valeurs indicatives, pas des mesures certifiées.

Comparatif quantizations — RTX 5090
ModèleQ4_K_MQ5_K_MQ6_KQ8_0FP16
Granite 4.2 8B138 t/s125 t/s115 t/s95 t/s72 t/s
Qwen 3.5 9B122 t/s110 t/s100 t/s82 t/s62 t/s
Gemma 4 12B72 t/s65 t/s58 t/s48 t/s
Qwen 3.8 27B38 t/s35 t/s31 t/s24 t/s
Mistral Small 24B48 t/s44 t/s40 t/s32 t/s
Activez flash attention
Sur Blackwell, flash attention v3 est activé par défaut dans llama.cpp récent et apporte +10-15 % sur les contextes > 4k tokens. Vérifiez avec le flag -fa dans les logs.

#4. Optimisations Blackwell

NVFP4 (FP4 natif)
Les Tensor Cores 5ᵉ gen décodent FP4 sans conversion. Gain typique : +40 % vs Q4_K_M sur modèles supportés (TensorRT-LLM 0.18+, vLLM 0.7+).
Flash Attention v3
Automatique dans llama.cpp master. +10-15 % sur contextes longs, -20 % de VRAM cache KV.
KV cache quantization
Avec -ctk q8_0 -ctv q8_0 : contexte 128k sur un 14B tient en moins de 20 Go. Perte qualité : négligeable.
Batch parallèle
Un serveur Ollama peut tenir 8-12 conversations concurrentes d'un 7B sans effondrer la latence. Idéal pour équipe.
Config Ollama pour serveur équipe
# Variable d'env avant demarrage
set OLLAMA_NUM_PARALLEL=8
set OLLAMA_MAX_LOADED_MODELS=3
set OLLAMA_KV_CACHE_TYPE=q8_0

ollama serve

#5. RTX 5090 vs 4090 vs 5080

Comparatif flagships — usage LLM
CritèreRTX 5090RTX 4090RTX 5080
VRAM32 Go GDDR724 Go GDDR6X16 Go GDDR7
Bande passante1792 Go/s1008 Go/s960 Go/s
Granite 4.2 8B Q4138 t/s110 t/s102 t/s
Qwen 3.6 35B-A3B Q480-100 t/s60-75 t/s
Prix (2026)~2500 €~1800 € occasion~1300 €
Verdict LLMGros MoE accessiblesRéférence 30BExcellent 14B
i
Faut-il remplacer sa 4090 par une 5090 ?
Pour du 8B-27B : non, le gain de vitesse (+25-40 %) ne justifie pas ~700 €. Pour les gros MoE 30-35B (Qwen 3.6 35B-A3B, ou Nemotron 3.5 Lightning qui ne tient pas sur 24 Go) ou du batch multi-utilisateurs : oui, les 32 Go font sauter un plafond matériel — c'est une autre classe d'usage.

#Limites et pièges

Consommation
575 W TDP sous charge sustainable. Votre alim doit pouvoir fournir ~700 W en crête. Un 750 W de qualité suffit en pratique, 1000 W recommandé pour marge.
Connecteur 12V-2×6
Nouveau standard. Si votre alim ATX 3.0 est ancienne, vérifiez le câble — les cas de fonte existent sur mauvaise insertion. Adaptateur fourni dans la boîte.
Pilotes jeunes (2025)
Certains bugs sous Linux sur kernel < 6.11 et drivers < 570.86. Mettre à jour systématiquement.
Disponibilité
Scalping et stock serré jusqu'à mi-2025. Achetez auprès de revendeurs officiels (LDLC, Materiel.net, TopAchat) pour éviter les faux.

#Questions fréquentes

Quels gros modèles la RTX 5090 fait-elle tourner que les cartes 24 Go ne tiennent pas ?+
Sa force, c'est la tranche 30-35B. Nemotron 3.5 Lightning 30B pèse 25 Go en Q4 : il ne rentre pas sur une 4090 24 Go, mais tourne à l'aise sur la 5090. Idem pour Qwen 3.6 35B-A3B (MoE, 23 Go) ou GLM 4.7 Flash. Et Qwen 3.8 27B se charge avec son contexte complet de 262k tokens — impensable sur 16-24 Go. C'est le premier GPU grand public qui rend cette classe de modèles vraiment confortable.
Combien de tokens/seconde pour un petit modèle 8B (Granite 4.2, Qwen 3.5) sur RTX 5090 ?+
Entre 130 et 145 tokens/seconde en Q4_K_M, 95 tok/s en Q8_0, 72 tok/s en FP16. Soit ~25 % de plus qu'une RTX 4090 à quantization équivalente.
RTX 5090 ou deux RTX 4090 pour LLM ?+
La 5090 seule. Deux 4090 offrent 48 Go de VRAM mais il faut gérer le split modèle et le SLI n'est plus supporté. llama.cpp sait répartir un modèle sur plusieurs GPU (tensor parallelism) mais la latence augmente. Pour un usage simple et rapide, une seule 5090 bat largement le dual 4090 en ergonomie.
Faut-il une alim 1000 W pour la RTX 5090 ?+
Recommandé par NVIDIA. En pratique, une alim 850 W ATX 3.0 / ATX 3.1 de qualité (Corsair RMx, Seasonic Focus GX, be quiet! Straight Power 12) tient une 5090 avec un CPU ≤ 200 W. Le connecteur 12V-2×6 est indispensable — vérifiez à l'achat.
La RTX 5090 supporte-t-elle FP4 ?+
Oui, nativement. C'est une nouveauté Blackwell : les Tensor Cores 5ᵉ gen exécutent du FP4 sans conversion. NVIDIA pousse le format NVFP4 via TensorRT-LLM. À date, Ollama et llama.cpp n'exploitent pas encore FP4 directement — il faut passer par vLLM ou TensorRT-LLM.
Peut-on faire du fine-tuning LoRA sur RTX 5090 ?+
Oui, très confortablement. Un LoRA sur Qwen 3.5 9B tient en 12 Go de VRAM, laisse de la marge pour un contexte de 8k. Pour Mistral Small 24B en QLoRA : ~22 Go. Pour un gros MoE 30-35B en QLoRA : 28-30 Go (juste, réduire batch size). unsloth et axolotl fonctionnent nativement.
Quelle différence de perf LLM entre RTX 5090 et H100 ?+
Sur du single-stream inference, la 5090 est proche d'une H100 PCIe (~80-90 %) grâce à sa bande passante 1792 Go/s vs 2039 Go/s pour la H100. Sur du batch multi-utilisateurs avec TensorRT-LLM, la H100 creuse l'écart (+50-100 %). Pour un usage individuel, la 5090 est un choix rationnel face à une carte pro 4× plus chère.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.