Intermédiaire 12 minRTX 40

Quel LLM sur RTX 4090 (24 Go) ?

La RTX 4090 (octobre 2022) reste en 2026 la référence IA locale grand public : 24 Go de VRAM GDDR6X, 1008 Go/s de bande passante, 16 384 cœurs CUDA Ada Lovelace. Elle fait tourner Qwen 3.5 9B à plus de 90 tok/s, un Qwen 3.8 27B Q4 confortablement, et encore un Llama 70B Q4 en offload léger. Désormais 1700-2000 € en occasion (stocks ex-LHR), elle a un meilleur rapport perf/€ qu'une 5080 neuve pour pur usage LLM. Ce guide détaille tous les modèles qui tournent et des ordres de grandeur de débit.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 4090 en 2026, toujours reine

Architecture
Ada Lovelace (AD102), gravure TSMC 4N. 76 milliards de transistors.
VRAM
24 Go GDDR6X à 21 Gbps, bus 384 bits. Bande passante 1008 Go/s.
Cœurs CUDA
16 384. Tensor Cores 4ᵉ gen FP8 natif. RT Cores 3ᵉ gen.
TDP
450 W. Alim 850 W recommandée.
Prix 2026
1700-2000 € en occasion soignée, ~2200 € en neuf rare.
Pourquoi encore pertinente en 2026
24 Go = seuil magique qui ouvre Llama 3.3 70B Q2_K (26 Go avec offload 2 Go), Qwen 3.8 27B en Q8, Qwen3-Coder 30B-A3B. La 5080 (16 Go neuve) ne peut pas, la 5090 (32 Go neuve) coûte 2× le prix. En pur rapport VRAM/€, la 4090 occasion domine.

#1. Modèles compatibles 24 Go

Modèles LLM — RTX 4090 24 Go
ModèleQuantVRAMTokens/secUsage
gpt-oss 20BQ4_K_M13 Go117-143Chat instantané
Devstral Small 2 24BQ4_K_M14 Go36-44Chat + RAG FR
Qwen 3.6 27BQ4_K_M16 Go29-35Assistant code pro
Qwen 3.8 27BQ4_K_M16 Go20-24Raisonnement qualité
Mistral Small 24BQ6_K20 Go32-38Sweet spot polyvalent
GLM 4.7 FlashQ4_K_M19 Go90-110Reasoning avancé
Granite 4.1 30B InstructQ4_K_M17 Go27-33Code complexe multi-fichiers
Gemma 4 26B-A4B MoEQ5_K_M19 Go54-66Offload 2 Go RAM, usable
Gemma 4 31BQ5_K_M22 Go27-33Tout en VRAM, qualité dégradée
i
Llama 70B : quelle quantization privilégier ?
Q4_K_M (42 Go) : offload massif, ~6 tok/s, peu confortable. Q2_K (26 Go) : 2 Go à décharger en RAM, ~10 tok/s, qualité correcte. IQ2_XS (21 Go) : tout en VRAM, ~20 tok/s mais qualité nettement dégradée. Pour un 70B confortable en local, visez une 5090 (32 Go) ou un Mac Studio.

#2. Installation & CUDA

  1. 01
    Drivers NVIDIA 550+
    CUDA 12.4+. Pour une 4090 neuve, GeForce Experience fait le travail. Linux : nvidia-driver-565 ou plus.
  2. 02
    Ollama
    Installeur standard depuis ollama.com. Auto-détection GPU CUDA.
  3. 03
    Premier test modèle 24 Go
    ollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
Setup complet Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.8:27b

#3. Benchmarks tokens/sec

RTX 4090 24 Go — ordres de grandeur tokens/sec
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B135 t/s122 t/s110 t/s90 t/s
Granite 4.2 8B100 t/s92 t/s82 t/s66 t/s
Qwen 3.5 9B92 t/s85 t/s76 t/s62 t/s
Gemma 4 12B70 t/s64 t/s57 t/s48 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 3.8 27B32 t/s28 t/s25 t/s

#4. Optimisations Ada

Flash Attention 2
Actif par défaut. FA3 arrive dans les futures versions llama.cpp.
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permet contexte 32k sur 14B en ~15 Go, laissant 9 Go pour d'autres processus.
Power limit
nvidia-smi -pl 350 (à partir de 350 W). LLM : -2 % de vitesse, -25 % de chaleur et bruit. Config sustainable 24/7.
FP8 via TensorRT-LLM
Ada supporte FP8 natif. Via TensorRT-LLM, +40 % de throughput batch sur Qwen 3.5 9B. Surtout utile en serving multi-utilisateurs.

#5. 4090 vs 5090 vs 3090

Les trois flagships NVIDIA grand public
CritèreRTX 5090RTX 4090RTX 3090
VRAM32 Go GDDR724 Go GDDR6X24 Go GDDR6X
Bande passante1792 Go/s1008 Go/s936 Go/s
Qwen 3.5 9B Q4115 t/s92 t/s66 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Prix 2026~2500 € neuf~1800 € occasion~750 € occasion
Le meilleur rapport 24 Go/€ : 3090 occasion
Pour 750 € vs 1800 €, la 3090 offre les mêmes 24 Go de VRAM. Perte de ~30 % en vitesse pure. Si votre priorité c'est la VRAM (modèles 24-32B, QLoRA 14B+) et pas la vitesse max, la 3090 occasion reste le meilleur rapport qualité/prix LLM de toute l'histoire NVIDIA.

#Occasion 2026 : achat intelligent ?

Achetez une 4090 occasion si
Budget 1500-2000 €, usage LLM intensif, pas besoin de la toute dernière génération. 24 Go de VRAM = argument massif.
Préférez une RTX 5090 si
Budget ≥ 2500 €, usage 70B régulier, besoin de FP4 natif, serveur d'équipe. 32 Go changent la donne.
Préférez une RTX 3090 si
Budget ≤ 1000 €, pur usage LLM, vitesse secondaire. Même VRAM pour moitié prix.
Préférez une RTX 5070 Ti si
Budget ~1000 €, usage 14B max. Neuf avec garantie, GDDR7, FP4 support.

#Questions fréquentes

La RTX 4090 peut-elle faire tourner Llama 3.3 70B en local ?+
Oui, mais avec compromis. Q4_K_M (42 Go) : offload massif → 6-8 tok/s (inutilisable). Q2_K (26 Go) : 2 Go en RAM → 10-12 tok/s (acceptable). IQ2_XS (21 Go) : tout VRAM → 20 tok/s mais qualité dégradée. Pour un vrai grand modèle confortable, préférez une 5090 (32 Go) — ou restez sur un Qwen 3.8 27B qui tient entièrement en VRAM.
Combien de tokens/sec pour Qwen 3.5 9B sur RTX 4090 ?+
Environ 90 tokens/seconde en Q4_K_M, 62 tok/s en Q8_0. Très largement suffisant pour n'importe quel usage chat, avec en prime les 256k de contexte et la vision du modèle.
RTX 4090 occasion ou RTX 5080 neuve ?+
4090 occasion (1800 €) : 24 Go VRAM, 10 % plus lente qu'une 5080 sur 7B mais ouvre 70B en offload et 32B en Q6. 5080 neuve (1300 €) : 16 Go, plus rapide sur petits modèles, garantie 3 ans, support FP4. Pour pur LLM, 4090 gagne grâce à la VRAM. Pour perf + garantie, 5080.
La RTX 4090 chauffe et consomme beaucoup en LLM ?+
Moins qu'en jeu. Inférence Qwen 3.5 9B soutenue : 250-320 W (vs 450 W TDP), GPU à 65-72 °C. Un boîtier airflow correct suffit. Pour usage 24/7, undervolter à 350 W réduit chaleur et bruit sans perte LLM significative.
Peut-on faire du fine-tuning LoRA sur RTX 4090 ?+
Oui, excellent. LoRA sur Qwen 3.5 9B : 12 Go, confortable avec batch 4, contexte 4096. QLoRA sur Mistral Small 24B : ~18 Go, possible. QLoRA sur un 70B : serré, mais faisable avec unsloth + batch 1. Pour du 70B LoRA classique, il faut 2× 4090 ou une 5090.
La RTX 4090 supporte-t-elle FP8 ?+
Oui, les Tensor Cores 4ᵉ gen Ada Lovelace supportent FP8 nativement. Exploité par TensorRT-LLM (gain +30-40 % vs FP16), vLLM (0.5+), partiellement par llama.cpp. Pour Ollama grand public, reste Q4-Q8. Pour du serving batch, FP8 vaut le coup.
Quelle alim pour RTX 4090 ?+
850 W minimum qualité (ATX 3.0 recommandé mais pas obligatoire). En usage LLM, consommation moyenne 250-320 W. En jeu ou benchmark, 450 W. CPU haut de gamme (9950X, 14900K) : 1000 W plus serein.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.