Intermédiaire 12 minRTX 40

Quel LLM sur RTX 4090 (24 Go) ?

La RTX 4090 (octobre 2022) reste en 2026 la référence IA locale grand public : 24 Go de VRAM GDDR6X, 1008 Go/s de bande passante, 16 384 cœurs CUDA Ada Lovelace. Elle fait tourner Mistral 7B à 110 tok/s, Qwen 32B Q4 confortablement, et encore un Llama 70B Q4 en offload léger. Désormais 1700-2000 € en occasion (stocks ex-LHR), elle a un meilleur rapport perf/€ qu'une 5080 neuve pour pur usage LLM. Ce guide détaille tous les modèles qui tournent et les benchmarks mesurés.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur Windows, macOS, Linux

#La RTX 4090 en 2026, toujours reine

Architecture
Ada Lovelace (AD102), gravure TSMC 4N. 76 milliards de transistors.
VRAM
24 Go GDDR6X à 21 Gbps, bus 384 bits. Bande passante 1008 Go/s.
Cœurs CUDA
16 384. Tensor Cores 4ᵉ gen FP8 natif. RT Cores 3ᵉ gen.
TDP
450 W. Alim 850 W recommandée.
Prix 2026
1700-2000 € en occasion soignée, ~2200 € en neuf rare.
Pourquoi encore pertinente en 2026
24 Go = seuil magique qui ouvre Llama 3.3 70B Q2_K (26 Go avec offload 2 Go), Qwen 2.5 32B Q6, DeepSeek-Coder-33B. La 5080 (16 Go neuve) ne peut pas, la 5090 (32 Go neuve) coûte 2× le prix. En pur rapport VRAM/€, la 4090 occasion domine.

#1. Modèles compatibles 24 Go

Modèles LLM — RTX 4090 24 Go
ModèleQuantVRAMTokens/secUsage
Mistral 7BQ5_K_M5,1 Go100-115Chat instantané
Llama 3.1 8BQ6_K6,7 Go92-104Chat + RAG FR
Qwen 2.5 Coder 14BQ6_K11,7 Go58-68Assistant code pro
Phi-4 14BQ8_015 Go48-56Raisonnement qualité
Mistral Small 24BQ6_K20 Go32-38Sweet spot polyvalent
Qwen 2.5 32BQ5_K_M23 Go26-32Reasoning avancé
DeepSeek-Coder 33BQ4_K_M19 Go30-36Code complexe multi-fichiers
Llama 3.3 70BQ2_K26 Go8-12Offload 2 Go RAM, usable
Llama 3.3 70BIQ2_XS21 Go18-22Tout en VRAM, qualité dégradée
i
Llama 70B : quelle quantization privilégier ?
Q4_K_M (42 Go) : offload massif, ~6 tok/s, peu confortable. Q2_K (26 Go) : 2 Go à décharger en RAM, ~10 tok/s, qualité correcte. IQ2_XS (21 Go) : tout en VRAM, ~20 tok/s mais qualité nettement dégradée. Pour un 70B confortable en local, visez une 5090 (32 Go) ou un Mac Studio.

#2. Installation & CUDA

  1. 01
    Drivers NVIDIA 550+
    CUDA 12.4+. Pour une 4090 neuve, GeForce Experience fait le travail. Linux : nvidia-driver-565 ou plus.
  2. 02
    Ollama
    Installeur standard depuis ollama.com. Auto-détection GPU CUDA.
  3. 03
    Premier test modèle 24 Go
    ollama run qwen2.5:32b — profite de la VRAM dispo et met en valeur la carte.
Setup complet Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen2.5:32b-instruct-q5_K_M

#3. Benchmarks tokens/sec

RTX 4090 24 Go — mesures tokens/sec
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Mistral 7B110 t/s100 t/s92 t/s75 t/s
Llama 3.1 8B98 t/s92 t/s82 t/s66 t/s
Phi-4 14B62 t/s56 t/s50 t/s42 t/s
Qwen 2.5 14B60 t/s55 t/s50 t/s40 t/s
Mistral Small 24B42 t/s38 t/s34 t/s28 t/s
Qwen 2.5 32B32 t/s28 t/s24 t/s

#4. Optimisations Ada

Flash Attention 2
Actif par défaut. FA3 arrive dans les futures versions llama.cpp.
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permet contexte 32k sur 14B en ~15 Go, laissant 9 Go pour d'autres processus.
Power limit
nvidia-smi -pl 350 (à partir de 350 W). LLM : -2 % de vitesse, -25 % de chaleur et bruit. Config sustainable 24/7.
FP8 via TensorRT-LLM
Ada supporte FP8 natif. Via TensorRT-LLM, +40 % de throughput batch sur Mistral 7B. Surtout utile en serving multi-utilisateurs.

#5. 4090 vs 5090 vs 3090

Les trois flagships NVIDIA grand public
CritèreRTX 5090RTX 4090RTX 3090
VRAM32 Go GDDR724 Go GDDR6X24 Go GDDR6X
Bande passante1792 Go/s1008 Go/s936 Go/s
Mistral 7B Q4138 t/s110 t/s78 t/s
Llama 70B Q422-28 t/s7-10 t/s5-8 t/s
Prix 2026~2500 € neuf~1800 € occasion~750 € occasion
Le meilleur rapport 24 Go/€ : 3090 occasion
Pour 750 € vs 1800 €, la 3090 offre les mêmes 24 Go de VRAM. Perte de ~30 % en vitesse pure. Si votre priorité c'est la VRAM (modèles 24-32B, QLoRA 14B+) et pas la vitesse max, la 3090 occasion reste le meilleur rapport qualité/prix LLM de toute l'histoire NVIDIA.

#Occasion 2026 : achat intelligent ?

Achetez une 4090 occasion si
Budget 1500-2000 €, usage LLM intensif, pas besoin de la toute dernière génération. 24 Go de VRAM = argument massif.
Préférez une RTX 5090 si
Budget ≥ 2500 €, usage 70B régulier, besoin de FP4 natif, serveur d'équipe. 32 Go changent la donne.
Préférez une RTX 3090 si
Budget ≤ 1000 €, pur usage LLM, vitesse secondaire. Même VRAM pour moitié prix.
Préférez une RTX 5070 Ti si
Budget ~1000 €, usage 14B max. Neuf avec garantie, GDDR7, FP4 support.

#Questions fréquentes

La RTX 4090 peut-elle faire tourner Llama 3.1 70B en local ?+
Oui, mais avec compromis. Q4_K_M (42 Go) : offload massif → 6-8 tok/s (inutilisable). Q2_K (26 Go) : 2 Go en RAM → 10-12 tok/s (acceptable). IQ2_XS (21 Go) : tout VRAM → 20 tok/s mais qualité dégradée. Pour du 70B confortable, préférez une 5090 (32 Go).
Combien de tokens/sec pour Mistral 7B sur RTX 4090 ?+
100-115 tokens/seconde en Q4_K_M, 75 tok/s en Q8_0, 58 tok/s en FP16. Très largement suffisant pour n'importe quel usage chat.
RTX 4090 occasion ou RTX 5080 neuve ?+
4090 occasion (1800 €) : 24 Go VRAM, 10 % plus lente qu'une 5080 sur 7B mais ouvre 70B en offload et 32B en Q6. 5080 neuve (1300 €) : 16 Go, plus rapide sur petits modèles, garantie 3 ans, support FP4. Pour pur LLM, 4090 gagne grâce à la VRAM. Pour perf + garantie, 5080.
La RTX 4090 chauffe et consomme beaucoup en LLM ?+
Moins qu'en jeu. Inférence Mistral 7B soutenue : 250-320 W (vs 450 W TDP), GPU à 65-72 °C. Un boîtier airflow correct suffit. Pour usage 24/7, undervolter à 350 W réduit chaleur et bruit sans perte LLM significative.
Peut-on faire du fine-tuning LoRA sur RTX 4090 ?+
Oui, excellent. LoRA sur Llama 3.1 8B : 12 Go, confortable avec batch 4, contexte 4096. QLoRA sur Mistral Small 24B : ~18 Go, possible. QLoRA sur 70B : serré, mais faisable avec unsloth + batch 1. Pour du 70B LoRA classique, il faut 2× 4090 ou une 5090.
La RTX 4090 supporte-t-elle FP8 ?+
Oui, les Tensor Cores 4ᵉ gen Ada Lovelace supportent FP8 nativement. Exploité par TensorRT-LLM (gain +30-40 % vs FP16), vLLM (0.5+), partiellement par llama.cpp. Pour Ollama grand public, reste Q4-Q8. Pour du serving batch, FP8 vaut le coup.
Quelle alim pour RTX 4090 ?+
850 W minimum qualité (ATX 3.0 recommandé mais pas obligatoire). En usage LLM, consommation moyenne 250-320 W. En jeu ou benchmark, 450 W. CPU haut de gamme (9950X, 14900K) : 1000 W plus serein.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.