Intermédiaire 12 minRTX 40
Quel LLM sur RTX 4090 (24 Go) ?
La RTX 4090 (octobre 2022) reste en 2026 la référence IA locale grand public : 24 Go de VRAM GDDR6X, 1008 Go/s de bande passante, 16 384 cœurs CUDA Ada Lovelace. Elle fait tourner Mistral 7B à 110 tok/s, Qwen 32B Q4 confortablement, et encore un Llama 70B Q4 en offload léger. Désormais 1700-2000 € en occasion (stocks ex-LHR), elle a un meilleur rapport perf/€ qu'une 5080 neuve pour pur usage LLM. Ce guide détaille tous les modèles qui tournent et les benchmarks mesurés.
#La RTX 4090 en 2026, toujours reine
- Architecture
- Ada Lovelace (AD102), gravure TSMC 4N. 76 milliards de transistors.
- VRAM
- 24 Go GDDR6X à 21 Gbps, bus 384 bits. Bande passante 1008 Go/s.
- Cœurs CUDA
- 16 384. Tensor Cores 4ᵉ gen FP8 natif. RT Cores 3ᵉ gen.
- TDP
- 450 W. Alim 850 W recommandée.
- Prix 2026
- 1700-2000 € en occasion soignée, ~2200 € en neuf rare.
→
Pourquoi encore pertinente en 2026
24 Go = seuil magique qui ouvre Llama 3.3 70B Q2_K (26 Go avec offload 2 Go), Qwen 2.5 32B Q6, DeepSeek-Coder-33B. La 5080 (16 Go neuve) ne peut pas, la 5090 (32 Go neuve) coûte 2× le prix. En pur rapport VRAM/€, la 4090 occasion domine.
#1. Modèles compatibles 24 Go
Modèles LLM — RTX 4090 24 Go
| Modèle | Quant | VRAM | Tokens/sec | Usage |
|---|---|---|---|---|
| Mistral 7B | Q5_K_M | 5,1 Go | 100-115 | Chat instantané |
| Llama 3.1 8B | Q6_K | 6,7 Go | 92-104 | Chat + RAG FR |
| Qwen 2.5 Coder 14B | Q6_K | 11,7 Go | 58-68 | Assistant code pro |
| Phi-4 14B | Q8_0 | 15 Go | 48-56 | Raisonnement qualité |
| Mistral Small 24B | Q6_K | 20 Go | 32-38 | Sweet spot polyvalent |
| Qwen 2.5 32B | Q5_K_M | 23 Go | 26-32 | Reasoning avancé |
| DeepSeek-Coder 33B | Q4_K_M | 19 Go | 30-36 | Code complexe multi-fichiers |
| Llama 3.3 70B | Q2_K | 26 Go | 8-12 | Offload 2 Go RAM, usable |
| Llama 3.3 70B | IQ2_XS | 21 Go | 18-22 | Tout en VRAM, qualité dégradée |
i
Llama 70B : quelle quantization privilégier ?
Q4_K_M (42 Go) : offload massif, ~6 tok/s, peu confortable. Q2_K (26 Go) : 2 Go à décharger en RAM, ~10 tok/s, qualité correcte. IQ2_XS (21 Go) : tout en VRAM, ~20 tok/s mais qualité nettement dégradée. Pour un 70B confortable en local, visez une 5090 (32 Go) ou un Mac Studio.
#2. Installation & CUDA
- 01Drivers NVIDIA 550+CUDA 12.4+. Pour une 4090 neuve, GeForce Experience fait le travail. Linux : nvidia-driver-565 ou plus.
- 02OllamaInstalleur standard depuis ollama.com. Auto-détection GPU CUDA.
- 03Premier test modèle 24 Goollama run qwen2.5:32b — profite de la VRAM dispo et met en valeur la carte.
#3. Benchmarks tokens/sec
RTX 4090 24 Go — mesures tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Mistral 7B | 110 t/s | 100 t/s | 92 t/s | 75 t/s |
| Llama 3.1 8B | 98 t/s | 92 t/s | 82 t/s | 66 t/s |
| Phi-4 14B | 62 t/s | 56 t/s | 50 t/s | 42 t/s |
| Qwen 2.5 14B | 60 t/s | 55 t/s | 50 t/s | 40 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 2.5 32B | 32 t/s | 28 t/s | 24 t/s | — |
#4. Optimisations Ada
- Flash Attention 2
- Actif par défaut. FA3 arrive dans les futures versions llama.cpp.
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permet contexte 32k sur 14B en ~15 Go, laissant 9 Go pour d'autres processus.
- Power limit
- nvidia-smi -pl 350 (à partir de 350 W). LLM : -2 % de vitesse, -25 % de chaleur et bruit. Config sustainable 24/7.
- FP8 via TensorRT-LLM
- Ada supporte FP8 natif. Via TensorRT-LLM, +40 % de throughput batch sur Mistral 7B. Surtout utile en serving multi-utilisateurs.
#5. 4090 vs 5090 vs 3090
Les trois flagships NVIDIA grand public
| Critère | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 Go GDDR7 | 24 Go GDDR6X | 24 Go GDDR6X |
| Bande passante | 1792 Go/s | 1008 Go/s | 936 Go/s |
| Mistral 7B Q4 | 138 t/s | 110 t/s | 78 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Prix 2026 | ~2500 € neuf | ~1800 € occasion | ~750 € occasion |
→
Le meilleur rapport 24 Go/€ : 3090 occasion
Pour 750 € vs 1800 €, la 3090 offre les mêmes 24 Go de VRAM. Perte de ~30 % en vitesse pure. Si votre priorité c'est la VRAM (modèles 24-32B, QLoRA 14B+) et pas la vitesse max, la 3090 occasion reste le meilleur rapport qualité/prix LLM de toute l'histoire NVIDIA.
#Occasion 2026 : achat intelligent ?
- Achetez une 4090 occasion si
- Budget 1500-2000 €, usage LLM intensif, pas besoin de la toute dernière génération. 24 Go de VRAM = argument massif.
- Préférez une RTX 5090 si
- Budget ≥ 2500 €, usage 70B régulier, besoin de FP4 natif, serveur d'équipe. 32 Go changent la donne.
- Préférez une RTX 3090 si
- Budget ≤ 1000 €, pur usage LLM, vitesse secondaire. Même VRAM pour moitié prix.
- Préférez une RTX 5070 Ti si
- Budget ~1000 €, usage 14B max. Neuf avec garantie, GDDR7, FP4 support.
#Questions fréquentes
La RTX 4090 peut-elle faire tourner Llama 3.1 70B en local ?+
Oui, mais avec compromis. Q4_K_M (42 Go) : offload massif → 6-8 tok/s (inutilisable). Q2_K (26 Go) : 2 Go en RAM → 10-12 tok/s (acceptable). IQ2_XS (21 Go) : tout VRAM → 20 tok/s mais qualité dégradée. Pour du 70B confortable, préférez une 5090 (32 Go).
Combien de tokens/sec pour Mistral 7B sur RTX 4090 ?+
100-115 tokens/seconde en Q4_K_M, 75 tok/s en Q8_0, 58 tok/s en FP16. Très largement suffisant pour n'importe quel usage chat.
RTX 4090 occasion ou RTX 5080 neuve ?+
4090 occasion (1800 €) : 24 Go VRAM, 10 % plus lente qu'une 5080 sur 7B mais ouvre 70B en offload et 32B en Q6. 5080 neuve (1300 €) : 16 Go, plus rapide sur petits modèles, garantie 3 ans, support FP4. Pour pur LLM, 4090 gagne grâce à la VRAM. Pour perf + garantie, 5080.
La RTX 4090 chauffe et consomme beaucoup en LLM ?+
Moins qu'en jeu. Inférence Mistral 7B soutenue : 250-320 W (vs 450 W TDP), GPU à 65-72 °C. Un boîtier airflow correct suffit. Pour usage 24/7, undervolter à 350 W réduit chaleur et bruit sans perte LLM significative.
Peut-on faire du fine-tuning LoRA sur RTX 4090 ?+
Oui, excellent. LoRA sur Llama 3.1 8B : 12 Go, confortable avec batch 4, contexte 4096. QLoRA sur Mistral Small 24B : ~18 Go, possible. QLoRA sur 70B : serré, mais faisable avec unsloth + batch 1. Pour du 70B LoRA classique, il faut 2× 4090 ou une 5090.
La RTX 4090 supporte-t-elle FP8 ?+
Oui, les Tensor Cores 4ᵉ gen Ada Lovelace supportent FP8 nativement. Exploité par TensorRT-LLM (gain +30-40 % vs FP16), vLLM (0.5+), partiellement par llama.cpp. Pour Ollama grand public, reste Q4-Q8. Pour du serving batch, FP8 vaut le coup.
Quelle alim pour RTX 4090 ?+
850 W minimum qualité (ATX 3.0 recommandé mais pas obligatoire). En usage LLM, consommation moyenne 250-320 W. En jeu ou benchmark, 450 W. CPU haut de gamme (9950X, 14900K) : 1000 W plus serein.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.