Intermédiaire 12 minRTX 40
Quel LLM sur RTX 4090 (24 Go) ?
La RTX 4090 (octobre 2022) reste en 2026 la référence IA locale grand public : 24 Go de VRAM GDDR6X, 1008 Go/s de bande passante, 16 384 cœurs CUDA Ada Lovelace. Elle fait tourner Qwen 3.5 9B à plus de 90 tok/s, un Qwen 3.8 27B Q4 confortablement, et encore un Llama 70B Q4 en offload léger. Désormais 1700-2000 € en occasion (stocks ex-LHR), elle a un meilleur rapport perf/€ qu'une 5080 neuve pour pur usage LLM. Ce guide détaille tous les modèles qui tournent et des ordres de grandeur de débit.
#La RTX 4090 en 2026, toujours reine
- Architecture
- Ada Lovelace (AD102), gravure TSMC 4N. 76 milliards de transistors.
- VRAM
- 24 Go GDDR6X à 21 Gbps, bus 384 bits. Bande passante 1008 Go/s.
- Cœurs CUDA
- 16 384. Tensor Cores 4ᵉ gen FP8 natif. RT Cores 3ᵉ gen.
- TDP
- 450 W. Alim 850 W recommandée.
- Prix 2026
- 1700-2000 € en occasion soignée, ~2200 € en neuf rare.
→
Pourquoi encore pertinente en 2026
24 Go = seuil magique qui ouvre Llama 3.3 70B Q2_K (26 Go avec offload 2 Go), Qwen 3.8 27B en Q8, Qwen3-Coder 30B-A3B. La 5080 (16 Go neuve) ne peut pas, la 5090 (32 Go neuve) coûte 2× le prix. En pur rapport VRAM/€, la 4090 occasion domine.
#1. Modèles compatibles 24 Go
Modèles LLM — RTX 4090 24 Go
| Modèle | Quant | VRAM | Tokens/sec | Usage |
|---|---|---|---|---|
| gpt-oss 20B | Q4_K_M | 13 Go | 117-143 | Chat instantané |
| Devstral Small 2 24B | Q4_K_M | 14 Go | 36-44 | Chat + RAG FR |
| Qwen 3.6 27B | Q4_K_M | 16 Go | 29-35 | Assistant code pro |
| Qwen 3.8 27B | Q4_K_M | 16 Go | 20-24 | Raisonnement qualité |
| Mistral Small 24B | Q6_K | 20 Go | 32-38 | Sweet spot polyvalent |
| GLM 4.7 Flash | Q4_K_M | 19 Go | 90-110 | Reasoning avancé |
| Granite 4.1 30B Instruct | Q4_K_M | 17 Go | 27-33 | Code complexe multi-fichiers |
| Gemma 4 26B-A4B MoE | Q5_K_M | 19 Go | 54-66 | Offload 2 Go RAM, usable |
| Gemma 4 31B | Q5_K_M | 22 Go | 27-33 | Tout en VRAM, qualité dégradée |
i
Llama 70B : quelle quantization privilégier ?
Q4_K_M (42 Go) : offload massif, ~6 tok/s, peu confortable. Q2_K (26 Go) : 2 Go à décharger en RAM, ~10 tok/s, qualité correcte. IQ2_XS (21 Go) : tout en VRAM, ~20 tok/s mais qualité nettement dégradée. Pour un 70B confortable en local, visez une 5090 (32 Go) ou un Mac Studio.
#2. Installation & CUDA
- 01Drivers NVIDIA 550+CUDA 12.4+. Pour une 4090 neuve, GeForce Experience fait le travail. Linux : nvidia-driver-565 ou plus.
- 02OllamaInstalleur standard depuis ollama.com. Auto-détection GPU CUDA.
- 03Premier test modèle 24 Goollama run qwen3.8:27b — profite de la VRAM dispo et met en valeur la carte.
#3. Benchmarks tokens/sec
RTX 4090 24 Go — ordres de grandeur tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 135 t/s | 122 t/s | 110 t/s | 90 t/s |
| Granite 4.2 8B | 100 t/s | 92 t/s | 82 t/s | 66 t/s |
| Qwen 3.5 9B | 92 t/s | 85 t/s | 76 t/s | 62 t/s |
| Gemma 4 12B | 70 t/s | 64 t/s | 57 t/s | 48 t/s |
| Mistral Small 24B | 42 t/s | 38 t/s | 34 t/s | 28 t/s |
| Qwen 3.8 27B | 32 t/s | 28 t/s | 25 t/s | — |
#4. Optimisations Ada
- Flash Attention 2
- Actif par défaut. FA3 arrive dans les futures versions llama.cpp.
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0. Permet contexte 32k sur 14B en ~15 Go, laissant 9 Go pour d'autres processus.
- Power limit
- nvidia-smi -pl 350 (à partir de 350 W). LLM : -2 % de vitesse, -25 % de chaleur et bruit. Config sustainable 24/7.
- FP8 via TensorRT-LLM
- Ada supporte FP8 natif. Via TensorRT-LLM, +40 % de throughput batch sur Qwen 3.5 9B. Surtout utile en serving multi-utilisateurs.
#5. 4090 vs 5090 vs 3090
Les trois flagships NVIDIA grand public
| Critère | RTX 5090 | RTX 4090 | RTX 3090 |
|---|---|---|---|
| VRAM | 32 Go GDDR7 | 24 Go GDDR6X | 24 Go GDDR6X |
| Bande passante | 1792 Go/s | 1008 Go/s | 936 Go/s |
| Qwen 3.5 9B Q4 | 115 t/s | 92 t/s | 66 t/s |
| Llama 70B Q4 | 22-28 t/s | 7-10 t/s | 5-8 t/s |
| Prix 2026 | ~2500 € neuf | ~1800 € occasion | ~750 € occasion |
→
Le meilleur rapport 24 Go/€ : 3090 occasion
Pour 750 € vs 1800 €, la 3090 offre les mêmes 24 Go de VRAM. Perte de ~30 % en vitesse pure. Si votre priorité c'est la VRAM (modèles 24-32B, QLoRA 14B+) et pas la vitesse max, la 3090 occasion reste le meilleur rapport qualité/prix LLM de toute l'histoire NVIDIA.
#Occasion 2026 : achat intelligent ?
- Achetez une 4090 occasion si
- Budget 1500-2000 €, usage LLM intensif, pas besoin de la toute dernière génération. 24 Go de VRAM = argument massif.
- Préférez une RTX 5090 si
- Budget ≥ 2500 €, usage 70B régulier, besoin de FP4 natif, serveur d'équipe. 32 Go changent la donne.
- Préférez une RTX 3090 si
- Budget ≤ 1000 €, pur usage LLM, vitesse secondaire. Même VRAM pour moitié prix.
- Préférez une RTX 5070 Ti si
- Budget ~1000 €, usage 14B max. Neuf avec garantie, GDDR7, FP4 support.
#Questions fréquentes
La RTX 4090 peut-elle faire tourner Llama 3.3 70B en local ?+
Oui, mais avec compromis. Q4_K_M (42 Go) : offload massif → 6-8 tok/s (inutilisable). Q2_K (26 Go) : 2 Go en RAM → 10-12 tok/s (acceptable). IQ2_XS (21 Go) : tout VRAM → 20 tok/s mais qualité dégradée. Pour un vrai grand modèle confortable, préférez une 5090 (32 Go) — ou restez sur un Qwen 3.8 27B qui tient entièrement en VRAM.
Combien de tokens/sec pour Qwen 3.5 9B sur RTX 4090 ?+
Environ 90 tokens/seconde en Q4_K_M, 62 tok/s en Q8_0. Très largement suffisant pour n'importe quel usage chat, avec en prime les 256k de contexte et la vision du modèle.
RTX 4090 occasion ou RTX 5080 neuve ?+
4090 occasion (1800 €) : 24 Go VRAM, 10 % plus lente qu'une 5080 sur 7B mais ouvre 70B en offload et 32B en Q6. 5080 neuve (1300 €) : 16 Go, plus rapide sur petits modèles, garantie 3 ans, support FP4. Pour pur LLM, 4090 gagne grâce à la VRAM. Pour perf + garantie, 5080.
La RTX 4090 chauffe et consomme beaucoup en LLM ?+
Moins qu'en jeu. Inférence Qwen 3.5 9B soutenue : 250-320 W (vs 450 W TDP), GPU à 65-72 °C. Un boîtier airflow correct suffit. Pour usage 24/7, undervolter à 350 W réduit chaleur et bruit sans perte LLM significative.
Peut-on faire du fine-tuning LoRA sur RTX 4090 ?+
Oui, excellent. LoRA sur Qwen 3.5 9B : 12 Go, confortable avec batch 4, contexte 4096. QLoRA sur Mistral Small 24B : ~18 Go, possible. QLoRA sur un 70B : serré, mais faisable avec unsloth + batch 1. Pour du 70B LoRA classique, il faut 2× 4090 ou une 5090.
La RTX 4090 supporte-t-elle FP8 ?+
Oui, les Tensor Cores 4ᵉ gen Ada Lovelace supportent FP8 nativement. Exploité par TensorRT-LLM (gain +30-40 % vs FP16), vLLM (0.5+), partiellement par llama.cpp. Pour Ollama grand public, reste Q4-Q8. Pour du serving batch, FP8 vaut le coup.
Quelle alim pour RTX 4090 ?+
850 W minimum qualité (ATX 3.0 recommandé mais pas obligatoire). En usage LLM, consommation moyenne 250-320 W. En jeu ou benchmark, 450 W. CPU haut de gamme (9950X, 14900K) : 1000 W plus serein.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.