Intermédiaire 11 minRTX 40
Quel LLM sur RTX 4080 / 4080 Super (16 Go) ?
La RTX 4080 (novembre 2022) et sa refresh 4080 Super (janvier 2024) sont les cartes Ada 16 Go premium. 9 728 cœurs CUDA (4080) ou 10 240 (4080 Super), 736 Go/s de bande passante GDDR6X. Elles font tourner Mistral 7B à 85-90 tok/s et Mistral Small 24B Q4 confortablement. En 2026, trouvables à ~1000-1200 € en occasion, elles offrent un excellent compromis pour un usage LLM 14B-24B. Ce guide compare les deux variantes et détaille quels LLM installer.
#RTX 4080 et 4080 Super
- Architecture
- Ada Lovelace AD103. TSMC 4N.
- VRAM
- 16 Go GDDR6X 22,4 Gbps (4080) / 23 Gbps (Super). Bande passante 716 / 736 Go/s.
- Cœurs CUDA
- 9 728 (4080) / 10 240 (4080 Super).
- TDP
- 320 W. Alim 850 W recommandée.
- Prix 2026
- 1000-1200 € occasion bon état. 4080 Super ~1300 € neuve raréfiée.
i
4080 vs 4080 Super — écart réel
+5 % de CUs, +3 % de bande passante. Sur LLM : ~3-5 % de tokens/sec. Différence négligeable en usage. Ne payez pas plus de 100 € de surcoût pour la Super face à une 4080 classique.
#1. Modèles compatibles 16 Go
Modèles LLM — RTX 4080 / 4080 Super 16 Go
| Modèle | Quant | VRAM | Tokens/sec | Usage |
|---|---|---|---|---|
| Mistral 7B | Q5_K_M | 5,1 Go | 82-92 | Chat rapide |
| Llama 3.1 8B | Q6_K | 6,7 Go | 72-82 | Chat + RAG |
| Qwen 2.5 Coder 14B | Q5_K_M | 10 Go | 48-56 | Code assistant |
| Phi-4 14B | Q6_K | 11,5 Go | 44-52 | Raisonnement |
| Qwen 2.5 14B | Q6_K | 11,5 Go | 42-50 | Chat qualité |
| Mistral Small 24B | Q4_K_M | 14 Go | 28-34 | Polyvalent premium |
| Qwen 2.5 32B | Q3_K_M | 15 Go | 22-26 | Reasoning serré |
#2. Installation
- 01Drivers NVIDIA 535+Standard pour Ada Lovelace. GeForce Experience ou apt install.
- 02OllamaInstalleur depuis ollama.com. CUDA embarqué.
- 03Modèle d'essai 16 Goollama run mistral-small (24B Q4_K_M, 14 Go).
#3. Benchmarks
RTX 4080 Super — tokens/sec
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Mistral 7B | 92 t/s | 82 t/s | 76 t/s | 62 t/s |
| Llama 3.1 8B | 82 t/s | 76 t/s | 68 t/s | 54 t/s |
| Phi-4 14B | 52 t/s | 48 t/s | 44 t/s | 36 t/s |
| Qwen 2.5 14B | 50 t/s | 46 t/s | 42 t/s | — |
| Mistral Small 24B | 34 t/s | 28 t/s | — | — |
#4. 4080 vs 4080 Super vs 5080
Triangle 16 Go premium
| Carte | VRAM | Bande p. | Mistral 7B | Prix 2026 |
|---|---|---|---|---|
| RTX 4080 | 16 Go GDDR6X | 716 Go/s | 85 t/s | ~1000 € occ. |
| RTX 4080 Super | 16 Go GDDR6X | 736 Go/s | 88 t/s | ~1200 € |
| RTX 5080 | 16 Go GDDR7 | 960 Go/s | 102 t/s | ~1300 € neuf |
| RTX 5070 Ti | 16 Go GDDR7 | 896 Go/s | 94 t/s | ~950 € neuf |
→
En 2026, préférez 5070 Ti neuve
Pour ~950 € neuf avec garantie, la 5070 Ti offre +10 % de vitesse LLM vs 4080 Super occasion, même 16 Go, support FP4 futur. Une 4080 occasion ne se justifie qu'à partir de -200 € vs 5070 Ti neuve.
#Verdict 2026
- Gardez votre 4080 si
- Elle fonctionne bien — 16 Go est toujours pertinent en 2026. Upgrade non prioritaire.
- Achetez une 4080/Super occasion si
- Prix ≤ 900 € (4080) ou 1050 € (Super). Au-delà, la 5070 Ti neuve est meilleur choix.
- Upgrade vers 5080/5070 Ti
- Vaut le coup uniquement si besoin FP4 futur ou revente 4080 à bon prix.
#Questions fréquentes
Quelle différence entre RTX 4080 et 4080 Super pour LLM ?+
~3-5 % de tokens/sec en faveur de la Super (+500 CUs, +3 % bande passante). Différence négligeable. Sur 1000 € d'écart, prenez la moins chère.
La RTX 4080 peut-elle faire tourner Qwen 2.5 32B ?+
Oui, en Q3_K_M (15 Go) à 22-26 tok/s, tangent. En Q4 (19 Go) : offload 3 Go RAM → 15-20 tok/s. Pour un 32B confortable, 24 Go sont nécessaires (3090/4090/5090).
RTX 4080 Super vs RTX 4070 Ti Super pour LLM ?+
Même VRAM (16 Go), la 4080 Super est 10-15 % plus rapide mais ~250 € plus chère. Pour pur LLM, 4070 Ti Super = meilleur rapport perf/€. La 4080 Super justifie l'écart pour gaming 4K + LLM.
Flash Attention 2 fonctionne sur RTX 4080 ?+
Oui, FA2 est supporté depuis les pilotes 535. Actif par défaut dans llama.cpp et Ollama récents. Gain : +10 % sur contextes > 4k. FA3 arrive dans les versions 2026.
Consommation de la RTX 4080 en usage LLM ?+
180-250 W en inférence continue Mistral 7B ou Phi-4 14B (TDP max 320 W). Chauffe modérée, ventilateurs audibles mais pas dérangeants. Parfaite pour usage bureau.
Peut-on faire du fine-tuning sur RTX 4080 ?+
QLoRA sur 7B-14B : oui confortablement. QLoRA sur Mistral Small 24B : serré (15 Go requis avec batch 1). LoRA classique : limité aux 7B-8B. Pour du FT 24B+, visez 24 Go minimum (3090/4090/5090).
La RTX 4080 vaut-elle le coup d'occasion en 2026 ?+
Seulement à prix ≤ 900-1000 €. Au-delà, la RTX 5070 Ti neuve (950 €) offre +10 % de vitesse LLM, mêmes 16 Go, GDDR7, support FP4, garantie 3 ans. Exception : si vous tombez sur une 4080 à 800 €, foncez.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.