Intermédiaire 11 minRTX 40
Quel LLM sur RTX 4080 / 4080 Super (16 Go) ?
La RTX 4080 (novembre 2022) et sa refresh 4080 Super (janvier 2024) sont les cartes Ada 16 Go premium. 9 728 cœurs CUDA (4080) ou 10 240 (4080 Super), 736 Go/s de bande passante GDDR6X. Elles font tourner Qwen 3.5 9B à 40-44 tok/s et Mistral Small 24B Q4 confortablement. En 2026, trouvables à ~1000-1200 € en occasion, elles offrent un excellent compromis pour un usage LLM 14B-24B. Ce guide compare les deux variantes et détaille quels LLM installer.
#RTX 4080 et 4080 Super
- Architecture
- Ada Lovelace AD103. TSMC 4N.
- VRAM
- 16 Go GDDR6X 22,4 Gbps (4080) / 23 Gbps (Super). Bande passante 716 / 736 Go/s.
- Cœurs CUDA
- 9 728 (4080) / 10 240 (4080 Super).
- TDP
- 320 W. Alim 850 W recommandée.
- Prix 2026
- 1000-1200 € occasion bon état. 4080 Super ~1300 € neuve raréfiée.
i
4080 vs 4080 Super — écart réel
+5 % de CUs, +3 % de bande passante. Sur LLM : ~3-5 % de tokens/sec. Différence négligeable en usage. Ne payez pas plus de 100 € de surcoût pour la Super face à une 4080 classique.
#1. Modèles compatibles 16 Go
Modèles LLM — RTX 4080 / 4080 Super 16 Go
| Modèle | Quant | VRAM | Tokens/sec | Usage |
|---|---|---|---|---|
| Gemma 4 12B | Q4_K_M | 7 Go | 25-31 | Chat rapide |
| Granite 4.2 8B | Q5_K_M | 6 Go | 45-55 | Chat + RAG |
| Devstral Small 2 24B | Q4_K_M | 14 Go | 14-17 | Code assistant |
| Mistral Small 3 | Q4_K_M | 14 Go | 14-17 | Raisonnement |
| gpt-oss 20B | Q4_K_M | 13 Go | 50-61 | Chat qualité |
| Mistral Small 24B | Q4_K_M | 14 Go | 28-34 | Polyvalent premium |
| Qwen 3.5 9B | Q8_0 | 10 Go | 25-31 | Reasoning serré |
#2. Installation
- 01Drivers NVIDIA 535+Standard pour Ada Lovelace. GeForce Experience ou apt install.
- 02OllamaInstalleur depuis ollama.com. CUDA embarqué.
- 03Modèle d'essai 16 Goollama run mistral-small (24B Q4_K_M, 14 Go).
#3. Benchmarks
RTX 4080 Super — tokens/sec (ordres de grandeur)
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Granite 4.2 8B | 55 t/s | 50 t/s | 44 t/s | 36 t/s |
| Qwen 3.5 9B | 42 t/s | 37 t/s | 33 t/s | 28 t/s |
| Gemma 4 12B | 28 t/s | 25 t/s | 23 t/s | 19 t/s |
| gpt-oss 20B | 55 t/s | — | — | — |
| Mistral Small 24B | 31 t/s | 26 t/s | — | — |
#4. 4080 vs 4080 Super vs 5080
Triangle 16 Go premium
| Carte | VRAM | Bande p. | Qwen 3.5 9B | Prix 2026 |
|---|---|---|---|---|
| RTX 4080 | 16 Go GDDR6X | 716 Go/s | 40 t/s | ~1000 € occ. |
| RTX 4080 Super | 16 Go GDDR6X | 736 Go/s | 42 t/s | ~1200 € |
| RTX 5080 | 16 Go GDDR7 | 960 Go/s | 50 t/s | ~1300 € neuf |
| RTX 5070 Ti | 16 Go GDDR7 | 896 Go/s | 46 t/s | ~950 € neuf |
→
En 2026, préférez 5070 Ti neuve
Pour ~950 € neuf avec garantie, la 5070 Ti offre +10 % de vitesse LLM vs 4080 Super occasion, même 16 Go, support FP4 futur. Une 4080 occasion ne se justifie qu'à partir de -200 € vs 5070 Ti neuve.
#Verdict 2026
- Gardez votre 4080 si
- Elle fonctionne bien — 16 Go est toujours pertinent en 2026. Upgrade non prioritaire.
- Achetez une 4080/Super occasion si
- Prix ≤ 900 € (4080) ou 1050 € (Super). Au-delà, la 5070 Ti neuve est meilleur choix.
- Upgrade vers 5080/5070 Ti
- Vaut le coup uniquement si besoin FP4 futur ou revente 4080 à bon prix.
#Questions fréquentes
Quelle différence entre RTX 4080 et 4080 Super pour LLM ?+
~3-5 % de tokens/sec en faveur de la Super (+500 CUs, +3 % bande passante). Différence négligeable. Sur 1000 € d'écart, prenez la moins chère.
La RTX 4080 peut-elle faire tourner Qwen 3.8 27B ?+
C'est tangent : en Q4 (18 Go) il déborde d'environ 2 Go → offload en RAM à ~14-18 tok/s. Ce 27B sorti le 14/08/2026 apporte 262k de contexte et la vision (Apache 2.0). Pour le loger entièrement en VRAM, 24 Go sont nécessaires (3090/4090/5090). Astuce : son raisonnement par défaut le fait sur-réfléchir, passez-le en low pour les réponses courtes.
RTX 4080 Super vs RTX 4070 Ti Super pour LLM ?+
Même VRAM (16 Go), la 4080 Super est 10-15 % plus rapide mais ~250 € plus chère. Pour pur LLM, 4070 Ti Super = meilleur rapport perf/€. La 4080 Super justifie l'écart pour gaming 4K + LLM.
Flash Attention 2 fonctionne sur RTX 4080 ?+
Oui, FA2 est supporté depuis les pilotes 535. Actif par défaut dans llama.cpp et Ollama récents. Gain : +10 % sur contextes > 4k. FA3 arrive dans les versions 2026.
Consommation de la RTX 4080 en usage LLM ?+
180-250 W en inférence continue Qwen 3.5 9B ou Gemma 4 12B (TDP max 320 W). Chauffe modérée, ventilateurs audibles mais pas dérangeants. Parfaite pour usage bureau.
Peut-on faire du fine-tuning sur RTX 4080 ?+
QLoRA sur 7B-14B : oui confortablement. QLoRA sur Mistral Small 24B : serré (15 Go requis avec batch 1). LoRA classique : limité aux 7B-8B. Pour du FT 24B+, visez 24 Go minimum (3090/4090/5090).
La RTX 4080 vaut-elle le coup d'occasion en 2026 ?+
Seulement à prix ≤ 900-1000 €. Au-delà, la RTX 5070 Ti neuve (950 €) offre +10 % de vitesse LLM, mêmes 16 Go, GDDR7, support FP4, garantie 3 ans. Exception : si vous tombez sur une 4080 à 800 €, foncez.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.