Intermédiaire 11 minRTX 40

Quel LLM sur RTX 4080 / 4080 Super (16 Go) ?

La RTX 4080 (novembre 2022) et sa refresh 4080 Super (janvier 2024) sont les cartes Ada 16 Go premium. 9 728 cœurs CUDA (4080) ou 10 240 (4080 Super), 736 Go/s de bande passante GDDR6X. Elles font tourner Mistral 7B à 85-90 tok/s et Mistral Small 24B Q4 confortablement. En 2026, trouvables à ~1000-1200 € en occasion, elles offrent un excellent compromis pour un usage LLM 14B-24B. Ce guide compare les deux variantes et détaille quels LLM installer.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur Windows, macOS, Linux

#RTX 4080 et 4080 Super

Architecture
Ada Lovelace AD103. TSMC 4N.
VRAM
16 Go GDDR6X 22,4 Gbps (4080) / 23 Gbps (Super). Bande passante 716 / 736 Go/s.
Cœurs CUDA
9 728 (4080) / 10 240 (4080 Super).
TDP
320 W. Alim 850 W recommandée.
Prix 2026
1000-1200 € occasion bon état. 4080 Super ~1300 € neuve raréfiée.
i
4080 vs 4080 Super — écart réel
+5 % de CUs, +3 % de bande passante. Sur LLM : ~3-5 % de tokens/sec. Différence négligeable en usage. Ne payez pas plus de 100 € de surcoût pour la Super face à une 4080 classique.

#1. Modèles compatibles 16 Go

Modèles LLM — RTX 4080 / 4080 Super 16 Go
ModèleQuantVRAMTokens/secUsage
Mistral 7BQ5_K_M5,1 Go82-92Chat rapide
Llama 3.1 8BQ6_K6,7 Go72-82Chat + RAG
Qwen 2.5 Coder 14BQ5_K_M10 Go48-56Code assistant
Phi-4 14BQ6_K11,5 Go44-52Raisonnement
Qwen 2.5 14BQ6_K11,5 Go42-50Chat qualité
Mistral Small 24BQ4_K_M14 Go28-34Polyvalent premium
Qwen 2.5 32BQ3_K_M15 Go22-26Reasoning serré

#2. Installation

  1. 01
    Drivers NVIDIA 535+
    Standard pour Ada Lovelace. GeForce Experience ou apt install.
  2. 02
    Ollama
    Installeur depuis ollama.com. CUDA embarqué.
  3. 03
    Modèle d'essai 16 Go
    ollama run mistral-small (24B Q4_K_M, 14 Go).

#3. Benchmarks

RTX 4080 Super — tokens/sec
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Mistral 7B92 t/s82 t/s76 t/s62 t/s
Llama 3.1 8B82 t/s76 t/s68 t/s54 t/s
Phi-4 14B52 t/s48 t/s44 t/s36 t/s
Qwen 2.5 14B50 t/s46 t/s42 t/s
Mistral Small 24B34 t/s28 t/s

#4. 4080 vs 4080 Super vs 5080

Triangle 16 Go premium
CarteVRAMBande p.Mistral 7BPrix 2026
RTX 408016 Go GDDR6X716 Go/s85 t/s~1000 € occ.
RTX 4080 Super16 Go GDDR6X736 Go/s88 t/s~1200 €
RTX 508016 Go GDDR7960 Go/s102 t/s~1300 € neuf
RTX 5070 Ti16 Go GDDR7896 Go/s94 t/s~950 € neuf
En 2026, préférez 5070 Ti neuve
Pour ~950 € neuf avec garantie, la 5070 Ti offre +10 % de vitesse LLM vs 4080 Super occasion, même 16 Go, support FP4 futur. Une 4080 occasion ne se justifie qu'à partir de -200 € vs 5070 Ti neuve.

#Verdict 2026

Gardez votre 4080 si
Elle fonctionne bien — 16 Go est toujours pertinent en 2026. Upgrade non prioritaire.
Achetez une 4080/Super occasion si
Prix ≤ 900 € (4080) ou 1050 € (Super). Au-delà, la 5070 Ti neuve est meilleur choix.
Upgrade vers 5080/5070 Ti
Vaut le coup uniquement si besoin FP4 futur ou revente 4080 à bon prix.

#Questions fréquentes

Quelle différence entre RTX 4080 et 4080 Super pour LLM ?+
~3-5 % de tokens/sec en faveur de la Super (+500 CUs, +3 % bande passante). Différence négligeable. Sur 1000 € d'écart, prenez la moins chère.
La RTX 4080 peut-elle faire tourner Qwen 2.5 32B ?+
Oui, en Q3_K_M (15 Go) à 22-26 tok/s, tangent. En Q4 (19 Go) : offload 3 Go RAM → 15-20 tok/s. Pour un 32B confortable, 24 Go sont nécessaires (3090/4090/5090).
RTX 4080 Super vs RTX 4070 Ti Super pour LLM ?+
Même VRAM (16 Go), la 4080 Super est 10-15 % plus rapide mais ~250 € plus chère. Pour pur LLM, 4070 Ti Super = meilleur rapport perf/€. La 4080 Super justifie l'écart pour gaming 4K + LLM.
Flash Attention 2 fonctionne sur RTX 4080 ?+
Oui, FA2 est supporté depuis les pilotes 535. Actif par défaut dans llama.cpp et Ollama récents. Gain : +10 % sur contextes > 4k. FA3 arrive dans les versions 2026.
Consommation de la RTX 4080 en usage LLM ?+
180-250 W en inférence continue Mistral 7B ou Phi-4 14B (TDP max 320 W). Chauffe modérée, ventilateurs audibles mais pas dérangeants. Parfaite pour usage bureau.
Peut-on faire du fine-tuning sur RTX 4080 ?+
QLoRA sur 7B-14B : oui confortablement. QLoRA sur Mistral Small 24B : serré (15 Go requis avec batch 1). LoRA classique : limité aux 7B-8B. Pour du FT 24B+, visez 24 Go minimum (3090/4090/5090).
La RTX 4080 vaut-elle le coup d'occasion en 2026 ?+
Seulement à prix ≤ 900-1000 €. Au-delà, la RTX 5070 Ti neuve (950 €) offre +10 % de vitesse LLM, mêmes 16 Go, GDDR7, support FP4, garantie 3 ans. Exception : si vous tombez sur une 4080 à 800 €, foncez.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.