Intermédiaire 11 minRTX 50

Quel LLM sur RTX 5080 (16 Go) ?

La RTX 5080 (janvier 2025) est la carte la plus équilibrée de la gamme Blackwell pour l'IA locale. 16 Go de VRAM GDDR7, 960 Go/s de bande passante, 10 752 cœurs CUDA : elle fait tourner Qwen 3.5 9B à 78 tokens/seconde, gpt-oss 20B à 130 tok/s, et tient Qwen 3.6 35B-A3B en Q3 (16 Go) avec un léger offload. Ce guide détaille quels modèles installer, les ordres de grandeur de vitesse, et les optimisations spécifiques Blackwell.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 5080 en 2026

Architecture
Blackwell GB203. Gravure TSMC 4NP.
VRAM
16 Go GDDR7 à 30 Gbps, bus 256 bits. Bande passante 960 Go/s (+33 % vs 4080 Super).
Cœurs CUDA
10 752. Tensor Cores 5ᵉ gen. Support FP4 natif.
TDP
360 W. Alim 750 W recommandée.
Prix MSRP
1199 € au lancement. Autour de 1300 € en 2026.
Position dans la gamme
Entre la 5070 Ti (même 16 Go, ~15 % moins chère) et la 5090 (32 Go, 2× plus chère). Pour l'IA locale, son atout principal est la bande passante GDDR7 qui fait 10-15 % de mieux que la 4080 Super à VRAM égale.

#1. Modèles recommandés

Modèles compatibles RTX 5080 — 16 Go VRAM
ModèleQuantVRAMTokens/secUsage
Granite 4.2 8BQ4_K_M4,6 Go68-83Chat instant, draft model
Gemma 4 12BQ4_K_M7 Go41-50Chat quotidien
Qwen 3.5 9BQ4_K_M6 Go68-83Chat + RAG
gpt-oss 20BQ4_K_M13 Go117-143Assistant code complet
Qwen 3.5 9BQ8_011 Go45-55Raisonnement, qualité max
Devstral Small 2 24BQ4_K_M14 Go36-44Chat qualité
Mistral Small 24BQ4_K_M14 Go32-40Polyvalent haut de gamme
Qwen 3.6 35B-A3BQ3_K_M16 Go40-52MoE rapide, offload léger, RAG avancé

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Obligatoires pour que Windows/Linux reconnaissent la Blackwell. GeForce Experience ou téléchargement direct.
  2. 02
    Ollama (méthode simple)
    Téléchargez depuis ollama.com. L'installateur embarque CUDA 12.8. Aucune configuration GPU nécessaire.
  3. 03
    Vérifiez le GPU
    Lancez ollama run qwen3.5:9b puis dans une autre console ollama ps — vérifiez que PROCESSOR = 100% GPU.
  4. 04
    Optionnel : LM Studio
    UI graphique, détection CUDA 12 automatique depuis la 0.3.5. Recommandé pour explorer les modèles Hugging Face.
Installation & test
winget install Ollama.Ollama
ollama run qwen3.5:9b

#3. Benchmarks tokens/sec

RTX 5080 — tokens/sec, ordres de grandeur, batch 1, contexte 2k
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 9B78 t/s70 t/s64 t/s52 t/s
Granite 4.2 8B80 t/s72 t/s66 t/s54 t/s
Gemma 4 12B46 t/s41 t/s38 t/s32 t/s
Devstral 24B40 t/s34 t/s
Mistral Small 24B38 t/s32 t/s

#4. Optimisations

Flash Attention 3
Actif par défaut dans Ollama récent et llama.cpp master. Gain ~12 % sur contextes > 4k.
KV cache Q8
Permet un contexte 32k sur Qwen 3.5 9B en ne consommant que ~7 Go au lieu de 10.
Power limit
nvidia-smi -pl 300 réduit à 300 W sans perte de performance LLM notable (-3 % mesuré). Utile en été ou dans un boîtier compact.
NVFP4
Support hardware présent mais non exploité par Ollama/llama.cpp en 2026. À utiliser via vLLM 0.7+ ou TensorRT-LLM 0.18+ pour du serving batch.

#5. RTX 5080 vs 4080 Super vs 5070 Ti

Triangle 16 Go — le choix en 2026
CarteVRAMBande p.Qwen 3.5 9BPrix 2026
RTX 508016 Go960 Go/s78 t/s~1300 €
RTX 4080 Super16 Go736 Go/s67 t/s~1100 € occasion
RTX 5070 Ti16 Go896 Go/s72 t/s~950 €
RTX 4070 Ti Super16 Go672 Go/s60 t/s~750 € occasion
Le meilleur rapport perf/€ en 16 Go
La 5070 Ti — 72 tok/s sur Qwen 3.5 9B pour ~350 € de moins que la 5080. La 5080 justifie l'écart uniquement si vous avez besoin de sa puissance RT/rasterisation pour autre chose (jeu 4K, rendu 3D).

#Verdict achat 2026

Achetez une 5080 si
Vous voulez LE meilleur 16 Go du marché, tout neuf, avec garantie 3 ans. Budget ~1300 €, besoin de GDDR7, usage mixte LLM + gaming haut de gamme.
Évitez si
Budget serré — la 5070 Ti vous donne 90 % de la perf à 73 % du prix. Usage pur LLM + 24 Go nécessaires — visez une 4090 d'occasion à ~1800 €.
Upgrade depuis 4080 Super ?
Non. +15 % de vitesse LLM ne vaut pas 1000 €. Gardez la 4080 Super, attendez une génération de plus.

#Questions fréquentes

La RTX 5080 peut-elle faire tourner un modèle dense 70B ?+
Non en qualité raisonnable. Un 70B dense pèse ~42 Go en Q4_K_M, la carte a 16 Go — l'offload VRAM+RAM tombe à 4-6 tok/s, inutilisable. Restez sur Mistral Small 24B Q4 (14 Go, 38 tok/s) ou, pour plus de capacité, Qwen 3.6 35B-A3B Q3 (16 Go, ~45 tok/s) : son architecture MoE (3B actifs) reste rapide même avec un léger offload.
16 Go suffisent pour l'IA locale en 2026 ?+
Oui pour 95 % des usages : tout modèle 7B-14B confortable, 24B jouable en Q4, 32B faisable en Q3. Seule limite : les 70B. Pour un usage pro RAG + chat équipe, 16 Go est l'entrée de gamme raisonnable.
RTX 5080 vs MacBook Pro M4 Max pour LLM ?+
Sur pure vitesse d'un petit modèle (Qwen 3.5 9B) : 5080 écrase (78 t/s vs ~40 t/s). Sur modèle 70B : MBP M4 Max 64/128 Go gagne (RAM unifiée). En mobilité : MBP. En setup desktop sédentaire : 5080 dans un PC à ~2500 € bat un MBP M4 Max à 4500 €.
Combien de watts consomme la 5080 en usage LLM ?+
En inférence Qwen 3.5 9B continue : 180-220 W (le GPU n'est pas à fond). En chargement de modèle : pic à 320 W quelques secondes. TDP 360 W atteint uniquement en jeu AAA ou benchmark. Pour un chat LLM, l'impact facture est modéré.
Quelle alim pour RTX 5080 ?+
850 W ATX 3.0 ou 3.1 de qualité. La 5080 demande 360 W en pointe, plus 150-200 W CPU, plus périphériques. Une 750 W top-tier (Seasonic, Corsair RMx) peut tenir mais la marge est mince.
La RTX 5080 chauffe-t-elle beaucoup ?+
Les FE (Founders Edition) tournent à 72-78 °C sous charge soutenue, ce qui est raisonnable. Les modèles custom (ASUS TUF, MSI Gaming Trio) tombent à 65-70 °C. Pas de throttling observé en inférence LLM (moins gourmande qu'un jeu).
Flash Attention 3 est-il supporté sur 5080 ?+
Oui, pleinement. FA3 a été optimisé pour Blackwell. Dans llama.cpp récent, c'est actif par défaut et offre +10-15 % sur les contextes longs (>4k tokens) + réduction notable de l'usage KV cache.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.