Intermédiaire 11 minRTX 50

Quel LLM sur RTX 5080 (16 Go) ?

La RTX 5080 (janvier 2025) est la carte la plus équilibrée de la gamme Blackwell pour l'IA locale. 16 Go de VRAM GDDR7, 960 Go/s de bande passante, 10 752 cœurs CUDA : elle fait tourner Mistral 7B à 100 tokens/seconde, Phi-4 14B à 55 tok/s, et tient Qwen 2.5 32B Q4 (19 Go) avec un léger offload. Ce guide détaille quels modèles installer, les benchmarks mesurés, et les optimisations spécifiques Blackwell.

Par Mohamed Meguedmi·Màj 2026-04-19·Testé sur Windows, macOS, Linux

#La RTX 5080 en 2026

Architecture
Blackwell GB203. Gravure TSMC 4NP.
VRAM
16 Go GDDR7 à 30 Gbps, bus 256 bits. Bande passante 960 Go/s (+33 % vs 4080 Super).
Cœurs CUDA
10 752. Tensor Cores 5ᵉ gen. Support FP4 natif.
TDP
360 W. Alim 750 W recommandée.
Prix MSRP
1199 € au lancement. Autour de 1300 € en 2026.
Position dans la gamme
Entre la 5070 Ti (même 16 Go, ~15 % moins chère) et la 5090 (32 Go, 2× plus chère). Pour l'IA locale, son atout principal est la bande passante GDDR7 qui fait 10-15 % de mieux que la 4080 Super à VRAM égale.

#1. Modèles recommandés

Modèles compatibles RTX 5080 — 16 Go VRAM
ModèleQuantVRAMTokens/secUsage
Llama 3.2 3BQ6_K2,6 Go170-185Chat instant, draft model
Mistral 7BQ5_K_M5,1 Go92-102Chat quotidien
Llama 3.1 8BQ5_K_M5,7 Go84-95Chat + RAG
Qwen 2.5 Coder 14BQ4_K_M8,3 Go58-68Assistant code complet
Phi-4 14BQ5_K_M10 Go52-62Raisonnement
Qwen 2.5 14BQ6_K11,5 Go48-56Chat qualité
Mistral Small 24BQ4_K_M14 Go32-40Polyvalent haut de gamme
Qwen 2.5 32BQ3_K_M15 Go24-30Offload partiel, RAG avancé

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Obligatoires pour que Windows/Linux reconnaissent la Blackwell. GeForce Experience ou téléchargement direct.
  2. 02
    Ollama (méthode simple)
    Téléchargez depuis ollama.com. L'installateur embarque CUDA 12.8. Aucune configuration GPU nécessaire.
  3. 03
    Vérifiez le GPU
    Lancez ollama run mistral puis dans une autre console ollama ps — vérifiez que PROCESSOR = 100% GPU.
  4. 04
    Optionnel : LM Studio
    UI graphique, détection CUDA 12 automatique depuis la 0.3.5. Recommandé pour explorer les modèles Hugging Face.
Installation & test
winget install Ollama.Ollama
ollama run mistral

#3. Benchmarks tokens/sec

RTX 5080 — tokens/sec mesurés, batch 1, contexte 2k
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Mistral 7B102 t/s92 t/s84 t/s68 t/s
Llama 3.1 8B90 t/s84 t/s76 t/s62 t/s
Phi-4 14B58 t/s52 t/s48 t/s40 t/s
Qwen 2.5 14B55 t/s50 t/s48 t/s38 t/s
Mistral Small 24B38 t/s32 t/s

#4. Optimisations

Flash Attention 3
Actif par défaut dans Ollama récent et llama.cpp master. Gain ~12 % sur contextes > 4k.
KV cache Q8
Permet un contexte 32k sur Mistral 7B en ne consommant que ~7 Go au lieu de 10.
Power limit
nvidia-smi -pl 300 réduit à 300 W sans perte de performance LLM notable (-3 % mesuré). Utile en été ou dans un boîtier compact.
NVFP4
Support hardware présent mais non exploité par Ollama/llama.cpp en 2026. À utiliser via vLLM 0.7+ ou TensorRT-LLM 0.18+ pour du serving batch.

#5. RTX 5080 vs 4080 Super vs 5070 Ti

Triangle 16 Go — le choix en 2026
CarteVRAMBande p.Mistral 7BPrix 2026
RTX 508016 Go960 Go/s102 t/s~1300 €
RTX 4080 Super16 Go736 Go/s88 t/s~1100 € occasion
RTX 5070 Ti16 Go896 Go/s92 t/s~950 €
RTX 4070 Ti Super16 Go672 Go/s78 t/s~750 € occasion
Le meilleur rapport perf/€ en 16 Go
La 5070 Ti — 92 tok/s sur Mistral 7B pour ~350 € de moins que la 5080. La 5080 justifie l'écart uniquement si vous avez besoin de sa puissance RT/rasterisation pour autre chose (jeu 4K, rendu 3D).

#Verdict achat 2026

Achetez une 5080 si
Vous voulez LE meilleur 16 Go du marché, tout neuf, avec garantie 3 ans. Budget ~1300 €, besoin de GDDR7, usage mixte LLM + gaming haut de gamme.
Évitez si
Budget serré — la 5070 Ti vous donne 90 % de la perf à 73 % du prix. Usage pur LLM + 24 Go nécessaires — visez une 4090 d'occasion à ~1800 €.
Upgrade depuis 4080 Super ?
Non. +15 % de vitesse LLM ne vaut pas 1000 €. Gardez la 4080 Super, attendez une génération de plus.

#Questions fréquentes

La RTX 5080 peut-elle faire tourner Llama 3.1 70B ?+
Non en qualité raisonnable. Le modèle pèse 42 Go en Q4_K_M, la carte a 16 Go — l'offload VRAM+RAM tombe à 4-6 tok/s, inutilisable. Restez sur Mistral Small 24B Q4 (14 Go, 38 tok/s) ou Qwen 2.5 32B IQ3 (15 Go, 28 tok/s).
16 Go suffisent pour l'IA locale en 2026 ?+
Oui pour 95 % des usages : tout modèle 7B-14B confortable, 24B jouable en Q4, 32B faisable en Q3. Seule limite : les 70B. Pour un usage pro RAG + chat équipe, 16 Go est l'entrée de gamme raisonnable.
RTX 5080 vs MacBook Pro M4 Max pour LLM ?+
Sur pure vitesse 7B : 5080 écrase (102 t/s vs 50 t/s). Sur modèle 70B : MBP M4 Max 64/128 Go gagne (RAM unifiée). En mobilité : MBP. En setup desktop sédentaire : 5080 dans un PC à ~2500 € bat un MBP M4 Max à 4500 €.
Combien de watts consomme la 5080 en usage LLM ?+
En inférence Mistral 7B continue : 180-220 W (le GPU n'est pas à fond). En chargement de modèle : pic à 320 W quelques secondes. TDP 360 W atteint uniquement en jeu AAA ou benchmark. Pour un chat LLM, l'impact facture est modéré.
Quelle alim pour RTX 5080 ?+
850 W ATX 3.0 ou 3.1 de qualité. La 5080 demande 360 W en pointe, plus 150-200 W CPU, plus périphériques. Une 750 W top-tier (Seasonic, Corsair RMx) peut tenir mais la marge est mince.
La RTX 5080 chauffe-t-elle beaucoup ?+
Les FE (Founders Edition) tournent à 72-78 °C sous charge soutenue, ce qui est raisonnable. Les modèles custom (ASUS TUF, MSI Gaming Trio) tombent à 65-70 °C. Pas de throttling observé en inférence LLM (moins gourmande qu'un jeu).
Flash Attention 3 est-il supporté sur 5080 ?+
Oui, pleinement. FA3 a été optimisé pour Blackwell. Dans llama.cpp récent, c'est actif par défaut et offre +10-15 % sur les contextes longs (>4k tokens) + réduction notable de l'usage KV cache.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.