Intermédiaire 11 minRTX 50

Quel LLM sur RTX 5070 Ti (16 Go) ?

La RTX 5070 Ti (février 2025) est probablement la meilleure carte 2025 pour l'IA locale grand public. 16 Go de VRAM GDDR7, 896 Go/s de bande passante, 8 960 cœurs CUDA : elle fait tourner Granite 4.2 8B à ~50 tokens/seconde et Mistral Small 24B Q4 confortablement, pour ~950 € — soit 350 € de moins qu'une 5080. Ce guide détaille pourquoi c'est le sweet spot 2026 et quels modèles installer.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 5070 Ti, sweet spot 16 Go

Architecture
Blackwell GB203 (même die que la 5080, plus de CUs désactivées).
VRAM
16 Go GDDR7 à 28 Gbps, bus 256 bits. Bande passante 896 Go/s.
Cœurs CUDA
8 960. Tensor Cores 5ᵉ gen, support FP4 natif.
TDP
300 W. Alim 750 W recommandée.
Prix MSRP
884 € au lancement. ~950-1000 € en 2026 (custom).
Pourquoi c'est le sweet spot
Même 16 Go GDDR7 qu'une 5080, bande passante à 93 % de celle-ci, mais ~350 € moins chère. Pour l'IA locale où la VRAM et la bande passante mémoire dominent, l'écart de CUs ne fait perdre que 8-12 % en vitesse — pas 30 % de prix.

#1. Modèles LLM compatibles

Modèles recommandés — RTX 5070 Ti 16 Go
ModèleQuantVRAM modèleTokens/secUsage
Granite 4.2 8BQ4_K_M4,6 Go45-55Chat instantané
Gemma 4 12BQ4_K_M7 Go25-31Chat/RAG quotidien
Qwen 3.5 9BQ4_K_M6 Go25-31Assistant code VS Code
gpt-oss 20BQ4_K_M13 Go50-61Chat + RAG + FR
Qwen 3.5 9BQ8_011 Go18-22Qualité max / raisonnement
Devstral Small 2 24BQ4_K_M14 Go14-17Chat qualité
Mistral Small 24BQ4_K_M14 Go28-35Polyvalent premium
Qwen 3.6 35B-A3BQ3_K_M~15 Go22-28RAG avancé, MoE rapide (offload léger)

#2. Installation (Ollama + CUDA)

  1. 01
    Drivers NVIDIA 570+
    Requis pour Blackwell. GeForce Experience sur Windows, apt install nvidia-driver-570 sur Ubuntu.
  2. 02
    Ollama
    Installeur standard depuis ollama.com, CUDA embarqué. ollama run granite4.2:8b pour un test immédiat.
  3. 03
    Vérification
    nvidia-smi doit afficher RTX 5070 Ti, 16376 MiB. ollama ps pendant un chat : PROCESSOR 100% GPU.
Setup Linux complet
sudo apt update
sudo apt install nvidia-driver-570
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral-small

#3. Vitesse par quantification (ordres de grandeur)

RTX 5070 Ti — tokens/sec (ordres de grandeur), Ollama récent, batch 1, Ryzen 9 7900X
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Granite 4.2 8B50 t/s46 t/s42 t/s34 t/s
Qwen 3.5 9B30 t/s28 t/s26 t/s22 t/s
Gemma 4 12B28 t/s26 t/s24 t/s20 t/s
Mistral Small 24B32 t/s28 t/s
Devstral 24B16 t/s14 t/s

#4. Optimisations Blackwell

Flash Attention 3
Actif par défaut, +10-14 % sur contextes 4k+. Visible dans les logs llama.cpp.
KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0. Permet 32k de contexte sur Granite 4.2 8B en ~5-6 Go au lieu de 8.
NVFP4 future-proof
Hardware présent mais peu exploité en 2026. Dans 12-18 mois, Ollama supportera FP4 → +40 % de vitesse attendus.
Undervolt
250 W au lieu de 300 W (via MSI Afterburner -80 mV) : -1 % perf LLM, -5 °C, boîtier plus silencieux.

#5. 5070 Ti vs 4070 Ti Super vs 5080

Les trois cartes 16 Go premium
Critère5070 Ti4070 Ti Super5080
VRAM16 Go GDDR716 Go GDDR6X16 Go GDDR7
Bande passante896 Go/s672 Go/s960 Go/s
Granite 4.2 8B Q450 t/s42 t/s56 t/s
Gemma 4 12B Q428 t/s23 t/s32 t/s
Prix 2026~950 €~750 € occasion~1300 €
Perf/€ LLM★★★★★★★★★★★★

#Verdict achat 2026

Meilleur choix LLM 2026 grand public
Pour quiconque a ~1000 € de budget GPU et veut du LLM sérieux sans aller sur une 5090. Elle écrase le rapport perf/€ face à la 5080.
Upgrade depuis 4070 Ti Super ?
+20 % de vitesse LLM, +33 % de bande passante. Pas indispensable si ça tourne — mais argumentable si vous vendez la 4070 Ti Super à ~700 €.
vs RTX 4090 occasion
La 4090 d'occasion (~1800 €) garde l'avantage pour les 70B (24 Go VRAM). Si vous n'en avez pas besoin, 5070 Ti = perf LLM 14B quasi équivalente pour moitié prix.

#Questions fréquentes

RTX 5070 Ti ou RTX 5080 pour LLM ?+
5070 Ti sans hésiter si votre budget est < 1100 €. Vous perdez ~10 % de vitesse sur Granite 4.2 8B (50 vs 56 tok/s) pour ~350 € économisés. Même VRAM (16 Go), même génération, même GDDR7. La 5080 se justifie pour un usage mixte gaming 4K + LLM où vous voulez le top.
La RTX 5070 Ti 16 Go peut-elle tourner Mistral Small 24B ?+
Oui, en Q4_K_M (14 Go) à 28-35 tokens/seconde. C'est le modèle polyvalent qui tire le mieux parti de ses 16 Go. En Q5_K_M (17 Go), léger offload mais encore utilisable à 20-25 tok/s.
Quelle est la différence entre RTX 4070 Ti Super et RTX 5070 Ti ?+
Même VRAM (16 Go) mais GDDR7 au lieu de GDDR6X → +33 % de bande passante. Résultat LLM : +20-25 % de tokens/seconde. Prix similaire au lancement, mais la 4070 Ti Super se trouve moins cher en occasion (~750 € vs 950 € neuve).
Peut-on faire du QLoRA sur RTX 5070 Ti 16 Go ?+
Oui, confortablement sur 7B-8B (10-12 Go requis avec batch 4, contexte 2048). Pour du 14B QLoRA c'est serré mais jouable avec unsloth. Pour du 24B QLoRA : impossible, il faut 20 Go+.
Alim 650 W suffit pour une RTX 5070 Ti ?+
Oui avec un CPU ≤ 150 W (Ryzen 7600/7700, Core i5). TDP 300 W GPU + 150 W CPU + 50 W système = 500 W nominal, 650 W offrent de la marge. Si CPU ≥ 180 W (9950X, 14900K), visez 750 W.
La RTX 5070 Ti supporte-t-elle FP4 / NVFP4 ?+
Oui, les Tensor Cores 5ᵉ gen Blackwell gèrent FP4 nativement. En 2026, Ollama et llama.cpp ne l'exploitent pas encore — ça viendra. Via TensorRT-LLM 0.18+ ou vLLM 0.7+, on observe déjà +30-40 % vs Q4_K_M sur modèles quantifiés en NVFP4.
Je viens d'une RTX 3080 10 Go, l'upgrade vaut le coup ?+
Oui, saut générationnel énorme. +60 % de VRAM (10 → 16 Go — ouvre les 14B-24B), +3× la bande passante (760 → 896 Go/s après inflation GDDR7), +2× la vitesse brute. Si vous utilisez un LLM au quotidien, c'est l'upgrade le plus cost-effective de 2026.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.