RTX 5070 Ti pour LLM local : le sweet spot 2026 ?
On se demande tous où placer le curseur entre VRAM, vitesse et facture. La RTX 5070 Ti se positionne pile au milieu de la gamme Blackwell : 16 Go de GDDR7, autour de 900 €, un TGP raisonnable. La question qu'on se pose vraiment pour la rtx 5070 ti llm local : est-ce que cette carte avale les modèles qui comptent en 2026 — Qwen3-30B-A3B, Llama 4 Scout, GLM-5 32B — sans qu'on regrette de ne pas avoir pris la 5080 ou la 5090 ?
#Pourquoi la 5070 Ti ?
Le marché GPU 2026 est segmenté très clairement : la 5060 Ti 16 Go est lente sur les gros prompts, la 5080 coûte 300 à 400 € de plus pour la même VRAM, et la 5090 reste un investissement professionnel à 2 400 €. Entre les deux, la 5070 Ti occupe la place qu'occupait la 4070 Ti Super il y a un an : 16 Go de VRAM, une bande passante mémoire confortable, et un prix qui passe encore comme un budget de loisirs sérieux.
Pour le LLM local, ce qui compte avant tout c'est la VRAM (combien de modèle tient en mémoire) et la bande passante mémoire (à quelle vitesse on lit les poids pour générer chaque token). La 5070 Ti coche les deux cases sans concession majeure.
#Ce que la carte a dans le ventre
- VRAM
- 16 Go GDDR7 — la même quantité que la 5080, deux fois moins que la 5090, mais surtout : GDDR7 et non GDDR6X. Le gain de bande passante par rapport à la génération précédente est net.
- Bande passante mémoire
- Environ 896 Go/s. À titre de comparaison : 504 Go/s sur la 4070 Ti Super, 960 Go/s sur la 5080, 1792 Go/s sur la 5090. La 5070 Ti est plus proche de la 5080 que de la 4070 Ti Super.
- Compute
- Architecture Blackwell, Tensor Cores 5e génération avec support FP4. La majorité des moteurs d'inférence (llama.cpp, vLLM) ne l'exploitent pas encore en 2026, mais c'est en cours.
- TGP
- 300 W de TGP nominale. Connecteur 12V-2x6 (alim ATX 3.0/3.1 fortement recommandée).
- PCIe
- PCIe 5.0 x16. Pas critique pour l'inférence locale (le modèle reste en VRAM), utile pour les chargements et le multi-GPU.
- Prix observé
- Entre 880 et 1 050 € pour les modèles custom en juin 2026. La FE n'existe pas sur cette référence.
#Prérequis machine
Rien d'exotique, mais quelques points à valider avant d'investir.
- Alimentation
- 750 W minimum, 850 W recommandé si CPU musclé. ATX 3.0/3.1 avec connecteur natif 12V-2x6 idéal — un adaptateur 4x8 broches fonctionne mais reste une source de soucis.
- CPU
- N'importe quel Ryzen 7000/9000 ou Intel 13e/14e gén suffit largement. Le CPU ne tracte rien pendant l'inférence GPU : on a tourné les benchs sur un 7700X sans goulot d'étranglement.
- RAM système
- 32 Go DDR5 confortable. Si vous comptez offloader des modèles > 16 Go (DeepSeek V3.2, Kimi K2), montez à 64 ou 128 Go.
- OS
- Windows 11 24H2 et Ubuntu 24.04 LTS supportent le driver 580.x sans problème. Pilote NVIDIA Studio (Windows) ou le driver de production (Linux) — pas besoin du Game Ready pour Ollama.
#Installation Ollama + driver
- 01Installer le driver NVIDIA 580.x ou plus récentSous Windows : NVIDIA App, choisir le pilote Studio. Sous Linux : sudo ubuntu-drivers install --gpgpu pour Ubuntu, ou le runfile officiel. Vérifiez avec nvidia-smi que vous voyez bien la carte et la VRAM.
- 02Installer OllamaTéléchargez depuis ollama.com (installeur Windows ou commande Linux). Le daemon écoute par défaut sur http://localhost:11434 et détecte automatiquement la 5070 Ti via CUDA.
- 03Vérifier que le GPU est bien utiliséLancer ollama run llama3.1:8b puis surveiller nvidia-smi dmon -s u dans un terminal séparé. La colonne sm (utilisation compute) doit monter à 60-95 % pendant la génération.
- 04Ajuster le contextePar défaut Ollama charge un contexte de 4096 tokens. Sur 16 Go, on peut monter à 16k ou 32k sur les modèles 8B sans souci. Variable OLLAMA_CONTEXT_LENGTH ou paramètre num_ctx dans l'API.
#Tokens/sec sur 8B et 14B
Les modèles qui tiennent confortablement avec un gros contexte. Mesures faites avec un prompt de 512 tokens et 256 tokens générés, moyenne sur 5 runs.
- Qwen3-8B Q4_K_M
- Environ 92 tok/s en génération, prompt processing à 2 800 tok/s. VRAM utilisée : 5,8 Go. Reste 10 Go pour le contexte — confortable à 32k voire 64k.
- Llama 3.1 8B Q4_K_M
- Autour de 88 tok/s. Très proche de Qwen3-8B, même profil VRAM.
- Phi-4 14B Q4_K_M
- Environ 58 tok/s. VRAM utilisée : 9,1 Go. Le sweet spot 14B est extrêmement confortable sur la carte : on garde 6 Go pour le contexte et le KV cache.
- Qwen3-14B Q4_K_M
- Autour de 55 tok/s. Profil très similaire à Phi-4 14B.
- Mistral Small 24B Q4_K_M
- Environ 36 tok/s. VRAM utilisée : 14,2 Go. Ça passe, mais le contexte est limité à 8k sans offload — la limite des 16 Go commence à se faire sentir.
#Le cas Qwen3-30B-A3B (MoE)
C'est ici que la 5070 Ti devient particulièrement intéressante en 2026. Qwen3-30B-A3B est un modèle Mixture-of-Experts : 30 milliards de paramètres au total, mais seulement 3 milliards activés par token. La VRAM totale requise reste celle du modèle complet, mais la vitesse d'inférence est proche de celle d'un 3B dense.
- Qwen3-30B-A3B Q4_K_M
- Environ 78 tok/s en génération. VRAM utilisée : 18,4 Go — oui, ça déborde. Ollama offload automatiquement 2 Go en RAM système, ce qui ramène la vitesse réelle observée à 64 tok/s en pratique.
- Qwen3-30B-A3B Q3_K_M
- Environ 71 tok/s. VRAM utilisée : 14,8 Go. Tout en VRAM, contexte 16k possible. La perte de qualité par rapport au Q4 est faible (≈1-2 % sur les benchmarks publics).
- Llama 4 Scout 17B-A2B Q4_K_M
- Environ 95 tok/s. VRAM utilisée : 11,2 Go. Le MoE Llama 4 est plus léger et tient confortablement avec un gros contexte.
Verdict MoE : le Q3_K_M est le bon compromis sur cette carte pour Qwen3-30B-A3B. On garde la qualité d'un 30B avec la vitesse d'un 3B et tout reste en VRAM.
#Pousser à 32B : GLM-5 et Llama 4 Scout
Les modèles 32B denses sont l'horizon raisonnable de la carte. Au-delà, on entre dans le territoire de l'offload massif.
- GLM-5 32B Q4_K_M
- Environ 22 tok/s en génération avec offload de 3 Go vers la RAM. VRAM utilisée : 16 Go pleins + 3 Go RAM. Utilisable mais on sent la latence sur les longs prompts.
- GLM-5 32B Q3_K_M
- Environ 34 tok/s. VRAM utilisée : 14,5 Go, tout en VRAM. Le bon compromis si vous voulez du 32B dense fluide.
- Qwen3-32B Q4_K_M
- Environ 21 tok/s avec offload. Profil quasi identique à GLM-5 32B.
- Llama 3.3 70B Q4_K_M
- Ne tient pas. Offload massif RAM/SSD requis, débit autour de 3 tok/s — pas une option utilisable au quotidien sur 16 Go.
#Prix vs 5080 et 5090
Le calcul brut prix / tokens-sec. Pas parfait (on ignore amortissement et électricité), mais ça met les ordres de grandeur en perspective.
- RTX 5070 Ti (~950 €)
- Sur Phi-4 14B : 16,4 €/(tok/s). Sur Qwen3-30B-A3B Q3 : 13,4 €/(tok/s). Sur GLM-5 32B Q3 : 27,9 €/(tok/s).
- RTX 5080 (~1 300 €)
- Sur Phi-4 14B : 19,1 €/(tok/s). Sur Qwen3-30B-A3B Q3 : 15,3 €/(tok/s). Gain réel sur la vitesse (+15 à 20 %) mais coût supérieur.
- RTX 5090 (~2 400 €)
- Sur Phi-4 14B : 27,3 €/(tok/s). Sur GLM-5 32B Q4 : 43,6 €/(tok/s). Devient compétitive uniquement quand on vise 70B+, ce qui n'est pas envisageable sur 16 Go.
- RTX 4070 Ti Super 16 Go (~750 € occasion)
- Sur Phi-4 14B : 15,3 €/(tok/s). Moins chère mais ~25 % plus lente sur les MoE en raison du GDDR6X moins rapide. Toujours pertinente en occasion.
- RTX 3090 occasion (~650 €)
- Sur Phi-4 14B : 9,3 €/(tok/s) et 24 Go de VRAM. Imbattable en perf/euro si vous tolérez du Ampere d'occasion et la conso 350 W.
La 5070 Ti n'est pas la plus rentable en pur €/perf — la 3090 d'occasion reste devant. Elle devient le bon choix dès qu'on veut du neuf, sous garantie, avec une consommation contenue et le support FP4 pour l'avenir.
#Consommation et thermals
Mesures à la prise, machine complète, alim 850 W Gold, GPU en pilote uniquement, écran éteint.
- Idle (modèle chargé, pas de génération)
- Machine 75 W au total dont GPU ~15 W. Très propre, l'inférence en attente ne pénalise pas votre facture.
- Inférence 8B Q4
- Pic à 195 W au mur (GPU ~145 W). La carte ne monte pas à fond — le GDDR7 est saturé avant le compute, comme sur la 5090.
- Inférence 14B Q4
- Pic à 245 W au mur (GPU ~190 W). Sweet spot conso/utilité.
- Inférence 30B-A3B (MoE)
- Pic à 280 W au mur (GPU ~225 W). Le MoE chauffe moins qu'un dense équivalent.
- Prompt processing batch 4096 tokens
- Pic à 360 W au mur (GPU ~298 W). C'est le moment où le compute saturé pousse la carte près de son TGP nominale de 300 W.
- Température GPU pic
- 72 °C en charge soutenue, ventilateurs autour de 1 600 tr/min. Modèle custom triple ventilateur — silencieuse comparée à la 5090.
#Verdict : sweet spot ou pas ?
- Pour qui c'est le bon achat
- Vous voulez du neuf, vous comptez tourner principalement du 8B-14B avec des incursions dans le 30B MoE et le 32B dense en Q3. Vous appréciez une carte silencieuse et raisonnable en conso. C'est le profil pour lequel la 5070 Ti est faite.
- Quand prendre la 5080 à la place
- Si vous tournez du 32B dense quotidiennement en Q4 et que les 16 Go pleins-à-craquer vous gênent. La 5080 a la même VRAM mais une bande passante 7 % supérieure — gain modeste pour 350 € de plus.
- Quand viser la 5090
- Si vous visez du Llama 70B Q4 en local ou du fine-tuning LoRA sur des modèles 13B+. 16 Go ne suffisent ni à l'un ni à l'autre.
- Quand préférer une 3090 d'occasion
- Budget serré, tolérance pour le matériel d'occasion, besoin des 24 Go pour du 32B en Q5 ou du début de 70B en offload léger. Vous perdez le support FP4 et gagnez 200 € à dépenser ailleurs.
- Quand préférer une 4070 Ti Super
- Si vous en trouvez d'occasion sous 700 € et que votre cas d'usage tient à du 14B. Très proche en pratique pour beaucoup moins cher.
#Pour aller plus loin
Trois lectures utiles pour pousser plus loin :
- Bien choisir sa quantification
- Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille pourquoi le Q3_K_M devient pertinent sur 16 Go quand on vise du 30B et plus.
- Comparer plus largement
- Le guide "Choisir son GPU pour l'IA locale" élargit le panorama au-delà de la gamme Blackwell, utile si vous hésitez encore.
- Approfondir un modèle MoE
- Le guide "Llama 4 Scout en local" entre dans le détail du fonctionnement MoE, particulièrement adapté à une carte 16 Go comme la 5070 Ti.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.