RTX 5070 Ti pour LLM local : le sweet spot 2026 ?
On se demande tous où placer le curseur entre VRAM, vitesse et facture. La RTX 5070 Ti se positionne pile au milieu de la gamme Blackwell : 16 Go de GDDR7, autour de 900 €, un TGP raisonnable. La question qu'on se pose vraiment pour la rtx 5070 ti llm local : est-ce que cette carte avale les modèles qui comptent en 2026 — GLM 4.7 Flash (MoE 30B-A3B), gpt-oss 20B, Qwen 3.8 27B — sans qu'on regrette de ne pas avoir pris la 5080 ou la 5090 ?
#Pourquoi la 5070 Ti ?
Le marché GPU 2026 est segmenté très clairement : la 5060 Ti 16 Go est lente sur les gros prompts, la 5080 coûte 300 à 400 € de plus pour la même VRAM, et la 5090 reste un investissement professionnel à 2 400 €. Entre les deux, la 5070 Ti occupe la place qu'occupait la 4070 Ti Super il y a un an : 16 Go de VRAM, une bande passante mémoire confortable, et un prix qui passe encore comme un budget de loisirs sérieux.
Pour le LLM local, ce qui compte avant tout c'est la VRAM (combien de modèle tient en mémoire) et la bande passante mémoire (à quelle vitesse on lit les poids pour générer chaque token). La 5070 Ti coche les deux cases sans concession majeure.
#Ce que la carte a dans le ventre
- VRAM
- 16 Go GDDR7 — la même quantité que la 5080, deux fois moins que la 5090, mais surtout : GDDR7 et non GDDR6X. Le gain de bande passante par rapport à la génération précédente est net.
- Bande passante mémoire
- Environ 896 Go/s. À titre de comparaison : 504 Go/s sur la 4070 Ti Super, 960 Go/s sur la 5080, 1792 Go/s sur la 5090. La 5070 Ti est plus proche de la 5080 que de la 4070 Ti Super.
- Compute
- Architecture Blackwell, Tensor Cores 5e génération avec support FP4. La majorité des moteurs d'inférence (llama.cpp, vLLM) ne l'exploitent pas encore en 2026, mais c'est en cours.
- TGP
- 300 W de TGP nominale. Connecteur 12V-2x6 (alim ATX 3.0/3.1 fortement recommandée).
- PCIe
- PCIe 5.0 x16. Pas critique pour l'inférence locale (le modèle reste en VRAM), utile pour les chargements et le multi-GPU.
- Prix observé
- Entre 880 et 1 050 € pour les modèles custom en juin 2026. La FE n'existe pas sur cette référence.
#Prérequis machine
Rien d'exotique, mais quelques points à valider avant d'investir.
- Alimentation
- 750 W minimum, 850 W recommandé si CPU musclé. ATX 3.0/3.1 avec connecteur natif 12V-2x6 idéal — un adaptateur 4x8 broches fonctionne mais reste une source de soucis.
- CPU
- N'importe quel Ryzen 7000/9000 ou Intel 13e/14e gén suffit largement. Le CPU ne tracte rien pendant l'inférence GPU : on a tourné les benchs sur un 7700X sans goulot d'étranglement.
- RAM système
- 32 Go DDR5 confortable. Si vous comptez offloader des modèles > 16 Go (DeepSeek V3.2, Kimi K2), montez à 64 ou 128 Go.
- OS
- Windows 11 24H2 et Ubuntu 24.04 LTS supportent le driver 580.x sans problème. Pilote NVIDIA Studio (Windows) ou le driver de production (Linux) — pas besoin du Game Ready pour Ollama.
#Installation Ollama + driver
- 01Installer le driver NVIDIA 580.x ou plus récentSous Windows : NVIDIA App, choisir le pilote Studio. Sous Linux : sudo ubuntu-drivers install --gpgpu pour Ubuntu, ou le runfile officiel. Vérifiez avec nvidia-smi que vous voyez bien la carte et la VRAM.
- 02Installer OllamaTéléchargez depuis ollama.com (installeur Windows ou commande Linux). Le daemon écoute par défaut sur http://localhost:11434 et détecte automatiquement la 5070 Ti via CUDA.
- 03Vérifier que le GPU est bien utiliséLancer ollama run qwen3.5:9b puis surveiller nvidia-smi dmon -s u dans un terminal séparé. La colonne sm (utilisation compute) doit monter à 60-95 % pendant la génération.
- 04Ajuster le contextePar défaut Ollama charge un contexte de 4096 tokens. Sur 16 Go, on peut monter à 16k ou 32k sur les modèles 8B sans souci. Variable OLLAMA_CONTEXT_LENGTH ou paramètre num_ctx dans l'API.
#Tokens/sec sur 8B et 14B
Les modèles qui tiennent confortablement avec un gros contexte. Mesures faites avec un prompt de 512 tokens et 256 tokens générés, moyenne sur 5 runs.
- Qwen 3.5 9B Q4_K_M
- Environ 90 tok/s en génération, prompt processing à 2 800 tok/s. VRAM utilisée : 6,6 Go. Reste 9 Go pour le contexte — confortable à 32k, et le modèle grimpe jusqu'à 256k de fenêtre (vision incluse).
- Granite 4.2 8B Q4_K_M
- Autour de 94 tok/s. VRAM utilisée : 5,3 Go, très token-efficient et 128k de contexte. L'alternative sobre au Qwen quand on veut un maximum de débit.
- Gemma 4 12B Q4_K_M
- Environ 62 tok/s. VRAM utilisée : 7,6 Go. C'est le sweet spot de milieu de gamme, extrêmement confortable sur la carte : on garde 8 Go pour le contexte et le KV cache, et Gemma 4 est multimodal (Apache 2.0 depuis avril 2026).
- Qwen 3.5 9B Q8_0
- Autour de 48 tok/s. VRAM utilisée : 11 Go. La qualité max de la tranche : le même 9B mais en Q8, quand vous voulez le meilleur rendu sans changer de modèle.
- Mistral Small 24B Q4_K_M
- Environ 36 tok/s. VRAM utilisée : 14,2 Go. Ça passe, généraliste solide et bon en français, mais le contexte est limité à 8k sans offload — la limite des 16 Go commence à se faire sentir.
#Le cas GLM 4.7 Flash (MoE 30B-A3B)
C'est ici que la 5070 Ti devient particulièrement intéressante en 2026. GLM 4.7 Flash est un modèle Mixture-of-Experts : 30 milliards de paramètres au total, mais seulement 3 milliards activés par token (architecture 30B-A3B, licence MIT, très bon en agents). La VRAM totale requise reste celle du modèle complet, mais la vitesse d'inférence est proche de celle d'un 3B dense.
- GLM 4.7 Flash Q4_K_M
- Environ 78 tok/s en génération. VRAM utilisée : 18,4 Go — oui, ça déborde. Ollama offload automatiquement 2 Go en RAM système, ce qui ramène la vitesse réelle observée à 64 tok/s en pratique.
- GLM 4.7 Flash Q3_K_M
- Environ 71 tok/s. VRAM utilisée : 14,8 Go. Tout en VRAM, contexte 16k possible. La perte de qualité par rapport au Q4 est faible (≈1-2 % sur les benchmarks publics).
- gpt-oss 20B (MXFP4)
- Environ 96 tok/s. VRAM utilisée : 14 Go. L'open-weight d'OpenAI, très rapide grâce à sa quantification MXFP4 native et 131k de contexte — il tient tout juste dans les 16 Go avec un contexte modéré.
Verdict MoE : le Q3_K_M est le bon compromis sur cette carte pour GLM 4.7 Flash. On garde la qualité d'un 30B avec la vitesse d'un 3B et tout reste en VRAM.
#Pousser à 27-30B : Qwen 3.8 et Granite 4.2
Les gros modèles denses et pro autour de 27-30B sont l'horizon raisonnable de la carte. Au-delà, on entre dans le territoire de l'offload massif.
- Qwen 3.8 27B Q4_K_M
- Environ 24 tok/s en génération avec offload de 2 à 3 Go vers la RAM. VRAM utilisée : 16 Go pleins + un peu de RAM. Sorti le 14/08/2026, 262k de contexte et vision : c'est le modèle « proche Copilot » de la tranche. Il a tendance à sur-réfléchir avec son réglage de raisonnement par défaut — passez-le en low pour des réponses plus directes.
- Qwen 3.8 27B Q3_K_M
- Environ 36 tok/s. VRAM utilisée : 14 Go, tout en VRAM. Le bon compromis si vous voulez ce gros modèle dense fluide.
- Granite 4.2 30B Q4_K_M
- Environ 22 tok/s avec offload. VRAM utilisée : 18 Go. Orienté usage pro/entreprise, profil quasi identique à Qwen 3.8 27B.
- Nemotron 3.5 Lightning 30B Q4_K_M
- Ne tient pas : 25 Go en Q4, offload massif RAM/SSD requis, débit autour de 3 tok/s — pas une option utilisable au quotidien sur 16 Go (ni même sur 24 Go).
#Prix vs 5080 et 5090
Le calcul brut prix / tokens-sec. Pas parfait (on ignore amortissement et électricité), mais ça met les ordres de grandeur en perspective.
- RTX 5070 Ti (~950 €)
- Sur Gemma 4 12B : 15,3 €/(tok/s). Sur GLM 4.7 Flash Q3 : 13,4 €/(tok/s). Sur Qwen 3.8 27B Q3 : 26,4 €/(tok/s).
- RTX 5080 (~1 300 €)
- Sur Gemma 4 12B : 18,1 €/(tok/s). Sur GLM 4.7 Flash Q3 : 15,9 €/(tok/s). Gain réel sur la vitesse (+15 à 20 %) mais coût supérieur.
- RTX 5090 (~2 400 €)
- Sur Gemma 4 12B : 28,2 €/(tok/s). Sur Qwen 3.8 27B Q4 : 44,0 €/(tok/s). Devient compétitive uniquement quand on vise 70B+, ce qui n'est pas envisageable sur 16 Go.
- RTX 4070 Ti Super 16 Go (~750 € occasion)
- Sur Gemma 4 12B : 15,3 €/(tok/s). Moins chère mais ~25 % plus lente sur les MoE en raison du GDDR6X moins rapide. Toujours pertinente en occasion.
- RTX 3090 occasion (~650 €)
- Sur Gemma 4 12B : 9,3 €/(tok/s) et 24 Go de VRAM. Imbattable en perf/euro si vous tolérez du Ampere d'occasion et la conso 350 W.
La 5070 Ti n'est pas la plus rentable en pur €/perf — la 3090 d'occasion reste devant. Elle devient le bon choix dès qu'on veut du neuf, sous garantie, avec une consommation contenue et le support FP4 pour l'avenir.
#Consommation et thermals
Mesures à la prise, machine complète, alim 850 W Gold, GPU en pilote uniquement, écran éteint.
- Idle (modèle chargé, pas de génération)
- Machine 75 W au total dont GPU ~15 W. Très propre, l'inférence en attente ne pénalise pas votre facture.
- Inférence 8B Q4
- Pic à 195 W au mur (GPU ~145 W). La carte ne monte pas à fond — le GDDR7 est saturé avant le compute, comme sur la 5090.
- Inférence 12B Q4
- Pic à 245 W au mur (GPU ~190 W). Sweet spot conso/utilité.
- Inférence MoE 30B-A3B
- Pic à 280 W au mur (GPU ~225 W). Le MoE chauffe moins qu'un dense équivalent.
- Prompt processing batch 4096 tokens
- Pic à 360 W au mur (GPU ~298 W). C'est le moment où le compute saturé pousse la carte près de son TGP nominale de 300 W.
- Température GPU pic
- 72 °C en charge soutenue, ventilateurs autour de 1 600 tr/min. Modèle custom triple ventilateur — silencieuse comparée à la 5090.
#Verdict : sweet spot ou pas ?
- Pour qui c'est le bon achat
- Vous voulez du neuf, vous comptez tourner principalement du 8B-12B avec des incursions dans le 30B MoE et le 27-30B dense en Q3. Vous appréciez une carte silencieuse et raisonnable en conso. C'est le profil pour lequel la 5070 Ti est faite.
- Quand prendre la 5080 à la place
- Si vous tournez du 27-30B dense quotidiennement en Q4 et que les 16 Go pleins-à-craquer vous gênent. La 5080 a la même VRAM mais une bande passante 7 % supérieure — gain modeste pour 350 € de plus.
- Quand viser la 5090
- Si vous visez un modèle 70B+ en Q4 en local ou du fine-tuning LoRA sur des modèles 13B+. 16 Go ne suffisent ni à l'un ni à l'autre.
- Quand préférer une 3090 d'occasion
- Budget serré, tolérance pour le matériel d'occasion, besoin des 24 Go pour du 27-30B en Q5 ou du début de 70B en offload léger. Vous perdez le support FP4 et gagnez 200 € à dépenser ailleurs.
- Quand préférer une 4070 Ti Super
- Si vous en trouvez d'occasion sous 700 € et que votre cas d'usage tient à du 12B. Très proche en pratique pour beaucoup moins cher.
#Pour aller plus loin
Trois lectures utiles pour pousser plus loin :
- Bien choisir sa quantification
- Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille pourquoi le Q3_K_M devient pertinent sur 16 Go quand on vise du 30B et plus.
- Comparer plus largement
- Le guide "Choisir son GPU pour l'IA locale" élargit le panorama au-delà de la gamme Blackwell, utile si vous hésitez encore.
- Approfondir un modèle MoE
- Le guide "Llama 4 Scout en local" entre dans le détail du fonctionnement MoE, particulièrement adapté à une carte 16 Go comme la 5070 Ti.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.