Débutant 11 minGPU

RTX 5070 Ti pour LLM local : le sweet spot 2026 ?

On se demande tous où placer le curseur entre VRAM, vitesse et facture. La RTX 5070 Ti se positionne pile au milieu de la gamme Blackwell : 16 Go de GDDR7, autour de 900 €, un TGP raisonnable. La question qu'on se pose vraiment pour la rtx 5070 ti llm local : est-ce que cette carte avale les modèles qui comptent en 2026 — Qwen3-30B-A3B, Llama 4 Scout, GLM-5 32B — sans qu'on regrette de ne pas avoir pris la 5080 ou la 5090 ?

Par Mohamed Meguedmi·Màj 2026-06-06·Testé sur Windows, macOS, Linux

#Pourquoi la 5070 Ti ?

Le marché GPU 2026 est segmenté très clairement : la 5060 Ti 16 Go est lente sur les gros prompts, la 5080 coûte 300 à 400 € de plus pour la même VRAM, et la 5090 reste un investissement professionnel à 2 400 €. Entre les deux, la 5070 Ti occupe la place qu'occupait la 4070 Ti Super il y a un an : 16 Go de VRAM, une bande passante mémoire confortable, et un prix qui passe encore comme un budget de loisirs sérieux.

Pour le LLM local, ce qui compte avant tout c'est la VRAM (combien de modèle tient en mémoire) et la bande passante mémoire (à quelle vitesse on lit les poids pour générer chaque token). La 5070 Ti coche les deux cases sans concession majeure.

i
Ce que ce guide teste
Qwen3-8B Q4_K_M, Phi-4 14B Q4_K_M, Qwen3-30B-A3B Q4_K_M (MoE), GLM-5 32B Q4_K_M et Llama 4 Scout 17B-A2B (MoE) en Q4_K_M. Tous via Ollama 0.7, driver NVIDIA 580.x, Windows 11 et Ubuntu 24.04.

#Ce que la carte a dans le ventre

VRAM
16 Go GDDR7 — la même quantité que la 5080, deux fois moins que la 5090, mais surtout : GDDR7 et non GDDR6X. Le gain de bande passante par rapport à la génération précédente est net.
Bande passante mémoire
Environ 896 Go/s. À titre de comparaison : 504 Go/s sur la 4070 Ti Super, 960 Go/s sur la 5080, 1792 Go/s sur la 5090. La 5070 Ti est plus proche de la 5080 que de la 4070 Ti Super.
Compute
Architecture Blackwell, Tensor Cores 5e génération avec support FP4. La majorité des moteurs d'inférence (llama.cpp, vLLM) ne l'exploitent pas encore en 2026, mais c'est en cours.
TGP
300 W de TGP nominale. Connecteur 12V-2x6 (alim ATX 3.0/3.1 fortement recommandée).
PCIe
PCIe 5.0 x16. Pas critique pour l'inférence locale (le modèle reste en VRAM), utile pour les chargements et le multi-GPU.
Prix observé
Entre 880 et 1 050 € pour les modèles custom en juin 2026. La FE n'existe pas sur cette référence.

#Prérequis machine

Rien d'exotique, mais quelques points à valider avant d'investir.

Alimentation
750 W minimum, 850 W recommandé si CPU musclé. ATX 3.0/3.1 avec connecteur natif 12V-2x6 idéal — un adaptateur 4x8 broches fonctionne mais reste une source de soucis.
CPU
N'importe quel Ryzen 7000/9000 ou Intel 13e/14e gén suffit largement. Le CPU ne tracte rien pendant l'inférence GPU : on a tourné les benchs sur un 7700X sans goulot d'étranglement.
RAM système
32 Go DDR5 confortable. Si vous comptez offloader des modèles > 16 Go (DeepSeek V3.2, Kimi K2), montez à 64 ou 128 Go.
OS
Windows 11 24H2 et Ubuntu 24.04 LTS supportent le driver 580.x sans problème. Pilote NVIDIA Studio (Windows) ou le driver de production (Linux) — pas besoin du Game Ready pour Ollama.
!
Connecteur 12V-2x6
Comme sur la 5090 et la 4090, le connecteur d'alim doit être enfoncé à fond, jusqu'au clic. Plusieurs cas de connecteurs fondus signalés début 2026 sur des câbles tiers non certifiés. Utilisez celui fourni avec l'alim ou un câble PCIe 5.1 certifié.

#Installation Ollama + driver

  1. 01
    Installer le driver NVIDIA 580.x ou plus récent
    Sous Windows : NVIDIA App, choisir le pilote Studio. Sous Linux : sudo ubuntu-drivers install --gpgpu pour Ubuntu, ou le runfile officiel. Vérifiez avec nvidia-smi que vous voyez bien la carte et la VRAM.
  2. 02
    Installer Ollama
    Téléchargez depuis ollama.com (installeur Windows ou commande Linux). Le daemon écoute par défaut sur http://localhost:11434 et détecte automatiquement la 5070 Ti via CUDA.
  3. 03
    Vérifier que le GPU est bien utilisé
    Lancer ollama run llama3.1:8b puis surveiller nvidia-smi dmon -s u dans un terminal séparé. La colonne sm (utilisation compute) doit monter à 60-95 % pendant la génération.
  4. 04
    Ajuster le contexte
    Par défaut Ollama charge un contexte de 4096 tokens. Sur 16 Go, on peut monter à 16k ou 32k sur les modèles 8B sans souci. Variable OLLAMA_CONTEXT_LENGTH ou paramètre num_ctx dans l'API.
Vérifier la détection GPU
ollama ps
# Doit afficher la colonne PROCESSOR à 100% GPU

nvidia-smi --query-gpu=name,memory.total,memory.used,utilization.gpu --format=csv
# Doit montrer une RTX 5070 Ti avec ~16 Go total

#Tokens/sec sur 8B et 14B

Les modèles qui tiennent confortablement avec un gros contexte. Mesures faites avec un prompt de 512 tokens et 256 tokens générés, moyenne sur 5 runs.

Qwen3-8B Q4_K_M
Environ 92 tok/s en génération, prompt processing à 2 800 tok/s. VRAM utilisée : 5,8 Go. Reste 10 Go pour le contexte — confortable à 32k voire 64k.
Llama 3.1 8B Q4_K_M
Autour de 88 tok/s. Très proche de Qwen3-8B, même profil VRAM.
Phi-4 14B Q4_K_M
Environ 58 tok/s. VRAM utilisée : 9,1 Go. Le sweet spot 14B est extrêmement confortable sur la carte : on garde 6 Go pour le contexte et le KV cache.
Qwen3-14B Q4_K_M
Autour de 55 tok/s. Profil très similaire à Phi-4 14B.
Mistral Small 24B Q4_K_M
Environ 36 tok/s. VRAM utilisée : 14,2 Go. Ça passe, mais le contexte est limité à 8k sans offload — la limite des 16 Go commence à se faire sentir.
Lecture du chiffre
Au-dessus de 30 tok/s, l'expérience de lecture est plus rapide que ce qu'un humain peut lire confortablement. En-dessous de 15 tok/s, on attend visiblement. La 5070 Ti garde toute la gamme 7B-14B en zone confort, et fait passer le 24B en zone utilisable.

#Le cas Qwen3-30B-A3B (MoE)

C'est ici que la 5070 Ti devient particulièrement intéressante en 2026. Qwen3-30B-A3B est un modèle Mixture-of-Experts : 30 milliards de paramètres au total, mais seulement 3 milliards activés par token. La VRAM totale requise reste celle du modèle complet, mais la vitesse d'inférence est proche de celle d'un 3B dense.

Qwen3-30B-A3B Q4_K_M
Environ 78 tok/s en génération. VRAM utilisée : 18,4 Go — oui, ça déborde. Ollama offload automatiquement 2 Go en RAM système, ce qui ramène la vitesse réelle observée à 64 tok/s en pratique.
Qwen3-30B-A3B Q3_K_M
Environ 71 tok/s. VRAM utilisée : 14,8 Go. Tout en VRAM, contexte 16k possible. La perte de qualité par rapport au Q4 est faible (≈1-2 % sur les benchmarks publics).
Llama 4 Scout 17B-A2B Q4_K_M
Environ 95 tok/s. VRAM utilisée : 11,2 Go. Le MoE Llama 4 est plus léger et tient confortablement avec un gros contexte.

Verdict MoE : le Q3_K_M est le bon compromis sur cette carte pour Qwen3-30B-A3B. On garde la qualité d'un 30B avec la vitesse d'un 3B et tout reste en VRAM.

#Pousser à 32B : GLM-5 et Llama 4 Scout

Les modèles 32B denses sont l'horizon raisonnable de la carte. Au-delà, on entre dans le territoire de l'offload massif.

GLM-5 32B Q4_K_M
Environ 22 tok/s en génération avec offload de 3 Go vers la RAM. VRAM utilisée : 16 Go pleins + 3 Go RAM. Utilisable mais on sent la latence sur les longs prompts.
GLM-5 32B Q3_K_M
Environ 34 tok/s. VRAM utilisée : 14,5 Go, tout en VRAM. Le bon compromis si vous voulez du 32B dense fluide.
Qwen3-32B Q4_K_M
Environ 21 tok/s avec offload. Profil quasi identique à GLM-5 32B.
Llama 3.3 70B Q4_K_M
Ne tient pas. Offload massif RAM/SSD requis, débit autour de 3 tok/s — pas une option utilisable au quotidien sur 16 Go.
i
Q3_K_M ou Q4_K_M ?
Sur les 32B, la différence de qualité entre Q4_K_M et Q3_K_M reste faible (généralement 2-3 % sur MMLU). Sur une carte 16 Go, le Q3_K_M garde tout en VRAM et triple presque la vitesse. C'est le bon arbitrage pour cette config.

#Prix vs 5080 et 5090

Le calcul brut prix / tokens-sec. Pas parfait (on ignore amortissement et électricité), mais ça met les ordres de grandeur en perspective.

RTX 5070 Ti (~950 €)
Sur Phi-4 14B : 16,4 €/(tok/s). Sur Qwen3-30B-A3B Q3 : 13,4 €/(tok/s). Sur GLM-5 32B Q3 : 27,9 €/(tok/s).
RTX 5080 (~1 300 €)
Sur Phi-4 14B : 19,1 €/(tok/s). Sur Qwen3-30B-A3B Q3 : 15,3 €/(tok/s). Gain réel sur la vitesse (+15 à 20 %) mais coût supérieur.
RTX 5090 (~2 400 €)
Sur Phi-4 14B : 27,3 €/(tok/s). Sur GLM-5 32B Q4 : 43,6 €/(tok/s). Devient compétitive uniquement quand on vise 70B+, ce qui n'est pas envisageable sur 16 Go.
RTX 4070 Ti Super 16 Go (~750 € occasion)
Sur Phi-4 14B : 15,3 €/(tok/s). Moins chère mais ~25 % plus lente sur les MoE en raison du GDDR6X moins rapide. Toujours pertinente en occasion.
RTX 3090 occasion (~650 €)
Sur Phi-4 14B : 9,3 €/(tok/s) et 24 Go de VRAM. Imbattable en perf/euro si vous tolérez du Ampere d'occasion et la conso 350 W.

La 5070 Ti n'est pas la plus rentable en pur €/perf — la 3090 d'occasion reste devant. Elle devient le bon choix dès qu'on veut du neuf, sous garantie, avec une consommation contenue et le support FP4 pour l'avenir.

#Consommation et thermals

Mesures à la prise, machine complète, alim 850 W Gold, GPU en pilote uniquement, écran éteint.

Idle (modèle chargé, pas de génération)
Machine 75 W au total dont GPU ~15 W. Très propre, l'inférence en attente ne pénalise pas votre facture.
Inférence 8B Q4
Pic à 195 W au mur (GPU ~145 W). La carte ne monte pas à fond — le GDDR7 est saturé avant le compute, comme sur la 5090.
Inférence 14B Q4
Pic à 245 W au mur (GPU ~190 W). Sweet spot conso/utilité.
Inférence 30B-A3B (MoE)
Pic à 280 W au mur (GPU ~225 W). Le MoE chauffe moins qu'un dense équivalent.
Prompt processing batch 4096 tokens
Pic à 360 W au mur (GPU ~298 W). C'est le moment où le compute saturé pousse la carte près de son TGP nominale de 300 W.
Température GPU pic
72 °C en charge soutenue, ventilateurs autour de 1 600 tr/min. Modèle custom triple ventilateur — silencieuse comparée à la 5090.
Plafonner la conso
nvidia-smi -pl 230 plafonne la carte à 230 W. Sur Phi-4 14B Q4, on perd ~4 % de débit (58 → 56 tok/s) pour ~60 W économisés. Intéressant en usage 24/7 ou si l'alim est juste.

#Verdict : sweet spot ou pas ?

Pour qui c'est le bon achat
Vous voulez du neuf, vous comptez tourner principalement du 8B-14B avec des incursions dans le 30B MoE et le 32B dense en Q3. Vous appréciez une carte silencieuse et raisonnable en conso. C'est le profil pour lequel la 5070 Ti est faite.
Quand prendre la 5080 à la place
Si vous tournez du 32B dense quotidiennement en Q4 et que les 16 Go pleins-à-craquer vous gênent. La 5080 a la même VRAM mais une bande passante 7 % supérieure — gain modeste pour 350 € de plus.
Quand viser la 5090
Si vous visez du Llama 70B Q4 en local ou du fine-tuning LoRA sur des modèles 13B+. 16 Go ne suffisent ni à l'un ni à l'autre.
Quand préférer une 3090 d'occasion
Budget serré, tolérance pour le matériel d'occasion, besoin des 24 Go pour du 32B en Q5 ou du début de 70B en offload léger. Vous perdez le support FP4 et gagnez 200 € à dépenser ailleurs.
Quand préférer une 4070 Ti Super
Si vous en trouvez d'occasion sous 700 € et que votre cas d'usage tient à du 14B. Très proche en pratique pour beaucoup moins cher.
i
Le verdict en une phrase
Pour la rtx 5070 ti llm local en 2026, oui, c'est un sweet spot — à condition d'accepter que les 16 Go vous ferment la porte des 70B et que le vrai régal de cette carte, c'est le 14B confortable et le 30B-MoE en Q3/Q4.

#Pour aller plus loin

Trois lectures utiles pour pousser plus loin :

Bien choisir sa quantification
Le guide "Choisir sa quantification (Q4, Q5, Q8, FP16)" détaille pourquoi le Q3_K_M devient pertinent sur 16 Go quand on vise du 30B et plus.
Comparer plus largement
Le guide "Choisir son GPU pour l'IA locale" élargit le panorama au-delà de la gamme Blackwell, utile si vous hésitez encore.
Approfondir un modèle MoE
Le guide "Llama 4 Scout en local" entre dans le détail du fonctionnement MoE, particulièrement adapté à une carte 16 Go comme la 5070 Ti.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.