Intermédiaire 10 minRTX 50
Quel LLM sur RTX 5070 (12 Go) ?
La RTX 5070 (mars 2025) est l'entrée de gamme « milieu » de la génération Blackwell. 12 Go de VRAM GDDR7, 672 Go/s de bande passante, 6 144 cœurs CUDA : elle tourne Mistral 7B à 82 tokens/seconde et Phi-4 14B Q4 confortablement. Mais les 12 Go restent une limite stricte en 2026 face aux modèles 24-32B qui se généralisent. Ce guide détaille ce qu'elle fait bien, ce qu'elle ne fait pas, et comment tirer le maximum de ses 12 Go.
#La RTX 5070 et l'IA locale
- Architecture
- Blackwell GB205. TSMC 4NP, plus compact que GB203.
- VRAM
- 12 Go GDDR7 à 28 Gbps, bus 192 bits. Bande passante 672 Go/s.
- Cœurs CUDA
- 6 144. Tensor Cores 5ᵉ gen, FP4 natif.
- TDP
- 250 W. Alim 650 W suffit largement.
- Prix MSRP
- 649 € au lancement. ~750 € en 2026 (custom).
i
Le choix des 12 Go — pertinent ou pas ?
En 2026, les modèles pertinents pour un usage pro sont des 14B-32B. Un 12 Go tient 14B Q5 (tout juste), 24B Q4 impossible (14 Go requis), 32B jamais. La 5070 vise donc un usage 7B-14B, ce qui reste 80 % des besoins — mais la marge est faible.
#1. Modèles compatibles
Modèles LLM RTX 5070 — 12 Go VRAM
| Modèle | Quant | VRAM | Tokens/sec | OK ? |
|---|---|---|---|---|
| Llama 3.2 3B | Q8_0 | 3,4 Go | 140-160 | ★★★★★ |
| Mistral 7B | Q5_K_M | 5,1 Go | 74-84 | ★★★★★ |
| Qwen 2.5 Coder 7B | Q6_K | 6,3 Go | 64-72 | ★★★★★ |
| Llama 3.1 8B | Q5_K_M | 5,7 Go | 68-78 | ★★★★★ |
| Phi-4 14B | Q4_K_M | 8,5 Go | 44-52 | ★★★★ |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | 38-46 | ★★★★ |
| Phi-4 14B | Q5_K_M | 10 Go | 38-44 | ★★★ |
| Mistral Small 24B | Q3_K_M | 11 Go | 20-26 | ★★ offload possible |
!
La pente du Q5 → Q6 → Q8 sur 12 Go
Les 12 Go permettent Phi-4 14B Q4 (8,5 Go) confortable avec marge contexte. En Q5 (10 Go) c'est plus serré, Q6 (11,5 Go) touche au plafond, Q8 (15 Go) déborde. Un contexte 8k+ impose de rester en Q4 ou d'activer le KV cache quantifié.
#2. Installation
- 01Drivers NVIDIA 570+Requis pour Blackwell. Vérifiez nvidia-smi après installation.
- 02Ollama (recommandé)Installeur standard. Ollama détecte automatiquement la 5070 et utilise CUDA 12.8 intégré.
- 03Télécharger un modèle adaptéollama run mistral pour 7B, ollama run phi4 pour du 14B Q4.
#3. Benchmarks
RTX 5070 12 Go — tokens/sec mesurés
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Mistral 7B | 84 t/s | 74 t/s | 66 t/s | 52 t/s |
| Llama 3.1 8B | 78 t/s | 68 t/s | 60 t/s | 46 t/s |
| Phi-4 14B | 52 t/s | 44 t/s | 38 t/s | — |
| Qwen 2.5 14B | 46 t/s | 40 t/s | 36 t/s | — |
#4. La limite des 12 Go
- Mistral Small 24B
- Q4 = 14 Go. Déborde de 2 Go → offload VRAM+RAM → 20 tok/s max. Préférer Qwen 14B Q5 (tient en VRAM, meilleures perfs).
- Qwen 2.5 32B
- Q3 = 15 Go. Impossible. Restez sur 14B.
- RAG avec gros contexte
- Mistral 7B + contexte 32k = 7 Go (KV non-quant) → plein. Activer KV Q8 divise par 2.
- Multi-modèle parallèle
- Un 8B + un embedder BGE M3 = 8 Go. Ça tient, mais vous n'avez plus de marge pour un reranker.
#5. 5070 vs 4070 Super vs 5070 Ti
Le triangle 12 Go vs 16 Go
| Carte | VRAM | Bande p. | Mistral 7B | Phi-4 14B | Prix |
|---|---|---|---|---|---|
| RTX 5070 | 12 Go | 672 Go/s | 84 t/s | 52 t/s | ~750 € |
| RTX 4070 Super | 12 Go | 504 Go/s | 62 t/s | 38 t/s | ~550 € occasion |
| RTX 5070 Ti | 16 Go | 896 Go/s | 94 t/s | 52 t/s | ~950 € |
→
Le 200 € additionnel pour 5070 Ti ?
Oui, largement. +33 % de VRAM (12 → 16 Go) qui ouvre Mistral Small 24B et Qwen 32B IQ3, +33 % de bande passante → +15-25 % de vitesse sur 14B. Un des meilleurs upgrades par euro dépensé en 2026.
#Verdict achat 2026
- Achetez une 5070 si
- Budget ≤ 800 €, usage LLM occasionnel, principalement du 7B-8B chat/code. Carte très capable pour cet usage.
- Préférez la 5070 Ti si
- Usage LLM quotidien, envie d'explorer 14B-24B, budget atteint 950 €. Vous ne regretterez pas les 16 Go.
- Préférez une 4070 Ti Super (occasion) si
- Vous trouvez une occasion à ~700 €. Même 16 Go, perte de 15 % vs 5070 Ti mais économie de 250 €.
#Questions fréquentes
La RTX 5070 12 Go peut-elle faire tourner Llama 3.1 70B ?+
Non. Le modèle pèse 42 Go en Q4, la carte en a 12 — offload massif inutilisable (< 3 tok/s). Pour du 70B local, il faut minimum 32 Go (RTX 5090) ou un Mac Studio 64 Go+.
Combien de tokens/sec pour Mistral 7B sur RTX 5070 ?+
Entre 78 et 90 tokens/seconde en Q4_K_M selon la config système. Q5_K_M tombe à 74-84 tok/s, Q8_0 à 48-55 tok/s. Comparable voire légèrement supérieur à une RTX 4070 Super malgré la même VRAM.
12 Go suffisent-ils pour un usage pro en 2026 ?+
Pour chat + RAG sur Mistral 7B ou Llama 3.1 8B : oui, très confortable. Pour RAG avancé multi-stage (embedder + reranker + 14B) : ça devient serré, un 16 Go est plus serein. Pour du 24B+ : non.
RTX 5070 vs MacBook Pro M4 Pro pour LLM ?+
Sur pure vitesse 7B : 5070 gagne (84 vs 55 tok/s). Sur 24B+ : MBP M4 Pro 48 Go gagne (RAM unifiée supérieure). Coût total : un PC avec 5070 à 1500 € vs MBP M4 Pro à 2700 €. Dépend de votre besoin mobilité vs perf pure.
La RTX 5070 supporte-t-elle DLSS 4 ET le LLM ?+
Oui, les deux fonctionnalités cohabitent sans conflit. DLSS 4 utilise le Neural Engine (petits modèles dédiés < 100 Mo), le LLM prend la VRAM principale. Vous pouvez donc gamer en 4K DLSS et avoir un LLM chargé en arrière-plan sur les 12 Go.
Peut-on faire du fine-tuning sur RTX 5070 ?+
QLoRA sur 7B-8B : oui, ça tient en 10 Go avec batch 2. LoRA classique ou fine-tuning complet : non, 12 Go insuffisants. Pour du FT sérieux, visez minimum 24 Go (RTX 3090/4090/5090).
Alim 550 W suffit pour une RTX 5070 ?+
TDP 250 W GPU + 120 W CPU + 40 W système = ~410 W. Une 550 W qualité (Seasonic Focus GX, be quiet!) tient, mais 650 W offre plus de marge et de silence (ventilo alim moins sollicité).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.