Intermédiaire 10 minRTX 50
Quel LLM sur RTX 5070 (12 Go) ?
La RTX 5070 (mars 2025) est l'entrée de gamme « milieu » de la génération Blackwell. 12 Go de VRAM GDDR7, 672 Go/s de bande passante, 6 144 cœurs CUDA : elle tourne Qwen 3.5 4B à 82 tokens/seconde et Gemma 4 12B Q4 confortablement. Mais les 12 Go restent une limite stricte en 2026 face aux modèles 24-32B qui se généralisent. Ce guide détaille ce qu'elle fait bien, ce qu'elle ne fait pas, et comment tirer le maximum de ses 12 Go.
#La RTX 5070 et l'IA locale
- Architecture
- Blackwell GB205. TSMC 4NP, plus compact que GB203.
- VRAM
- 12 Go GDDR7 à 28 Gbps, bus 192 bits. Bande passante 672 Go/s.
- Cœurs CUDA
- 6 144. Tensor Cores 5ᵉ gen, FP4 natif.
- TDP
- 250 W. Alim 650 W suffit largement.
- Prix MSRP
- 649 € au lancement. ~750 € en 2026 (custom).
i
Le choix des 12 Go — pertinent ou pas ?
En 2026, les modèles pertinents pour un usage pro sont des 12B-30B. Un 12 Go tient 12B Q4 confortablement, 24B Q4 impossible (14 Go requis), 30B jamais. La 5070 vise donc un usage 4B-12B, ce qui reste 80 % des besoins — mais la marge est faible.
#1. Modèles compatibles
Modèles LLM RTX 5070 — 12 Go VRAM
| Modèle | Quant | VRAM | Tokens/sec | OK ? |
|---|---|---|---|---|
| Granite 4.2 8B | Q4_K_M | 4,6 Go | 45-55 | ★★★★★ confortable |
| Gemma 4 12B | Q4_K_M | 7 Go | 25-31 | ★★★★★ |
| Qwen 3.5 9B | Q4_K_M | 6 Go | 25-31 | ★★★★★ confortable |
| Qwen 3.5 4B | Q5_K_M | 4 Go | 70-78 | ★★★★★ très rapide |
| Granite 4.2 8B | Q8_0 | 8,5 Go | 40-48 | ★★★★ qualité max 8B |
| Qwen 3.5 9B | Q8_0 | 11 Go | 22-27 | ★★★★ qualité max tranche |
| Gemma 4 12B | Q6_K | 9,5 Go | 21-26 | ★★★ serré |
| Mistral Small 24B | Q3_K_M | 11 Go | 20-26 | ★★ offload possible |
!
La pente du Q5 → Q6 → Q8 sur 12 Go
Les 12 Go permettent Gemma 4 12B Q4 (7 Go) confortable avec marge contexte. En Q5 (9 Go) c'est plus serré, Q6 (9,5 Go) touche au plafond avec un gros contexte, Q8 (13 Go) déborde. Un contexte 8k+ impose de rester en Q4 ou d'activer le KV cache quantifié.
#2. Installation
- 01Drivers NVIDIA 570+Requis pour Blackwell. Vérifiez nvidia-smi après installation.
- 02Ollama (recommandé)Installeur standard. Ollama détecte automatiquement la 5070 et utilise CUDA 12.8 intégré.
- 03Télécharger un modèle adaptéollama run qwen3.5:4b pour un petit modèle très rapide, ollama run gemma4:12b pour du 12B Q4 confortable.
#3. Benchmarks
RTX 5070 12 Go — tokens/sec, ordres de grandeur
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Qwen 3.5 4B | 82 t/s | 74 t/s | 66 t/s | 54 t/s |
| Granite 4.2 8B | 50 t/s | 47 t/s | 45 t/s | 44 t/s |
| Qwen 3.5 9B | 28 t/s | 25 t/s | 23 t/s | 22 t/s |
| Gemma 4 12B | 27 t/s | 24 t/s | 22 t/s | — |
#4. La limite des 12 Go
- Mistral Small 24B
- Q4 = 14 Go. Déborde de 2 Go → offload VRAM+RAM → 20 tok/s max. Préférer Qwen 3.5 9B Q8 (tient en VRAM, meilleures perfs).
- Qwen 3.6 35B-A3B
- Q4 = 23 Go. Impossible sur 12 Go. Restez sur du 9-12B.
- RAG avec gros contexte
- Qwen 3.5 4B + contexte 32k = 7 Go (KV non-quant) → plein. Activer KV Q8 divise par 2.
- Multi-modèle parallèle
- Un Qwen 3.5 9B + un embedder BGE M3 = 8 Go. Ça tient, mais vous n'avez plus de marge pour un reranker.
#5. 5070 vs 4070 Super vs 5070 Ti
Le triangle 12 Go vs 16 Go
| Carte | VRAM | Bande p. | Qwen 3.5 4B | Qwen 3.5 9B | Prix |
|---|---|---|---|---|---|
| RTX 5070 | 12 Go | 672 Go/s | 82 t/s | 28 t/s | ~750 € |
| RTX 4070 Super | 12 Go | 504 Go/s | 62 t/s | 21 t/s | ~550 € occasion |
| RTX 5070 Ti | 16 Go | 896 Go/s | 92 t/s | 32 t/s | ~950 € |
→
Le 200 € additionnel pour 5070 Ti ?
Oui, largement. +33 % de VRAM (12 → 16 Go) qui ouvre Mistral Small 24B, Devstral 24B et gpt-oss 20B en pleine VRAM, +33 % de bande passante → +15-25 % de vitesse sur 12B. Un des meilleurs upgrades par euro dépensé en 2026.
#Verdict achat 2026
- Achetez une 5070 si
- Budget ≤ 800 €, usage LLM occasionnel, principalement du 4B-12B chat/code. Carte très capable pour cet usage.
- Préférez la 5070 Ti si
- Usage LLM quotidien, envie d'explorer 12B-24B, budget atteint 950 €. Vous ne regretterez pas les 16 Go.
- Préférez une 4070 Ti Super (occasion) si
- Vous trouvez une occasion à ~700 €. Même 16 Go, perte de 15 % vs 5070 Ti mais économie de 250 €.
#Questions fréquentes
La RTX 5070 12 Go peut-elle faire tourner un modèle 70B ?+
Non. Un 70B pèse ~42 Go en Q4, la carte en a 12 — offload massif inutilisable (< 3 tok/s). Pour du 70B local, il faut minimum 32 Go (RTX 5090) ou un Mac Studio 64 Go+.
Combien de tokens/sec pour Qwen 3.5 4B sur RTX 5070 ?+
Entre 78 et 86 tokens/seconde en Q4_K_M selon la config système. Q5_K_M tombe à 72-78 tok/s, Q8_0 à 52-58 tok/s. Comparable voire légèrement supérieur à une RTX 4070 Super malgré la même VRAM.
12 Go suffisent-ils pour un usage pro en 2026 ?+
Pour chat + RAG sur Qwen 3.5 9B ou Gemma 4 12B : oui, très confortable. Pour RAG avancé multi-stage (embedder + reranker + 12B) : ça devient serré, un 16 Go est plus serein. Pour du 24B+ : non.
RTX 5070 vs MacBook Pro M4 Pro pour LLM ?+
Sur pure vitesse 4B : 5070 gagne (82 vs ~50 tok/s). Sur 24B+ : MBP M4 Pro 48 Go gagne (RAM unifiée supérieure). Coût total : un PC avec 5070 à 1500 € vs MBP M4 Pro à 2700 €. Dépend de votre besoin mobilité vs perf pure.
La RTX 5070 supporte-t-elle DLSS 4 ET le LLM ?+
Oui, les deux fonctionnalités cohabitent sans conflit. DLSS 4 utilise le Neural Engine (petits modèles dédiés < 100 Mo), le LLM prend la VRAM principale. Vous pouvez donc gamer en 4K DLSS et avoir un LLM chargé en arrière-plan sur les 12 Go.
Peut-on faire du fine-tuning sur RTX 5070 ?+
QLoRA sur 7B-8B : oui, ça tient en 10 Go avec batch 2. LoRA classique ou fine-tuning complet : non, 12 Go insuffisants. Pour du FT sérieux, visez minimum 24 Go (RTX 3090/4090/5090).
Alim 550 W suffit pour une RTX 5070 ?+
TDP 250 W GPU + 120 W CPU + 40 W système = ~410 W. Une 550 W qualité (Seasonic Focus GX, be quiet!) tient, mais 650 W offre plus de marge et de silence (ventilo alim moins sollicité).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.