Intermédiaire 10 minRTX 50

Quel LLM sur RTX 5070 (12 Go) ?

La RTX 5070 (mars 2025) est l'entrée de gamme « milieu » de la génération Blackwell. 12 Go de VRAM GDDR7, 672 Go/s de bande passante, 6 144 cœurs CUDA : elle tourne Qwen 3.5 4B à 82 tokens/seconde et Gemma 4 12B Q4 confortablement. Mais les 12 Go restent une limite stricte en 2026 face aux modèles 24-32B qui se généralisent. Ce guide détaille ce qu'elle fait bien, ce qu'elle ne fait pas, et comment tirer le maximum de ses 12 Go.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 5070 et l'IA locale

Architecture
Blackwell GB205. TSMC 4NP, plus compact que GB203.
VRAM
12 Go GDDR7 à 28 Gbps, bus 192 bits. Bande passante 672 Go/s.
Cœurs CUDA
6 144. Tensor Cores 5ᵉ gen, FP4 natif.
TDP
250 W. Alim 650 W suffit largement.
Prix MSRP
649 € au lancement. ~750 € en 2026 (custom).
i
Le choix des 12 Go — pertinent ou pas ?
En 2026, les modèles pertinents pour un usage pro sont des 12B-30B. Un 12 Go tient 12B Q4 confortablement, 24B Q4 impossible (14 Go requis), 30B jamais. La 5070 vise donc un usage 4B-12B, ce qui reste 80 % des besoins — mais la marge est faible.

#1. Modèles compatibles

Modèles LLM RTX 5070 — 12 Go VRAM
ModèleQuantVRAMTokens/secOK ?
Granite 4.2 8BQ4_K_M4,6 Go45-55★★★★★ confortable
Gemma 4 12BQ4_K_M7 Go25-31★★★★★
Qwen 3.5 9BQ4_K_M6 Go25-31★★★★★ confortable
Qwen 3.5 4BQ5_K_M4 Go70-78★★★★★ très rapide
Granite 4.2 8BQ8_08,5 Go40-48★★★★ qualité max 8B
Qwen 3.5 9BQ8_011 Go22-27★★★★ qualité max tranche
Gemma 4 12BQ6_K9,5 Go21-26★★★ serré
Mistral Small 24BQ3_K_M11 Go20-26★★ offload possible
!
La pente du Q5 → Q6 → Q8 sur 12 Go
Les 12 Go permettent Gemma 4 12B Q4 (7 Go) confortable avec marge contexte. En Q5 (9 Go) c'est plus serré, Q6 (9,5 Go) touche au plafond avec un gros contexte, Q8 (13 Go) déborde. Un contexte 8k+ impose de rester en Q4 ou d'activer le KV cache quantifié.

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Requis pour Blackwell. Vérifiez nvidia-smi après installation.
  2. 02
    Ollama (recommandé)
    Installeur standard. Ollama détecte automatiquement la 5070 et utilise CUDA 12.8 intégré.
  3. 03
    Télécharger un modèle adapté
    ollama run qwen3.5:4b pour un petit modèle très rapide, ollama run gemma4:12b pour du 12B Q4 confortable.

#3. Benchmarks

RTX 5070 12 Go — tokens/sec, ordres de grandeur
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Qwen 3.5 4B82 t/s74 t/s66 t/s54 t/s
Granite 4.2 8B50 t/s47 t/s45 t/s44 t/s
Qwen 3.5 9B28 t/s25 t/s23 t/s22 t/s
Gemma 4 12B27 t/s24 t/s22 t/s

#4. La limite des 12 Go

Mistral Small 24B
Q4 = 14 Go. Déborde de 2 Go → offload VRAM+RAM → 20 tok/s max. Préférer Qwen 3.5 9B Q8 (tient en VRAM, meilleures perfs).
Qwen 3.6 35B-A3B
Q4 = 23 Go. Impossible sur 12 Go. Restez sur du 9-12B.
RAG avec gros contexte
Qwen 3.5 4B + contexte 32k = 7 Go (KV non-quant) → plein. Activer KV Q8 divise par 2.
Multi-modèle parallèle
Un Qwen 3.5 9B + un embedder BGE M3 = 8 Go. Ça tient, mais vous n'avez plus de marge pour un reranker.
Maximiser le contexte sur 12 Go
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1

./llama-server -m qwen3.5-9b.gguf -c 32768 -fa --cache-type-k q8_0 --cache-type-v q8_0

#5. 5070 vs 4070 Super vs 5070 Ti

Le triangle 12 Go vs 16 Go
CarteVRAMBande p.Qwen 3.5 4BQwen 3.5 9BPrix
RTX 507012 Go672 Go/s82 t/s28 t/s~750 €
RTX 4070 Super12 Go504 Go/s62 t/s21 t/s~550 € occasion
RTX 5070 Ti16 Go896 Go/s92 t/s32 t/s~950 €
Le 200 € additionnel pour 5070 Ti ?
Oui, largement. +33 % de VRAM (12 → 16 Go) qui ouvre Mistral Small 24B, Devstral 24B et gpt-oss 20B en pleine VRAM, +33 % de bande passante → +15-25 % de vitesse sur 12B. Un des meilleurs upgrades par euro dépensé en 2026.

#Verdict achat 2026

Achetez une 5070 si
Budget ≤ 800 €, usage LLM occasionnel, principalement du 4B-12B chat/code. Carte très capable pour cet usage.
Préférez la 5070 Ti si
Usage LLM quotidien, envie d'explorer 12B-24B, budget atteint 950 €. Vous ne regretterez pas les 16 Go.
Préférez une 4070 Ti Super (occasion) si
Vous trouvez une occasion à ~700 €. Même 16 Go, perte de 15 % vs 5070 Ti mais économie de 250 €.

#Questions fréquentes

La RTX 5070 12 Go peut-elle faire tourner un modèle 70B ?+
Non. Un 70B pèse ~42 Go en Q4, la carte en a 12 — offload massif inutilisable (< 3 tok/s). Pour du 70B local, il faut minimum 32 Go (RTX 5090) ou un Mac Studio 64 Go+.
Combien de tokens/sec pour Qwen 3.5 4B sur RTX 5070 ?+
Entre 78 et 86 tokens/seconde en Q4_K_M selon la config système. Q5_K_M tombe à 72-78 tok/s, Q8_0 à 52-58 tok/s. Comparable voire légèrement supérieur à une RTX 4070 Super malgré la même VRAM.
12 Go suffisent-ils pour un usage pro en 2026 ?+
Pour chat + RAG sur Qwen 3.5 9B ou Gemma 4 12B : oui, très confortable. Pour RAG avancé multi-stage (embedder + reranker + 12B) : ça devient serré, un 16 Go est plus serein. Pour du 24B+ : non.
RTX 5070 vs MacBook Pro M4 Pro pour LLM ?+
Sur pure vitesse 4B : 5070 gagne (82 vs ~50 tok/s). Sur 24B+ : MBP M4 Pro 48 Go gagne (RAM unifiée supérieure). Coût total : un PC avec 5070 à 1500 € vs MBP M4 Pro à 2700 €. Dépend de votre besoin mobilité vs perf pure.
La RTX 5070 supporte-t-elle DLSS 4 ET le LLM ?+
Oui, les deux fonctionnalités cohabitent sans conflit. DLSS 4 utilise le Neural Engine (petits modèles dédiés < 100 Mo), le LLM prend la VRAM principale. Vous pouvez donc gamer en 4K DLSS et avoir un LLM chargé en arrière-plan sur les 12 Go.
Peut-on faire du fine-tuning sur RTX 5070 ?+
QLoRA sur 7B-8B : oui, ça tient en 10 Go avec batch 2. LoRA classique ou fine-tuning complet : non, 12 Go insuffisants. Pour du FT sérieux, visez minimum 24 Go (RTX 3090/4090/5090).
Alim 550 W suffit pour une RTX 5070 ?+
TDP 250 W GPU + 120 W CPU + 40 W système = ~410 W. Une 550 W qualité (Seasonic Focus GX, be quiet!) tient, mais 650 W offre plus de marge et de silence (ventilo alim moins sollicité).
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.