Intermédiaire 10 minRTX 50

Quel LLM sur RTX 5070 (12 Go) ?

La RTX 5070 (mars 2025) est l'entrée de gamme « milieu » de la génération Blackwell. 12 Go de VRAM GDDR7, 672 Go/s de bande passante, 6 144 cœurs CUDA : elle tourne Mistral 7B à 82 tokens/seconde et Phi-4 14B Q4 confortablement. Mais les 12 Go restent une limite stricte en 2026 face aux modèles 24-32B qui se généralisent. Ce guide détaille ce qu'elle fait bien, ce qu'elle ne fait pas, et comment tirer le maximum de ses 12 Go.

Par Mohamed Meguedmi·Màj 2026-04-19·Testé sur Windows, macOS, Linux

#La RTX 5070 et l'IA locale

Architecture
Blackwell GB205. TSMC 4NP, plus compact que GB203.
VRAM
12 Go GDDR7 à 28 Gbps, bus 192 bits. Bande passante 672 Go/s.
Cœurs CUDA
6 144. Tensor Cores 5ᵉ gen, FP4 natif.
TDP
250 W. Alim 650 W suffit largement.
Prix MSRP
649 € au lancement. ~750 € en 2026 (custom).
i
Le choix des 12 Go — pertinent ou pas ?
En 2026, les modèles pertinents pour un usage pro sont des 14B-32B. Un 12 Go tient 14B Q5 (tout juste), 24B Q4 impossible (14 Go requis), 32B jamais. La 5070 vise donc un usage 7B-14B, ce qui reste 80 % des besoins — mais la marge est faible.

#1. Modèles compatibles

Modèles LLM RTX 5070 — 12 Go VRAM
ModèleQuantVRAMTokens/secOK ?
Llama 3.2 3BQ8_03,4 Go140-160★★★★★
Mistral 7BQ5_K_M5,1 Go74-84★★★★★
Qwen 2.5 Coder 7BQ6_K6,3 Go64-72★★★★★
Llama 3.1 8BQ5_K_M5,7 Go68-78★★★★★
Phi-4 14BQ4_K_M8,5 Go44-52★★★★
Qwen 2.5 14BQ5_K_M10,5 Go38-46★★★★
Phi-4 14BQ5_K_M10 Go38-44★★★
Mistral Small 24BQ3_K_M11 Go20-26★★ offload possible
!
La pente du Q5 → Q6 → Q8 sur 12 Go
Les 12 Go permettent Phi-4 14B Q4 (8,5 Go) confortable avec marge contexte. En Q5 (10 Go) c'est plus serré, Q6 (11,5 Go) touche au plafond, Q8 (15 Go) déborde. Un contexte 8k+ impose de rester en Q4 ou d'activer le KV cache quantifié.

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Requis pour Blackwell. Vérifiez nvidia-smi après installation.
  2. 02
    Ollama (recommandé)
    Installeur standard. Ollama détecte automatiquement la 5070 et utilise CUDA 12.8 intégré.
  3. 03
    Télécharger un modèle adapté
    ollama run mistral pour 7B, ollama run phi4 pour du 14B Q4.

#3. Benchmarks

RTX 5070 12 Go — tokens/sec mesurés
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Mistral 7B84 t/s74 t/s66 t/s52 t/s
Llama 3.1 8B78 t/s68 t/s60 t/s46 t/s
Phi-4 14B52 t/s44 t/s38 t/s
Qwen 2.5 14B46 t/s40 t/s36 t/s

#4. La limite des 12 Go

Mistral Small 24B
Q4 = 14 Go. Déborde de 2 Go → offload VRAM+RAM → 20 tok/s max. Préférer Qwen 14B Q5 (tient en VRAM, meilleures perfs).
Qwen 2.5 32B
Q3 = 15 Go. Impossible. Restez sur 14B.
RAG avec gros contexte
Mistral 7B + contexte 32k = 7 Go (KV non-quant) → plein. Activer KV Q8 divise par 2.
Multi-modèle parallèle
Un 8B + un embedder BGE M3 = 8 Go. Ça tient, mais vous n'avez plus de marge pour un reranker.
Maximiser le contexte sur 12 Go
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_FLASH_ATTENTION=1

./llama-server -m mistral.gguf -c 32768 -fa --cache-type-k q8_0 --cache-type-v q8_0

#5. 5070 vs 4070 Super vs 5070 Ti

Le triangle 12 Go vs 16 Go
CarteVRAMBande p.Mistral 7BPhi-4 14BPrix
RTX 507012 Go672 Go/s84 t/s52 t/s~750 €
RTX 4070 Super12 Go504 Go/s62 t/s38 t/s~550 € occasion
RTX 5070 Ti16 Go896 Go/s94 t/s52 t/s~950 €
Le 200 € additionnel pour 5070 Ti ?
Oui, largement. +33 % de VRAM (12 → 16 Go) qui ouvre Mistral Small 24B et Qwen 32B IQ3, +33 % de bande passante → +15-25 % de vitesse sur 14B. Un des meilleurs upgrades par euro dépensé en 2026.

#Verdict achat 2026

Achetez une 5070 si
Budget ≤ 800 €, usage LLM occasionnel, principalement du 7B-8B chat/code. Carte très capable pour cet usage.
Préférez la 5070 Ti si
Usage LLM quotidien, envie d'explorer 14B-24B, budget atteint 950 €. Vous ne regretterez pas les 16 Go.
Préférez une 4070 Ti Super (occasion) si
Vous trouvez une occasion à ~700 €. Même 16 Go, perte de 15 % vs 5070 Ti mais économie de 250 €.

#Questions fréquentes

La RTX 5070 12 Go peut-elle faire tourner Llama 3.1 70B ?+
Non. Le modèle pèse 42 Go en Q4, la carte en a 12 — offload massif inutilisable (< 3 tok/s). Pour du 70B local, il faut minimum 32 Go (RTX 5090) ou un Mac Studio 64 Go+.
Combien de tokens/sec pour Mistral 7B sur RTX 5070 ?+
Entre 78 et 90 tokens/seconde en Q4_K_M selon la config système. Q5_K_M tombe à 74-84 tok/s, Q8_0 à 48-55 tok/s. Comparable voire légèrement supérieur à une RTX 4070 Super malgré la même VRAM.
12 Go suffisent-ils pour un usage pro en 2026 ?+
Pour chat + RAG sur Mistral 7B ou Llama 3.1 8B : oui, très confortable. Pour RAG avancé multi-stage (embedder + reranker + 14B) : ça devient serré, un 16 Go est plus serein. Pour du 24B+ : non.
RTX 5070 vs MacBook Pro M4 Pro pour LLM ?+
Sur pure vitesse 7B : 5070 gagne (84 vs 55 tok/s). Sur 24B+ : MBP M4 Pro 48 Go gagne (RAM unifiée supérieure). Coût total : un PC avec 5070 à 1500 € vs MBP M4 Pro à 2700 €. Dépend de votre besoin mobilité vs perf pure.
La RTX 5070 supporte-t-elle DLSS 4 ET le LLM ?+
Oui, les deux fonctionnalités cohabitent sans conflit. DLSS 4 utilise le Neural Engine (petits modèles dédiés < 100 Mo), le LLM prend la VRAM principale. Vous pouvez donc gamer en 4K DLSS et avoir un LLM chargé en arrière-plan sur les 12 Go.
Peut-on faire du fine-tuning sur RTX 5070 ?+
QLoRA sur 7B-8B : oui, ça tient en 10 Go avec batch 2. LoRA classique ou fine-tuning complet : non, 12 Go insuffisants. Pour du FT sérieux, visez minimum 24 Go (RTX 3090/4090/5090).
Alim 550 W suffit pour une RTX 5070 ?+
TDP 250 W GPU + 120 W CPU + 40 W système = ~410 W. Une 550 W qualité (Seasonic Focus GX, be quiet!) tient, mais 650 W offre plus de marge et de silence (ventilo alim moins sollicité).
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.