Intermédiaire 11 minRTX 40

Quel LLM sur RTX 4070 / 4070 Super / 4070 Ti (12 Go) ?

Les RTX 4070, 4070 Super et 4070 Ti (avril 2023 - janvier 2024) partagent toutes 12 Go de VRAM GDDR6X mais diffèrent en puissance de calcul : 5 888 / 7 168 / 7 680 cœurs CUDA, 504 / 504 / 504 Go/s de bande passante (Ti identique). Elles font tourner Qwen 3.5 9B à 52-68 tok/s selon la variante et Gemma 4 12B Q4 confortablement. Ce guide compare les trois et détaille les modèles qui tournent vraiment sur 12 Go.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#RTX 4070 / Super / Ti

Architecture commune
Ada Lovelace AD104. 12 Go GDDR6X, bus 192 bits.
4070
5 888 CUs, 504 Go/s, TDP 200 W, ~450 € occ.
4070 Super
7 168 CUs (+22 %), 504 Go/s, TDP 220 W, ~550 € occ.
4070 Ti
7 680 CUs, 504 Go/s, TDP 285 W, ~600 € occ. (évitez face à Super).
La 4070 Super est le meilleur choix de la famille
+22 % de CUs vs 4070 classique, même bande passante, TDP modéré (220 W). La 4070 Ti a plus de CUs mais consomme 30 % de plus pour ~5 % de perf LLM supplémentaire — mauvais rapport.

#1. Les 3 variantes en comparaison

Tableau des 3 variantes RTX 4070
CarteCUsTDPQwen 3.5 9BGemma 4 12BPrix 2026
RTX 40705 888200 W52 t/s40 t/s~450 € occ.
RTX 4070 Super7 168220 W62 t/s46 t/s~550 € occ.
RTX 4070 Ti7 680285 W68 t/s50 t/s~600 € occ.

#2. Modèles compatibles 12 Go

Modèles LLM — RTX 4070 series (12 Go)
ModèleQuantVRAMOK ?
Gemma 4 12BQ4_K_M7 Go★★★★★
Granite 4.2 8BQ5_K_M6 Go★★★★★ confortable
Qwen 3.5 9BQ4_K_M6 Go★★★★★ confortable
Qwen 3.5 9BQ8_011 Go★★★★ qualité max (serré mais tient)
gpt-oss 20BMXFP414 Go❌ déborde
Mistral Small 24BQ414 Go+❌ déborde
Qwen 3.8 27BQ418 Go+

#3. Installation

Setup standard
# Windows
winget install Ollama.Ollama
ollama run qwen3.5:9b
ollama run gemma4:12b       # Test du 12B multimodal

#4. Benchmarks par variante

Tokens/sec — les 3 RTX 4070 (ordres de grandeur)
Modèle40704070 Super4070 Ti
Granite 4.2 8B58 t/s68 t/s74 t/s
Qwen 3.5 9B52 t/s62 t/s68 t/s
Gemma 4 12B40 t/s46 t/s50 t/s
Qwen 3.5 9B (Q8)34 t/s40 t/s44 t/s

#5. Limites des 12 Go

Mistral Small 24B
Q4 = 14 Go → déborde de 2 Go → chute à ~15 tok/s. Peu utilisable.
Qwen 3.8 27B
Q4 = 18 Go, ~14 Go même en Q3 → impossible sur 12 Go.
Gemma 4 12B contexte long
Q4 + contexte 32k = ~10 Go. Jouable. Activez KV cache Q8.
Pas de RAG multi-stage en parallèle
Granite 4.2 8B + embedder + reranker = ~10 Go. Possible mais sans marge.

#Verdict 2026

4070 Super = choix intelligent de la famille
Meilleur rapport perf/€ des trois. À ~550 € occasion, excellent pour LLM 8B-12B.
Préférez la 5070 si neuf
~750 € neuve, +35 % vitesse LLM vs 4070 Super, même 12 Go, FP4 support.
Préférez la 4070 Ti Super 16 Go occasion
À 750 € d'occasion. 4 Go de plus = Mistral Small 24B accessible.

#Questions fréquentes

Quelle est la différence entre RTX 4070, 4070 Super et 4070 Ti ?+
Même VRAM (12 Go GDDR6X) et même bande passante (504 Go/s). Diffèrent en CUDA cores : 5 888 / 7 168 / 7 680 et en TDP : 200 / 220 / 285 W. Résultat LLM : 4070 Super +15 % vs 4070, 4070 Ti +5 % vs Super. Le sweet spot = Super.
La RTX 4070 peut-elle tourner Gemma 4 12B ?+
Oui en Q4_K_M (7,6 Go) confortablement : 40-50 tok/s selon variante. En Q5_K_M (~9 Go), plus serré. Modèle multimodal Apache 2.0, idéal sur 12 Go. Évitez Q6+.
12 Go suffisent-ils en 2026 ?+
Pour les 8B-12B : oui. Pour les 24B+ (Devstral, gpt-oss 20B, Mistral Small) : non (débordement). Un usage pro moderne (RAG multi-stage, 24B polyvalent) préfère 16 Go. Mais pour 90 % des cas débutant/intermédiaire, 12 Go restent pertinents.
RTX 4070 ou RTX 3080 10 Go pour LLM ?+
RTX 4070 : 12 Go (+20 %), +30 % vitesse, moins gourmande (200 vs 320 W), moins chère occasion. Sauf si vous trouvez une 3080 à ~350 €, la 4070 l'emporte.
Peut-on faire du QLoRA sur RTX 4070 ?+
QLoRA sur 7B-8B : oui, tient en 10 Go. QLoRA sur 14B : tangent, nécessite unsloth + batch 1 + contexte court. Pour FT sérieux, 16 Go mini (4070 Ti Super/5070 Ti).
Flash Attention sur RTX 4070 ?+
Oui, FA2 actif par défaut dans llama.cpp et Ollama récents. Gain ~10 % sur contextes longs, KV cache réduit.
Alim 550 W suffit pour RTX 4070 Super ?+
Oui largement. TDP 220 W GPU + 120 W CPU + 40 W système = 380 W. 550 W qualité offre marge saine.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.