Intermédiaire 11 minRTX 40
Quel LLM sur RTX 4070 / 4070 Super / 4070 Ti (12 Go) ?
Les RTX 4070, 4070 Super et 4070 Ti (avril 2023 - janvier 2024) partagent toutes 12 Go de VRAM GDDR6X mais diffèrent en puissance de calcul : 5 888 / 7 168 / 7 680 cœurs CUDA, 504 / 504 / 504 Go/s de bande passante (Ti identique). Elles font tourner Qwen 3.5 9B à 52-68 tok/s selon la variante et Gemma 4 12B Q4 confortablement. Ce guide compare les trois et détaille les modèles qui tournent vraiment sur 12 Go.
#RTX 4070 / Super / Ti
- Architecture commune
- Ada Lovelace AD104. 12 Go GDDR6X, bus 192 bits.
- 4070
- 5 888 CUs, 504 Go/s, TDP 200 W, ~450 € occ.
- 4070 Super
- 7 168 CUs (+22 %), 504 Go/s, TDP 220 W, ~550 € occ.
- 4070 Ti
- 7 680 CUs, 504 Go/s, TDP 285 W, ~600 € occ. (évitez face à Super).
→
La 4070 Super est le meilleur choix de la famille
+22 % de CUs vs 4070 classique, même bande passante, TDP modéré (220 W). La 4070 Ti a plus de CUs mais consomme 30 % de plus pour ~5 % de perf LLM supplémentaire — mauvais rapport.
#1. Les 3 variantes en comparaison
Tableau des 3 variantes RTX 4070
| Carte | CUs | TDP | Qwen 3.5 9B | Gemma 4 12B | Prix 2026 |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 200 W | 52 t/s | 40 t/s | ~450 € occ. |
| RTX 4070 Super | 7 168 | 220 W | 62 t/s | 46 t/s | ~550 € occ. |
| RTX 4070 Ti | 7 680 | 285 W | 68 t/s | 50 t/s | ~600 € occ. |
#2. Modèles compatibles 12 Go
Modèles LLM — RTX 4070 series (12 Go)
| Modèle | Quant | VRAM | OK ? |
|---|---|---|---|
| Gemma 4 12B | Q4_K_M | 7 Go | ★★★★★ |
| Granite 4.2 8B | Q5_K_M | 6 Go | ★★★★★ confortable |
| Qwen 3.5 9B | Q4_K_M | 6 Go | ★★★★★ confortable |
| Qwen 3.5 9B | Q8_0 | 11 Go | ★★★★ qualité max (serré mais tient) |
| gpt-oss 20B | MXFP4 | 14 Go | ❌ déborde |
| Mistral Small 24B | Q4 | 14 Go+ | ❌ déborde |
| Qwen 3.8 27B | Q4 | 18 Go+ | ❌ |
#3. Installation
#4. Benchmarks par variante
Tokens/sec — les 3 RTX 4070 (ordres de grandeur)
| Modèle | 4070 | 4070 Super | 4070 Ti |
|---|---|---|---|
| Granite 4.2 8B | 58 t/s | 68 t/s | 74 t/s |
| Qwen 3.5 9B | 52 t/s | 62 t/s | 68 t/s |
| Gemma 4 12B | 40 t/s | 46 t/s | 50 t/s |
| Qwen 3.5 9B (Q8) | 34 t/s | 40 t/s | 44 t/s |
#5. Limites des 12 Go
- Mistral Small 24B
- Q4 = 14 Go → déborde de 2 Go → chute à ~15 tok/s. Peu utilisable.
- Qwen 3.8 27B
- Q4 = 18 Go, ~14 Go même en Q3 → impossible sur 12 Go.
- Gemma 4 12B contexte long
- Q4 + contexte 32k = ~10 Go. Jouable. Activez KV cache Q8.
- Pas de RAG multi-stage en parallèle
- Granite 4.2 8B + embedder + reranker = ~10 Go. Possible mais sans marge.
#Verdict 2026
- 4070 Super = choix intelligent de la famille
- Meilleur rapport perf/€ des trois. À ~550 € occasion, excellent pour LLM 8B-12B.
- Préférez la 5070 si neuf
- ~750 € neuve, +35 % vitesse LLM vs 4070 Super, même 12 Go, FP4 support.
- Préférez la 4070 Ti Super 16 Go occasion
- À 750 € d'occasion. 4 Go de plus = Mistral Small 24B accessible.
#Questions fréquentes
Quelle est la différence entre RTX 4070, 4070 Super et 4070 Ti ?+
Même VRAM (12 Go GDDR6X) et même bande passante (504 Go/s). Diffèrent en CUDA cores : 5 888 / 7 168 / 7 680 et en TDP : 200 / 220 / 285 W. Résultat LLM : 4070 Super +15 % vs 4070, 4070 Ti +5 % vs Super. Le sweet spot = Super.
La RTX 4070 peut-elle tourner Gemma 4 12B ?+
Oui en Q4_K_M (7,6 Go) confortablement : 40-50 tok/s selon variante. En Q5_K_M (~9 Go), plus serré. Modèle multimodal Apache 2.0, idéal sur 12 Go. Évitez Q6+.
12 Go suffisent-ils en 2026 ?+
Pour les 8B-12B : oui. Pour les 24B+ (Devstral, gpt-oss 20B, Mistral Small) : non (débordement). Un usage pro moderne (RAG multi-stage, 24B polyvalent) préfère 16 Go. Mais pour 90 % des cas débutant/intermédiaire, 12 Go restent pertinents.
RTX 4070 ou RTX 3080 10 Go pour LLM ?+
RTX 4070 : 12 Go (+20 %), +30 % vitesse, moins gourmande (200 vs 320 W), moins chère occasion. Sauf si vous trouvez une 3080 à ~350 €, la 4070 l'emporte.
Peut-on faire du QLoRA sur RTX 4070 ?+
QLoRA sur 7B-8B : oui, tient en 10 Go. QLoRA sur 14B : tangent, nécessite unsloth + batch 1 + contexte court. Pour FT sérieux, 16 Go mini (4070 Ti Super/5070 Ti).
Flash Attention sur RTX 4070 ?+
Oui, FA2 actif par défaut dans llama.cpp et Ollama récents. Gain ~10 % sur contextes longs, KV cache réduit.
Alim 550 W suffit pour RTX 4070 Super ?+
Oui largement. TDP 220 W GPU + 120 W CPU + 40 W système = 380 W. 550 W qualité offre marge saine.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.