Intermédiaire 11 minRTX 40
Quel LLM sur RTX 4070 / 4070 Super / 4070 Ti (12 Go) ?
Les RTX 4070, 4070 Super et 4070 Ti (avril 2023 - janvier 2024) partagent toutes 12 Go de VRAM GDDR6X mais diffèrent en puissance de calcul : 5 888 / 7 168 / 7 680 cœurs CUDA, 504 / 504 / 504 Go/s de bande passante (Ti identique). Elles font tourner Mistral 7B à 62-78 tok/s selon la variante et Phi-4 14B Q4 confortablement. Ce guide compare les trois et détaille les modèles qui tournent vraiment sur 12 Go.
#RTX 4070 / Super / Ti
- Architecture commune
- Ada Lovelace AD104. 12 Go GDDR6X, bus 192 bits.
- 4070
- 5 888 CUs, 504 Go/s, TDP 200 W, ~450 € occ.
- 4070 Super
- 7 168 CUs (+22 %), 504 Go/s, TDP 220 W, ~550 € occ.
- 4070 Ti
- 7 680 CUs, 504 Go/s, TDP 285 W, ~600 € occ. (évitez face à Super).
→
La 4070 Super est le meilleur choix de la famille
+22 % de CUs vs 4070 classique, même bande passante, TDP modéré (220 W). La 4070 Ti a plus de CUs mais consomme 30 % de plus pour ~5 % de perf LLM supplémentaire — mauvais rapport.
#1. Les 3 variantes en comparaison
Tableau des 3 variantes RTX 4070
| Carte | CUs | TDP | Mistral 7B | Phi-4 14B | Prix 2026 |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 200 W | 62 t/s | 38 t/s | ~450 € occ. |
| RTX 4070 Super | 7 168 | 220 W | 72 t/s | 44 t/s | ~550 € occ. |
| RTX 4070 Ti | 7 680 | 285 W | 78 t/s | 48 t/s | ~600 € occ. |
#2. Modèles compatibles 12 Go
Modèles LLM — RTX 4070 series (12 Go)
| Modèle | Quant | VRAM | OK ? |
|---|---|---|---|
| Mistral 7B | Q5_K_M | 5,1 Go | ★★★★★ |
| Llama 3.1 8B | Q5_K_M | 5,7 Go | ★★★★★ |
| Qwen 2.5 Coder 7B | Q6_K | 6,3 Go | ★★★★★ |
| Phi-4 14B | Q4_K_M | 8,5 Go | ★★★★ (sweet spot) |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | ★★★ serré |
| Mistral Small 24B | — | 14 Go+ | ❌ déborde |
| Qwen 2.5 32B | — | 18 Go+ | ❌ |
#3. Installation
#4. Benchmarks par variante
Tokens/sec — les 3 RTX 4070 en Q4_K_M
| Modèle | 4070 | 4070 Super | 4070 Ti |
|---|---|---|---|
| Mistral 7B | 62 t/s | 72 t/s | 78 t/s |
| Llama 3.1 8B | 54 t/s | 64 t/s | 70 t/s |
| Phi-4 14B | 38 t/s | 44 t/s | 48 t/s |
| Qwen 2.5 14B | 36 t/s | 42 t/s | 46 t/s |
#5. Limites des 12 Go
- Mistral Small 24B
- Q4 = 14 Go → déborde de 2 Go → chute à ~15 tok/s. Peu utilisable.
- Qwen 2.5 32B
- Minimum Q3 = 15 Go → impossible.
- Phi-4 14B contexte long
- Q4 + contexte 16k = ~11 Go. Juste jouable. Activez KV cache Q8.
- Pas de RAG multi-stage en parallèle
- 8B + embedder + reranker = ~10 Go. Possible mais sans marge.
#Verdict 2026
- 4070 Super = choix intelligent de la famille
- Meilleur rapport perf/€ des trois. À ~550 € occasion, excellent pour LLM 7B-14B.
- Préférez la 5070 si neuf
- ~750 € neuve, +35 % vitesse LLM vs 4070 Super, même 12 Go, FP4 support.
- Préférez la 4070 Ti Super 16 Go occasion
- À 750 € d'occasion. 4 Go de plus = Mistral Small 24B accessible.
#Questions fréquentes
Quelle est la différence entre RTX 4070, 4070 Super et 4070 Ti ?+
Même VRAM (12 Go GDDR6X) et même bande passante (504 Go/s). Diffèrent en CUDA cores : 5 888 / 7 168 / 7 680 et en TDP : 200 / 220 / 285 W. Résultat LLM : 4070 Super +15 % vs 4070, 4070 Ti +5 % vs Super. Le sweet spot = Super.
La RTX 4070 peut-elle tourner Phi-4 14B ?+
Oui en Q4_K_M (8,5 Go) confortablement : 38-48 tok/s selon variante. En Q5_K_M (10 Go), plus serré. Évitez Q6+.
12 Go suffisent-ils en 2026 ?+
Pour les 7B-14B : oui. Pour les 24B+ : non (débordement). Un usage pro moderne (RAG multi-stage, 24B polyvalent) préfère 16 Go. Mais pour 90 % des cas débutant/intermédiaire, 12 Go restent pertinents.
RTX 4070 ou RTX 3080 10 Go pour LLM ?+
RTX 4070 : 12 Go (+20 %), +30 % vitesse, moins gourmande (200 vs 320 W), moins chère occasion. Sauf si vous trouvez une 3080 à ~350 €, la 4070 l'emporte.
Peut-on faire du QLoRA sur RTX 4070 ?+
QLoRA sur 7B-8B : oui, tient en 10 Go. QLoRA sur 14B : tangent, nécessite unsloth + batch 1 + contexte court. Pour FT sérieux, 16 Go mini (4070 Ti Super/5070 Ti).
Flash Attention sur RTX 4070 ?+
Oui, FA2 actif par défaut dans llama.cpp et Ollama récents. Gain ~10 % sur contextes longs, KV cache réduit.
Alim 550 W suffit pour RTX 4070 Super ?+
Oui largement. TDP 220 W GPU + 120 W CPU + 40 W système = 380 W. 550 W qualité offre marge saine.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.