Débutant 9 minRTX 40
Quel LLM sur RTX 4060 (8 Go) ?
La RTX 4060 (juin 2023) est l'entrée de gamme Ada. 8 Go de VRAM GDDR6, 272 Go/s de bande passante, 3 072 cœurs CUDA, TDP 115 W. Pour l'IA locale, elle tient Granite 4.2 8B Q4 à ~32 tok/s — correct pour débuter mais plafonne vite. En 2026, on la trouve à ~310 € d'occasion, mais la RTX 3060 12 Go (~250 €) reste souvent un meilleur choix LLM grâce à ses 4 Go supplémentaires. Ce guide détaille ce qu'elle peut faire.
#La RTX 4060 en 2026
- Architecture
- Ada Lovelace AD107. TSMC 4N.
- VRAM
- 8 Go GDDR6 17 Gbps, bus 128 bits. Bande passante 272 Go/s (le point faible).
- Cœurs CUDA
- 3 072. Tensor Cores 4ᵉ gen, FP8 natif.
- TDP
- 115 W (très sobre). Alim 500 W suffit.
- Prix 2026
- ~310 € en occasion. ~340 € en neuf rare.
#1. Modèles LLM compatibles
RTX 4060 8 Go — modèles LLM
| Modèle | Quant | VRAM | Tokens/sec |
|---|---|---|---|
| Gemma 4 2B | Q5_K_M | 1,4 Go | 32-39 |
| Granite 4.2 8B | Q4_K_M | 4,6 Go | 29-35 |
| Qwen 3.5 9B | Q4_K_M | 6 Go | 8-10 |
| Qwen 3.5 4B | Q5_K_M | 2,8 Go | 29-35 |
#2. Installation
- 01Drivers NVIDIA 535+Standard Ada. GeForce Experience.
- 02OllamaInstallation standard, CUDA auto-détecté.
- 03Modèle conseilléollama run granite4.2:8b pour Granite 4.2 8B (5,3 Go, 128k ctx) — le sweet spot sur 8 Go.
#3. Benchmarks
RTX 4060 8 Go — tokens/sec (ordres de grandeur)
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 3.5 4B | 38 t/s | 34 t/s | 28 t/s |
| Granite 4.2 8B | 32 t/s | 28 t/s | 22 t/s |
| Qwen 3.5 9B | 10 t/s | — | — |
#4. Astuces 8 Go
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 16k sur un 8B tient en ~6,5 Go au lieu de 8.
- Fermez Chrome
- Avec accélération GPU, il prend 0,8-1 Go. Sur 8 Go c'est beaucoup.
- Monitor VRAM
- nvidia-smi avant chaque load pour éviter l'offload CPU silencieux.
#5. 4060 vs 3060 12 Go vs 5060
Cartes entrée de gamme ~300 €
| Carte | VRAM | Bande p. | Granite 4.2 8B | Prix 2026 |
|---|---|---|---|---|
| RTX 3060 12 Go | 12 Go | 360 Go/s | 31 t/s | ~250 € occ. |
| RTX 4060 | 8 Go | 272 Go/s | 32 t/s | ~310 € occ. |
| RTX 5060 | 8 Go | 448 Go/s | 50 t/s | ~400 € neuf |
→
La 3060 12 Go, toujours meilleur choix LLM sous 350 €
Pour 60 € de moins qu'une 4060, vous gagnez 4 Go de VRAM — soit l'accès à Gemma 4 12B, Qwen 3.5 9B en Q8, et pleins de modèles que la 4060 refuse. Vitesse équivalente. La 4060 ne se justifie que pour gaming + consommation faible.
#Verdict 2026
- Gardez votre 4060 si
- Elle fonctionne bien. Utilisable pour Granite 4.2 8B et modèles 3B-4B.
- Préférez RTX 3060 12 Go occasion
- Moins chère, plus de VRAM. Meilleur rapport capacité LLM/€.
- Préférez RTX 5060 neuve
- +50 % vitesse pour +90 €, mêmes 8 Go. Rapport perf/€ supérieur en neuf.
#Questions fréquentes
La RTX 4060 peut-elle faire tourner un LLM en local ?+
Oui, correctement sur modèles 3B-8B. Granite 4.2 8B Q4 : ~32 tok/s, Qwen 3.5 4B Q5 : ~34 tok/s. Suffisant pour un usage chat et RAG simple. Les 14B+ sont hors de portée avec 8 Go.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 4060 ?+
~29-35 tokens/seconde en Q4_K_M. C'est modeste mais utilisable. Une RTX 5060 ferait ~50 tok/s, une 3060 12 Go ~31 tok/s (équivalent).
RTX 4060 ou RTX 3060 12 Go pour LLM en 2026 ?+
RTX 3060 12 Go, sans hésiter. Moins chère (~250 € vs ~310 €), +50 % de VRAM (12 vs 8 Go), accès à Gemma 4 12B et Qwen 3.5 9B en Q8. La 4060 n'a aucun avantage décisif pour LLM.
La RTX 4060 supporte-t-elle FP8 ?+
Oui nativement via Tensor Cores 4ᵉ gen Ada. Exploité par TensorRT-LLM. Pour Ollama/llama.cpp grand public, reste Q4-Q8 classiques.
Peut-on faire du fine-tuning sur RTX 4060 ?+
QLoRA sur Granite 4.2 3B ou Qwen 3.5 4B : oui, 5-6 Go requis. QLoRA sur un 8B : tangent, batch 1 uniquement. Rien au-delà.
Alim 450 W suffit pour RTX 4060 ?+
Largement. TDP 115 W GPU + 100 W CPU + 40 W système = 255 W. Une 450 W qualité offre double marge.
La RTX 4060 est-elle silencieuse ?+
Oui, un de ses atouts. 115 W TDP permet des ventilateurs très lents. En LLM (consommation ~80 W), quasiment inaudible.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.