Débutant 9 minRTX 40

Quel LLM sur RTX 4060 (8 Go) ?

La RTX 4060 (juin 2023) est l'entrée de gamme Ada. 8 Go de VRAM GDDR6, 272 Go/s de bande passante, 3 072 cœurs CUDA, TDP 115 W. Pour l'IA locale, elle tient Granite 4.2 8B Q4 à ~32 tok/s — correct pour débuter mais plafonne vite. En 2026, on la trouve à ~310 € d'occasion, mais la RTX 3060 12 Go (~250 €) reste souvent un meilleur choix LLM grâce à ses 4 Go supplémentaires. Ce guide détaille ce qu'elle peut faire.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 4060 en 2026

Architecture
Ada Lovelace AD107. TSMC 4N.
VRAM
8 Go GDDR6 17 Gbps, bus 128 bits. Bande passante 272 Go/s (le point faible).
Cœurs CUDA
3 072. Tensor Cores 4ᵉ gen, FP8 natif.
TDP
115 W (très sobre). Alim 500 W suffit.
Prix 2026
~310 € en occasion. ~340 € en neuf rare.

#1. Modèles LLM compatibles

RTX 4060 8 Go — modèles LLM
ModèleQuantVRAMTokens/sec
Gemma 4 2BQ5_K_M1,4 Go32-39
Granite 4.2 8BQ4_K_M4,6 Go29-35
Qwen 3.5 9BQ4_K_M6 Go8-10
Qwen 3.5 4BQ5_K_M2,8 Go29-35

#2. Installation

  1. 01
    Drivers NVIDIA 535+
    Standard Ada. GeForce Experience.
  2. 02
    Ollama
    Installation standard, CUDA auto-détecté.
  3. 03
    Modèle conseillé
    ollama run granite4.2:8b pour Granite 4.2 8B (5,3 Go, 128k ctx) — le sweet spot sur 8 Go.

#3. Benchmarks

RTX 4060 8 Go — tokens/sec (ordres de grandeur)
ModèleQ4_K_MQ5_K_MQ8_0
Qwen 3.5 4B38 t/s34 t/s28 t/s
Granite 4.2 8B32 t/s28 t/s22 t/s
Qwen 3.5 9B10 t/s

#4. Astuces 8 Go

KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 16k sur un 8B tient en ~6,5 Go au lieu de 8.
Fermez Chrome
Avec accélération GPU, il prend 0,8-1 Go. Sur 8 Go c'est beaucoup.
Monitor VRAM
nvidia-smi avant chaque load pour éviter l'offload CPU silencieux.

#5. 4060 vs 3060 12 Go vs 5060

Cartes entrée de gamme ~300 €
CarteVRAMBande p.Granite 4.2 8BPrix 2026
RTX 3060 12 Go12 Go360 Go/s31 t/s~250 € occ.
RTX 40608 Go272 Go/s32 t/s~310 € occ.
RTX 50608 Go448 Go/s50 t/s~400 € neuf
La 3060 12 Go, toujours meilleur choix LLM sous 350 €
Pour 60 € de moins qu'une 4060, vous gagnez 4 Go de VRAM — soit l'accès à Gemma 4 12B, Qwen 3.5 9B en Q8, et pleins de modèles que la 4060 refuse. Vitesse équivalente. La 4060 ne se justifie que pour gaming + consommation faible.

#Verdict 2026

Gardez votre 4060 si
Elle fonctionne bien. Utilisable pour Granite 4.2 8B et modèles 3B-4B.
Préférez RTX 3060 12 Go occasion
Moins chère, plus de VRAM. Meilleur rapport capacité LLM/€.
Préférez RTX 5060 neuve
+50 % vitesse pour +90 €, mêmes 8 Go. Rapport perf/€ supérieur en neuf.

#Questions fréquentes

La RTX 4060 peut-elle faire tourner un LLM en local ?+
Oui, correctement sur modèles 3B-8B. Granite 4.2 8B Q4 : ~32 tok/s, Qwen 3.5 4B Q5 : ~34 tok/s. Suffisant pour un usage chat et RAG simple. Les 14B+ sont hors de portée avec 8 Go.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 4060 ?+
~29-35 tokens/seconde en Q4_K_M. C'est modeste mais utilisable. Une RTX 5060 ferait ~50 tok/s, une 3060 12 Go ~31 tok/s (équivalent).
RTX 4060 ou RTX 3060 12 Go pour LLM en 2026 ?+
RTX 3060 12 Go, sans hésiter. Moins chère (~250 € vs ~310 €), +50 % de VRAM (12 vs 8 Go), accès à Gemma 4 12B et Qwen 3.5 9B en Q8. La 4060 n'a aucun avantage décisif pour LLM.
La RTX 4060 supporte-t-elle FP8 ?+
Oui nativement via Tensor Cores 4ᵉ gen Ada. Exploité par TensorRT-LLM. Pour Ollama/llama.cpp grand public, reste Q4-Q8 classiques.
Peut-on faire du fine-tuning sur RTX 4060 ?+
QLoRA sur Granite 4.2 3B ou Qwen 3.5 4B : oui, 5-6 Go requis. QLoRA sur un 8B : tangent, batch 1 uniquement. Rien au-delà.
Alim 450 W suffit pour RTX 4060 ?+
Largement. TDP 115 W GPU + 100 W CPU + 40 W système = 255 W. Une 450 W qualité offre double marge.
La RTX 4060 est-elle silencieuse ?+
Oui, un de ses atouts. 115 W TDP permet des ventilateurs très lents. En LLM (consommation ~80 W), quasiment inaudible.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.