Débutant 9 minRTX 50
Quel LLM sur RTX 5060 (8 Go) ?
La RTX 5060 (mai 2025) est l'entrée dans la gamme Blackwell : 349 € MSRP, 8 Go de VRAM GDDR7 à 448 Go/s, 3 840 cœurs CUDA. Pour l'IA locale, elle est correcte sur les modèles 3B-8B mais se heurte immédiatement au plafond des 8 Go dès qu'on veut faire tenir Gemma 4 12B ou plus gros. Ce guide détaille quels LLM tournent bien, lesquels passent à peine, et quelles astuces permettent d'étirer les 8 Go.
#La RTX 5060 en 2026
- Architecture
- Blackwell GB206 (même die que 5060 Ti, moins de CUs activées).
- VRAM
- 8 Go GDDR7 28 Gbps, bus 128 bits. Bande passante 448 Go/s (+60 % vs 4060).
- Cœurs CUDA
- 3 840. Tensor Cores 5ᵉ gen, FP4 natif.
- TDP
- 150 W. Alim 500 W suffit.
- Prix MSRP
- 349 € au lancement. ~400 € en 2026.
→
L'intérêt réel face à la 4060
+60 % de bande passante mémoire vs RTX 4060 (448 vs 272 Go/s), même VRAM (8 Go). Pour le LLM, c'est énorme : les modèles inférence sont mémoire-bound. Résultat : +50-60 % tokens/sec vs 4060 pour le même prix.
#1. Modèles LLM compatibles
RTX 5060 8 Go — ce qui passe, ce qui cale
| Modèle | Quant | VRAM | Tokens/sec | Verdict |
|---|---|---|---|---|
| Gemma 4 2B | Q5_K_M | 1,4 Go | 32-39 | ★★★★★ confortable |
| Granite 4.2 8B | Q4_K_M | 4,6 Go | 29-35 | ★★★★★ |
| Qwen 3.5 9B | Q4_K_M | 6 Go | 8-10 | ★★★★★ |
| Qwen 3.5 4B | Q5_K_M | 2,8 Go | 29-35 | ★★★★★ confortable |
!
Les 12B — trop juste sur 8 Go
Techniquement Gemma 4 12B en Q4_K_M tient en 7,6 Go, mais il ne reste alors quasi rien pour le KV cache : le contexte s'effondre à 2-3k tokens et la moindre appli GPU fait déborder. Restez sur Qwen 3.5 9B Q4 (6 Go) ou Granite 4.2 8B Q4 (4,6 Go) — bien mieux servis avec la VRAM disponible.
#2. Installation
- 01Drivers NVIDIA 570+Obligatoires pour Blackwell. Via GeForce Experience ou nvidia.com.
- 02OllamaInstalleur depuis ollama.com. Auto-détection GPU.
- 03Premier modèle adapté 8 Goollama run qwen3.5:9b (le choix 8 Go 2026, 6 Go) ou ollama run granite4.2:8b si vous voulez plus sobre (4,6 Go). Évitez gemma4:12b sauf curiosité — trop juste en contexte.
#3. Benchmarks
RTX 5060 8 Go — tokens/sec (ordres de grandeur)
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Granite 4.2 3B | 55 t/s | 48 t/s | 36 t/s |
| Qwen 3.5 4B | 38 t/s | 33 t/s | 25 t/s |
| Granite 4.2 8B | 32 t/s | 28 t/s | 22 t/s |
| Gemma 4 12B | 18 t/s | — | — |
#4. Astuces pour 8 Go
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 — divise par 2 la VRAM du cache contexte. Permet 16k de contexte sur Granite 4.2 8B sur 8 Go.
- num_gpu_layers judicieux
- Par défaut Ollama charge tout sur GPU. Pour tester un 12B comme Gemma 4 12B en offload CPU+GPU partiel : num_gpu_layers 20 (au lieu de 40+).
- Fermez les apps GPU-hungry
- Chrome avec accélération matérielle mange 0,5-1 Go. Fermez ou désactivez avant de charger le LLM.
- Une seule tâche GPU à la fois
- Pas d'encodage vidéo OBS + LLM + jeu. Avec 8 Go, c'est un seul de ces trois.
#5. 5060 vs 4060 vs 5060 Ti
Les 3 petites Ada/Blackwell
| Carte | VRAM | Bande p. | Granite 4.2 8B Q4 | Prix 2026 |
|---|---|---|---|---|
| RTX 5060 | 8 Go | 448 Go/s | 32 t/s | ~400 € |
| RTX 4060 | 8 Go | 272 Go/s | 20 t/s | ~310 € occasion |
| RTX 5060 Ti 8 Go | 8 Go | 448 Go/s | 34 t/s | ~450 € |
| RTX 5060 Ti 16 Go | 16 Go | 448 Go/s | 34 t/s | ~500 € |
→
Le vrai arbitrage
Pour 100 € de plus qu'une 5060, vous prenez une 5060 Ti 16 Go : DOUBLE de VRAM et accès aux 24B (Devstral, gpt-oss 20B, Mistral Small). Pour du LLM, c'est une évidence. La 5060 seule se justifie uniquement pour un budget strict ≤ 400 €.
#Verdict achat 2026
- Achetez une 5060 si
- Budget ≤ 400 €, usage LLM modeste (Qwen 3.5 9B ou Granite 4.2 8B en chat uniquement), également gaming 1080p esport.
- Préférez 5060 Ti 16 Go si
- +100 € disponibles. Gain massif en capacité LLM.
- Évitez si
- Vous comptez utiliser Gemma 4 12B, Qwen 3.8 27B, ou n'importe quel modèle > 8 Go sérieusement. Les 8 Go coincent vite.
#Questions fréquentes
La RTX 5060 peut-elle faire tourner un LLM en local ?+
Oui, très correctement pour des modèles 3B-9B. Granite 4.2 8B Q4 : ~32 tok/s, Qwen 3.5 9B Q4 tient en 6 Go et reste fluide. Pour du chat quotidien et du RAG simple, c'est largement suffisant. Les modèles 12B+ sont hors de portée raisonnable avec 8 Go.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 5060 ?+
Autour de 30-35 tokens/seconde en Q4_K_M. C'est ~50 % de mieux qu'une RTX 4060 à même VRAM, grâce à la GDDR7.
RTX 5060 ou RTX 4060 Ti 16 Go pour LLM ?+
4060 Ti 16 Go sans hésiter. Même prix en occasion (~420 €), DOUBLE de VRAM, accès à Gemma 4 12B et aux 24B comme Devstral ou Mistral Small. La 5060 est légèrement plus rapide sur 8B mais ne peut pas les 12B+.
Peut-on tourner Qwen 3.5 9B sur RTX 5060 ?+
Oui, en Q4_K_M (6 Go). Il reste ~2 Go pour le KV cache et le contexte — suffisant jusqu'à ~6-8k. C'est un cran plus lent qu'un 8B comme Granite 4.2, mais reste fluide pour du chat. Besoin de plus de marge de contexte ? Granite 4.2 8B Q4 (4,6 Go) laisse davantage de place.
Le NVFP4 de la 5060 accélère-t-il Ollama ?+
Pas directement en 2026 : Ollama et llama.cpp n'exploitent pas encore FP4. Via vLLM 0.7+ ou TensorRT-LLM, oui — gain de 30-40 % sur modèles compatibles. Pour un usage Ollama grand public, restez sur Q4_K_M.
Alim 450 W suffit pour RTX 5060 ?+
TDP 150 W GPU + 100 W CPU milieu de gamme + 40 W système = 290 W nominal. Une 450 W qualité suffit largement. 500 W pour marge/silence.
Peut-on faire du RAG avec la RTX 5060 ?+
Oui, pour du RAG simple (Granite 4.2 8B + BGE-M3 embedder). Ça tient en 6-7 Go. Pour du RAG multi-stage (embedder + reranker + 12B+), les 8 Go ne suffisent pas — préférez une 5060 Ti 16 Go.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.