Débutant 9 minRTX 50

Quel LLM sur RTX 5060 (8 Go) ?

La RTX 5060 (mai 2025) est l'entrée dans la gamme Blackwell : 349 € MSRP, 8 Go de VRAM GDDR7 à 448 Go/s, 3 840 cœurs CUDA. Pour l'IA locale, elle est correcte sur les modèles 3B-8B mais se heurte immédiatement au plafond des 8 Go dès qu'on veut faire tenir Gemma 4 12B ou plus gros. Ce guide détaille quels LLM tournent bien, lesquels passent à peine, et quelles astuces permettent d'étirer les 8 Go.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 5060 en 2026

Architecture
Blackwell GB206 (même die que 5060 Ti, moins de CUs activées).
VRAM
8 Go GDDR7 28 Gbps, bus 128 bits. Bande passante 448 Go/s (+60 % vs 4060).
Cœurs CUDA
3 840. Tensor Cores 5ᵉ gen, FP4 natif.
TDP
150 W. Alim 500 W suffit.
Prix MSRP
349 € au lancement. ~400 € en 2026.
L'intérêt réel face à la 4060
+60 % de bande passante mémoire vs RTX 4060 (448 vs 272 Go/s), même VRAM (8 Go). Pour le LLM, c'est énorme : les modèles inférence sont mémoire-bound. Résultat : +50-60 % tokens/sec vs 4060 pour le même prix.

#1. Modèles LLM compatibles

RTX 5060 8 Go — ce qui passe, ce qui cale
ModèleQuantVRAMTokens/secVerdict
Gemma 4 2BQ5_K_M1,4 Go32-39★★★★★ confortable
Granite 4.2 8BQ4_K_M4,6 Go29-35★★★★★
Qwen 3.5 9BQ4_K_M6 Go8-10★★★★★
Qwen 3.5 4BQ5_K_M2,8 Go29-35★★★★★ confortable
!
Les 12B — trop juste sur 8 Go
Techniquement Gemma 4 12B en Q4_K_M tient en 7,6 Go, mais il ne reste alors quasi rien pour le KV cache : le contexte s'effondre à 2-3k tokens et la moindre appli GPU fait déborder. Restez sur Qwen 3.5 9B Q4 (6 Go) ou Granite 4.2 8B Q4 (4,6 Go) — bien mieux servis avec la VRAM disponible.

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Obligatoires pour Blackwell. Via GeForce Experience ou nvidia.com.
  2. 02
    Ollama
    Installeur depuis ollama.com. Auto-détection GPU.
  3. 03
    Premier modèle adapté 8 Go
    ollama run qwen3.5:9b (le choix 8 Go 2026, 6 Go) ou ollama run granite4.2:8b si vous voulez plus sobre (4,6 Go). Évitez gemma4:12b sauf curiosité — trop juste en contexte.

#3. Benchmarks

RTX 5060 8 Go — tokens/sec (ordres de grandeur)
ModèleQ4_K_MQ5_K_MQ8_0
Granite 4.2 3B55 t/s48 t/s36 t/s
Qwen 3.5 4B38 t/s33 t/s25 t/s
Granite 4.2 8B32 t/s28 t/s22 t/s
Gemma 4 12B18 t/s

#4. Astuces pour 8 Go

KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0 — divise par 2 la VRAM du cache contexte. Permet 16k de contexte sur Granite 4.2 8B sur 8 Go.
num_gpu_layers judicieux
Par défaut Ollama charge tout sur GPU. Pour tester un 12B comme Gemma 4 12B en offload CPU+GPU partiel : num_gpu_layers 20 (au lieu de 40+).
Fermez les apps GPU-hungry
Chrome avec accélération matérielle mange 0,5-1 Go. Fermez ou désactivez avant de charger le LLM.
Une seule tâche GPU à la fois
Pas d'encodage vidéo OBS + LLM + jeu. Avec 8 Go, c'est un seul de ces trois.

#5. 5060 vs 4060 vs 5060 Ti

Les 3 petites Ada/Blackwell
CarteVRAMBande p.Granite 4.2 8B Q4Prix 2026
RTX 50608 Go448 Go/s32 t/s~400 €
RTX 40608 Go272 Go/s20 t/s~310 € occasion
RTX 5060 Ti 8 Go8 Go448 Go/s34 t/s~450 €
RTX 5060 Ti 16 Go16 Go448 Go/s34 t/s~500 €
Le vrai arbitrage
Pour 100 € de plus qu'une 5060, vous prenez une 5060 Ti 16 Go : DOUBLE de VRAM et accès aux 24B (Devstral, gpt-oss 20B, Mistral Small). Pour du LLM, c'est une évidence. La 5060 seule se justifie uniquement pour un budget strict ≤ 400 €.

#Verdict achat 2026

Achetez une 5060 si
Budget ≤ 400 €, usage LLM modeste (Qwen 3.5 9B ou Granite 4.2 8B en chat uniquement), également gaming 1080p esport.
Préférez 5060 Ti 16 Go si
+100 € disponibles. Gain massif en capacité LLM.
Évitez si
Vous comptez utiliser Gemma 4 12B, Qwen 3.8 27B, ou n'importe quel modèle > 8 Go sérieusement. Les 8 Go coincent vite.

#Questions fréquentes

La RTX 5060 peut-elle faire tourner un LLM en local ?+
Oui, très correctement pour des modèles 3B-9B. Granite 4.2 8B Q4 : ~32 tok/s, Qwen 3.5 9B Q4 tient en 6 Go et reste fluide. Pour du chat quotidien et du RAG simple, c'est largement suffisant. Les modèles 12B+ sont hors de portée raisonnable avec 8 Go.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 5060 ?+
Autour de 30-35 tokens/seconde en Q4_K_M. C'est ~50 % de mieux qu'une RTX 4060 à même VRAM, grâce à la GDDR7.
RTX 5060 ou RTX 4060 Ti 16 Go pour LLM ?+
4060 Ti 16 Go sans hésiter. Même prix en occasion (~420 €), DOUBLE de VRAM, accès à Gemma 4 12B et aux 24B comme Devstral ou Mistral Small. La 5060 est légèrement plus rapide sur 8B mais ne peut pas les 12B+.
Peut-on tourner Qwen 3.5 9B sur RTX 5060 ?+
Oui, en Q4_K_M (6 Go). Il reste ~2 Go pour le KV cache et le contexte — suffisant jusqu'à ~6-8k. C'est un cran plus lent qu'un 8B comme Granite 4.2, mais reste fluide pour du chat. Besoin de plus de marge de contexte ? Granite 4.2 8B Q4 (4,6 Go) laisse davantage de place.
Le NVFP4 de la 5060 accélère-t-il Ollama ?+
Pas directement en 2026 : Ollama et llama.cpp n'exploitent pas encore FP4. Via vLLM 0.7+ ou TensorRT-LLM, oui — gain de 30-40 % sur modèles compatibles. Pour un usage Ollama grand public, restez sur Q4_K_M.
Alim 450 W suffit pour RTX 5060 ?+
TDP 150 W GPU + 100 W CPU milieu de gamme + 40 W système = 290 W nominal. Une 450 W qualité suffit largement. 500 W pour marge/silence.
Peut-on faire du RAG avec la RTX 5060 ?+
Oui, pour du RAG simple (Granite 4.2 8B + BGE-M3 embedder). Ça tient en 6-7 Go. Pour du RAG multi-stage (embedder + reranker + 12B+), les 8 Go ne suffisent pas — préférez une 5060 Ti 16 Go.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.