Débutant 9 minRTX 50
Quel LLM sur RTX 5060 (8 Go) ?
La RTX 5060 (mai 2025) est l'entrée dans la gamme Blackwell : 349 € MSRP, 8 Go de VRAM GDDR7 à 448 Go/s, 3 840 cœurs CUDA. Pour l'IA locale, elle est correcte sur les modèles 3B-8B mais se heurte immédiatement au plafond des 8 Go dès qu'on veut tester Phi-4 14B ou plus. Ce guide détaille quels LLM tournent bien, lesquels passent à peine, et quelles astuces permettent d'étirer les 8 Go.
#La RTX 5060 en 2026
- Architecture
- Blackwell GB206 (même die que 5060 Ti, moins de CUs activées).
- VRAM
- 8 Go GDDR7 28 Gbps, bus 128 bits. Bande passante 448 Go/s (+60 % vs 4060).
- Cœurs CUDA
- 3 840. Tensor Cores 5ᵉ gen, FP4 natif.
- TDP
- 150 W. Alim 500 W suffit.
- Prix MSRP
- 349 € au lancement. ~400 € en 2026.
→
L'intérêt réel face à la 4060
+60 % de bande passante mémoire vs RTX 4060 (448 vs 272 Go/s), même VRAM (8 Go). Pour le LLM, c'est énorme : les modèles inférence sont mémoire-bound. Résultat : +50-60 % tokens/sec vs 4060 pour le même prix.
#1. Modèles LLM compatibles
RTX 5060 8 Go — ce qui passe, ce qui cale
| Modèle | Quant | VRAM | Tokens/sec | Verdict |
|---|---|---|---|---|
| Llama 3.2 1B | Q8_0 | 1,4 Go | 170-190 | Excellent draft |
| Qwen 2.5 3B | Q6_K | 2,4 Go | 115-130 | Rapide, qualité correcte |
| Llama 3.2 3B | Q8_0 | 3,4 Go | 110-125 | Meilleur 3B du marché |
| Gemma 3 4B | Q5_K_M | 3,1 Go | 95-108 | Polyvalent |
| Mistral 7B | Q4_K_M | 4,4 Go | 58-66 | Sweet spot |
| Qwen 2.5 Coder 7B | Q4_K_M | 4,5 Go | 55-62 | Code confort |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | 52-60 | Juste, utilisable |
| Phi-4 14B | Q3_K_S | 6,5 Go | 28-34 | Limite, dégradé |
!
Les 14B en Q3 — à éviter
Techniquement Phi-4 14B en Q3_K_S tient en 6,5 Go, mais la qualité chute sensiblement (perte IFEval de ~8-12 %). Restez sur Llama 3.1 8B Q4 ou Mistral 7B Q5 — mieux servi avec la VRAM disponible.
#2. Installation
- 01Drivers NVIDIA 570+Obligatoires pour Blackwell. Via GeForce Experience ou nvidia.com.
- 02OllamaInstalleur depuis ollama.com. Auto-détection GPU.
- 03Premier modèle adapté 8 Goollama run mistral (7B Q4) ou ollama run llama3.2 (3B). Évitez phi4 sauf si vraiment curieux.
#3. Benchmarks
RTX 5060 8 Go — tokens/sec mesurés
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 2.5 3B | 125 t/s | 115 t/s | 90 t/s |
| Mistral 7B | 64 t/s | 56 t/s | 42 t/s |
| Llama 3.1 8B | 56 t/s | — | — |
| Phi-4 14B Q3_K_S | 32 t/s | — | — |
#4. Astuces pour 8 Go
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 — divise par 2 la VRAM du cache contexte. Permet 16k de contexte sur Mistral 7B sur 8 Go.
- num_gpu_layers judicieux
- Par défaut Ollama charge tout sur GPU. Pour tester un 14B Q4 en offload CPU+GPU partiel : num_gpu_layers 20 (au lieu de 40+).
- Fermez les apps GPU-hungry
- Chrome avec accélération matérielle mange 0,5-1 Go. Fermez ou désactivez avant de charger le LLM.
- Une seule tâche GPU à la fois
- Pas d'encodage vidéo OBS + LLM + jeu. Avec 8 Go, c'est un seul de ces trois.
#5. 5060 vs 4060 vs 5060 Ti
Les 3 petites Ada/Blackwell
| Carte | VRAM | Bande p. | Mistral 7B Q4 | Prix 2026 |
|---|---|---|---|---|
| RTX 5060 | 8 Go | 448 Go/s | 64 t/s | ~400 € |
| RTX 4060 | 8 Go | 272 Go/s | 42 t/s | ~310 € occasion |
| RTX 5060 Ti 8 Go | 8 Go | 448 Go/s | 68 t/s | ~450 € |
| RTX 5060 Ti 16 Go | 16 Go | 448 Go/s | 68 t/s | ~500 € |
→
Le vrai arbitrage
Pour 100 € de plus qu'une 5060, vous prenez une 5060 Ti 16 Go : DOUBLE de VRAM et accès aux 14B. Pour du LLM, c'est une évidence. La 5060 seule se justifie uniquement pour un budget strict ≤ 400 €.
#Verdict achat 2026
- Achetez une 5060 si
- Budget ≤ 400 €, usage LLM modeste (Mistral 7B chat uniquement), également gaming 1080p esport.
- Préférez 5060 Ti 16 Go si
- +100 € disponibles. Gain massif en capacité LLM.
- Évitez si
- Vous comptez utiliser Phi-4 14B, Qwen 14B, ou n'importe quel 14B+ sérieusement. Les 8 Go coincent vite.
#Questions fréquentes
La RTX 5060 peut-elle faire tourner un LLM en local ?+
Oui, très correctement pour des modèles 3B-8B. Mistral 7B Q4 : 64 tok/s, Llama 3.1 8B Q4 : 56 tok/s. Pour du chat quotidien et du RAG simple, c'est largement suffisant. Les 14B+ sont hors de portée raisonnable avec 8 Go.
Combien de tokens/sec pour Mistral 7B sur RTX 5060 ?+
Entre 58 et 68 tokens/seconde en Q4_K_M. C'est ~50 % de mieux qu'une RTX 4060 à même VRAM, grâce à la GDDR7.
RTX 5060 ou RTX 4060 Ti 16 Go pour LLM ?+
4060 Ti 16 Go sans hésiter. Même prix en occasion (~420 €), DOUBLE de VRAM, accès à Phi-4 14B et Qwen 14B. La 5060 est légèrement plus rapide sur 7B mais ne peut pas les 14B.
Peut-on tourner Llama 3.1 8B sur RTX 5060 ?+
Oui, en Q4_K_M (4,9 Go). Il reste ~3 Go pour le KV cache et le contexte — suffisant jusqu'à ~8k. Tokens/sec : 52-60. Évitez Q5 : 5,7 Go + cache = trop serré.
Le NVFP4 de la 5060 accélère-t-il Ollama ?+
Pas directement en 2026 : Ollama et llama.cpp n'exploitent pas encore FP4. Via vLLM 0.7+ ou TensorRT-LLM, oui — gain de 30-40 % sur modèles compatibles. Pour un usage Ollama grand public, restez sur Q4_K_M.
Alim 450 W suffit pour RTX 5060 ?+
TDP 150 W GPU + 100 W CPU milieu de gamme + 40 W système = 290 W nominal. Une 450 W qualité suffit largement. 500 W pour marge/silence.
Peut-on faire du RAG avec la RTX 5060 ?+
Oui, pour du RAG simple (Mistral 7B + BGE-M3 embedder). Ça tient en 6-7 Go. Pour du RAG multi-stage (embedder + reranker + 14B), les 8 Go ne suffisent pas — préférez une 5060 Ti 16 Go.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.