Débutant 9 minRTX 50

Quel LLM sur RTX 5060 (8 Go) ?

La RTX 5060 (mai 2025) est l'entrée dans la gamme Blackwell : 349 € MSRP, 8 Go de VRAM GDDR7 à 448 Go/s, 3 840 cœurs CUDA. Pour l'IA locale, elle est correcte sur les modèles 3B-8B mais se heurte immédiatement au plafond des 8 Go dès qu'on veut tester Phi-4 14B ou plus. Ce guide détaille quels LLM tournent bien, lesquels passent à peine, et quelles astuces permettent d'étirer les 8 Go.

Par Mohamed Meguedmi·Màj 2026-04-19·Testé sur Windows, macOS, Linux

#La RTX 5060 en 2026

Architecture
Blackwell GB206 (même die que 5060 Ti, moins de CUs activées).
VRAM
8 Go GDDR7 28 Gbps, bus 128 bits. Bande passante 448 Go/s (+60 % vs 4060).
Cœurs CUDA
3 840. Tensor Cores 5ᵉ gen, FP4 natif.
TDP
150 W. Alim 500 W suffit.
Prix MSRP
349 € au lancement. ~400 € en 2026.
L'intérêt réel face à la 4060
+60 % de bande passante mémoire vs RTX 4060 (448 vs 272 Go/s), même VRAM (8 Go). Pour le LLM, c'est énorme : les modèles inférence sont mémoire-bound. Résultat : +50-60 % tokens/sec vs 4060 pour le même prix.

#1. Modèles LLM compatibles

RTX 5060 8 Go — ce qui passe, ce qui cale
ModèleQuantVRAMTokens/secVerdict
Llama 3.2 1BQ8_01,4 Go170-190Excellent draft
Qwen 2.5 3BQ6_K2,4 Go115-130Rapide, qualité correcte
Llama 3.2 3BQ8_03,4 Go110-125Meilleur 3B du marché
Gemma 3 4BQ5_K_M3,1 Go95-108Polyvalent
Mistral 7BQ4_K_M4,4 Go58-66Sweet spot
Qwen 2.5 Coder 7BQ4_K_M4,5 Go55-62Code confort
Llama 3.1 8BQ4_K_M4,9 Go52-60Juste, utilisable
Phi-4 14BQ3_K_S6,5 Go28-34Limite, dégradé
!
Les 14B en Q3 — à éviter
Techniquement Phi-4 14B en Q3_K_S tient en 6,5 Go, mais la qualité chute sensiblement (perte IFEval de ~8-12 %). Restez sur Llama 3.1 8B Q4 ou Mistral 7B Q5 — mieux servi avec la VRAM disponible.

#2. Installation

  1. 01
    Drivers NVIDIA 570+
    Obligatoires pour Blackwell. Via GeForce Experience ou nvidia.com.
  2. 02
    Ollama
    Installeur depuis ollama.com. Auto-détection GPU.
  3. 03
    Premier modèle adapté 8 Go
    ollama run mistral (7B Q4) ou ollama run llama3.2 (3B). Évitez phi4 sauf si vraiment curieux.

#3. Benchmarks

RTX 5060 8 Go — tokens/sec mesurés
ModèleQ4_K_MQ5_K_MQ8_0
Qwen 2.5 3B125 t/s115 t/s90 t/s
Mistral 7B64 t/s56 t/s42 t/s
Llama 3.1 8B56 t/s
Phi-4 14B Q3_K_S32 t/s

#4. Astuces pour 8 Go

KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0 — divise par 2 la VRAM du cache contexte. Permet 16k de contexte sur Mistral 7B sur 8 Go.
num_gpu_layers judicieux
Par défaut Ollama charge tout sur GPU. Pour tester un 14B Q4 en offload CPU+GPU partiel : num_gpu_layers 20 (au lieu de 40+).
Fermez les apps GPU-hungry
Chrome avec accélération matérielle mange 0,5-1 Go. Fermez ou désactivez avant de charger le LLM.
Une seule tâche GPU à la fois
Pas d'encodage vidéo OBS + LLM + jeu. Avec 8 Go, c'est un seul de ces trois.

#5. 5060 vs 4060 vs 5060 Ti

Les 3 petites Ada/Blackwell
CarteVRAMBande p.Mistral 7B Q4Prix 2026
RTX 50608 Go448 Go/s64 t/s~400 €
RTX 40608 Go272 Go/s42 t/s~310 € occasion
RTX 5060 Ti 8 Go8 Go448 Go/s68 t/s~450 €
RTX 5060 Ti 16 Go16 Go448 Go/s68 t/s~500 €
Le vrai arbitrage
Pour 100 € de plus qu'une 5060, vous prenez une 5060 Ti 16 Go : DOUBLE de VRAM et accès aux 14B. Pour du LLM, c'est une évidence. La 5060 seule se justifie uniquement pour un budget strict ≤ 400 €.

#Verdict achat 2026

Achetez une 5060 si
Budget ≤ 400 €, usage LLM modeste (Mistral 7B chat uniquement), également gaming 1080p esport.
Préférez 5060 Ti 16 Go si
+100 € disponibles. Gain massif en capacité LLM.
Évitez si
Vous comptez utiliser Phi-4 14B, Qwen 14B, ou n'importe quel 14B+ sérieusement. Les 8 Go coincent vite.

#Questions fréquentes

La RTX 5060 peut-elle faire tourner un LLM en local ?+
Oui, très correctement pour des modèles 3B-8B. Mistral 7B Q4 : 64 tok/s, Llama 3.1 8B Q4 : 56 tok/s. Pour du chat quotidien et du RAG simple, c'est largement suffisant. Les 14B+ sont hors de portée raisonnable avec 8 Go.
Combien de tokens/sec pour Mistral 7B sur RTX 5060 ?+
Entre 58 et 68 tokens/seconde en Q4_K_M. C'est ~50 % de mieux qu'une RTX 4060 à même VRAM, grâce à la GDDR7.
RTX 5060 ou RTX 4060 Ti 16 Go pour LLM ?+
4060 Ti 16 Go sans hésiter. Même prix en occasion (~420 €), DOUBLE de VRAM, accès à Phi-4 14B et Qwen 14B. La 5060 est légèrement plus rapide sur 7B mais ne peut pas les 14B.
Peut-on tourner Llama 3.1 8B sur RTX 5060 ?+
Oui, en Q4_K_M (4,9 Go). Il reste ~3 Go pour le KV cache et le contexte — suffisant jusqu'à ~8k. Tokens/sec : 52-60. Évitez Q5 : 5,7 Go + cache = trop serré.
Le NVFP4 de la 5060 accélère-t-il Ollama ?+
Pas directement en 2026 : Ollama et llama.cpp n'exploitent pas encore FP4. Via vLLM 0.7+ ou TensorRT-LLM, oui — gain de 30-40 % sur modèles compatibles. Pour un usage Ollama grand public, restez sur Q4_K_M.
Alim 450 W suffit pour RTX 5060 ?+
TDP 150 W GPU + 100 W CPU milieu de gamme + 40 W système = 290 W nominal. Une 450 W qualité suffit largement. 500 W pour marge/silence.
Peut-on faire du RAG avec la RTX 5060 ?+
Oui, pour du RAG simple (Mistral 7B + BGE-M3 embedder). Ça tient en 6-7 Go. Pour du RAG multi-stage (embedder + reranker + 14B), les 8 Go ne suffisent pas — préférez une 5060 Ti 16 Go.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.