Débutant 8 minGTX 10

Quel LLM sur GTX 1060 (6 Go) ?

La GTX 1060 6 Go (juillet 2016) est le hardware minimum absolu pour lancer un LLM local en 2026. Pascal GP106, 1 280 cœurs CUDA, GDDR5, 192 Go/s, 6 Go VRAM. À ~50-80 € d'occasion, elle intéresse ceux qui veulent juste essayer sans rien investir. Verdict honnête : utilisable pour Granite 4.2 8B Q4 (5,3 Go) à ~10 tok/s, rien au-dessus. Ce guide dit la vérité sur ses capacités.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La GTX 1060 6 Go en 2026

Architecture
Pascal GP106 (2016). Vieille de presque 10 ans.
VRAM
6 Go GDDR5, bus 192 bits, bande passante 192 Go/s.
Cœurs CUDA
1 280. Pas de Tensor Cores, pas de FP16 accéléré.
TDP
120 W. Alim 400 W suffit.
Prix 2026
50-80 € en occasion. Existe aussi en 3 Go (à éviter — inutilisable pour LLM).

#1. Ce qui tourne vraiment

GTX 1060 6 Go — modèles LLM 2026 (ordres de grandeur)
ModèleQuantVRAMTokens/sec
Qwen 3.5 2BQ8_02,1 Go32-40 t/s
Granite 4.2 3BQ5_K_M2,4 Go18-24 t/s
Qwen 3.5 4BQ4_K_M3,0 Go14-18 t/s
Granite 4.2 8BQ4_K_M5,3 Go8-12 t/s

#Verdict honnête

Pour découvrir uniquement
Vous pouvez installer Ollama, faire tourner Granite 4.2 8B, discuter. Mais à 10 tok/s, l'expérience n'est pas fluide. Pour du confort, restez sur Qwen 3.5 4B (14-18 tok/s).
Pas de 9B confortable
Qwen 3.5 9B (6,6 Go) déborde des 6 Go et doit offloader sur le CPU — 5-7 tok/s, frustrant.
Recommandation 2026
Si vous avez la carte : testez. Si vous hésitez à l'acheter : cherchez 50 € de plus pour une RTX 3050 ou 2060 Super.

#Questions fréquentes

La GTX 1060 6 Go peut-elle faire tourner un modèle 8B ?+
Oui tout juste : Granite 4.2 8B en Q4_K_M (5,3 Go) à 8-12 tok/s. Lent mais fonctionnel. Préférez Qwen 3.5 4B Q4 (14-18 tok/s) pour une meilleure expérience.
GTX 1060 3 Go ou 6 Go pour LLM ?+
6 Go impérativement. La 3 Go ne peut tenir aucun modèle utile (Granite 4.2 8B Q4 = 5,3 Go > 3 Go, et même Qwen 3.5 4B à 3 Go déborde). La 3 Go est inutilisable pour LLM.
Combien de tokens/sec pour un 8B (Granite 4.2) sur GTX 1060 ?+
8-12 tokens/seconde. C'est 4-5× plus lent qu'une RTX 3060 12 Go. Utilisable pour chat patient, pas pour usage productif.
Peut-on tourner Qwen 3.5 9B sur GTX 1060 ?+
Il déborde des 6 Go (6,6 Go en Q4) et doit offloader sur le CPU : 5-7 tok/s, frustrant. Restez sur Granite 4.2 8B ou Qwen 3.5 4B.
La GTX 1060 est-elle encore supportée par Ollama en 2026 ?+
Oui, Ollama supporte CUDA jusqu'à Pascal. Drivers NVIDIA 535+ encore maintenus. Fonctionne — juste lentement.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.