Débutant 9 minPar VRAM

Quel LLM pour 6 Go de VRAM ?

6 Go de VRAM permettent de faire tourner Qwen 3.5 4B (3,4 Go) très confortablement et Granite 4.2 8B en Q4 (5,3 Go), le plus gros modèle qui tient encore. GTX 1660 series, RTX 2060, RTX 3050 6GB : ces cartes restent pertinentes pour démarrer en LLM sans investissement. Ce guide détaille exactement quels modèles 2026 tournent et comment optimiser 6 Go.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#6 Go VRAM en 2026

Le seuil Granite 4.2 8B Q4
6 Go = vous pouvez faire tourner Granite 4.2 8B en Q4 (5,3 Go), token-efficient, avec une petite marge de contexte. Pour plus de vitesse et de confort, Qwen 3.5 4B (3,4 Go) laisse 2 Go de marge. C'est le minimum confortable pour un usage LLM réel.

#1. GPU concernés

GTX 1660 / Super / Ti
Turing 2019, 6 Go GDDR5/GDDR6. ~100-150 € occasion.
RTX 2060 6 Go
Turing avec Tensor Cores. ~120 € occasion.
RTX 3050 6 Go
Ampere bas de gamme 2024. ~140 € occasion.
GTX 1060 6 Go
Pascal 2016. ~50 € occasion. Limité par l'absence de Tensor Cores.

#2. Modèles compatibles

6 Go VRAM — modèles LLM
ModèleQuantVRAMTokens/sec (RTX 2060)
Qwen 3.5 4BQ5_K_M2,8 Go29-35
Gemma 4 2BQ8_02,1 Go32-39
Granite 4.2 8BQ4_K_M5,3 Go16-22
Granite 4.2 3BQ8_02,2 Go30-38
Qwen 2.5 Coder 7B baseQ4_K_M4,7 Go16-22 (autocomplétion FIM)

#3. Astuces 6 Go

KV cache Q8 obligatoire
OLLAMA_KV_CACHE_TYPE=q8_0 — sinon contexte 4k+ déborde.
Context 4k max
Au-delà, Granite 4.2 8B Q4 + cache déborde. Suffisant pour chat.
Une seule app GPU
Pas de Chrome accéléré + LLM + jeu. Choisissez.
Pas de 27B/30B
Qwen 3.8 27B ou Qwen 3.6 35B-A3B débordent largement 6 Go, même en MoE. Restez sur 4B-8B.

#Upgrade conseillé

RTX 3060 12 Go (~250 €)
Le doublement de VRAM ouvre Qwen 3.5 9B en Q8 et Gemma 4 12B. Meilleur upgrade LLM 2026.
RTX 4060 Ti 16 Go occasion (~420 €)
Si budget plus large, accès Mistral Small 24B, Devstral 24B et gpt-oss 20B.

#Questions fréquentes

Quel est le meilleur LLM pour 6 Go de VRAM ?+
Granite 4.2 8B en Q4_K_M (5,3 Go) est le meilleur modèle qui tient : token-efficient, 128k de contexte. Pour plus de rapidité, Qwen 3.5 4B (3,4 Go) reste excellent en français et laisse de la marge.
Combien de tokens/sec pour Granite 4.2 8B sur 6 Go ?+
Sur RTX 2060 6 Go : 16-22 tok/s. Sur GTX 1660 Super : 12-16 tok/s. Sur GTX 1060 6 Go : 7-11 tok/s.
Peut-on faire tourner Qwen 3.5 9B sur 6 Go ?+
En Q4 (6,6 Go) non, ça déborde. En Q3 c'est tangent avec qualité dégradée. Préférez Granite 4.2 8B en Q4 — token-efficient, il tient mieux dans 6 Go pour une qualité proche.
RTX 2060 6 Go ou RTX 3050 8 Go pour LLM ?+
RTX 3050 8 Go : +33 % VRAM (8 vs 6 Go), Tensor Cores 3ᵉ gen, plus récente. À prix équivalent (~150-180 €), 3050 8 Go gagne.
6 Go suffisent pour le RAG ?+
RAG simple oui (Qwen 3.5 4B ou Granite 4.2 8B Q4 + embedder léger). RAG multi-stage non. Pour RAG sérieux, 12 Go+.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.