Débutant 10 minRTX 30
Quel LLM sur RTX 3060 12 Go ?
La RTX 3060 12 Go (février 2021) est devenue LE GPU iconique pour l'IA locale budget. 12 Go de VRAM GDDR6, 360 Go/s de bande passante, 3 584 cœurs CUDA Ampere, TDP 170 W. En 2026 à 220-260 € d'occasion, elle reste la meilleure affaire pour quiconque veut faire tourner Gemma 4 12B et Qwen 3.5 9B sans exploser son budget. Ce guide détaille pourquoi elle écrase tout sous 350 € et ce qu'elle tourne vraiment.
#La RTX 3060 12 Go, icône LLM budget
- Architecture
- Ampere GA106. Samsung 8nm.
- VRAM
- 12 Go GDDR6 15 Gbps, bus 192 bits. Bande passante 360 Go/s.
- Cœurs CUDA
- 3 584. Tensor Cores 3ᵉ gen.
- TDP
- 170 W. Alim 500 W suffit.
- Prix 2026
- 220-260 € en occasion, stock abondant.
→
Pourquoi elle écrase tout sous 350 €
12 Go de VRAM à ce prix, c'est unique. La 4060 a 8 Go pour 310 €, la 5060 a 8 Go pour 400 €. La 3060 12 Go offre +50 % de VRAM à moindre prix — et 12 Go, en 2026, est le seuil qui permet Gemma 4 12B (7,6 Go) et Qwen 3.5 9B en Q8 (11 Go), soit tous les modèles multimodaux milieu de gamme modernes.
#1. Modèles compatibles 12 Go
RTX 3060 12 Go — modèles LLM
| Modèle | Quant | VRAM | Tokens/sec |
|---|---|---|---|
| Granite 4.2 8B | Q4_K_M | 4,6 Go | 29-35 |
| Gemma 4 12B | Q4_K_M | 7 Go | 16-20 |
| Qwen 3.5 9B | Q4_K_M | 6 Go | 8-10 |
| Qwen 3.5 4B | Q8_0 | 4,3 Go | 29-35 |
| Gemma 4 2B | FP16 | 4 Go | 32-39 |
| Mistral Small 24B | Q3_K_S | 10,5 Go | 12-16 |
i
Le seuil magique : 11 Go
Qwen 3.5 9B en Q8 = 11 Go, ou Gemma 4 12B Q4 = 7,6 Go. Ces modèles multimodaux 2026 entrent dans 12 Go avec marge pour le contexte. Impossibles à charger utilement sur 8 Go (4060, 3070, 5060). C'est la frontière décisive LLM en 2026, et la 3060 12 Go est la carte la moins chère qui la franchit.
#2. Installation Ollama
- 01Drivers NVIDIA 525+Standard Ampere. GeForce Experience ou nvidia.com.
- 02OllamaInstalleur depuis ollama.com. CUDA auto-détecté.
- 03Premier modèle 12 Goollama run gemma4:12b — le modèle multimodal qui exploite pleinement la carte.
#3. Benchmarks mesurés
RTX 3060 12 Go — ordres de grandeur tokens/sec (Ollama récent, Ryzen 5 7600, DDR5 6000)
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Granite 4.2 3B | 60 t/s | 55 t/s | 50 t/s | 44 t/s |
| Qwen 3.5 4B | 52 t/s | 48 t/s | 44 t/s | 38 t/s |
| Granite 4.2 8B | 33 t/s | 29 t/s | 26 t/s | 21 t/s |
| Gemma 4 12B | 18 t/s | 16 t/s | 14 t/s | 11 t/s |
#4. Optimisations spécifiques
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 32k sur Qwen 3.5 9B en ~8 Go, laisse marge.
- Flash Attention 2
- Actif par défaut. Gain ~8 % sur contextes longs, -15 % KV cache.
- Undervolt pour silence
- MSI Afterburner : -80 mV, 140 W max. Inférence LLM quasi-silencieuse.
- Context size adapté
- Pour Gemma 4 12B Q4 (7,6 Go), context 8192 = ~10 Go total. Context 16k nécessite KV cache Q8.
#5. vs 3060 8 Go, 4060 et 5060
Cartes budget NVIDIA — comparatif LLM
| Carte | VRAM | Bande p. | Granite 4.2 8B | Gemma 4 12B | Prix 2026 |
|---|---|---|---|---|---|
| RTX 3060 8 Go | 8 Go | 240 Go/s | 26 t/s | ❌ | ~200 € occ. |
| RTX 3060 12 Go | 12 Go | 360 Go/s | 32 t/s | 18 t/s | ~250 € occ. |
| RTX 4060 | 8 Go | 272 Go/s | 29 t/s | ❌ | ~310 € occ. |
| RTX 5060 | 8 Go | 448 Go/s | 45 t/s | ❌ | ~400 € neuf |
| RTX 5060 Ti 16 Go | 16 Go | 448 Go/s | 47 t/s | 26 t/s | ~500 € neuf |
→
Le meilleur rapport LLM/€ en 2026
250 € pour 12 Go + accès Gemma 4 12B + Qwen 3.5 9B en Q8 = champion toutes catégories. Aucune autre carte neuve ou occasion ne rivalise sous 400 €.
#Meilleur GPU LLM budget 2026
- Achetez une 3060 12 Go si
- Budget ≤ 300 €, débuter sérieusement en LLM local, vouloir tester Gemma 4 12B et Qwen 3.5 9B, usage occasionnel. Champion absolu dans cette gamme.
- Vérifiez bien la version 12 Go
- La 3060 existe aussi en 8 Go — confusion fréquente sur marché occasion. L'emballage doit indiquer explicitement 12 Go.
- Préférez 5060 Ti 16 Go neuve si > 500 €
- Double budget mais +40 % vitesse, +33 % VRAM, garantie, FP4.
#Questions fréquentes
La RTX 3060 12 Go est-elle suffisante pour l'IA locale en 2026 ?+
Oui, largement, pour un usage particulier. Elle tient Granite 4.2 8B Q4 à ~32 tok/s, Gemma 4 12B Q4 à ~18 tok/s, Qwen 3.5 9B Q4 à ~9 tok/s. Pour chat, RAG documentaire, code assistant, c'est parfaitement confortable.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 3060 12 Go ?+
Entre 29 et 35 tokens/seconde en Q4_K_M. Q5_K_M : 26-31. Q8_0 : 20-24. C'est confortable pour du chat.
RTX 3060 12 Go ou RTX 4060 8 Go pour LLM ?+
3060 12 Go sans hésiter. Moins chère (~250 vs 310 €), +50 % de VRAM qui ouvre Gemma 4 12B et Qwen 3.5 9B en Q8. La 4060 a l'avantage de la consommation (115 vs 170 W) et du gaming, pas pour LLM.
Peut-on faire tourner un gros modèle 70B sur RTX 3060 12 Go ?+
Non en pratique. Un 70B en Q4 (42 Go) déborde massivement → <2 tok/s. Pour ce gabarit, visez minimum 24 Go (RTX 3090/4090) ou Mac 64 Go+. Sur 12 Go, le plafond réaliste 2026 est Gemma 4 12B ou Qwen 3.5 9B en Q8.
La RTX 3060 12 Go permet-elle du RAG multi-stage ?+
Oui, confortablement. Qwen 3.5 9B (6 Go) + bge-m3 embedder (2 Go) + BGE-reranker-v2 (1 Go) = 9 Go. Reste 3 Go pour contexte et buffer. Cas d'usage idéal.
Combien consomme la RTX 3060 12 Go en LLM ?+
En inférence continue : 110-140 W (TDP 170 W). Très sobre. Idéale pour un serveur d'inférence domestique branché 24/7.
Peut-on faire du fine-tuning LoRA sur RTX 3060 12 Go ?+
QLoRA sur 7B-8B : oui très confortable, ~9-10 Go requis. QLoRA sur 14B : tight, batch 1 + contexte court + unsloth obligatoire. Pour FT plus large, 16 Go+ nécessaires.
Alim 450 W suffit pour RTX 3060 12 Go ?+
Largement. TDP 170 W GPU + 100 W CPU + 40 W système = 310 W. Une 450 W qualité offre marge saine.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.