Débutant 10 minRTX 30
Quel LLM sur RTX 3060 12 Go ?
La RTX 3060 12 Go (février 2021) est devenue LE GPU iconique pour l'IA locale budget. 12 Go de VRAM GDDR6, 360 Go/s de bande passante, 3 584 cœurs CUDA Ampere, TDP 170 W. En 2026 à 220-260 € d'occasion, elle reste la meilleure affaire pour quiconque veut faire tourner Phi-4 14B et Qwen 14B sans exploser son budget. Ce guide détaille pourquoi elle écrase tout sous 350 € et ce qu'elle tourne vraiment.
#La RTX 3060 12 Go, icône LLM budget
- Architecture
- Ampere GA106. Samsung 8nm.
- VRAM
- 12 Go GDDR6 15 Gbps, bus 192 bits. Bande passante 360 Go/s.
- Cœurs CUDA
- 3 584. Tensor Cores 3ᵉ gen.
- TDP
- 170 W. Alim 500 W suffit.
- Prix 2026
- 220-260 € en occasion, stock abondant.
→
Pourquoi elle écrase tout sous 350 €
12 Go de VRAM à ce prix, c'est unique. La 4060 a 8 Go pour 310 €, la 5060 a 8 Go pour 400 €. La 3060 12 Go offre +50 % de VRAM à moindre prix — et 12 Go, en 2026, est le seuil qui permet Phi-4 14B (8,5 Go) et Qwen 14B (10,5 Go), soit tous les modèles milieu de gamme modernes.
#1. Modèles compatibles 12 Go
RTX 3060 12 Go — modèles LLM
| Modèle | Quant | VRAM | Tokens/sec |
|---|---|---|---|
| Llama 3.2 3B | Q8_0 | 3,4 Go | 55-65 |
| Mistral 7B | Q5_K_M | 5,1 Go | 36-42 |
| Mistral 7B | Q4_K_M | 4,4 Go | 40-46 |
| Llama 3.1 8B | Q5_K_M | 5,7 Go | 32-38 |
| Qwen 2.5 Coder 7B | Q5_K_M | 5,4 Go | 34-40 |
| Phi-4 14B | Q4_K_M | 8,5 Go | 22-28 |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | 18-22 |
| Mistral Small 24B | Q3_K_S | 10,5 Go | 12-16 |
i
Le seuil magique : 8,5 Go
Phi-4 14B Q4 = 8,5 Go. Entre dans 12 Go avec marge pour contexte 8k. Impossible sur 8 Go (4060, 3070, 5060). C'est la frontière décisive LLM en 2026, et la 3060 12 Go est la carte la moins chère qui la franchit.
#2. Installation Ollama
- 01Drivers NVIDIA 525+Standard Ampere. GeForce Experience ou nvidia.com.
- 02OllamaInstalleur depuis ollama.com. CUDA auto-détecté.
- 03Premier modèle 12 Goollama run phi4 — le modèle qui exploite pleinement la carte.
#3. Benchmarks mesurés
RTX 3060 12 Go — tokens/sec, Ollama 0.5.x, Ryzen 5 7600, DDR5 6000
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Mistral 7B | 42 t/s | 38 t/s | 34 t/s | 26 t/s |
| Llama 3.1 8B | 38 t/s | 34 t/s | 30 t/s | 24 t/s |
| Phi-4 14B | 24 t/s | 22 t/s | 18 t/s | — |
| Qwen 2.5 14B | 22 t/s | 20 t/s | 18 t/s | — |
#4. Optimisations spécifiques
- KV cache Q8
- OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 32k sur Mistral 7B en ~7 Go, laisse marge.
- Flash Attention 2
- Actif par défaut. Gain ~8 % sur contextes longs, -15 % KV cache.
- Undervolt pour silence
- MSI Afterburner : -80 mV, 140 W max. Inférence LLM quasi-silencieuse.
- Context size adapté
- Pour Phi-4 14B Q4 (8,5 Go), context 8192 = ~11 Go total. Context 16k nécessite KV cache Q8.
#5. vs 3060 8 Go, 4060 et 5060
Cartes budget NVIDIA — comparatif LLM
| Carte | VRAM | Bande p. | Mistral 7B | Phi-4 14B | Prix 2026 |
|---|---|---|---|---|---|
| RTX 3060 8 Go | 8 Go | 240 Go/s | 30 t/s | ❌ | ~200 € occ. |
| RTX 3060 12 Go | 12 Go | 360 Go/s | 42 t/s | 24 t/s | ~250 € occ. |
| RTX 4060 | 8 Go | 272 Go/s | 42 t/s | ❌ | ~310 € occ. |
| RTX 5060 | 8 Go | 448 Go/s | 64 t/s | ❌ | ~400 € neuf |
| RTX 5060 Ti 16 Go | 16 Go | 448 Go/s | 68 t/s | 36 t/s | ~500 € neuf |
→
Le meilleur rapport LLM/€ en 2026
250 € pour 12 Go + accès Phi-4 14B + Qwen 14B = champion toutes catégories. Aucune autre carte neuve ou occasion ne rivalise sous 400 €.
#Meilleur GPU LLM budget 2026
- Achetez une 3060 12 Go si
- Budget ≤ 300 €, débuter sérieusement en LLM local, vouloir tester Phi-4 14B, usage occasionnel. Champion absolu dans cette gamme.
- Vérifiez bien la version 12 Go
- La 3060 existe aussi en 8 Go — confusion fréquente sur marché occasion. L'emballage doit indiquer explicitement 12 Go.
- Préférez 5060 Ti 16 Go neuve si > 500 €
- Double budget mais +40 % vitesse, +33 % VRAM, garantie, FP4.
#Questions fréquentes
La RTX 3060 12 Go est-elle suffisante pour l'IA locale en 2026 ?+
Oui, largement, pour un usage particulier. Elle tient Mistral 7B Q5 à 38 tok/s, Phi-4 14B Q4 à 24 tok/s, Qwen 14B Q5 à 20 tok/s. Pour chat, RAG documentaire, code assistant, c'est parfaitement confortable.
Combien de tokens/sec pour Mistral 7B sur RTX 3060 12 Go ?+
Entre 40 et 46 tokens/seconde en Q4_K_M. Q5_K_M : 36-42. Q8_0 : 24-28. C'est modeste mais très utilisable pour du chat.
RTX 3060 12 Go ou RTX 4060 8 Go pour LLM ?+
3060 12 Go sans hésiter. Moins chère (~250 vs 310 €), +50 % de VRAM qui ouvre Phi-4 14B et Qwen 14B. La 4060 a l'avantage de la consommation (115 vs 170 W) et du gaming, pas pour LLM.
Peut-on faire tourner Llama 3.1 70B sur RTX 3060 12 Go ?+
Non en pratique. Q4 (42 Go) déborde massivement → <2 tok/s. Pour du 70B, visez minimum 24 Go (RTX 3090/4090) ou Mac 64 Go+.
La RTX 3060 12 Go permet-elle du RAG multi-stage ?+
Oui, confortablement. Mistral 7B (5 Go) + bge-m3 embedder (2 Go) + BGE-reranker-v2 (1 Go) = 8 Go. Reste 4 Go pour contexte et buffer. Cas d'usage idéal.
Combien consomme la RTX 3060 12 Go en LLM ?+
En inférence continue : 110-140 W (TDP 170 W). Très sobre. Idéale pour un serveur d'inférence domestique branché 24/7.
Peut-on faire du fine-tuning LoRA sur RTX 3060 12 Go ?+
QLoRA sur 7B-8B : oui très confortable, ~9-10 Go requis. QLoRA sur 14B : tight, batch 1 + contexte court + unsloth obligatoire. Pour FT plus large, 16 Go+ nécessaires.
Alim 450 W suffit pour RTX 3060 12 Go ?+
Largement. TDP 170 W GPU + 100 W CPU + 40 W système = 310 W. Une 450 W qualité offre marge saine.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.