Débutant 10 minRTX 30

Quel LLM sur RTX 3060 12 Go ?

La RTX 3060 12 Go (février 2021) est devenue LE GPU iconique pour l'IA locale budget. 12 Go de VRAM GDDR6, 360 Go/s de bande passante, 3 584 cœurs CUDA Ampere, TDP 170 W. En 2026 à 220-260 € d'occasion, elle reste la meilleure affaire pour quiconque veut faire tourner Gemma 4 12B et Qwen 3.5 9B sans exploser son budget. Ce guide détaille pourquoi elle écrase tout sous 350 € et ce qu'elle tourne vraiment.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur Windows, macOS, Linux

#La RTX 3060 12 Go, icône LLM budget

Architecture
Ampere GA106. Samsung 8nm.
VRAM
12 Go GDDR6 15 Gbps, bus 192 bits. Bande passante 360 Go/s.
Cœurs CUDA
3 584. Tensor Cores 3ᵉ gen.
TDP
170 W. Alim 500 W suffit.
Prix 2026
220-260 € en occasion, stock abondant.
Pourquoi elle écrase tout sous 350 €
12 Go de VRAM à ce prix, c'est unique. La 4060 a 8 Go pour 310 €, la 5060 a 8 Go pour 400 €. La 3060 12 Go offre +50 % de VRAM à moindre prix — et 12 Go, en 2026, est le seuil qui permet Gemma 4 12B (7,6 Go) et Qwen 3.5 9B en Q8 (11 Go), soit tous les modèles multimodaux milieu de gamme modernes.

#1. Modèles compatibles 12 Go

RTX 3060 12 Go — modèles LLM
ModèleQuantVRAMTokens/sec
Granite 4.2 8BQ4_K_M4,6 Go29-35
Gemma 4 12BQ4_K_M7 Go16-20
Qwen 3.5 9BQ4_K_M6 Go8-10
Qwen 3.5 4BQ8_04,3 Go29-35
Gemma 4 2BFP164 Go32-39
Mistral Small 24BQ3_K_S10,5 Go12-16
i
Le seuil magique : 11 Go
Qwen 3.5 9B en Q8 = 11 Go, ou Gemma 4 12B Q4 = 7,6 Go. Ces modèles multimodaux 2026 entrent dans 12 Go avec marge pour le contexte. Impossibles à charger utilement sur 8 Go (4060, 3070, 5060). C'est la frontière décisive LLM en 2026, et la 3060 12 Go est la carte la moins chère qui la franchit.

#2. Installation Ollama

  1. 01
    Drivers NVIDIA 525+
    Standard Ampere. GeForce Experience ou nvidia.com.
  2. 02
    Ollama
    Installeur depuis ollama.com. CUDA auto-détecté.
  3. 03
    Premier modèle 12 Go
    ollama run gemma4:12b — le modèle multimodal qui exploite pleinement la carte.
Commandes Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run gemma4:12b
ollama run qwen3.5:9b
ollama run granite4.2:8b

#3. Benchmarks mesurés

RTX 3060 12 Go — ordres de grandeur tokens/sec (Ollama récent, Ryzen 5 7600, DDR5 6000)
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Granite 4.2 3B60 t/s55 t/s50 t/s44 t/s
Qwen 3.5 4B52 t/s48 t/s44 t/s38 t/s
Granite 4.2 8B33 t/s29 t/s26 t/s21 t/s
Gemma 4 12B18 t/s16 t/s14 t/s11 t/s

#4. Optimisations spécifiques

KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 32k sur Qwen 3.5 9B en ~8 Go, laisse marge.
Flash Attention 2
Actif par défaut. Gain ~8 % sur contextes longs, -15 % KV cache.
Undervolt pour silence
MSI Afterburner : -80 mV, 140 W max. Inférence LLM quasi-silencieuse.
Context size adapté
Pour Gemma 4 12B Q4 (7,6 Go), context 8192 = ~10 Go total. Context 16k nécessite KV cache Q8.

#5. vs 3060 8 Go, 4060 et 5060

Cartes budget NVIDIA — comparatif LLM
CarteVRAMBande p.Granite 4.2 8BGemma 4 12BPrix 2026
RTX 3060 8 Go8 Go240 Go/s26 t/s~200 € occ.
RTX 3060 12 Go12 Go360 Go/s32 t/s18 t/s~250 € occ.
RTX 40608 Go272 Go/s29 t/s~310 € occ.
RTX 50608 Go448 Go/s45 t/s~400 € neuf
RTX 5060 Ti 16 Go16 Go448 Go/s47 t/s26 t/s~500 € neuf
Le meilleur rapport LLM/€ en 2026
250 € pour 12 Go + accès Gemma 4 12B + Qwen 3.5 9B en Q8 = champion toutes catégories. Aucune autre carte neuve ou occasion ne rivalise sous 400 €.

#Meilleur GPU LLM budget 2026

Achetez une 3060 12 Go si
Budget ≤ 300 €, débuter sérieusement en LLM local, vouloir tester Gemma 4 12B et Qwen 3.5 9B, usage occasionnel. Champion absolu dans cette gamme.
Vérifiez bien la version 12 Go
La 3060 existe aussi en 8 Go — confusion fréquente sur marché occasion. L'emballage doit indiquer explicitement 12 Go.
Préférez 5060 Ti 16 Go neuve si > 500 €
Double budget mais +40 % vitesse, +33 % VRAM, garantie, FP4.

#Questions fréquentes

La RTX 3060 12 Go est-elle suffisante pour l'IA locale en 2026 ?+
Oui, largement, pour un usage particulier. Elle tient Granite 4.2 8B Q4 à ~32 tok/s, Gemma 4 12B Q4 à ~18 tok/s, Qwen 3.5 9B Q4 à ~9 tok/s. Pour chat, RAG documentaire, code assistant, c'est parfaitement confortable.
Combien de tokens/sec pour Granite 4.2 8B sur RTX 3060 12 Go ?+
Entre 29 et 35 tokens/seconde en Q4_K_M. Q5_K_M : 26-31. Q8_0 : 20-24. C'est confortable pour du chat.
RTX 3060 12 Go ou RTX 4060 8 Go pour LLM ?+
3060 12 Go sans hésiter. Moins chère (~250 vs 310 €), +50 % de VRAM qui ouvre Gemma 4 12B et Qwen 3.5 9B en Q8. La 4060 a l'avantage de la consommation (115 vs 170 W) et du gaming, pas pour LLM.
Peut-on faire tourner un gros modèle 70B sur RTX 3060 12 Go ?+
Non en pratique. Un 70B en Q4 (42 Go) déborde massivement → <2 tok/s. Pour ce gabarit, visez minimum 24 Go (RTX 3090/4090) ou Mac 64 Go+. Sur 12 Go, le plafond réaliste 2026 est Gemma 4 12B ou Qwen 3.5 9B en Q8.
La RTX 3060 12 Go permet-elle du RAG multi-stage ?+
Oui, confortablement. Qwen 3.5 9B (6 Go) + bge-m3 embedder (2 Go) + BGE-reranker-v2 (1 Go) = 9 Go. Reste 3 Go pour contexte et buffer. Cas d'usage idéal.
Combien consomme la RTX 3060 12 Go en LLM ?+
En inférence continue : 110-140 W (TDP 170 W). Très sobre. Idéale pour un serveur d'inférence domestique branché 24/7.
Peut-on faire du fine-tuning LoRA sur RTX 3060 12 Go ?+
QLoRA sur 7B-8B : oui très confortable, ~9-10 Go requis. QLoRA sur 14B : tight, batch 1 + contexte court + unsloth obligatoire. Pour FT plus large, 16 Go+ nécessaires.
Alim 450 W suffit pour RTX 3060 12 Go ?+
Largement. TDP 170 W GPU + 100 W CPU + 40 W système = 310 W. Une 450 W qualité offre marge saine.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.