Débutant 10 minRTX 30

Quel LLM sur RTX 3060 12 Go ?

La RTX 3060 12 Go (février 2021) est devenue LE GPU iconique pour l'IA locale budget. 12 Go de VRAM GDDR6, 360 Go/s de bande passante, 3 584 cœurs CUDA Ampere, TDP 170 W. En 2026 à 220-260 € d'occasion, elle reste la meilleure affaire pour quiconque veut faire tourner Phi-4 14B et Qwen 14B sans exploser son budget. Ce guide détaille pourquoi elle écrase tout sous 350 € et ce qu'elle tourne vraiment.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur Windows, macOS, Linux

#La RTX 3060 12 Go, icône LLM budget

Architecture
Ampere GA106. Samsung 8nm.
VRAM
12 Go GDDR6 15 Gbps, bus 192 bits. Bande passante 360 Go/s.
Cœurs CUDA
3 584. Tensor Cores 3ᵉ gen.
TDP
170 W. Alim 500 W suffit.
Prix 2026
220-260 € en occasion, stock abondant.
Pourquoi elle écrase tout sous 350 €
12 Go de VRAM à ce prix, c'est unique. La 4060 a 8 Go pour 310 €, la 5060 a 8 Go pour 400 €. La 3060 12 Go offre +50 % de VRAM à moindre prix — et 12 Go, en 2026, est le seuil qui permet Phi-4 14B (8,5 Go) et Qwen 14B (10,5 Go), soit tous les modèles milieu de gamme modernes.

#1. Modèles compatibles 12 Go

RTX 3060 12 Go — modèles LLM
ModèleQuantVRAMTokens/sec
Llama 3.2 3BQ8_03,4 Go55-65
Mistral 7BQ5_K_M5,1 Go36-42
Mistral 7BQ4_K_M4,4 Go40-46
Llama 3.1 8BQ5_K_M5,7 Go32-38
Qwen 2.5 Coder 7BQ5_K_M5,4 Go34-40
Phi-4 14BQ4_K_M8,5 Go22-28
Qwen 2.5 14BQ5_K_M10,5 Go18-22
Mistral Small 24BQ3_K_S10,5 Go12-16
i
Le seuil magique : 8,5 Go
Phi-4 14B Q4 = 8,5 Go. Entre dans 12 Go avec marge pour contexte 8k. Impossible sur 8 Go (4060, 3070, 5060). C'est la frontière décisive LLM en 2026, et la 3060 12 Go est la carte la moins chère qui la franchit.

#2. Installation Ollama

  1. 01
    Drivers NVIDIA 525+
    Standard Ampere. GeForce Experience ou nvidia.com.
  2. 02
    Ollama
    Installeur depuis ollama.com. CUDA auto-détecté.
  3. 03
    Premier modèle 12 Go
    ollama run phi4 — le modèle qui exploite pleinement la carte.
Commandes Linux
# Ubuntu 24.04
sudo apt install nvidia-driver-565
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run phi4
ollama run mistral
ollama run qwen2.5:14b

#3. Benchmarks mesurés

RTX 3060 12 Go — tokens/sec, Ollama 0.5.x, Ryzen 5 7600, DDR5 6000
ModèleQ4_K_MQ5_K_MQ6_KQ8_0
Mistral 7B42 t/s38 t/s34 t/s26 t/s
Llama 3.1 8B38 t/s34 t/s30 t/s24 t/s
Phi-4 14B24 t/s22 t/s18 t/s
Qwen 2.5 14B22 t/s20 t/s18 t/s

#4. Optimisations spécifiques

KV cache Q8
OLLAMA_KV_CACHE_TYPE=q8_0 → contexte 32k sur Mistral 7B en ~7 Go, laisse marge.
Flash Attention 2
Actif par défaut. Gain ~8 % sur contextes longs, -15 % KV cache.
Undervolt pour silence
MSI Afterburner : -80 mV, 140 W max. Inférence LLM quasi-silencieuse.
Context size adapté
Pour Phi-4 14B Q4 (8,5 Go), context 8192 = ~11 Go total. Context 16k nécessite KV cache Q8.

#5. vs 3060 8 Go, 4060 et 5060

Cartes budget NVIDIA — comparatif LLM
CarteVRAMBande p.Mistral 7BPhi-4 14BPrix 2026
RTX 3060 8 Go8 Go240 Go/s30 t/s~200 € occ.
RTX 3060 12 Go12 Go360 Go/s42 t/s24 t/s~250 € occ.
RTX 40608 Go272 Go/s42 t/s~310 € occ.
RTX 50608 Go448 Go/s64 t/s~400 € neuf
RTX 5060 Ti 16 Go16 Go448 Go/s68 t/s36 t/s~500 € neuf
Le meilleur rapport LLM/€ en 2026
250 € pour 12 Go + accès Phi-4 14B + Qwen 14B = champion toutes catégories. Aucune autre carte neuve ou occasion ne rivalise sous 400 €.

#Meilleur GPU LLM budget 2026

Achetez une 3060 12 Go si
Budget ≤ 300 €, débuter sérieusement en LLM local, vouloir tester Phi-4 14B, usage occasionnel. Champion absolu dans cette gamme.
Vérifiez bien la version 12 Go
La 3060 existe aussi en 8 Go — confusion fréquente sur marché occasion. L'emballage doit indiquer explicitement 12 Go.
Préférez 5060 Ti 16 Go neuve si > 500 €
Double budget mais +40 % vitesse, +33 % VRAM, garantie, FP4.

#Questions fréquentes

La RTX 3060 12 Go est-elle suffisante pour l'IA locale en 2026 ?+
Oui, largement, pour un usage particulier. Elle tient Mistral 7B Q5 à 38 tok/s, Phi-4 14B Q4 à 24 tok/s, Qwen 14B Q5 à 20 tok/s. Pour chat, RAG documentaire, code assistant, c'est parfaitement confortable.
Combien de tokens/sec pour Mistral 7B sur RTX 3060 12 Go ?+
Entre 40 et 46 tokens/seconde en Q4_K_M. Q5_K_M : 36-42. Q8_0 : 24-28. C'est modeste mais très utilisable pour du chat.
RTX 3060 12 Go ou RTX 4060 8 Go pour LLM ?+
3060 12 Go sans hésiter. Moins chère (~250 vs 310 €), +50 % de VRAM qui ouvre Phi-4 14B et Qwen 14B. La 4060 a l'avantage de la consommation (115 vs 170 W) et du gaming, pas pour LLM.
Peut-on faire tourner Llama 3.1 70B sur RTX 3060 12 Go ?+
Non en pratique. Q4 (42 Go) déborde massivement → <2 tok/s. Pour du 70B, visez minimum 24 Go (RTX 3090/4090) ou Mac 64 Go+.
La RTX 3060 12 Go permet-elle du RAG multi-stage ?+
Oui, confortablement. Mistral 7B (5 Go) + bge-m3 embedder (2 Go) + BGE-reranker-v2 (1 Go) = 8 Go. Reste 4 Go pour contexte et buffer. Cas d'usage idéal.
Combien consomme la RTX 3060 12 Go en LLM ?+
En inférence continue : 110-140 W (TDP 170 W). Très sobre. Idéale pour un serveur d'inférence domestique branché 24/7.
Peut-on faire du fine-tuning LoRA sur RTX 3060 12 Go ?+
QLoRA sur 7B-8B : oui très confortable, ~9-10 Go requis. QLoRA sur 14B : tight, batch 1 + contexte court + unsloth obligatoire. Pour FT plus large, 16 Go+ nécessaires.
Alim 450 W suffit pour RTX 3060 12 Go ?+
Largement. TDP 170 W GPU + 100 W CPU + 40 W système = 310 W. Une 450 W qualité offre marge saine.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.