◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →

Guide budget · mis à jour 2026

Construire son stack LLM local par budget

Le combo matériel + modèle le moins cher qui fait vraiment tourner Qwen3, Llama 4 et les distillations DeepSeek R1 à une vitesse utilisable en 2026.

Comment lire ce guide

Fixez deux variables : budget et usage principal. Tout le reste — quantification, runtime, longueur de contexte — en découle. Partez de la VRAM, choisissez le plus gros modèle qui tient en Q4_K_M avec de la marge à 8K de contexte, puis choisissez le runtime.

Règle de base : un modèle en GGUF Q4_K_M occupe (paramètres × 0,55) Go de VRAM, plus ~1,5 Go de cache KV à 8K. Un 14B a donc besoin de ~9,2 Go, ce qui explique pourquoi la RTX 3060 12 Go reste la référence rapport qualité/prix mi-2026.

Choisissez votre palier

PalierBudgetConfig de référenceVRAM / mém. unifiéeModèle idéal (Q4_K_M)
Entrée400-550 €Mini-PC Ryzen 7 5700U d'occasion, 16 Go DDR40 Go GPU / 16 Go RAMQwen3 4B
Valeur850-1 000 €Ryzen 5 7600 + RTX 3060 12 Go d'occasion + 32 Go DDR512 GoQwen3-Coder 14B
Performance1 400-1 600 €Ryzen 7 7700 + RTX 3090 24 Go d'occasion + 64 Go DDR524 GoQwen3-Coder 32B ou DeepSeek-R1-Distill-Qwen-32B
Silencieux2 300 €Apple Mac mini M4 Pro 24 Go unifiée~18 Go utilisablesLlama 4 Scout 17B Q4

Prix indicatifs marché d'occasion France/UE mi-2026 — le marché de l'occasion fluctue, vérifiez les prix courants avant d'acheter.

Palier 2 — le champion à 900 €

C'est le palier que nous recommandons à la majorité des lecteurs. Une RTX 3060 12 Go d'occasion se négocie autour de 200-240 € sur le marché secondaire, et 12 Go de VRAM tombe exactement sur le point idéal pour les modèles classe 14B.

Modèle (Q4_K_M)VRAM utiliséeTokens/sIdéal pour
Qwen3 8B5,9 Go71Chat, RAG
Qwen3-Coder 14B9,4 Go42Complétion de code, refactors
Gemma 3 12B8,1 Go48Multilingue, QA documentaire
DeepSeek-R1-Distill-Qwen-14B9,7 Go39Raisonnement pas à pas

Runtime : Ollama, llama.cpp ou vLLM ?

Développeurs solo → Ollama par défaut. Équipes de 3+ → vLLM derrière un petit proxy FastAPI.

Consommation, bruit et coût total

ConfigRepos (W)Charge (W)kWh/an @ 4h/jCoût/an @ 0,20 €/kWh
Mini-PC entrée8357114,20 €
3060 valeur4522046092,00 €
3090 performance50360686137,20 €
Mac mini M4 Pro66510420,80 €

Même la config la plus gourmande coûte moins par an que trois mois d'un abonnement SaaS LLM à 20 €/mois.

Verdict

ProfilPalier recommandéPourquoi
Curieux, chat uniquementEntrée 400 €Qwen3 4B sur CPU va plus vite que la lecture
Développeur solo, code quotidienValeur 900 €Le 14B coder à 42 tok/s est le point d'équilibre prix/perf
Raisonnement, agents, multi-modèlePerformance 1 500 €24 Go débloque les modèles classe 32B
Silence et zéro maintenanceSilencieux 2 300 €Le M4 Pro consomme 6 W au repos

Questions fréquentes

8 Go de VRAM suffisent-ils pour un usage utile en 2026 ?

Marginalement. Vous pouvez faire tourner Qwen3 8B Q4_K_M avec un contexte 4K sur une RTX 3050 8 Go ou une RX 6600, mais vous perdez la marge pour les 14B qui rendent l'inférence locale vraiment intéressante. Viser 12 Go si possible.

Faut-il acheter une carte AMD plutôt que NVIDIA ?

Pour l'inférence seule, les cartes RDNA3 (7800 XT, 7900 GRE) fonctionnent bien avec le backend Vulkan de llama.cpp et ROCm 6.2. Vous gagnez ~15 % sur le prix de la carte mais perdez vLLM, flash-attn et la plupart des outils de fine-tuning.

Peut-on fine-tuner avec ces budgets ?

Le fine-tuning LoRA de modèles 7B fonctionne sur une carte 12 Go avec Unsloth. Un 14B+ demande réalistement 24 Go. Le fine-tuning complet au-delà de 1B dépasse ce que le matériel grand public permet en 2026.

Comment la mémoire unifiée Mac se compare-t-elle à de la VRAM dédiée ?

La mémoire unifiée Apple délivre environ 75-85 % du débit d'une VRAM équivalente pour l'inférence, du fait d'une bande passante plus faible (273 Go/s sur M4 Pro contre 936 Go/s sur RTX 3090). Elle gagne sur la consommation et le chargement multi-modèles, perd sur les tokens/seconde par euro.