Guide budget · mis à jour 2026
Construire son stack LLM local par budget
Le combo matériel + modèle le moins cher qui fait vraiment tourner Qwen3, Llama 4 et les distillations DeepSeek R1 à une vitesse utilisable en 2026.
Comment lire ce guide
Fixez deux variables : budget et usage principal. Tout le reste — quantification, runtime, longueur de contexte — en découle. Partez de la VRAM, choisissez le plus gros modèle qui tient en Q4_K_M avec de la marge à 8K de contexte, puis choisissez le runtime.
Règle de base : un modèle en GGUF Q4_K_M occupe (paramètres × 0,55) Go de VRAM, plus ~1,5 Go de cache KV à 8K. Un 14B a donc besoin de ~9,2 Go, ce qui explique pourquoi la RTX 3060 12 Go reste la référence rapport qualité/prix mi-2026.
Choisissez votre palier
| Palier | Budget | Config de référence | VRAM / mém. unifiée | Modèle idéal (Q4_K_M) |
|---|---|---|---|---|
| Entrée | 400-550 € | Mini-PC Ryzen 7 5700U d'occasion, 16 Go DDR4 | 0 Go GPU / 16 Go RAM | Qwen3 4B |
| Valeur | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 Go d'occasion + 32 Go DDR5 | 12 Go | Qwen3-Coder 14B |
| Performance | 1 400-1 600 € | Ryzen 7 7700 + RTX 3090 24 Go d'occasion + 64 Go DDR5 | 24 Go | Qwen3-Coder 32B ou DeepSeek-R1-Distill-Qwen-32B |
| Silencieux | 2 300 € | Apple Mac mini M4 Pro 24 Go unifiée | ~18 Go utilisables | Llama 4 Scout 17B Q4 |
Prix indicatifs marché d'occasion France/UE mi-2026 — le marché de l'occasion fluctue, vérifiez les prix courants avant d'acheter.
Palier 2 — le champion à 900 €
C'est le palier que nous recommandons à la majorité des lecteurs. Une RTX 3060 12 Go d'occasion se négocie autour de 200-240 € sur le marché secondaire, et 12 Go de VRAM tombe exactement sur le point idéal pour les modèles classe 14B.
| Modèle (Q4_K_M) | VRAM utilisée | Tokens/s | Idéal pour |
|---|---|---|---|
| Qwen3 8B | 5,9 Go | 71 | Chat, RAG |
| Qwen3-Coder 14B | 9,4 Go | 42 | Complétion de code, refactors |
| Gemma 3 12B | 8,1 Go | 48 | Multilingue, QA documentaire |
| DeepSeek-R1-Distill-Qwen-14B | 9,7 Go | 39 | Raisonnement pas à pas |
Runtime : Ollama, llama.cpp ou vLLM ?
- Ollama 0.5+ — le meilleur pour un usage mono-utilisateur sur poste. Télécharge automatiquement les GGUF, expose une API compatible OpenAI, s'intègre à Open WebUI en une commande.
- llama.cpp — le meilleur quand il faut extraire chaque token/s d'un CPU ou de mémoire unifiée. CLI plus technique, meilleure portabilité.
- vLLM 0.7+ — le meilleur pour servir plusieurs utilisateurs ou agents en parallèle. PagedAttention passe à l'échelle presque linéairement jusqu'à un batch de 16 sur une 3090.
Développeurs solo → Ollama par défaut. Équipes de 3+ → vLLM derrière un petit proxy FastAPI.
Consommation, bruit et coût total
| Config | Repos (W) | Charge (W) | kWh/an @ 4h/j | Coût/an @ 0,20 €/kWh |
|---|---|---|---|---|
| Mini-PC entrée | 8 | 35 | 71 | 14,20 € |
| 3060 valeur | 45 | 220 | 460 | 92,00 € |
| 3090 performance | 50 | 360 | 686 | 137,20 € |
| Mac mini M4 Pro | 6 | 65 | 104 | 20,80 € |
Même la config la plus gourmande coûte moins par an que trois mois d'un abonnement SaaS LLM à 20 €/mois.
Verdict
| Profil | Palier recommandé | Pourquoi |
|---|---|---|
| Curieux, chat uniquement | Entrée 400 € | Qwen3 4B sur CPU va plus vite que la lecture |
| Développeur solo, code quotidien | Valeur 900 € | Le 14B coder à 42 tok/s est le point d'équilibre prix/perf |
| Raisonnement, agents, multi-modèle | Performance 1 500 € | 24 Go débloque les modèles classe 32B |
| Silence et zéro maintenance | Silencieux 2 300 € | Le M4 Pro consomme 6 W au repos |
Questions fréquentes
8 Go de VRAM suffisent-ils pour un usage utile en 2026 ?
Marginalement. Vous pouvez faire tourner Qwen3 8B Q4_K_M avec un contexte 4K sur une RTX 3050 8 Go ou une RX 6600, mais vous perdez la marge pour les 14B qui rendent l'inférence locale vraiment intéressante. Viser 12 Go si possible.
Faut-il acheter une carte AMD plutôt que NVIDIA ?
Pour l'inférence seule, les cartes RDNA3 (7800 XT, 7900 GRE) fonctionnent bien avec le backend Vulkan de llama.cpp et ROCm 6.2. Vous gagnez ~15 % sur le prix de la carte mais perdez vLLM, flash-attn et la plupart des outils de fine-tuning.
Peut-on fine-tuner avec ces budgets ?
Le fine-tuning LoRA de modèles 7B fonctionne sur une carte 12 Go avec Unsloth. Un 14B+ demande réalistement 24 Go. Le fine-tuning complet au-delà de 1B dépasse ce que le matériel grand public permet en 2026.
Comment la mémoire unifiée Mac se compare-t-elle à de la VRAM dédiée ?
La mémoire unifiée Apple délivre environ 75-85 % du débit d'une VRAM équivalente pour l'inférence, du fait d'une bande passante plus faible (273 Go/s sur M4 Pro contre 936 Go/s sur RTX 3090). Elle gagne sur la consommation et le chargement multi-modèles, perd sur les tokens/seconde par euro.