DeepSeek V4 Pro en local : VRAM, hardware requis et installation
DeepSeek V4 Pro est le modèle open-weights le plus puissant au monde à sa sortie le 24 avril 2026. 1,6 trillion de paramètres en architecture MoE (49 milliards actifs par token), licence MIT, contexte 1M tokens, attention hybride CSA+HCA, et trois modes de raisonnement. Sur les benchmarks publiés, il rivalise avec GPT-5 et Claude 4.7 — sans serveur cloud, sans API, sans limite de tokens. Ce guide détaille comment l'exploiter en local et ce qu'il faut comme matériel.
#DeepSeek V4 Pro en bref
- Sortie
- 24 avril 2026 — DeepSeek-AI sur HuggingFace, weights MIT, paper publié simultanément.
- Architecture
- Mixture-of-Experts dense 1,6T paramètres totaux, 49B actifs par token, 256 experts top-8 routing.
- Attention
- CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention) hybrides — première implémentation à cette échelle.
- Contexte
- 1 000 000 tokens natifs (avec RoPE étendu et flash attention v3).
- Pré-entraînement
- 32T+ tokens, optimiseur Muon (remplace AdamW), précision mixte FP4+FP8 (entraînement le plus efficient connu).
- Modes thinking
- 3 niveaux : Non / High / Max. Le mode Max approche les performances de o4 sur AIME et GPQA.
- Licence
- MIT — usage commercial, redistribution, modification autorisés sans restriction. Plus libre que la licence Llama.
#1. Architecture CSA+HCA et MoE 1.6T
DeepSeek V4 Pro empile trois innovations majeures, chacune publiée séparément ces 12 derniers mois et combinées ici pour la première fois à l'échelle du trillion.
- MoE 1,6T / 49B actifs
- 256 experts par couche, top-8 routing. Pour chaque token, seuls 49 milliards de paramètres calculent — d'où une vitesse comparable à un modèle dense 50B malgré la taille totale.
- CSA — Compressed Sparse Attention
- Compresse les anciennes clés/valeurs du KV cache via low-rank decomposition. Divise par 4 la mémoire attention sur contextes >128k.
- HCA — Hybrid Constrained Attention
- Combine attention locale (sliding window 4k) et globale (sparse) selon la couche. Throughput ×2 sur contexte long vs attention dense.
- mHC — multi-Head Compressor
- Mécanisme de compression inter-têtes — réduit la VRAM des activations sans perte mesurable de qualité.
- Optimiseur Muon
- Successeur d'AdamW, 1,8× plus rapide à converger sur le pré-entraînement de très grands modèles. Adopté par DeepSeek depuis V3.5.
- Entraînement FP4+FP8
- Mix FP4 sur les couches d'attention, FP8 sur les MLP. -45 % de mémoire d'entraînement vs FP8 pur, qualité préservée grâce à un schéma de scaling propriétaire.
#2. Les 3 modes thinking (Non / High / Max)
Le système thinking de DeepSeek V4 Pro est explicite et toggleable, contrairement aux modes opaques des modèles propriétaires concurrents.
- Mode Non (default)
- Réponse directe sans chain-of-thought visible. Latence minimale (~2-5s à 8 tok/s). Pour chat, traduction, génération de texte simple.
- Mode High
- Insère 200-2000 tokens de réflexion avant la réponse. +30-40 % de qualité sur math, code, analyse. Déclenchable via flag /think dans Ollama, header thinking_mode dans l'API.
- Mode Max
- Réflexion exhaustive (jusqu'à 16k tokens de chain-of-thought). Approche les performances o4 sur AIME 2025 (87 % vs 91 % pour o4). Coûteux : 10-30 minutes par requête en local.
#3. Hardware requis par quantization
| Quantization | VRAM modèle | + KV 32k | Configurations possibles |
|---|---|---|---|
| FP16 (référence) | 3 200 Go | ~3 350 Go | DC : 16× H100 80GB ou 8× H200 141GB. Inaccessible local. |
| Q8_0 | 1 700 Go | ~1 800 Go | 8× H200 141GB cluster. ~250 k$ matériel. |
| Q5_K_M | 1 150 Go | ~1 230 Go | Mac Studio 512 Go cluster ×3, ou 4× H200 141GB. |
| Q4_K_M | 960 Go | ~1 040 Go | Cluster 8× A100 80GB, ou 2× Mac Studio 512 Go en network swarm. |
| IQ3_M (compressé) | 720 Go | ~800 Go | Single Mac Studio 512 + offload SSD partiel. Lent mais possible. |
| IQ2_XS (extrême) | 480 Go | ~560 Go | Mac Studio 512 Go seul, qualité fortement dégradée. |
#4. Installation locale
Trois voies selon votre infrastructure : llama.cpp pour le multi-machine swarm, vLLM pour un cluster GPU homogène, ou MLX-distributed pour un swarm Mac Studio.
#Option A — llama.cpp distribué (recommandé multi-machine)
#Option B — vLLM sur cluster H100/H200
#Option C — Ollama (quand le portage sera dispo)
Au 25 avril 2026, Ollama n'a pas encore intégré DeepSeek V4 Pro (les quants communautaires Q4_K_M sortent ce week-end). Suivez la progression sur ollama.com/library.
#5. Benchmarks vs GPT-5, Claude 4.7, Gemini 3
| Benchmark | DeepSeek V4 Pro Max | GPT-5 | Claude 4.7 Opus | Gemini 3 Ultra |
|---|---|---|---|---|
| MMLU-Pro | 84.2 | 85.1 | 84.7 | 83.9 |
| GPQA Diamond | 78.5 | 76.8 | 79.2 | 77.1 |
| AIME 2025 | 87.0 | 82.4 | 85.6 | 80.2 |
| LiveCodeBench v5 | 79.8 | 78.2 | 75.4 | 76.1 |
| SWE-bench Verified | 59.4 | 62.1 | 63.8 | 55.7 |
| LongBench v2 (1M) | 72.6 | — | 68.4 | 70.2 |
| Humanity's Last Exam | 26.8 | 23.4 | 25.1 | 22.9 |
#6. Exploiter le contexte 1M tokens
Le contexte 1M est natif (pas étendu via YaRN), grâce à HCA. C'est l'un des trois ou quatre modèles open-weights au monde à offrir 1M, et le seul à le faire avec cette qualité de rappel.
- Needle-in-Haystack 1M
- 98 % de récupération sur tout le contexte (vs 76 % pour Gemini 1.5 Pro à équivalent).
- Use case 1 — Bases de code entières
- Linux kernel net/* (~800 k tokens) ingéré en une fois, refactoring inter-fichier en une seule requête.
- Use case 2 — Recherche juridique
- Code civil + arrêts récents (~600 k tokens) dans le contexte, extraction de jurisprudence en une passe.
- Use case 3 — Analyse comptable
- 10 ans de bilans + annexes (~400 k tokens), détection d'anomalies multi-exercices.
- VRAM KV cache à 1M
- Avec KV Q4 et CSA actif : ~280 Go. À 1M sans compression : ~2 To (impraticable).
#7. Cas d'usage idéaux
- Recherche scientifique
- Math, physique théorique, chimie computationnelle. Mode Max bat o4 sur certains benchmarks AIME/Putnam.
- Sécurité / souveraineté
- Banques, défense, santé, gouvernement : modèle frontière 100 % auto-hébergé, MIT, auditable. Aucun équivalent autre que LLaMA 4 (licence plus restrictive).
- Agents complexes long-horizon
- Le contexte 1M + raisonnement Max + 49B actifs en font un meilleur agent que les modèles dense plus petits, sans le coût d'inférence d'un GPT-5.
- RAG enterprise scale
- Knowledge base de plusieurs millions de tokens (codebases, docs internes, normes ISO). Recherche directe sans retrieval grâce au contexte.
#Limites et alternatives
- Hardware prohibitif pour individus
- Min 960 Go VRAM Q4 = cluster ~80 k€ d'occasion. Hors de portée d'un particulier.
- Tooling immature à J+1
- Quants GGUF communautaires en cours, vLLM nécessite la branche dev, MLX-distributed encore expérimental. Attendre ~2 semaines pour la stabilité.
- Empreinte carbone
- Cluster 8× H200 24/7 = ~45 MWh/an. À mettre en balance avec l'usage d'API (qui amortit mieux).
- Alternatives plus accessibles
- DeepSeek V4 Flash 284B (170 Go Q4, fits Mac Studio) · DeepSeek V3.2 671B (240 Go Q2 sur Mac Studio 512) · Llama 4 Behemoth (proche en qualité).
#FAQ
DeepSeek V4 Pro est-il vraiment meilleur que GPT-5 ?+
Quelle est la licence exacte de DeepSeek V4 Pro ?+
Pourquoi 1,6T paramètres si seulement 49B sont actifs ?+
Peut-on faire tourner DeepSeek V4 Pro sur un Mac Studio Ultra 512 Go seul ?+
Quelle différence entre les 3 modes thinking ?+
Comment activer le mode thinking dans Ollama / vLLM / API ?+
DeepSeek V4 Pro peut-il faire de la vision (multimodal) ?+
Les modèles distillés (70B, 32B, 14B) arrivent-ils ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.