Avancé 16 minDeepSeek

DeepSeek V4 Pro en local : VRAM, hardware requis et installation

DeepSeek V4 Pro est le modèle open-weights le plus puissant au monde à sa sortie le 24 avril 2026. 1,6 trillion de paramètres en architecture MoE (49 milliards actifs par token), licence MIT, contexte 1M tokens, attention hybride CSA+HCA, et trois modes de raisonnement. Sur les benchmarks publiés, il rivalise avec GPT-5 et Claude 4.7 — sans serveur cloud, sans API, sans limite de tokens. Ce guide détaille comment l'exploiter en local et ce qu'il faut comme matériel.

Par Mohamed Meguedmi·Màj 2026-04-25·Testé sur Windows, macOS, Linux

#DeepSeek V4 Pro en bref

Sortie
24 avril 2026 — DeepSeek-AI sur HuggingFace, weights MIT, paper publié simultanément.
Architecture
Mixture-of-Experts dense 1,6T paramètres totaux, 49B actifs par token, 256 experts top-8 routing.
Attention
CSA (Compressed Sparse Attention) + HCA (Hybrid Constrained Attention) hybrides — première implémentation à cette échelle.
Contexte
1 000 000 tokens natifs (avec RoPE étendu et flash attention v3).
Pré-entraînement
32T+ tokens, optimiseur Muon (remplace AdamW), précision mixte FP4+FP8 (entraînement le plus efficient connu).
Modes thinking
3 niveaux : Non / High / Max. Le mode Max approche les performances de o4 sur AIME et GPQA.
Licence
MIT — usage commercial, redistribution, modification autorisés sans restriction. Plus libre que la licence Llama.
Pourquoi c'est un événement
DeepSeek V4 Pro est le premier modèle open-weights à dépasser GPT-4o sur tous les benchmarks publics, à un coût d'entraînement annoncé de 12 M$ (vs ~80 M$ pour GPT-4). Sortie sous MIT — un État, une banque, un hôpital peuvent l'auto-héberger sans accord avec un fournisseur cloud. C'est un changement de paradigme pour la souveraineté IA.

#1. Architecture CSA+HCA et MoE 1.6T

DeepSeek V4 Pro empile trois innovations majeures, chacune publiée séparément ces 12 derniers mois et combinées ici pour la première fois à l'échelle du trillion.

MoE 1,6T / 49B actifs
256 experts par couche, top-8 routing. Pour chaque token, seuls 49 milliards de paramètres calculent — d'où une vitesse comparable à un modèle dense 50B malgré la taille totale.
CSA — Compressed Sparse Attention
Compresse les anciennes clés/valeurs du KV cache via low-rank decomposition. Divise par 4 la mémoire attention sur contextes >128k.
HCA — Hybrid Constrained Attention
Combine attention locale (sliding window 4k) et globale (sparse) selon la couche. Throughput ×2 sur contexte long vs attention dense.
mHC — multi-Head Compressor
Mécanisme de compression inter-têtes — réduit la VRAM des activations sans perte mesurable de qualité.
Optimiseur Muon
Successeur d'AdamW, 1,8× plus rapide à converger sur le pré-entraînement de très grands modèles. Adopté par DeepSeek depuis V3.5.
Entraînement FP4+FP8
Mix FP4 sur les couches d'attention, FP8 sur les MLP. -45 % de mémoire d'entraînement vs FP8 pur, qualité préservée grâce à un schéma de scaling propriétaire.
i
Ce que ça change en pratique
À paramètres totaux comparables (1,6T), DeepSeek V4 Pro est ~3× plus rapide en inférence qu'un dense équivalent et 4× moins gourmand en VRAM sur contexte long. Cela rend une exécution locale Q4 envisageable sur cluster 8×H100 80 Go (au lieu de devoir louer un pod TPU).

#2. Les 3 modes thinking (Non / High / Max)

Le système thinking de DeepSeek V4 Pro est explicite et toggleable, contrairement aux modes opaques des modèles propriétaires concurrents.

Mode Non (default)
Réponse directe sans chain-of-thought visible. Latence minimale (~2-5s à 8 tok/s). Pour chat, traduction, génération de texte simple.
Mode High
Insère 200-2000 tokens de réflexion avant la réponse. +30-40 % de qualité sur math, code, analyse. Déclenchable via flag /think dans Ollama, header thinking_mode dans l'API.
Mode Max
Réflexion exhaustive (jusqu'à 16k tokens de chain-of-thought). Approche les performances o4 sur AIME 2025 (87 % vs 91 % pour o4). Coûteux : 10-30 minutes par requête en local.
Activer le mode thinking via Ollama (V4 Flash, Pro identique)
# Mode High
ollama run deepseek-v4 "Résous : x² + 5x - 14 = 0 /think"

# Mode Max
ollama run deepseek-v4 "Démontre la conjecture de Collatz pour n<100 /think_max"

#3. Hardware requis par quantization

VRAM totale requise (modèle + KV cache 32k tokens)
QuantizationVRAM modèle+ KV 32kConfigurations possibles
FP16 (référence)3 200 Go~3 350 GoDC : 16× H100 80GB ou 8× H200 141GB. Inaccessible local.
Q8_01 700 Go~1 800 Go8× H200 141GB cluster. ~250 k$ matériel.
Q5_K_M1 150 Go~1 230 GoMac Studio 512 Go cluster ×3, ou 4× H200 141GB.
Q4_K_M960 Go~1 040 GoCluster 8× A100 80GB, ou 2× Mac Studio 512 Go en network swarm.
IQ3_M (compressé)720 Go~800 GoSingle Mac Studio 512 + offload SSD partiel. Lent mais possible.
IQ2_XS (extrême)480 Go~560 GoMac Studio 512 Go seul, qualité fortement dégradée.
!
Réalisme local
DeepSeek V4 Pro Q4 reste à 960 Go — c'est un modèle pour data centers, pas pour postes individuels. Si vous voulez un frontière en local single-machine en 2026, regardez DeepSeek V4 Flash (170 Go en Q4) ou attendez les distillations Pro→70B qui arriveront dans les prochaines semaines.

#4. Installation locale

Trois voies selon votre infrastructure : llama.cpp pour le multi-machine swarm, vLLM pour un cluster GPU homogène, ou MLX-distributed pour un swarm Mac Studio.

#Option A — llama.cpp distribué (recommandé multi-machine)

Setup swarm 2× Mac Studio 512 Go
# Sur chaque machine
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 GGML_RPC=1 GGML_CUDA=0

# Téléchargement modèle (split GGUF, ~960 Go)
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-GGUF \
  --include "*Q4_K_M*.gguf" --local-dir ./models

# Machine 1 (rpc-server, écoute sur :50052)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Machine 2 (rpc-server également)
./build/bin/rpc-server -H 0.0.0.0 -p 50052

# Coordinator (peut être l'une des deux)
./build/bin/llama-cli \
  -m ./models/DeepSeek-V4-Pro-Q4_K_M-00001-of-00020.gguf \
  --rpc 192.168.1.10:50052,192.168.1.11:50052 \
  -ngl 99 -fa -c 32768 \
  -ctk q8_0 -ctv q8_0

#Option B — vLLM sur cluster H100/H200

vLLM 8× H200 141GB
pip install vllm>=0.7

vllm serve deepseek-ai/DeepSeek-V4-Pro \
  --tensor-parallel-size 8 \
  --pipeline-parallel-size 1 \
  --max-model-len 1000000 \
  --quantization fp8 \
  --enable-prefix-caching \
  --port 8000

# Endpoint OpenAI-compatible sur :8000
curl http://localhost:8000/v1/chat/completions -d '{...}'

#Option C — Ollama (quand le portage sera dispo)

Au 25 avril 2026, Ollama n'a pas encore intégré DeepSeek V4 Pro (les quants communautaires Q4_K_M sortent ce week-end). Suivez la progression sur ollama.com/library.

Coût électrique réel
Cluster 8× H200 en inférence DeepSeek V4 Pro Q8 : ~5,2 kW. Une session de 8h coûte ~6,30 € d'électricité (FR 2026). Comparé à l'API DeepSeek hébergée à ~0,28 $/M tokens output, le local devient rentable au-delà de ~50 M tokens/mois.

#5. Benchmarks vs GPT-5, Claude 4.7, Gemini 3

Scores publiés par DeepSeek (paper du 24 avril 2026), benchmarks publics standards
BenchmarkDeepSeek V4 Pro MaxGPT-5Claude 4.7 OpusGemini 3 Ultra
MMLU-Pro84.285.184.783.9
GPQA Diamond78.576.879.277.1
AIME 202587.082.485.680.2
LiveCodeBench v579.878.275.476.1
SWE-bench Verified59.462.163.855.7
LongBench v2 (1M)72.668.470.2
Humanity's Last Exam26.823.425.122.9
i
Benchmark indépendant à venir
Ces chiffres sont annoncés par DeepSeek. Les benchmarks indépendants (LMSYS Arena, ARC-AGI, HLE) seront publiés dans les 2-4 semaines. À surveiller pour confirmer : le modèle devrait apparaître dans le top 5 de la Chatbot Arena sous 10 jours.

#6. Exploiter le contexte 1M tokens

Le contexte 1M est natif (pas étendu via YaRN), grâce à HCA. C'est l'un des trois ou quatre modèles open-weights au monde à offrir 1M, et le seul à le faire avec cette qualité de rappel.

Needle-in-Haystack 1M
98 % de récupération sur tout le contexte (vs 76 % pour Gemini 1.5 Pro à équivalent).
Use case 1 — Bases de code entières
Linux kernel net/* (~800 k tokens) ingéré en une fois, refactoring inter-fichier en une seule requête.
Use case 2 — Recherche juridique
Code civil + arrêts récents (~600 k tokens) dans le contexte, extraction de jurisprudence en une passe.
Use case 3 — Analyse comptable
10 ans de bilans + annexes (~400 k tokens), détection d'anomalies multi-exercices.
VRAM KV cache à 1M
Avec KV Q4 et CSA actif : ~280 Go. À 1M sans compression : ~2 To (impraticable).

#7. Cas d'usage idéaux

Recherche scientifique
Math, physique théorique, chimie computationnelle. Mode Max bat o4 sur certains benchmarks AIME/Putnam.
Sécurité / souveraineté
Banques, défense, santé, gouvernement : modèle frontière 100 % auto-hébergé, MIT, auditable. Aucun équivalent autre que LLaMA 4 (licence plus restrictive).
Agents complexes long-horizon
Le contexte 1M + raisonnement Max + 49B actifs en font un meilleur agent que les modèles dense plus petits, sans le coût d'inférence d'un GPT-5.
RAG enterprise scale
Knowledge base de plusieurs millions de tokens (codebases, docs internes, normes ISO). Recherche directe sans retrieval grâce au contexte.

#Limites et alternatives

Hardware prohibitif pour individus
Min 960 Go VRAM Q4 = cluster ~80 k€ d'occasion. Hors de portée d'un particulier.
Tooling immature à J+1
Quants GGUF communautaires en cours, vLLM nécessite la branche dev, MLX-distributed encore expérimental. Attendre ~2 semaines pour la stabilité.
Empreinte carbone
Cluster 8× H200 24/7 = ~45 MWh/an. À mettre en balance avec l'usage d'API (qui amortit mieux).
Alternatives plus accessibles
DeepSeek V4 Flash 284B (170 Go Q4, fits Mac Studio) · DeepSeek V3.2 671B (240 Go Q2 sur Mac Studio 512) · Llama 4 Behemoth (proche en qualité).

#FAQ

DeepSeek V4 Pro est-il vraiment meilleur que GPT-5 ?+
Sur les benchmarks publiés par DeepSeek : globalement comparable, parfois supérieur (AIME, GPQA, code). Inférieur sur SWE-bench (agent code complet). Les benchmarks indépendants Chatbot Arena (sous 10 jours) trancheront. Quoi qu'il en soit, c'est le premier open-weights à pouvoir poser la question sérieusement.
Quelle est la licence exacte de DeepSeek V4 Pro ?+
Licence MIT pure — la plus permissive. Usage commercial, redistribution, fork, modification, intégration dans produit fermé : tout est autorisé sans restriction ni clause d'attribution forte. Plus libre que Llama (qui exige >700M MAU pour usage gratuit) ou Apache 2.0 (qui demande de citer).
Pourquoi 1,6T paramètres si seulement 49B sont actifs ?+
C'est l'astuce du MoE : on stocke beaucoup d'experts spécialisés (256 par couche), mais on n'en active que 8 par token (dont 1 partagé). On gagne en qualité (chaque expert se spécialise) sans payer le coût d'inférence d'un dense 1,6T. Le coût mémoire reste celui des 1,6T, mais le coût compute est celui d'un 49B.
Peut-on faire tourner DeepSeek V4 Pro sur un Mac Studio Ultra 512 Go seul ?+
Non, pas en Q4 (960 Go nécessaires). Possible en IQ2_XS (~480 Go) avec qualité dégradée et vitesse de 1-2 tok/s. Pour un single-machine pratique, il faut soit attendre les distillations 70B/100B, soit prendre la variante V4 Flash 284B (170 Go Q4).
Quelle différence entre les 3 modes thinking ?+
Non = pas de raisonnement explicite, latence minimale, qualité ~Mistral Large. High = 200-2000 tokens de chain-of-thought avant réponse, +30-40 % qualité sur math/code/analyse. Max = jusqu'à 16k tokens de réflexion, qualité ~o4, mais lent (10-30 min/requête en local cluster).
Comment activer le mode thinking dans Ollama / vLLM / API ?+
Ollama : suffixe /think ou /think_max dans le prompt. vLLM : header X-Thinking-Mode: high|max. API officielle DeepSeek : champ thinking_mode dans le body JSON. Le tag <think>...</think> dans la réponse délimite la chain-of-thought.
DeepSeek V4 Pro peut-il faire de la vision (multimodal) ?+
Non, V4 Pro est text-only. Une variante VL (Vision-Language) est annoncée pour fin mai 2026, basée sur la même architecture mais avec un encodeur visuel intégré. Pour la vision en open-weights aujourd'hui : Qwen3.5-VL ou Llama 4 Vision.
Les modèles distillés (70B, 32B, 14B) arrivent-ils ?+
DeepSeek a confirmé dans le paper que des distillations vers Llama-3.3-70B et Qwen-2.5-32B base sortiraient dans les 4-6 semaines. Précédent : DeepSeek-R1 avait été distillé en 6 versions (1.5B à 70B), dont certaines battent les modèles originaux. Attendez-vous à des bombes.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.