DeepSeek V4 Flash 284B : le 1er frontier qui tient sur Mac Studio
DeepSeek V4 Flash 284B est sorti le 24 avril 2026 en même temps que V4 Pro. C'est la variante "efficient" : 284 milliards de paramètres totaux en MoE (13B actifs par token), licence MIT, contexte 1M tokens, même architecture CSA+HCA et mêmes 3 modes thinking que le Pro. Surtout, c'est le premier modèle frontier-class qui tient sur une seule workstation : 170 Go en Q4 — un Mac Studio M3 Ultra 256 Go suffit. Ce guide explique comment l'installer et ce qu'il vaut.
#DeepSeek V4 Flash en bref
- Sortie
- 24 avril 2026, simultanée avec V4 Pro. Disponible sur HuggingFace : deepseek-ai/DeepSeek-V4-Flash.
- Architecture
- MoE 284B totaux, 13B actifs par token. 128 experts par couche, top-8 routing. Variantes Base + Instruct disponibles.
- Innovations héritées du Pro
- Attention CSA+HCA, mHC, optimiseur Muon, entraînement FP4+FP8 mixte.
- Contexte
- 1 000 000 tokens natifs (identique au Pro).
- Modes thinking
- 3 niveaux Non / High / Max — toggleable au prompt.
- Licence
- MIT, identique au Pro. Aucune restriction d'usage commercial ni géographique.
#1. Pourquoi c'est un événement
Avant le 24 avril 2026, faire tourner un modèle frontière en local impliquait soit un cluster GPU à 80 k€+, soit accepter une qualité dégradée d'un modèle 70B. DeepSeek V4 Flash change ça : 170 Go en Q4 tient sur des configurations à 4-8 k€ d'occasion.
- Mac Studio M3 Ultra 256 Go
- 7 299 €. 170 Go modèle + 30 Go contexte = tient large. ~10-12 tok/s en Q4.
- 2× RTX 5090 32 Go (64 Go VRAM)
- ~5 200 €. Insuffisant — il manque ~110 Go. Possible avec offload CPU, mais lent (3-5 tok/s).
- 4× RTX A6000 48 Go (192 Go VRAM)
- ~12 000 € occasion. Tient confortablement, ~18-25 tok/s.
- Workstation 2× Mac Studio Max 64 Go
- Insuffisant en single. Avec llama.cpp RPC swarm et 4× Mac Studio : possible, ~5 tok/s.
#2. Architecture (variante efficient de V4)
V4 Flash est une réduction proportionnelle du V4 Pro : ~5,7× moins d'experts, ~3,8× moins de paramètres actifs, mais même squelette CSA+HCA + Muon + FP4/FP8. C'est cette homogénéité qui permet à V4 Flash d'hériter de la qualité du Pro à coût bien moindre.
- Experts par couche
- 128 (vs 256 pour Pro). Top-8 routing identique.
- Paramètres actifs
- 13B (vs 49B pour Pro). Vitesse d'inférence ~3,8× supérieure à params total équivalent.
- Couches
- 61 (Pro : 76). Réduction modérée pour préserver la profondeur de raisonnement.
- Heads d'attention
- Identique au Pro (CSA+HCA configurés à l'identique). Pas d'économie sur l'attention pour préserver la qualité long contexte.
- Pré-entraînement
- Cible « efficient reasoning » : 18T tokens (vs 32T pour Pro), avec data mix optimisé pour math + code.
#3. Hardware par quantization
| Quantization | VRAM modèle | + KV 32k | Configurations recommandées |
|---|---|---|---|
| FP16 (référence) | 568 Go | ~620 Go | DC : 4× H200 141GB. Local impraticable. |
| Q8_0 | 305 Go | ~340 Go | Mac Studio M3 Ultra 512 Go ou 8× RTX 4090 24GB. |
| Q5_K_M | 205 Go | ~235 Go | Mac Studio Ultra 256 Go (juste), 4× RTX A6000 48GB confortable. |
| Q4_K_M | 170 Go | ~200 Go | Mac Studio Ultra 256 Go, 4× RTX 4090 24GB, 2× RTX 6000 Ada 48GB. |
| IQ3_M (compressé) | 130 Go | ~160 Go | Mac Studio M2 Ultra 192 Go, 4× RTX 4090 (offload léger). |
| IQ2_XS (extrême) | 85 Go | ~115 Go | RTX 5090 + 64 Go DDR5 offload, ou 2× RTX 4090. |
#4. Setup Mac Studio Ultra 256/512 Go
#5. Setup multi-GPU NVIDIA
#Option A — vLLM 4× RTX A6000 (48 Go × 4 = 192 Go)
#Option B — llama.cpp avec offload partiel
#6. Benchmarks et tokens/sec mesurés
| Benchmark | V4 Flash | V4 Pro | Llama 4 Scout 109B | Mistral Large 2 |
|---|---|---|---|---|
| MMLU-Pro | 79.4 | 84.2 | 76.8 | 75.3 |
| GPQA Diamond | 70.1 | 78.5 | 63.2 | 59.4 |
| AIME 2025 | 76.5 | 87.0 | 61.3 | 52.1 |
| LiveCodeBench v5 | 72.6 | 79.8 | 65.4 | 61.8 |
| LongBench v2 (1M) | 68.9 | 72.6 | — | — |
| Setup | Tok/s mode Non | Tok/s mode High | Tok/s mode Max |
|---|---|---|---|
| Mac Studio M3 Ultra 256 Go | 10-12 | 8-10 | 5-7 |
| Mac Studio M3 Ultra 512 Go | 12-14 | 10-12 | 7-9 |
| 4× RTX A6000 48GB | 20-25 | 16-20 | 12-15 |
| 2× RTX 5090 + 64GB offload | 3-5 | 2-4 | 1-2 |
#7. Modes thinking et long contexte
V4 Flash hérite des trois modes thinking de V4 Pro à qualité légèrement inférieure mais coût d'inférence bien moindre. C'est le bon choix pour des agents qui doivent raisonner sans monopoliser une infrastructure.
- Mode Non
- Réponse directe. Latence très basse (~1s pour démarrer le streaming). Pour chat conversationnel, traduction.
- Mode High
- 200-2000 tokens de chain-of-thought avant réponse. +25 % qualité sur math/code. Latence 5-15s avant le premier token de réponse finale.
- Mode Max
- Jusqu'à 16k tokens de réflexion. Latence 1-5 minutes en local. À réserver aux problèmes durs (preuves math, débogage complexe).
- Long contexte 1M
- Mêmes capacités que V4 Pro grâce à HCA — Needle-in-Haystack 1M ~95 % (vs 98 % pour Pro). Excellent pour RAG sur grandes bases.
#V4 Flash vs V4 Pro : choisir
| Critère | V4 Flash 284B | V4 Pro 1.6T |
|---|---|---|
| Paramètres totaux | 284 B | 1 600 B |
| Paramètres actifs / token | 13 B | 49 B |
| VRAM Q4_K_M | 170 Go | 960 Go |
| Hardware minimal local | Mac Studio Ultra 256 Go (7 300 €) | Cluster ~80 000 € |
| Tokens/sec en local typique | 10-25 | 0,5-2 |
| Qualité MMLU-Pro | 79.4 | 84.2 |
| Qualité AIME 2025 | 76.5 | 87.0 |
| Contexte natif | 1 M | 1 M |
| Mode thinking max | Oui | Oui (meilleure qualité) |
| Licence | MIT | MIT |
#FAQ
DeepSeek V4 Flash tourne-t-il vraiment sur Mac Studio M3 Ultra 256 Go ?+
Combien coûte un setup viable pour V4 Flash en local ?+
Faut-il choisir V4 Flash ou attendre une distillation 70B ?+
V4 Flash bat-il Llama 4 Maverick / Scout ?+
Quelle est la consommation électrique d'un Mac Studio M3 Ultra en inférence V4 Flash ?+
Le mode thinking Max vaut-il la peine sur V4 Flash ?+
Peut-on fine-tuner V4 Flash en local ?+
Existe-t-il une version quantifiée Q4 stable au 25 avril 2026 ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.