Quel LLM sur Mac Studio (M2 / M3 / M4 Ultra, 64–512 Go) ?
Le Mac Studio (M2 Ultra, M3 Ultra, M4 Max) est en 2026 la seule machine grand public au monde capable de faire tourner localement des modèles de plus de 200 milliards de paramètres. Le M3 Ultra 512 Go (sorti début 2025) pousse la mémoire unifiée à 512 Go pour environ 11 000 € — assez pour Llama 4 Maverick 402B en Q4 ou DeepSeek V3 671B en Q4. Ce guide détaille chaque configuration et ses cas d'usage.
#Mac Studio en 2026
- Mac Studio M2 Ultra (2023)
- 24 cœurs CPU + 60 ou 76 cœurs GPU, 800 Go/s, RAM 64/128/192 Go. Toujours disponible d'occasion à partir de 2800 €.
- Mac Studio M4 Max (2025)
- 16 cœurs CPU + 40 cœurs GPU, 546 Go/s, RAM 36-128 Go. Remplace le M2 Max. À partir de 2299 €.
- Mac Studio M3 Ultra (2025)
- 28 cœurs CPU + 60 ou 80 cœurs GPU, 800 Go/s, RAM 96/256/512 Go. Le monstre. De 4499 € (96 Go) à 11 299 € (512 Go).
- Consommation
- 15 W idle, 70-130 W en inférence selon config. Le M3 Ultra 512 Go pic à ~150 W en 405B.
#1. M2 Ultra vs M3 Ultra vs M4 Max
- M4 Max
- Entry-level du Mac Studio. 546 Go/s, 128 Go max. Mieux qu'un MBP M4 Max : pas de throttle, moins cher (boîtier desktop).
- M2 Ultra
- Première génération Ultra. 800 Go/s, jusqu'à 192 Go. Occasion entre 2800-4500 €. Toujours compétitif pour 70B-123B.
- M3 Ultra
- Dernier Ultra (2025). 800 Go/s identique à M2 Ultra, mais architecture M3 (+20 % en pratique). 96 à 512 Go RAM. Pour qui veut pousser au-delà de 200B.
#2. Jusqu'où pousser la RAM ?
- 96 Go (M3 Ultra base)
- 4499 €. Fait tourner gpt-oss 120B (MXFP4, 63 Go) à ~50 tok/s et les MoE ~30B (Qwen 3.6 35B-A3B) à ~70 tok/s, avec de la marge pour un contexte long. Sweet spot pour les gros MoE jusqu'à ~120B.
- 256 Go (M3 Ultra + 256)
- 7299 €. Ouvre Llama 4 Maverick 402B Q4 (230 Go) à ~34 tok/s et DeepSeek V3 671B Q2 (~240 Go). Pour qui veut du 400B+.
- 512 Go (M3 Ultra max)
- 11 299 €. DeepSeek V3 671B Q4 (380 Go) passe, Qwen3-235B-A22B en Q8, contexte 128k+ sur les gros MoE. Territoire recherche/R&D.
- 192 Go (M2 Ultra max)
- Charge Qwen3-235B-A22B Q4 (133 Go) et Maverick 402B en Q3. Équivalent fonctionnel du 256 Go M3 Ultra pour un peu moins cher d'occasion. Bon compromis.
#3. Modèles exclusifs Ultra
| Modèle | Quant | RAM requise | M2 Ultra 192 | M3 Ultra 256 | M3 Ultra 512 |
|---|---|---|---|---|---|
| gpt-oss 120B | MXFP4 | 63 Go | ✓ 42 t/s | ✓ 50 t/s | ✓ 50 t/s |
| Qwen3-235B-A22B | Q4_K_M | 133 Go | ✓ 26 t/s | ✓ 30 t/s | ✓ 30 t/s |
| Llama 4 Maverick 402B | Q4_K_M | 230 Go | — | ✓ 34 t/s | ✓ 34 t/s |
| Llama 4 Maverick 402B | Q8_0 | 410 Go | — | — | ✓ 22 t/s |
| DeepSeek V3 671B | Q2_K | 240 Go | — | ✓ 20 t/s | ✓ 20 t/s |
| DeepSeek V3 671B | Q4_K_M | 380 Go | — | — | ✓ 16 t/s |
#4. Benchmarks 120B, 235B, 671B
| Modèle | Q4_K_M | Q5_K_M | Q6_K | Flash Attn 16k |
|---|---|---|---|---|
| gpt-oss 120B | 50 t/s | — | — | 48 t/s |
| Qwen3-235B-A22B | 30 t/s | 28 t/s | 26 t/s | 27 t/s |
| Llama 4 Maverick 402B | 34 t/s | 30 t/s | 28 t/s | 31 t/s |
| DeepSeek V3 671B | 16 t/s | 14 t/s | — | 15 t/s |
#5. Setup workstation LLM
#6. DeepSeek V3 671B sur M3 Ultra 512 Go
C'est le cas d'usage flagship du Mac Studio 512 Go. Le modèle fait 380 Go en Q4_K_M, tient en RAM sur la config 512 Go, contexte 16k à ~16 tok/s (MoE, ~37B de paramètres actifs sur 671B). Qualité proche des meilleurs modèles propriétaires sur la plupart des tâches.
- Téléchargement
- Environ 380 Go via Hugging Face. Prévoyez 4-8 heures selon la connexion.
- Temps de chargement
- ~60 secondes la première fois (SSD → RAM). Instantané ensuite tant que le modèle reste en mémoire.
- Consommation en inférence
- ~150 W. Chauffe à 70-75 °C. Ventilateur audible mais pas bruyant (bien inférieur à un PC équivalent).
- Quand ça vaut le coup
- R&D, équipes qui veulent un modèle frontier 100 % offline, benchmark interne, datasets sensibles. Pour de la production, l'API cloud est plus économique.
#Mac Studio vs PC 2× RTX 5090
- Prix 2026
- Mac Studio M3 Ultra 512 Go : ~11 300 €. PC 2× RTX 5090 + plateforme : ~8500 €.
- Mémoire utile pour LLM
- Mac : 512 Go unifiée. PC : 2 × 32 Go VRAM = 64 Go. Pour du 400B+ (Maverick 402B, DeepSeek 671B), le PC ne peut tout simplement pas charger le modèle.
- Vitesse sur un ~30B (Qwen 3.6 35B-A3B)
- PC 5090 duo : ~120 tok/s (CUDA, tient en VRAM). Mac M3 Ultra : ~70 tok/s. Avantage PC sur ce qui rentre en VRAM.
- Vitesse sur DeepSeek 671B / Maverick 402B
- Mac : 16-34 tok/s (MoE). PC : impossible sans offload CPU massif (< 2 tok/s).
- Consommation
- Mac Studio : 150 W en pic. PC 2× 5090 : 900 W max. Compter 3× la facture électrique côté PC.
- Bruit
- Mac : audible léger. PC 2× 5090 : très bruyant (ventilos GPU à fond).
- Verdict
- Le Mac Studio gagne sur capacité (modèles 200B+) et efficience. Le PC gagne sur vitesse pure sur les modèles qui tiennent en VRAM (≤ ~30 Go). Choisissez selon votre profil de modèles cible.
#Questions fréquentes
Quel Mac Studio pour gpt-oss 120B ?+
Le Mac Studio M3 Ultra 512 Go vaut-il 11 000 € ?+
Mac Studio M3 Ultra 256 Go ou 512 Go ?+
Peut-on mettre un Mac Studio en rack serveur ?+
Le Mac Studio M4 Max vaut-il mieux qu'un MBP M4 Max ?+
Quelle est la durée de vie attendue d'un Mac Studio en inférence 24/7 ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.