Avancé 13 minMac Studio

Quel LLM sur Mac Studio (M2 / M3 / M4 Ultra, 64–512 Go) ?

Le Mac Studio (M2 Ultra, M3 Ultra, M4 Max) est en 2026 la seule machine grand public au monde capable de faire tourner localement des modèles de plus de 200 milliards de paramètres. Le M3 Ultra 512 Go (sorti début 2025) pousse la mémoire unifiée à 512 Go pour environ 11 000 € — assez pour Llama 4 Maverick 402B en Q4 ou DeepSeek V3 671B en Q4. Ce guide détaille chaque configuration et ses cas d'usage.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur macOS 14+

#Mac Studio en 2026

Mac Studio M2 Ultra (2023)
24 cœurs CPU + 60 ou 76 cœurs GPU, 800 Go/s, RAM 64/128/192 Go. Toujours disponible d'occasion à partir de 2800 €.
Mac Studio M4 Max (2025)
16 cœurs CPU + 40 cœurs GPU, 546 Go/s, RAM 36-128 Go. Remplace le M2 Max. À partir de 2299 €.
Mac Studio M3 Ultra (2025)
28 cœurs CPU + 60 ou 80 cœurs GPU, 800 Go/s, RAM 96/256/512 Go. Le monstre. De 4499 € (96 Go) à 11 299 € (512 Go).
Consommation
15 W idle, 70-130 W en inférence selon config. Le M3 Ultra 512 Go pic à ~150 W en 405B.
La carte mémoire est le vrai produit
Le Mac Studio M3 Ultra n'est pas seulement un ordinateur rapide : c'est la seule machine « grand public » à offrir 512 Go de RAM accessible par le GPU. Aucun PC, même à 20 000 €, ne propose ça nativement. Pour qui veut faire du 400B+ en local, il n'y a pas d'alternative.

#1. M2 Ultra vs M3 Ultra vs M4 Max

M4 Max
Entry-level du Mac Studio. 546 Go/s, 128 Go max. Mieux qu'un MBP M4 Max : pas de throttle, moins cher (boîtier desktop).
M2 Ultra
Première génération Ultra. 800 Go/s, jusqu'à 192 Go. Occasion entre 2800-4500 €. Toujours compétitif pour 70B-123B.
M3 Ultra
Dernier Ultra (2025). 800 Go/s identique à M2 Ultra, mais architecture M3 (+20 % en pratique). 96 à 512 Go RAM. Pour qui veut pousser au-delà de 200B.
!
Pourquoi pas de M4 Ultra en 2026 ?
Apple n'a pas sorti de M4 Ultra. La gamme M4 s'arrête au Max. Pour un Ultra, il faut aller chercher le M3 Ultra (mars 2025) — qui reste l'offre haut de gamme Apple en 2026.

#2. Jusqu'où pousser la RAM ?

96 Go (M3 Ultra base)
4499 €. Fait tourner gpt-oss 120B (MXFP4, 63 Go) à ~50 tok/s et les MoE ~30B (Qwen 3.6 35B-A3B) à ~70 tok/s, avec de la marge pour un contexte long. Sweet spot pour les gros MoE jusqu'à ~120B.
256 Go (M3 Ultra + 256)
7299 €. Ouvre Llama 4 Maverick 402B Q4 (230 Go) à ~34 tok/s et DeepSeek V3 671B Q2 (~240 Go). Pour qui veut du 400B+.
512 Go (M3 Ultra max)
11 299 €. DeepSeek V3 671B Q4 (380 Go) passe, Qwen3-235B-A22B en Q8, contexte 128k+ sur les gros MoE. Territoire recherche/R&D.
192 Go (M2 Ultra max)
Charge Qwen3-235B-A22B Q4 (133 Go) et Maverick 402B en Q3. Équivalent fonctionnel du 256 Go M3 Ultra pour un peu moins cher d'occasion. Bon compromis.

#3. Modèles exclusifs Ultra

Modèles que seul un Mac Studio Ultra peut charger confortablement
ModèleQuantRAM requiseM2 Ultra 192M3 Ultra 256M3 Ultra 512
gpt-oss 120BMXFP463 Go✓ 42 t/s✓ 50 t/s✓ 50 t/s
Qwen3-235B-A22BQ4_K_M133 Go✓ 26 t/s✓ 30 t/s✓ 30 t/s
Llama 4 Maverick 402BQ4_K_M230 Go✓ 34 t/s✓ 34 t/s
Llama 4 Maverick 402BQ8_0410 Go✓ 22 t/s
DeepSeek V3 671BQ2_K240 Go✓ 20 t/s✓ 20 t/s
DeepSeek V3 671BQ4_K_M380 Go✓ 16 t/s

#4. Benchmarks 120B, 235B, 671B

Ordres de grandeur, Mac Studio M3 Ultra 80-core GPU 512 Go (llama.cpp Metal, contexte 16k)
ModèleQ4_K_MQ5_K_MQ6_KFlash Attn 16k
gpt-oss 120B50 t/s48 t/s
Qwen3-235B-A22B30 t/s28 t/s26 t/s27 t/s
Llama 4 Maverick 402B34 t/s30 t/s28 t/s31 t/s
DeepSeek V3 671B16 t/s14 t/s15 t/s

#5. Setup workstation LLM

Setup Mac Studio M3 Ultra 512 Go
# Ollama + optimisations max
brew install --cask ollama

launchctl setenv OLLAMA_FLASH_ATTENTION 1
launchctl setenv OLLAMA_KV_CACHE_TYPE q8_0
launchctl setenv OLLAMA_NUM_PARALLEL 4
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"

# Relever mémoire GPU à 480 Go (sur 512 Go)
sudo sysctl iogpu.wired_limit_mb=491520
echo "iogpu.wired_limit_mb=491520" | sudo tee -a /etc/sysctl.conf

brew services start ollama

# Pour DeepSeek V3 671B : passer par llama.cpp maison
git clone https://github.com/ggerganov/llama.cpp && cd llama.cpp
make GGML_METAL=1 LLAMA_METAL_EMBED_LIBRARY=1

# Lancement
./build/bin/llama-server \
  -m ./models/DeepSeek-V3-671B-Q4_K_M.gguf \
  -ngl 99 -fa -c 16384 \
  -ctk q8_0 -ctv q8_0 \
  --host 0.0.0.0 --port 8080

#6. DeepSeek V3 671B sur M3 Ultra 512 Go

C'est le cas d'usage flagship du Mac Studio 512 Go. Le modèle fait 380 Go en Q4_K_M, tient en RAM sur la config 512 Go, contexte 16k à ~16 tok/s (MoE, ~37B de paramètres actifs sur 671B). Qualité proche des meilleurs modèles propriétaires sur la plupart des tâches.

Téléchargement
Environ 380 Go via Hugging Face. Prévoyez 4-8 heures selon la connexion.
Temps de chargement
~60 secondes la première fois (SSD → RAM). Instantané ensuite tant que le modèle reste en mémoire.
Consommation en inférence
~150 W. Chauffe à 70-75 °C. Ventilateur audible mais pas bruyant (bien inférieur à un PC équivalent).
Quand ça vaut le coup
R&D, équipes qui veulent un modèle frontier 100 % offline, benchmark interne, datasets sensibles. Pour de la production, l'API cloud est plus économique.

#Mac Studio vs PC 2× RTX 5090

Prix 2026
Mac Studio M3 Ultra 512 Go : ~11 300 €. PC 2× RTX 5090 + plateforme : ~8500 €.
Mémoire utile pour LLM
Mac : 512 Go unifiée. PC : 2 × 32 Go VRAM = 64 Go. Pour du 400B+ (Maverick 402B, DeepSeek 671B), le PC ne peut tout simplement pas charger le modèle.
Vitesse sur un ~30B (Qwen 3.6 35B-A3B)
PC 5090 duo : ~120 tok/s (CUDA, tient en VRAM). Mac M3 Ultra : ~70 tok/s. Avantage PC sur ce qui rentre en VRAM.
Vitesse sur DeepSeek 671B / Maverick 402B
Mac : 16-34 tok/s (MoE). PC : impossible sans offload CPU massif (< 2 tok/s).
Consommation
Mac Studio : 150 W en pic. PC 2× 5090 : 900 W max. Compter 3× la facture électrique côté PC.
Bruit
Mac : audible léger. PC 2× 5090 : très bruyant (ventilos GPU à fond).
Verdict
Le Mac Studio gagne sur capacité (modèles 200B+) et efficience. Le PC gagne sur vitesse pure sur les modèles qui tiennent en VRAM (≤ ~30 Go). Choisissez selon votre profil de modèles cible.

#Questions fréquentes

Quel Mac Studio pour gpt-oss 120B ?+
Le modèle fait 63 Go en MXFP4 : il faut au minimum un M3 Ultra 96 Go (4499 € neuf) — un M2 Ultra 64 Go ne laisse pas assez de marge pour le contexte. Comptez ~50 tok/s, avec de la place pour un contexte long 128k.
Le Mac Studio M3 Ultra 512 Go vaut-il 11 000 € ?+
Pour un chercheur, une équipe R&D, une entreprise qui traite des données sensibles à ne pas envoyer sur le cloud : absolument. Aucun concurrent ne fait tourner Llama 4 Maverick 402B ou DeepSeek 671B en local à ce prix. Pour un particulier, c'est probablement surdimensionné — un M4 Max 128 Go suffit à 95 % des usages.
Mac Studio M3 Ultra 256 Go ou 512 Go ?+
256 Go (7299 €) si votre cible max est Llama 4 Maverick 402B Q4 (230 Go) ou DeepSeek V3 Q2. 512 Go (11299 €) si vous voulez Maverick en Q8 ou DeepSeek V3 Q4 (380 Go). L'écart de 4000 € ne se justifie que si vous poussez vraiment au-delà de 400B.
Peut-on mettre un Mac Studio en rack serveur ?+
Oui, existe des solutions rack 19" accueillant 2 à 4 Mac mini/Studio. Marques : Sonnet, MacStadium. Utile si vous hébergez un cluster LLM pour une équipe.
Le Mac Studio M4 Max vaut-il mieux qu'un MBP M4 Max ?+
Même puce, même perf. Mac Studio gagne sur le prix (pas d'écran ni clavier ni batterie à payer) et sur l'absence totale de throttle — inférence soutenue 24/7 possible. MBP gagne sur la portabilité. Pour un usage sédentaire, Studio sans hésiter.
Quelle est la durée de vie attendue d'un Mac Studio en inférence 24/7 ?+
Apple ne communique pas de chiffre officiel, mais les retours communautaires indiquent 5-8 ans sans problème matériel en inférence continue. Le composant le plus à risque est le SSD (endurance écriture), mais les modèles LLM sont lus et rarement écrits — usure SSD minime.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.