Outil · Apple Silicon M1 à M6
Quel LLM peut tourner sur mon Mac ?
Choisissez votre puce et votre mémoire : l'outil liste les modèles du catalogue qui tiennent, avec la quantification à utiliser et la vitesse à attendre.
Votre Mac
Chargement du catalogue…
Ce qui tourne selon la mémoire de votre Mac
La mémoire unifiée est partagée entre macOS et les modèles. Par défaut, le GPU peut en utiliser environ deux tiers jusqu'à 32 Go, trois quarts au-delà. Suggestion : le modèle le plus gros et le plus récent qui tient en Q4 avec un contexte de 8K.
| Mémoire | Utilisable | Suggestion (Q4) |
|---|---|---|
| 8 Go | ≈ 5,4 Go | Granite 4.0 H-Tiny 7B-A1B · classement 8 Go |
| 16 Go | ≈ 11 Go | Nemotron 3 Super 12B · classement 16 Go |
| 24 Go | ≈ 16 Go | Devstral Small 2 24B · classement 24 Go |
| 32 Go | ≈ 21 Go | Laguna XS.2 · classement 32 Go |
| 36 Go | ≈ 27 Go | Qwen 3.6 35B-A3B |
| 48 Go | ≈ 36 Go | Qwen 3.6 35B-A3B · classement 48 Go |
| 64 Go | ≈ 48 Go | Nemotron 3 Puzzle 75B-A9B · classement 64 Go |
| 96 Go | ≈ 72 Go | Laguna S 2.1 · classement 96 Go |
| 128 Go | ≈ 96 Go | Mistral Medium 3.5 128B · classement 128 Go |
| 192 Go | ≈ 144 Go | MiniMax-M2.7 |
| 256 Go | ≈ 192 Go | GLM 5.3 Flash 320B-A18B |
| 512 Go | ≈ 384 Go | Nemotron 3 Ultra (BF16) |
La vitesse dépend de la puce
À chaque mot généré, le Mac relit tout le modèle en mémoire : la bande passante fixe donc le plafond de vitesse. À mémoire égale, une puce Max ou Ultra va plusieurs fois plus vite qu'une puce de base.
| Puce | Bande passante | Mémoires proposées |
|---|---|---|
| M1 | 68 Go/s | 8, 16 Go |
| M1 Pro | 200 Go/s | 16, 32 Go |
| M1 Max | 400 Go/s | 32, 64 Go |
| M1 Ultra | 800 Go/s | 64, 128 Go |
| M2 | 100 Go/s | 8, 16, 24 Go |
| M2 Pro | 200 Go/s | 16, 32 Go |
| M2 Max | 400 Go/s | 32, 64, 96 Go |
| M2 Ultra | 800 Go/s | 64, 128, 192 Go |
| M3 | 100 Go/s | 8, 16, 24 Go |
| M3 Pro | 150 Go/s | 18, 36 Go |
| M3 Max | 300 à 400 Go/s | 36, 48, 64, 96, 128 Go |
| M3 Ultra | 819 Go/s | 96, 256, 512 Go |
| M4 | 120 Go/s | 16, 24, 32 Go |
| M4 Pro | 273 Go/s | 24, 48, 64 Go |
| M4 Max | 410 à 546 Go/s | 36, 48, 64, 128 Go |
| M5 | 153 Go/s | 16, 24, 32 Go |
| M5 Pro | 307 Go/s | 24, 48, 64 Go |
| M5 Max | 460 à 614 Go/s | 36, 48, 64, 96, 128 Go |
| M5 Ultra | 1200 Go/s | 96, 256, 512 Go |
| M6 | 170 Go/s | 16, 24, 32 Go |
Deux valeurs : la version à moins de cœurs GPU (et moins de mémoire) a une bande passante plus faible. Sources : fiches techniques Apple ; M5 et M6 : nos fiches Mac Studio M5 et Mac mini M6.
Questions fréquentes
Un Mac avec 8 Go peut-il faire tourner un LLM ?
Oui, mais seulement de petits modèles : environ 5 Go sont utilisables par les modèles, ce qui laisse la place à un modèle de 3 à 4 milliards de paramètres en Q4 (Qwen 3 4B, Gemma 3 4B). À partir de 16 Go, les modèles de 7-8B deviennent confortables.
Quelle part de la mémoire unifiée le GPU peut-il utiliser ?
Par défaut, macOS réserve environ un tiers de la mémoire au système sur les Mac jusqu'à 32 Go, un quart au-delà. Un Mac de 24 Go offre donc environ 16 Go aux modèles, un Mac de 96 Go environ 72 Go. La commande sysctl iogpu.wired_limit_mb permet de relever cette limite, en laissant assez de mémoire à macOS.
Pourquoi deux Mac de même mémoire n’ont-ils pas la même vitesse ?
Parce que la vitesse de génération dépend surtout de la bande passante mémoire : 120 Go/s sur un M4, 273 Go/s sur un M4 Pro, 546 Go/s sur un M4 Max. À chaque mot, la machine relit tout le modèle. Un M4 Max va donc environ 4 fois plus vite qu'un M4 sur un modèle qui tient dans les deux.
MLX, Ollama ou LM Studio sur Mac ?
Les trois fonctionnent. MLX, le framework d'Apple, est souvent le plus rapide sur Apple Silicon ; LM Studio le propose avec une interface graphique ; Ollama est le plus simple en ligne de commande et s'intègre à de nombreux outils.