◆ Mac — L'IA locale sur ton Mac, à fond — mémoire unifiée, MLX, le bon modèle pour ta puce · 24 € · ou tous les kits 49 € →

Outil · Apple Silicon M1 à M6

Quel LLM peut tourner sur mon Mac ?

Choisissez votre puce et votre mémoire : l'outil liste les modèles du catalogue qui tiennent, avec la quantification à utiliser et la vitesse à attendre.

Votre Mac

Chargement du catalogue…

Ce qui tourne selon la mémoire de votre Mac

La mémoire unifiée est partagée entre macOS et les modèles. Par défaut, le GPU peut en utiliser environ deux tiers jusqu'à 32 Go, trois quarts au-delà. Suggestion : le modèle le plus gros et le plus récent qui tient en Q4 avec un contexte de 8K.

MémoireUtilisableSuggestion (Q4)
8 Go≈ 5,4 GoGranite 4.0 H-Tiny 7B-A1B · classement 8 Go
16 Go≈ 11 GoNemotron 3 Super 12B · classement 16 Go
24 Go≈ 16 GoDevstral Small 2 24B · classement 24 Go
32 Go≈ 21 GoLaguna XS.2 · classement 32 Go
36 Go≈ 27 GoQwen 3.6 35B-A3B
48 Go≈ 36 GoQwen 3.6 35B-A3B · classement 48 Go
64 Go≈ 48 GoNemotron 3 Puzzle 75B-A9B · classement 64 Go
96 Go≈ 72 GoLaguna S 2.1 · classement 96 Go
128 Go≈ 96 GoMistral Medium 3.5 128B · classement 128 Go
192 Go≈ 144 GoMiniMax-M2.7
256 Go≈ 192 GoGLM 5.3 Flash 320B-A18B
512 Go≈ 384 GoNemotron 3 Ultra (BF16)

La vitesse dépend de la puce

À chaque mot généré, le Mac relit tout le modèle en mémoire : la bande passante fixe donc le plafond de vitesse. À mémoire égale, une puce Max ou Ultra va plusieurs fois plus vite qu'une puce de base.

PuceBande passanteMémoires proposées
M168 Go/s8, 16 Go
M1 Pro200 Go/s16, 32 Go
M1 Max400 Go/s32, 64 Go
M1 Ultra800 Go/s64, 128 Go
M2100 Go/s8, 16, 24 Go
M2 Pro200 Go/s16, 32 Go
M2 Max400 Go/s32, 64, 96 Go
M2 Ultra800 Go/s64, 128, 192 Go
M3100 Go/s8, 16, 24 Go
M3 Pro150 Go/s18, 36 Go
M3 Max300 à 400 Go/s36, 48, 64, 96, 128 Go
M3 Ultra819 Go/s96, 256, 512 Go
M4120 Go/s16, 24, 32 Go
M4 Pro273 Go/s24, 48, 64 Go
M4 Max410 à 546 Go/s36, 48, 64, 128 Go
M5153 Go/s16, 24, 32 Go
M5 Pro307 Go/s24, 48, 64 Go
M5 Max460 à 614 Go/s36, 48, 64, 96, 128 Go
M5 Ultra1200 Go/s96, 256, 512 Go
M6170 Go/s16, 24, 32 Go

Deux valeurs : la version à moins de cœurs GPU (et moins de mémoire) a une bande passante plus faible. Sources : fiches techniques Apple ; M5 et M6 : nos fiches Mac Studio M5 et Mac mini M6.

Questions fréquentes

Un Mac avec 8 Go peut-il faire tourner un LLM ?

Oui, mais seulement de petits modèles : environ 5 Go sont utilisables par les modèles, ce qui laisse la place à un modèle de 3 à 4 milliards de paramètres en Q4 (Qwen 3 4B, Gemma 3 4B). À partir de 16 Go, les modèles de 7-8B deviennent confortables.

Quelle part de la mémoire unifiée le GPU peut-il utiliser ?

Par défaut, macOS réserve environ un tiers de la mémoire au système sur les Mac jusqu'à 32 Go, un quart au-delà. Un Mac de 24 Go offre donc environ 16 Go aux modèles, un Mac de 96 Go environ 72 Go. La commande sysctl iogpu.wired_limit_mb permet de relever cette limite, en laissant assez de mémoire à macOS.

Pourquoi deux Mac de même mémoire n’ont-ils pas la même vitesse ?

Parce que la vitesse de génération dépend surtout de la bande passante mémoire : 120 Go/s sur un M4, 273 Go/s sur un M4 Pro, 546 Go/s sur un M4 Max. À chaque mot, la machine relit tout le modèle. Un M4 Max va donc environ 4 fois plus vite qu'un M4 sur un modèle qui tient dans les deux.

MLX, Ollama ou LM Studio sur Mac ?

Les trois fonctionnent. MLX, le framework d'Apple, est souvent le plus rapide sur Apple Silicon ; LM Studio le propose avec une interface graphique ; Ollama est le plus simple en ligne de commande et s'intègre à de nombreux outils.

Plus d'outils gratuits