Intermédiaire 12 minQwen

Qwen3 32B sur Mac M1/M2 : mémoire et réglages MLX

Réponse directe

Qwen3 32B tient en 18,4 Go de RAM en version MLX 4-bit officielle, plus le contexte utilisé : comptez au moins 24 à 32 Go de mémoire unifiée pour un usage confortable sans swap. Un Mac M1 ou M2 de base (8 ou 16 Go) ne suffit pas ; il faut une puce Pro, Max ou Ultra.

Qwen3 32B est un modèle dense de 32,8 milliards de paramètres, avec un contexte natif de 32 768 tokens extensible à 131 072 via YaRN. Sur Mac, la question n'est pas seulement « est-ce que ça charge ? » mais « avec quelle mémoire réellement libre, quelle quantification et quel contexte ? ». Ce guide détaille les chiffres vérifiables pour un Mac M1 ou M2, sans supposer une compatibilité qui n'existe pas sur les configurations les plus modestes.

Par Mohamed Meguedmi·Màj 2026-09-28·Testé sur Windows, macOS, Linux

#Mémoire unifiée réellement nécessaire

Le point de départ est le poids du modèle quantifié, pas le nombre de paramètres. La version MLX 4-bit publiée par la communauté mlx-community pèse 18,4 Go sur disque et en mémoire au chargement. Sur un Mac, la mémoire unifiée est partagée entre le système, les applications ouvertes et le modèle : réserver uniquement 18,4 Go de RAM totale ne laisse aucune marge pour le système ni pour le contexte de conversation.

Mémoire unifiée à prévoir pour Qwen3 32B
ConfigurationFaisabilitéRemarque
16 Go de RAM unifiéeNon réalisteLe modèle seul (18,4 Go en 4-bit) dépasse déjà la RAM totale.
24 Go de RAM unifiéePossible, contexte courtMarge réduite pour le système et le KV cache ; à réserver à un usage ponctuel.
32 Go de RAM unifiéeConfortableMarge suffisante pour un contexte moyen sans swap fréquent.
64 Go ou plusÀ l'aisePermet un contexte long et de garder d'autres applications ouvertes.

#Quelle puce M1/M2 pour 32B ?

Le kit Mac

L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Un MacBook Air ou Pro M1 ou M2 « de base » est vendu avec 8 ou 16 Go de mémoire unifiée : insuffisant pour Qwen3 32B, même en 4-bit. Il faut viser une puce M1 Pro/Max/Ultra ou M2 Pro/Max/Ultra, configurée avec au moins 32 Go de mémoire unifiée, pour disposer d'une marge raisonnable une fois le système et le contexte pris en compte. Ce n'est pas une question de puissance de calcul du GPU : c'est une question de quantité de mémoire physiquement présente sur la machine, qui ne s'augmente pas après achat.

!
Objection : « ma machine affiche 16 Go, ça devrait passer en swap »
Techniquement, macOS peut utiliser le SSD comme mémoire d'appoint (swap), mais les débits d'un SSD sont sans commune mesure avec ceux de la mémoire unifiée : un modèle qui swappe massivement devient inutilisable en pratique, avec des temps de réponse qui se comptent en minutes plutôt qu'en secondes. Ce n'est pas une option viable pour un usage régulier.

#MLX ou llama.cpp/Ollama ?

MLX est le framework développé pour tirer parti de l'architecture mémoire unifiée d'Apple Silicon ; llama.cpp (et Ollama, qui s'appuie dessus) reste une alternative solide, avec un écosystème de quantifications GGUF plus large et une prise en main plus simple pour qui connaît déjà Ollama sur d'autres machines. Pour Qwen3 32B en particulier, la version MLX 4-bit officielle de la communauté mlx-community est directement comparable en taille (18,4 Go) aux quantifications GGUF équivalentes : le choix dépend surtout de l'outil que vous maîtrisez déjà, pas d'un écart de faisabilité.

Choisir MLX
Si vous êtes déjà dans l'écosystem Python/Hugging Face et voulez la conversion la plus proche de l'architecture Apple Silicon.
Choisir Ollama/llama.cpp
Si vous voulez une commande unique, un serveur local standard, et une compatibilité avec les mêmes outils que sur PC/Linux.

#Installer avec MLX, pas à pas

  1. 01
    Vérifier la mémoire disponible
    Dans le Moniteur d'activité (onglet Mémoire), noter la mémoire réellement libre avant de lancer quoi que ce soit, pas seulement la RAM totale annoncée par la machine.
  2. 02
    Installer mlx-lm
    Installer le paquet Python mlx-lm dans un environnement dédié, plutôt que globalement, pour éviter les conflits de versions.
  3. 03
    Télécharger la version 4-bit
    Récupérer mlx-community/Qwen3-32B-4bit plutôt qu'une version non quantifiée, pour limiter l'empreinte mémoire au chargement.
  4. 04
    Lancer avec un contexte réduit d'abord
    Démarrer avec un contexte court (4 000 à 8 000 tokens) pour valider que le modèle charge et répond, avant d'augmenter progressivement selon la mémoire restante observée.

#Le réglage mémoire GPU macOS (non officiel)

Sur Apple Silicon, macOS réserve par défaut une partie de la mémoire unifiée hors d'atteinte du GPU : Metal expose une taille de travail recommandée d'environ 75 % de la RAM totale. Un réglage système, iogpu.wired_limit_mb, permet techniquement de relever ce plafond. Ce n'est toutefois pas un réglage documenté officiellement par Apple : c'est une pratique connue de la communauté technique, non supportée, susceptible de changer ou de casser à une prochaine mise à jour de macOS.

Relever le plafond mémoire GPU (non officiel, à vos risques)
sudo sysctl iogpu.wired_limit_mb=26624

La valeur est en mégaoctets et doit rester sous la mémoire physique : comptez la RAM totale moins 6 à 8 Go pour macOS. L'exemple ci-dessus vise un Mac de 32 Go (26 624 Mo, soit 26 Go pour le GPU) ; sur un Mac de 64 Go, 57 344 Mo laisse la même marge. Les notes qui circulent avec 122 880 Mo visent une machine de 128 Go : recopiée telle quelle sur un M1 ou un M2 de 32 Go, cette valeur dépasserait la mémoire installée.

i
À garder en tête
Ce réglage revient à la valeur par défaut après redémarrage sauf persistance manuelle, et Apple ne garantit aucune stabilité pour cette configuration. À réserver aux utilisateurs prêts à surveiller la pression mémoire du système et à revenir en arrière en cas d'instabilité.

#Mode réflexion : un coût mémoire indirect

Qwen3-32B propose un mécanisme de bascule entre un mode réflexion, qui génère un raisonnement interne avant la réponse finale, et un mode direct. Ce choix se fait via le paramètre enable_thinking ou les balises /think et /no_think selon l'outil utilisé. Sur une machine à la limite de sa mémoire, le mode réflexion a un effet indirect mais réel : chaque token de raisonnement généré avant la réponse finale s'ajoute au contexte de la conversation en cours, donc au KV cache qui grandit avec elle. Sur un Mac à 24-32 Go, désactiver le mode réflexion pour les questions simples limite la croissance du contexte et réduit le risque de saturation mémoire en session longue.

→
Objection : « le mode réflexion améliore la qualité, pourquoi le désactiver ? »
Il ne s'agit pas de le désactiver systématiquement, mais de l'activer quand la tâche le justifie (raisonnement multi-étapes, calcul, code complexe) et de rester en mode direct pour les échanges courts, où le gain de qualité est marginal face au coût en tokens et en mémoire.

#Erreurs de swap et signes de saturation

Le symptôme le plus clair d'une mémoire insuffisante n'est pas un message d'erreur explicite, mais un ralentissement brutal : le système entier devient lent, pas seulement le modèle, parce que macOS commence à écrire en swap sur le SSD. Dans le Moniteur d'activité, l'indicateur de pression mémoire qui passe au orange ou au rouge pendant le chargement du modèle est le signal à surveiller avant même d'attendre la première réponse.

Pression mémoire orange/rouge au chargement
Réduire la taille du contexte demandé, ou passer à une quantification plus légère si disponible.
Le modèle charge mais la première réponse met plusieurs minutes
Signe de swap actif : fermer les applications gourmandes en mémoire avant de relancer.
Échec de chargement immédiat
La mémoire unifiée totale de la machine est probablement insuffisante pour cette taille de modèle, quantification comprise.

#Contexte long : le vrai coût mémoire

Le contexte natif de 32 768 tokens de Qwen3-32B, extensible à 131 072 via YaRN, n'est pas gratuit en mémoire : chaque token de contexte réellement utilisé alimente un cache (KV cache) qui grandit avec la conversation. Sur une machine à la limite (24 à 32 Go), privilégier un contexte modéré (8 000 à 16 000 tokens) laisse une marge de sécurité ; réserver l'extension à 131 072 tokens aux machines disposant de 64 Go ou plus de mémoire unifiée, où la marge après chargement du modèle reste confortable.

Questions fréquentes
Un Mac M1 8 Go peut-il faire tourner Qwen3 32B ?+
Non. La version 4-bit du modèle pèse déjà 18,4 Go, soit plus que la mémoire totale d'un Mac 8 ou 16 Go. Il faut au minimum une configuration à 24-32 Go, idéalement une puce Pro/Max/Ultra à 32 Go ou plus.
Faut-il choisir MLX ou Ollama pour Qwen3 32B sur Mac ?+
Les deux fonctionnent avec des tailles de fichiers comparables. MLX est pensé nativement pour Apple Silicon ; Ollama/llama.cpp offre une prise en main plus simple si vous l'utilisez déjà sur d'autres machines. Le choix ne change pas la mémoire minimale nécessaire.
Le réglage iogpu.wired_limit_mb est-il sûr ?+
Ce n'est pas un réglage documenté officiellement par Apple : il fonctionne en pratique mais reste non supporté, peut être modifié par une future mise à jour de macOS, et doit être surveillé via l'indicateur de pression mémoire du Moniteur d'activité.
Quel contexte utiliser sur une machine à 32 Go ?+
Un contexte modéré, entre 8 000 et 16 000 tokens, laisse une marge de sécurité suffisante après le chargement du modèle en 4-bit. Réserver le contexte étendu à 131 072 tokens aux machines à 64 Go ou plus.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.