Débutant 9 minMacBook Air

Quel LLM sur MacBook Air M1 (8 / 16 Go) ?

Sorti fin 2020, le MacBook Air M1 reste en 2026 une machine parfaitement viable pour l'IA locale, à condition de choisir les bons modèles. Sa mémoire unifiée (8 ou 16 Go), son GPU Apple Silicon et son architecture sans ventilateur changent les règles : un 7B Mistral y tourne à 15-25 tokens/seconde, plus vite qu'un CPU PC récent. Voici comment en tirer le meilleur.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#Le MacBook Air M1 en 2026

Le MacBook Air M1 a 5 ans et se vend encore neuf à 999 € ou d'occasion autour de 500 €. Pour l'IA locale, c'est la meilleure porte d'entrée : Apple Silicon de première génération, Metal déjà mature, mémoire unifiée, et surtout un silence total grâce à son design sans ventilateur.

Puce
Apple M1 (2020), 8 cœurs CPU + 7 ou 8 cœurs GPU selon config.
Bande passante mémoire
68,25 Go/s (LPDDR4X). C'est la principale limite pour les gros modèles.
RAM disponible
8 Go ou 16 Go (non upgradable). Le choix que vous avez fait à l'achat détermine ce qui est possible.
Refroidissement
Passif. Après ~10 minutes d'inférence intensive, la puce throttle de 20-30 %.
Support Apple
macOS Sequoia (15) toujours supporté en 2026. Au-delà, Apple peut arrêter le support.
Pourquoi c'est toujours une bonne machine
Un M1 fanless fait tourner Mistral 7B à 15-20 tok/s en consommant 15 W. Un laptop PC équivalent en vitesse consomme 3× plus, chauffe, ventile, et coûte plus cher d'occasion.

#1. Votre RAM : 8 ou 16 Go ?

La quantité de RAM détermine tout. Sur Mac, le GPU et le CPU partagent la même RAM — mais macOS en réserve une bonne partie pour le système et vos apps.

MBA M1 8 Go
~4-5 Go utilisables pour un LLM. Ouvre Mistral 7B Q4 (tout juste), Qwen 2.5 3B Q5, Llama 3.2 1B/3B. Fermez Chrome pendant l'inférence.
MBA M1 16 Go
~10-11 Go utilisables. Confortable pour 7B Q5, envisageable pour Mistral Small 8B, Qwen 7B. Pas de 13B.
!
Swap = danger sur Air M1
Si macOS swape plus de 3-4 Go, votre SSD souffre (l'Air M1 a un SSD relativement lent en écriture) et la vitesse d'inférence chute. Surveillez avec top -o mem : si SWAP actif > 5 Go, réduisez la taille du modèle.

#2. Les modèles qui tournent vraiment

Modèles recommandés par config — tokens/sec mesurés sur Air M1 8-core GPU
ModèleQuantizationRAM requiseTokens/s (8 Go)Tokens/s (16 Go)
Llama 3.2 1BQ8_01,5 Go55-6560-70
Qwen 2.5 3BQ4_K_M2,2 Go30-4035-45
Gemma 3 4BQ4_K_M2,8 Go22-2828-35
Mistral 7B InstructQ4_K_M4,4 Go14-1818-22
Llama 3.1 8BQ4_K_M4,9 Go14-18
Qwen 2.5 7BQ5_K_M5,4 Go12-16
Phi-4 14BQ3_K_M6,8 Go7-9 (limite)
Modèle de démarrage conseillé
Sur 8 Go : Qwen 2.5 3B (ollama run qwen2.5:3b). Sur 16 Go : Mistral 7B (ollama run mistral). Ces deux couvrent 80 % des usages courants (résumé, rédaction, code simple).

#3. Installation en 3 minutes

Ollama est la voie la plus simple. Il détecte Metal tout seul et gère les téléchargements.

  1. 01
    Installez Ollama via Homebrew
    Si Homebrew n'est pas présent, téléchargez le .dmg sur ollama.com. Sinon, une commande suffit.
  2. 02
    Lancez un modèle adapté à votre RAM
    Air 8 Go : ollama run qwen2.5:3b. Air 16 Go : ollama run mistral. Le premier téléchargement prend 2-5 minutes, les suivants sont instantanés.
  3. 03
    Vérifiez l'accélération Metal
    Une fois le modèle chargé, ouvrez un autre terminal et tapez ollama ps. La colonne PROCESSOR doit afficher 100% GPU.
  4. 04
    Ajoutez une interface graphique (optionnel)
    Enchanted (App Store, gratuit) ou Msty (.dmg). Les deux se connectent à Ollama sans config.
Terminal — installation complète
# Installation
brew install --cask ollama
brew services start ollama

# Premier modèle (Air 16 Go)
ollama run mistral

# Vérification du GPU
ollama ps
i
Si vous venez d'un PC
Pas besoin de drivers, pas de CUDA, pas de configuration de VRAM. Metal est activé par défaut et tout est géré par macOS. C'est le principal argument du Mac pour l'IA locale.

#4. Tokens/seconde mesurés

Mesures effectuées sur un MacBook Air M1 8-core GPU, 16 Go, macOS Sequoia 15.3, Ollama 0.5.x. Prompt : "Écris un paragraphe de 200 mots sur l'intelligence artificielle locale." Moyenne sur 5 runs.

Prompt 200 tokens en sortie
ModèleQ4_K_MQ5_K_MQ8_0
Llama 3.2 1B62 t/s55 t/s48 t/s
Qwen 2.5 3B38 t/s34 t/s25 t/s
Gemma 3 4B30 t/s27 t/s19 t/s
Mistral 7B19 t/s17 t/s11 t/s
Llama 3.1 8B16 t/s14 t/s9 t/s
i
Pourquoi Q4 > Q8 ici
La bande passante mémoire (68 Go/s) est le goulot d'étranglement du M1. Un modèle Q4 est 2× plus petit en mémoire qu'un Q8, donc 2× plus rapide à lire. La perte de qualité est négligeable sur 7B et moins.

#5. Quelle quantization choisir

⭐ Q4_K_M
Le défaut pour M1. Meilleur compromis taille/qualité/vitesse. À privilégier sauf raison contraire.
Q5_K_M
+5 % qualité, -15 % vitesse. Intéressant sur 16 Go si le modèle reste dans la RAM utile.
Q3_K_M
Pour caser un 14B sur 16 Go. Qualité notable en baisse — à réserver aux cas où rien d'autre ne passe.
FP16 / Q8_0
À éviter sur M1. La bande passante n'est pas adaptée, la vitesse tombe et vous perdez sans gain net.

#6. Gérer la chauffe (fanless)

Le MacBook Air M1 n'a pas de ventilateur. En inférence soutenue, la puce monte à 85-95 °C et throttle automatiquement après 8-12 minutes. Pour un chat ponctuel, aucun souci. Pour un batch d'embeddings d'une heure, c'est différent.

Surélevez la machine
Un simple support à 10 € (laptop stand) améliore la dissipation de 10-15 °C, donc repousse le throttle.
Travaillez dans une pièce fraîche
À 20 °C ambiante vs 28 °C, vous gagnez 5 minutes avant throttle. Réel.
Fermez les apps Electron
Chrome, VS Code, Slack consomment du CPU et contribuent à la chauffe. Sur Air M1, chaque watt compte.
Évitez le Q8
Les quantizations plus compactes (Q4) chauffent moins à qualité comparable.
Monitoring en direct
Téléchargez TG Pro ou stats (gratuit, open source) pour surveiller la température en barre de menus. Au-delà de 95 °C soutenu, coupez l'inférence 2 minutes pour laisser refroidir.

#Limites à connaître

Pas de modèles 70B
Même Q2, un 70B ne rentre pas. Pour ça, un M1 Max ou ultérieur est nécessaire.
Pas d'entraînement sérieux
Le fine-tuning LoRA est théoriquement possible mais lent. Préférez un service cloud ponctuel.
Context window limité
Au-delà de 8 k tokens, la RAM explose. Restez sur 4-8 k sauf si vous quantifiez le KV cache.
Pas de vision rapide
Les modèles multimodaux (Llama 3.2 Vision 11B, Qwen-VL) tournent mais lentement. Utilisez la version 3B si possible.

#Questions fréquentes

Un MacBook Air M1 8 Go suffit-il pour un LLM local ?+
Oui, pour démarrer avec des modèles 1B à 3B (Llama 3.2, Qwen 2.5, Gemma 3). Mistral 7B Q4 passe tout juste si vous fermez les autres apps, mais c'est serré. Pour un usage confortable, 16 Go est recommandé — sinon limitez-vous aux 3B.
Quelle différence de vitesse entre M1 8-core GPU et 7-core GPU ?+
Environ 10-12 % en faveur du 8-core sur des modèles 7B. Sur 1B-3B, la différence est négligeable car c'est la bande passante mémoire qui limite, pas les cœurs GPU. Ne changez pas de machine pour ça.
Peut-on faire du RAG sur MacBook Air M1 ?+
Oui — c'est même un excellent cas d'usage. Un modèle d'embeddings BGE-M3 + Mistral 7B en reranker tournent confortablement sur 16 Go. Sur 8 Go, c'est jouable avec Qwen 3B et un embedder léger comme all-MiniLM-L6-v2.
Llama 3.3 70B peut-il tourner sur M1 16 Go ?+
Non. Même en Q2 (qualité fortement dégradée), le modèle fait plus de 20 Go. Sur Air M1, la limite pratique est un 7B Q5 ou un 8B Q4.
Faut-il préférer Ollama, LM Studio ou MLX sur M1 ?+
Ollama pour la simplicité, LM Studio si vous voulez une UI riche, MLX si vous êtes curieux des formats Apple. Sur 8 Go, LM Studio consomme un peu plus de RAM qu'Ollama (environ 400 Mo de plus) — un détail qui compte.
Le MacBook Air M1 va-t-il devenir obsolète pour l'IA bientôt ?+
Les modèles 3B-7B resteront largement utiles en 2027-2028. Apple supportera macOS sur M1 au moins jusqu'en 2027. La vraie limite viendra plus probablement de modèles qui exigeront plus de 16 Go de RAM unifiée minimum.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.