Quel LLM sur MacBook Air M1 (8 / 16 Go) ?
Sorti fin 2020, le MacBook Air M1 reste en 2026 une machine parfaitement viable pour l'IA locale, à condition de choisir les bons modèles. Sa mémoire unifiée (8 ou 16 Go), son GPU Apple Silicon et son architecture sans ventilateur changent les règles : un Granite 4.2 8B (5,3 Go) y tourne à 14-20 tokens/seconde, plus vite qu'un CPU PC récent. Voici comment en tirer le meilleur.
#Le MacBook Air M1 en 2026
Le MacBook Air M1 a 5 ans et se vend encore neuf à 999 € ou d'occasion autour de 500 €. Pour l'IA locale, c'est la meilleure porte d'entrée : Apple Silicon de première génération, Metal déjà mature, mémoire unifiée, et surtout un silence total grâce à son design sans ventilateur.
- Puce
- Apple M1 (2020), 8 cœurs CPU + 7 ou 8 cœurs GPU selon config.
- Bande passante mémoire
- 68,25 Go/s (LPDDR4X). C'est la principale limite pour les gros modèles.
- RAM disponible
- 8 Go ou 16 Go (non upgradable). Le choix que vous avez fait à l'achat détermine ce qui est possible.
- Refroidissement
- Passif. Après ~10 minutes d'inférence intensive, la puce throttle de 20-30 %.
- Support Apple
- macOS Sequoia (15) toujours supporté en 2026. Au-delà, Apple peut arrêter le support.
#1. Votre RAM : 8 ou 16 Go ?
La quantité de RAM détermine tout. Sur Mac, le GPU et le CPU partagent la même RAM — mais macOS en réserve une bonne partie pour le système et vos apps.
- MBA M1 8 Go
- ~4-5 Go utilisables pour un LLM. Ouvre Qwen 3.5 4B (confortable), Granite 4.2 3B, Qwen 3.5 2B. Gemma 4 E2B Q4 passe tout juste. Fermez Chrome pendant l'inférence.
- MBA M1 16 Go
- ~10-11 Go utilisables. Confortable pour Qwen 3.5 9B et Granite 4.2 8B, envisageable pour Gemma 4 12B. Pas de 24B.
#2. Les modèles qui tournent vraiment
| Modèle | Quantization | RAM requise | Tokens/s (8 Go) | Tokens/s (16 Go) |
|---|---|---|---|---|
| Qwen 3.5 2B | Q4_K_M | 1,9 Go | 46-54 | 52-60 |
| Granite 4.2 3B | Q4_K_M | 2,2 Go | 38-46 | 42-50 |
| Qwen 3.5 4B | Q4_K_M | 3,4 Go | 24-30 | 28-36 |
| Gemma 4 E2B | Q4_K_M | 4,3 Go | 18-23 | 24-30 |
| Granite 4.2 8B | Q4_K_M | 5,3 Go | — | 16-20 |
| Qwen 3.5 9B | Q4_K_M | 6,6 Go | — | 12-16 |
| Gemma 4 12B | Q4_K_M | 7,6 Go | — | 10-13 (limite) |
#3. Installation en 3 minutes
Ollama est la voie la plus simple. Il détecte Metal tout seul et gère les téléchargements.
- 01Installez Ollama via HomebrewSi Homebrew n'est pas présent, téléchargez le .dmg sur ollama.com. Sinon, une commande suffit.
- 02Lancez un modèle adapté à votre RAMAir 8 Go : ollama run qwen3.5:4b. Air 16 Go : ollama run qwen3.5:9b. Le premier téléchargement prend 2-5 minutes, les suivants sont instantanés.
- 03Vérifiez l'accélération MetalUne fois le modèle chargé, ouvrez un autre terminal et tapez ollama ps. La colonne PROCESSOR doit afficher 100% GPU.
- 04Ajoutez une interface graphique (optionnel)Enchanted (App Store, gratuit) ou Msty (.dmg). Les deux se connectent à Ollama sans config.
#4. Tokens/seconde mesurés
Ordres de grandeur relevés sur un MacBook Air M1 8-core GPU, 16 Go, macOS Sequoia 15.3, Ollama récent. Prompt : "Écris un paragraphe de 200 mots sur l'intelligence artificielle locale." Moyenne sur 5 runs.
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 3.5 2B | 54 t/s | 48 t/s | 42 t/s |
| Granite 4.2 3B | 46 t/s | 40 t/s | 30 t/s |
| Qwen 3.5 4B | 32 t/s | 28 t/s | 20 t/s |
| Granite 4.2 8B | 18 t/s | 16 t/s | 10 t/s |
| Qwen 3.5 9B | 14 t/s | 12 t/s | 8 t/s |
#5. Quelle quantization choisir
- ⭐ Q4_K_M
- Le défaut pour M1. Meilleur compromis taille/qualité/vitesse. À privilégier sauf raison contraire.
- Q5_K_M
- +5 % qualité, -15 % vitesse. Intéressant sur 16 Go si le modèle reste dans la RAM utile.
- Q3_K_M
- Pour faire tenir un Gemma 4 12B sur 16 Go quand le contexte est long. Qualité notable en baisse — à réserver aux cas où rien d'autre ne passe.
- FP16 / Q8_0
- À éviter sur M1. La bande passante n'est pas adaptée, la vitesse tombe et vous perdez sans gain net.
#6. Gérer la chauffe (fanless)
Le MacBook Air M1 n'a pas de ventilateur. En inférence soutenue, la puce monte à 85-95 °C et throttle automatiquement après 8-12 minutes. Pour un chat ponctuel, aucun souci. Pour un batch d'embeddings d'une heure, c'est différent.
- Surélevez la machine
- Un simple support à 10 € (laptop stand) améliore la dissipation de 10-15 °C, donc repousse le throttle.
- Travaillez dans une pièce fraîche
- À 20 °C ambiante vs 28 °C, vous gagnez 5 minutes avant throttle. Réel.
- Fermez les apps Electron
- Chrome, VS Code, Slack consomment du CPU et contribuent à la chauffe. Sur Air M1, chaque watt compte.
- Évitez le Q8
- Les quantizations plus compactes (Q4) chauffent moins à qualité comparable.
#Limites à connaître
- Pas de modèles 70B
- Même Q2, un 70B ne rentre pas. Pour ça, un M1 Max ou ultérieur est nécessaire.
- Pas d'entraînement sérieux
- Le fine-tuning LoRA est théoriquement possible mais lent. Préférez un service cloud ponctuel.
- Context window limité
- Au-delà de 8 k tokens, la RAM explose. Restez sur 4-8 k sauf si vous quantifiez le KV cache.
- Pas de vision rapide
- Les modèles multimodaux (Gemma 4 12B, Qwen 3.5 9B) tournent mais lentement sur M1. Préférez Qwen 3.5 2B (multimodal, 1,9 Go) si vous avez besoin de vision réactive.
#Questions fréquentes
Un MacBook Air M1 8 Go suffit-il pour un LLM local ?+
Quelle différence de vitesse entre M1 8-core GPU et 7-core GPU ?+
Peut-on faire du RAG sur MacBook Air M1 ?+
Un modèle 70B peut-il tourner sur MacBook Air M1 16 Go ?+
Faut-il préférer Ollama, LM Studio ou MLX sur M1 ?+
Le MacBook Air M1 va-t-il devenir obsolète pour l'IA bientôt ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.