Quel LLM sur MacBook Air M1 (8 / 16 Go) ?
Sorti fin 2020, le MacBook Air M1 reste en 2026 une machine parfaitement viable pour l'IA locale, à condition de choisir les bons modèles. Sa mémoire unifiée (8 ou 16 Go), son GPU Apple Silicon et son architecture sans ventilateur changent les règles : un 7B Mistral y tourne à 15-25 tokens/seconde, plus vite qu'un CPU PC récent. Voici comment en tirer le meilleur.
#Le MacBook Air M1 en 2026
Le MacBook Air M1 a 5 ans et se vend encore neuf à 999 € ou d'occasion autour de 500 €. Pour l'IA locale, c'est la meilleure porte d'entrée : Apple Silicon de première génération, Metal déjà mature, mémoire unifiée, et surtout un silence total grâce à son design sans ventilateur.
- Puce
- Apple M1 (2020), 8 cœurs CPU + 7 ou 8 cœurs GPU selon config.
- Bande passante mémoire
- 68,25 Go/s (LPDDR4X). C'est la principale limite pour les gros modèles.
- RAM disponible
- 8 Go ou 16 Go (non upgradable). Le choix que vous avez fait à l'achat détermine ce qui est possible.
- Refroidissement
- Passif. Après ~10 minutes d'inférence intensive, la puce throttle de 20-30 %.
- Support Apple
- macOS Sequoia (15) toujours supporté en 2026. Au-delà, Apple peut arrêter le support.
#1. Votre RAM : 8 ou 16 Go ?
La quantité de RAM détermine tout. Sur Mac, le GPU et le CPU partagent la même RAM — mais macOS en réserve une bonne partie pour le système et vos apps.
- MBA M1 8 Go
- ~4-5 Go utilisables pour un LLM. Ouvre Mistral 7B Q4 (tout juste), Qwen 2.5 3B Q5, Llama 3.2 1B/3B. Fermez Chrome pendant l'inférence.
- MBA M1 16 Go
- ~10-11 Go utilisables. Confortable pour 7B Q5, envisageable pour Mistral Small 8B, Qwen 7B. Pas de 13B.
#2. Les modèles qui tournent vraiment
| Modèle | Quantization | RAM requise | Tokens/s (8 Go) | Tokens/s (16 Go) |
|---|---|---|---|---|
| Llama 3.2 1B | Q8_0 | 1,5 Go | 55-65 | 60-70 |
| Qwen 2.5 3B | Q4_K_M | 2,2 Go | 30-40 | 35-45 |
| Gemma 3 4B | Q4_K_M | 2,8 Go | 22-28 | 28-35 |
| Mistral 7B Instruct | Q4_K_M | 4,4 Go | 14-18 | 18-22 |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | — | 14-18 |
| Qwen 2.5 7B | Q5_K_M | 5,4 Go | — | 12-16 |
| Phi-4 14B | Q3_K_M | 6,8 Go | — | 7-9 (limite) |
#3. Installation en 3 minutes
Ollama est la voie la plus simple. Il détecte Metal tout seul et gère les téléchargements.
- 01Installez Ollama via HomebrewSi Homebrew n'est pas présent, téléchargez le .dmg sur ollama.com. Sinon, une commande suffit.
- 02Lancez un modèle adapté à votre RAMAir 8 Go : ollama run qwen2.5:3b. Air 16 Go : ollama run mistral. Le premier téléchargement prend 2-5 minutes, les suivants sont instantanés.
- 03Vérifiez l'accélération MetalUne fois le modèle chargé, ouvrez un autre terminal et tapez ollama ps. La colonne PROCESSOR doit afficher 100% GPU.
- 04Ajoutez une interface graphique (optionnel)Enchanted (App Store, gratuit) ou Msty (.dmg). Les deux se connectent à Ollama sans config.
#4. Tokens/seconde mesurés
Mesures effectuées sur un MacBook Air M1 8-core GPU, 16 Go, macOS Sequoia 15.3, Ollama 0.5.x. Prompt : "Écris un paragraphe de 200 mots sur l'intelligence artificielle locale." Moyenne sur 5 runs.
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Llama 3.2 1B | 62 t/s | 55 t/s | 48 t/s |
| Qwen 2.5 3B | 38 t/s | 34 t/s | 25 t/s |
| Gemma 3 4B | 30 t/s | 27 t/s | 19 t/s |
| Mistral 7B | 19 t/s | 17 t/s | 11 t/s |
| Llama 3.1 8B | 16 t/s | 14 t/s | 9 t/s |
#5. Quelle quantization choisir
- ⭐ Q4_K_M
- Le défaut pour M1. Meilleur compromis taille/qualité/vitesse. À privilégier sauf raison contraire.
- Q5_K_M
- +5 % qualité, -15 % vitesse. Intéressant sur 16 Go si le modèle reste dans la RAM utile.
- Q3_K_M
- Pour caser un 14B sur 16 Go. Qualité notable en baisse — à réserver aux cas où rien d'autre ne passe.
- FP16 / Q8_0
- À éviter sur M1. La bande passante n'est pas adaptée, la vitesse tombe et vous perdez sans gain net.
#6. Gérer la chauffe (fanless)
Le MacBook Air M1 n'a pas de ventilateur. En inférence soutenue, la puce monte à 85-95 °C et throttle automatiquement après 8-12 minutes. Pour un chat ponctuel, aucun souci. Pour un batch d'embeddings d'une heure, c'est différent.
- Surélevez la machine
- Un simple support à 10 € (laptop stand) améliore la dissipation de 10-15 °C, donc repousse le throttle.
- Travaillez dans une pièce fraîche
- À 20 °C ambiante vs 28 °C, vous gagnez 5 minutes avant throttle. Réel.
- Fermez les apps Electron
- Chrome, VS Code, Slack consomment du CPU et contribuent à la chauffe. Sur Air M1, chaque watt compte.
- Évitez le Q8
- Les quantizations plus compactes (Q4) chauffent moins à qualité comparable.
#Limites à connaître
- Pas de modèles 70B
- Même Q2, un 70B ne rentre pas. Pour ça, un M1 Max ou ultérieur est nécessaire.
- Pas d'entraînement sérieux
- Le fine-tuning LoRA est théoriquement possible mais lent. Préférez un service cloud ponctuel.
- Context window limité
- Au-delà de 8 k tokens, la RAM explose. Restez sur 4-8 k sauf si vous quantifiez le KV cache.
- Pas de vision rapide
- Les modèles multimodaux (Llama 3.2 Vision 11B, Qwen-VL) tournent mais lentement. Utilisez la version 3B si possible.
#Questions fréquentes
Un MacBook Air M1 8 Go suffit-il pour un LLM local ?+
Quelle différence de vitesse entre M1 8-core GPU et 7-core GPU ?+
Peut-on faire du RAG sur MacBook Air M1 ?+
Llama 3.3 70B peut-il tourner sur M1 16 Go ?+
Faut-il préférer Ollama, LM Studio ou MLX sur M1 ?+
Le MacBook Air M1 va-t-il devenir obsolète pour l'IA bientôt ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.