Quel LLM sur MacBook Air M2 (8 / 16 / 24 Go) ?
Le MacBook Air M2 (2022-2024) reste en 2026 l'un des meilleurs rapport prix/performance pour faire tourner un LLM en local. Avec 100 Go/s de bande passante (+47 % vs M1), jusqu'à 24 Go de mémoire unifiée et toujours un design sans ventilateur, il avale Mistral 7B à 25-30 tokens/seconde tout en restant silencieux. Ce guide détaille quels modèles installer selon votre RAM.
#Le MacBook Air M2 pour l'IA locale
- Puce
- Apple M2 (2022), 8 cœurs CPU + 8 ou 10 cœurs GPU selon config.
- Bande passante mémoire
- 100 Go/s (LPDDR5). +47 % vs M1 — gain net sur les modèles 7B et plus.
- RAM disponible
- 8, 16 ou 24 Go. Le 24 Go est rare d'occasion mais existe sur les MBA M2 15".
- Refroidissement
- Fanless. Throttle après ~8-10 minutes d'inférence soutenue.
- Différence M2 vs M1
- +15-25 % de vitesse d'inférence à modèle équivalent, +6 à +16 Go de RAM max selon config.
#1. Choisir 8, 16 ou 24 Go
- MBA M2 8 Go
- ~5 Go utilisables. Mistral 7B Q4 (juste), Qwen 3B confortable. Évitez les modèles 8B+.
- MBA M2 16 Go
- ~11 Go utilisables. Mistral/Qwen 7B en Q5/Q6, Llama 3.1 8B Q4, envisageable Phi-4 14B Q4.
- MBA M2 24 Go
- ~18 Go utilisables. Qwen 14B Q6, Mistral Small 24B Q4, RAG confortable avec modèle + embedder + reranker.
#2. Modèles compatibles par RAM
| Modèle | Quant | RAM | MBA 8 Go | MBA 16 Go | MBA 24 Go |
|---|---|---|---|---|---|
| Llama 3.2 1B | Q8_0 | 1,5 Go | 75-85 | 80-90 | 80-90 |
| Qwen 2.5 3B | Q5_K_M | 2,6 Go | 45-55 | 50-60 | 50-60 |
| Gemma 3 4B | Q4_K_M | 2,8 Go | 35-42 | 38-45 | 38-45 |
| Mistral 7B | Q4_K_M | 4,4 Go | 22-27 | 25-30 | 25-30 |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | — | 20-25 | 22-27 |
| Phi-4 14B | Q4_K_M | 8,5 Go | — | 11-14 | 13-16 |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | — | — | 10-13 |
| Mistral Small 24B | Q4_K_M | 14 Go | — | — | 6-9 |
#3. Installation Ollama
La première fois, le modèle se télécharge depuis le CDN Ollama. Comptez 2 à 5 minutes pour un 7B sur une connexion 100 Mbit/s.
#4. Tokens/seconde mesurés
Mesures MBA M2 10-core GPU, 16 Go, macOS Sequoia 15.3, Ollama 0.5.x, batterie 100 %, branché secteur. Prompt : génération de 200 tokens.
| Modèle | Q4_K_M | Q5_K_M | Q8_0 |
|---|---|---|---|
| Qwen 2.5 3B | 52 t/s | 47 t/s | 35 t/s |
| Mistral 7B | 27 t/s | 24 t/s | 16 t/s |
| Llama 3.1 8B | 23 t/s | 20 t/s | 14 t/s |
| Phi-4 14B | 13 t/s | 11 t/s | — |
#5. Quantization optimale
- ⭐ Q4_K_M
- Défaut recommandé. 95 % de la qualité FP16 pour 25 % de la taille. Parfaitement aligné avec la bande passante du M2.
- Q5_K_M
- Quand la RAM le permet. +3-5 % qualité, -15 % vitesse. Vaut le coup sur 16 Go+.
- IQ4_XS
- Compression 15 % meilleure que Q4_K_M, mais décodage plus lourd sur Metal. Testez avant d'adopter.
- MLX 4-bit
- Format Apple-natif. 5-10 % plus rapide que GGUF Q4 sur certains modèles. À tester via LM Studio.
#6. Impact batterie et thermique
- Autonomie chat 7B continu
- 4-5h sur batterie pleine. Consommation typique : 12-15 W.
- Autonomie chat 14B continu
- 2,5-3h. Consommation : 18-22 W.
- Température en usage
- 78-88 °C sur la puce. Throttle après ~8 min en continu sur 7B+, rarement sur 3B.
- Low Power Mode
- Divise la vitesse d'inférence par ~1,5. À activer uniquement en déplacement si l'autonomie prime sur la vitesse.
#Rester sur M2 ou passer au M4 ?
Si vous avez un MBA M2 16 Go qui fonctionne bien : gardez-le. Le M4 apporte +20-25 % de vitesse pure, mais l'écart en usage réel est souvent masqué par d'autres facteurs (réseau, RAG, UI). Changez seulement si :
- Vous êtes en M2 8 Go
- L'écart avec un M4 16 Go (minimum en 2025) est énorme. L'upgrade se justifie.
- Vous voulez tourner des 14B sérieusement
- Le M4 24-32 Go est un meilleur terrain. Sinon, 16 Go M2 suffit pour du 7B-8B.
- Votre batterie est usée
- En dessous de 80 % de capacité, le throttle batterie se déclenche trop vite. Un remplacement de batterie (200 € chez Apple) est souvent plus rentable qu'un nouveau Mac.
#Questions fréquentes
Le MacBook Air M2 8 Go peut-il faire tourner Mistral 7B ?+
Quelle est la différence réelle entre MBA M2 et MBA M3 pour l'IA ?+
Le MacBook Air M2 24 Go est-il intéressant en 2026 ?+
Peut-on faire du fine-tuning LoRA sur MBA M2 ?+
Ollama ou LM Studio sur Air M2 ?+
Le ventilateur s'enclenche quand je charge un gros modèle ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.