Débutant 9 minMacBook Air

Quel LLM sur MacBook Air M2 (8 / 16 / 24 Go) ?

Le MacBook Air M2 (2022-2024) reste en 2026 l'un des meilleurs rapport prix/performance pour faire tourner un LLM en local. Avec 100 Go/s de bande passante (+47 % vs M1), jusqu'à 24 Go de mémoire unifiée et toujours un design sans ventilateur, il avale Mistral 7B à 25-30 tokens/seconde tout en restant silencieux. Ce guide détaille quels modèles installer selon votre RAM.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#Le MacBook Air M2 pour l'IA locale

Puce
Apple M2 (2022), 8 cœurs CPU + 8 ou 10 cœurs GPU selon config.
Bande passante mémoire
100 Go/s (LPDDR5). +47 % vs M1 — gain net sur les modèles 7B et plus.
RAM disponible
8, 16 ou 24 Go. Le 24 Go est rare d'occasion mais existe sur les MBA M2 15".
Refroidissement
Fanless. Throttle après ~8-10 minutes d'inférence soutenue.
Différence M2 vs M1
+15-25 % de vitesse d'inférence à modèle équivalent, +6 à +16 Go de RAM max selon config.

#1. Choisir 8, 16 ou 24 Go

MBA M2 8 Go
~5 Go utilisables. Mistral 7B Q4 (juste), Qwen 3B confortable. Évitez les modèles 8B+.
MBA M2 16 Go
~11 Go utilisables. Mistral/Qwen 7B en Q5/Q6, Llama 3.1 8B Q4, envisageable Phi-4 14B Q4.
MBA M2 24 Go
~18 Go utilisables. Qwen 14B Q6, Mistral Small 24B Q4, RAG confortable avec modèle + embedder + reranker.
Le sweet spot : 16 Go
Le 16 Go couvre 90 % des usages IA locale en 2026 (Mistral 7B, Llama 3.1 8B, Qwen 14B Q4). Le surcoût du 24 Go (+250 € chez Apple) ne se justifie que si vous comptez tourner des 14B en Q5/Q6 ou faire du RAG avec beaucoup de contexte.

#2. Modèles compatibles par RAM

Modèles recommandés — tokens/sec mesurés sur Air M2 10-core GPU
ModèleQuantRAMMBA 8 GoMBA 16 GoMBA 24 Go
Llama 3.2 1BQ8_01,5 Go75-8580-9080-90
Qwen 2.5 3BQ5_K_M2,6 Go45-5550-6050-60
Gemma 3 4BQ4_K_M2,8 Go35-4238-4538-45
Mistral 7BQ4_K_M4,4 Go22-2725-3025-30
Llama 3.1 8BQ4_K_M4,9 Go20-2522-27
Phi-4 14BQ4_K_M8,5 Go11-1413-16
Qwen 2.5 14BQ5_K_M10,5 Go10-13
Mistral Small 24BQ4_K_M14 Go6-9

#3. Installation Ollama

Installation complète
# Homebrew si pas déjà installé
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Ollama
brew install --cask ollama
brew services start ollama

# Modèle adapté
# 8 Go :  ollama run qwen2.5:3b
# 16 Go : ollama run mistral
# 24 Go : ollama run qwen2.5:14b

La première fois, le modèle se télécharge depuis le CDN Ollama. Comptez 2 à 5 minutes pour un 7B sur une connexion 100 Mbit/s.

#4. Tokens/seconde mesurés

Mesures MBA M2 10-core GPU, 16 Go, macOS Sequoia 15.3, Ollama 0.5.x, batterie 100 %, branché secteur. Prompt : génération de 200 tokens.

Comparaison Q4 vs Q5 vs Q8 — MBA M2 10-core GPU
ModèleQ4_K_MQ5_K_MQ8_0
Qwen 2.5 3B52 t/s47 t/s35 t/s
Mistral 7B27 t/s24 t/s16 t/s
Llama 3.1 8B23 t/s20 t/s14 t/s
Phi-4 14B13 t/s11 t/s
!
Sur batterie, -15 à -25 %
Débranché, macOS ralentit le GPU pour préserver l'autonomie. Mesuré : Mistral 7B tombe de 27 à 21 tok/s en mode batterie normale, et à 17 en Low Power Mode. Pour un benchmark propre, branchez.

#5. Quantization optimale

⭐ Q4_K_M
Défaut recommandé. 95 % de la qualité FP16 pour 25 % de la taille. Parfaitement aligné avec la bande passante du M2.
Q5_K_M
Quand la RAM le permet. +3-5 % qualité, -15 % vitesse. Vaut le coup sur 16 Go+.
IQ4_XS
Compression 15 % meilleure que Q4_K_M, mais décodage plus lourd sur Metal. Testez avant d'adopter.
MLX 4-bit
Format Apple-natif. 5-10 % plus rapide que GGUF Q4 sur certains modèles. À tester via LM Studio.

#6. Impact batterie et thermique

Autonomie chat 7B continu
4-5h sur batterie pleine. Consommation typique : 12-15 W.
Autonomie chat 14B continu
2,5-3h. Consommation : 18-22 W.
Température en usage
78-88 °C sur la puce. Throttle après ~8 min en continu sur 7B+, rarement sur 3B.
Low Power Mode
Divise la vitesse d'inférence par ~1,5. À activer uniquement en déplacement si l'autonomie prime sur la vitesse.
Astuce silence
Contrairement au MBP, l'Air M2 est 100 % silencieux quelle que soit la charge. Parfait pour un setup bureau sans bruit, ou pour laisser un LLM tourner la nuit en RAG mode.

#Rester sur M2 ou passer au M4 ?

Si vous avez un MBA M2 16 Go qui fonctionne bien : gardez-le. Le M4 apporte +20-25 % de vitesse pure, mais l'écart en usage réel est souvent masqué par d'autres facteurs (réseau, RAG, UI). Changez seulement si :

Vous êtes en M2 8 Go
L'écart avec un M4 16 Go (minimum en 2025) est énorme. L'upgrade se justifie.
Vous voulez tourner des 14B sérieusement
Le M4 24-32 Go est un meilleur terrain. Sinon, 16 Go M2 suffit pour du 7B-8B.
Votre batterie est usée
En dessous de 80 % de capacité, le throttle batterie se déclenche trop vite. Un remplacement de batterie (200 € chez Apple) est souvent plus rentable qu'un nouveau Mac.

#Questions fréquentes

Le MacBook Air M2 8 Go peut-il faire tourner Mistral 7B ?+
Oui, en Q4_K_M, à ~22 tok/s. Mais c'est serré : fermez Chrome et les apps gourmandes. Pour un usage confortable, 16 Go est vivement recommandé. En dessous, restez sur Qwen 2.5 3B ou Llama 3.2 3B.
Quelle est la différence réelle entre MBA M2 et MBA M3 pour l'IA ?+
Environ +10-15 % de vitesse d'inférence sur les 7B à RAM égale. La bande passante mémoire est identique (100 Go/s). Si vous avez un M2, ne changez pas pour un M3 — attendez le M4 ou M5.
Le MacBook Air M2 24 Go est-il intéressant en 2026 ?+
Oui, si vous le trouvez d'occasion à moins de 1200 €. Les 24 Go ouvrent les 14B en Q5 et les 24B en Q4, ce qu'aucun autre MacBook Air ne permet aussi bien dans cette gamme de prix. Sinon, un Mac mini M4 24 Go fait mieux pour moins cher.
Peut-on faire du fine-tuning LoRA sur MBA M2 ?+
Techniquement oui via MLX ou mlx-lm, en pratique lent et thermiquement contraint. Un LoRA 7B prend des heures et fait chauffer la machine. Pour du fine-tuning sérieux, préférez un service cloud ou un Mac Studio.
Ollama ou LM Studio sur Air M2 ?+
Ollama pour la vitesse de mise en route et la CLI. LM Studio si vous voulez une interface graphique pour explorer les modèles sur Hugging Face. Les deux peuvent coexister — ils ne se marchent pas dessus.
Le ventilateur s'enclenche quand je charge un gros modèle ?+
Non — le MacBook Air M2 est fanless. C'est son principal atout pour l'IA locale (silence absolu) mais aussi sa principale limite (throttle après ~8 min de charge soutenue). Pour de l'inférence continue, préférez un MacBook Pro ou un Mac mini.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.