Débutant 10 minMacBook Air
Quel LLM sur MacBook Air M4 (16 / 24 / 32 Go) ?
Le MacBook Air M4 (2025) est en 2026 le meilleur MacBook Air jamais sorti pour l'IA locale. 16 Go de RAM minimum (enfin), bande passante mémoire de 120 Go/s, GPU 10 cœurs, et toujours le design fanless. Un Mistral 7B y tourne à 32-38 tokens/seconde, un Phi-4 14B à 14-16 tok/s. Ce guide détaille quelles configs choisir et quels modèles installer.
#Le MacBook Air M4 en 2026
- Puce
- Apple M4 (2024), 10 cœurs CPU (4P + 6E) + 8 ou 10 cœurs GPU.
- Bande passante
- 120 Go/s (LPDDR5X). +20 % vs M3/M2. Fait une vraie différence sur 14B et plus.
- Neural Engine
- 16 cœurs, 38 TOPS. Exploitable via MLX et Core ML, pas encore par Ollama.
- RAM disponible
- 16, 24 ou 32 Go. Le 32 Go est nouveau sur MBA et ouvre les 24B confortablement.
- Refroidissement
- Fanless. Throttle légèrement repoussé vs M3 grâce à une meilleure efficience énergétique.
→
Ce qui change vraiment avec M4
La bande passante mémoire (+20 % vs M3) et le plafond RAM (32 Go contre 24 Go) font du MBA M4 le premier MacBook Air capable de faire tourner un modèle 24B en Q4 de manière confortable. C'est un saut de palier significatif.
#1. RAM : 16, 24 ou 32 Go
- 16 Go (base)
- ~11-12 Go utilisables. Couvre les 7B-8B en Q5, Phi-4 14B Q4. Suffit à 80 % des usages perso.
- 24 Go (+230 €)
- ~18 Go utilisables. Ouvre Qwen 14B Q5-Q6, Mistral Small 24B Q4, RAG avec reranker.
- 32 Go (+460 €)
- ~25 Go utilisables. Mistral Small 24B Q5-Q6, Qwen 32B Q4, marge pour context 32k+.
i
Sweet spot 2026 : 24 Go
Le 24 Go cible pile la génération de modèles actuelle (14B-24B en Q4/Q5). +230 € vs 16 Go, c'est le meilleur ROI. Le 32 Go ne se justifie que si vous voulez tourner du 32B régulièrement, ce qui reste un cas d'usage power user.
#2. Modèles recommandés
Modèles recommandés — MBA M4 10-core GPU
| Modèle | Quant | RAM modèle | MBA 16 Go | MBA 24 Go | MBA 32 Go |
|---|---|---|---|---|---|
| Qwen 2.5 3B | Q5_K_M | 2,6 Go | 65 | 65 | 65 |
| Gemma 3 4B | Q4_K_M | 2,8 Go | 50 | 50 | 50 |
| Mistral 7B | Q4_K_M | 4,4 Go | 35 | 36 | 36 |
| Qwen 2.5 Coder 7B | Q5_K_M | 5,4 Go | 30 | 32 | 32 |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | 30 | 31 | 31 |
| Phi-4 14B | Q4_K_M | 8,5 Go | 16 | 17 | 17 |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | 12 | 14 | 14 |
| Mistral Small 24B | Q4_K_M | 14 Go | — | 9 | 10 |
| Qwen 2.5 32B | Q4_K_M | 19 Go | — | — | 7 |
#3. Installation (Ollama / LM Studio)
#4. Benchmarks 2026
MBA M4 10-core GPU, 16 Go, secteur, Ollama 0.5.x
| Modèle | Q4_K_M | Q5_K_M | MLX 4-bit | MLX 8-bit |
|---|---|---|---|---|
| Mistral 7B | 35 t/s | 32 t/s | 38 t/s | 22 t/s |
| Llama 3.1 8B | 30 t/s | 27 t/s | 33 t/s | 19 t/s |
| Qwen 2.5 7B | 32 t/s | 29 t/s | 35 t/s | 20 t/s |
| Phi-4 14B | 16 t/s | 14 t/s | 18 t/s | — |
#5. Optimisations M4-specific
- MLX préféré
- Sur M4, MLX tire mieux parti de la bande passante accrue. +8-12 % vs GGUF Q4 mesuré sur Mistral 7B.
- KV cache Q4
- Nouvelle option llama.cpp : -ctk q4_0 -ctv q4_0. Contextes 32k possibles sur 16 Go.
- Neural Engine via Core ML
- Certains modèles (Llama 3.2 quantized Apple) tournent sur le NPU — silencieux, très peu gourmand. Usage pro niche.
- sysctl iogpu.wired_limit_mb
- Sur 32 Go, relevez à 28 Go pour garantir l'allocation GPU d'un 24B sans swap.
#6. MBA M4 vs MBP M4 vs Mac mini M4
- MBA M4 16 Go (1299 €)
- Fanless, silence total, 11h d'autonomie. Throttle après 10-12 min de charge LLM.
- MBP M4 14" 16 Go (1899 €)
- Ventilateurs actifs, aucun throttle, +10 % de vitesse soutenue. +600 € vs MBA M4.
- Mac mini M4 16 Go (729 €)
- Desktop, aucun throttle, -40 % vs MBA à perf égale. Pour un usage sédentaire, imbattable.
→
Règle du pouce
MBA M4 si mobilité et silence comptent. Mini M4 si vous avez un bureau fixe. MBP M4 si vous voulez la mobilité sans compromis (batch, sessions longues, thermique).
#Limites du MBA M4
- Throttle thermique
- Après ~12 min sur un 14B+, la vitesse baisse de 15-20 %. Pas bloquant pour le chat, gênant pour le batch.
- Plafond 32 Go
- Ne peut pas tourner de 70B. Pour ça, un MBP M4 Max 64 Go ou un Mac Studio est requis.
- Pas de port SD
- Détail qui compte si vous chargez des datasets photo pour un RAG multimodal.
#Questions fréquentes
Le MacBook Air M4 16 Go suffit-il pour Ollama et LM Studio ?+
Oui, largement. Mistral 7B à 35 tok/s, Llama 3.1 8B à 30 tok/s, Phi-4 14B à 16 tok/s. Pour du chat, du code, du RAG documentaire, c'est confortable. Ne dépassez pas un 14B si vous voulez garder de la RAM pour les apps.
MBA M4 24 Go vaut-il les 230 € de plus ?+
Oui si vous envisagez de tourner des 14B régulièrement ou de faire du RAG avec embedder + reranker + LLM en parallèle. Non si vous restez sur du 7B-8B — le 16 Go suffira.
Le MacBook Air M4 peut-il tourner un 32B ?+
Uniquement la version 32 Go. Qwen 2.5 32B Q4 (19 Go sur disque, 21 Go en RAM avec contexte) passe à ~7 tok/s. Utilisable pour du chat patient, inadapté au batch.
Différence Ollama vs LM Studio sur M4 ?+
Ollama démarre plus vite, consomme moins de RAM idle (~200 Mo vs ~450 Mo pour LM Studio), et a une API OpenAI-compatible plus stable. LM Studio offre une meilleure UI pour explorer les modèles. Beaucoup utilisent les deux.
Le Neural Engine du M4 accélère-t-il vraiment les LLM ?+
Pas avec Ollama ou llama.cpp aujourd'hui — ils utilisent le GPU Metal. Seuls MLX (avec certains modèles) et Core ML l'exploitent. Pour 95 % des usages, l'amélioration vient du GPU + de la bande passante, pas du NPU.
Quelle autonomie batterie pendant un chat LLM ?+
Environ 5-6h avec Mistral 7B en chat ponctuel (pas continu), 3-4h avec Phi-4 14B actif. En chat continu (requêtes enchaînées), comptez la moitié. Branché, aucune limite.
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.