Débutant 10 minMacBook Air

Quel LLM sur MacBook Air M4 (16 / 24 / 32 Go) ?

Le MacBook Air M4 (2025) est en 2026 le meilleur MacBook Air jamais sorti pour l'IA locale. 16 Go de RAM minimum (enfin), bande passante mémoire de 120 Go/s, GPU 10 cœurs, et toujours le design fanless. Un Mistral 7B y tourne à 32-38 tokens/seconde, un Phi-4 14B à 14-16 tok/s. Ce guide détaille quelles configs choisir et quels modèles installer.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#Le MacBook Air M4 en 2026

Puce
Apple M4 (2024), 10 cœurs CPU (4P + 6E) + 8 ou 10 cœurs GPU.
Bande passante
120 Go/s (LPDDR5X). +20 % vs M3/M2. Fait une vraie différence sur 14B et plus.
Neural Engine
16 cœurs, 38 TOPS. Exploitable via MLX et Core ML, pas encore par Ollama.
RAM disponible
16, 24 ou 32 Go. Le 32 Go est nouveau sur MBA et ouvre les 24B confortablement.
Refroidissement
Fanless. Throttle légèrement repoussé vs M3 grâce à une meilleure efficience énergétique.
Ce qui change vraiment avec M4
La bande passante mémoire (+20 % vs M3) et le plafond RAM (32 Go contre 24 Go) font du MBA M4 le premier MacBook Air capable de faire tourner un modèle 24B en Q4 de manière confortable. C'est un saut de palier significatif.

#1. RAM : 16, 24 ou 32 Go

16 Go (base)
~11-12 Go utilisables. Couvre les 7B-8B en Q5, Phi-4 14B Q4. Suffit à 80 % des usages perso.
24 Go (+230 €)
~18 Go utilisables. Ouvre Qwen 14B Q5-Q6, Mistral Small 24B Q4, RAG avec reranker.
32 Go (+460 €)
~25 Go utilisables. Mistral Small 24B Q5-Q6, Qwen 32B Q4, marge pour context 32k+.
i
Sweet spot 2026 : 24 Go
Le 24 Go cible pile la génération de modèles actuelle (14B-24B en Q4/Q5). +230 € vs 16 Go, c'est le meilleur ROI. Le 32 Go ne se justifie que si vous voulez tourner du 32B régulièrement, ce qui reste un cas d'usage power user.

#2. Modèles recommandés

Modèles recommandés — MBA M4 10-core GPU
ModèleQuantRAM modèleMBA 16 GoMBA 24 GoMBA 32 Go
Qwen 2.5 3BQ5_K_M2,6 Go656565
Gemma 3 4BQ4_K_M2,8 Go505050
Mistral 7BQ4_K_M4,4 Go353636
Qwen 2.5 Coder 7BQ5_K_M5,4 Go303232
Llama 3.1 8BQ4_K_M4,9 Go303131
Phi-4 14BQ4_K_M8,5 Go161717
Qwen 2.5 14BQ5_K_M10,5 Go121414
Mistral Small 24BQ4_K_M14 Go910
Qwen 2.5 32BQ4_K_M19 Go7

#3. Installation (Ollama / LM Studio)

Installation Ollama
brew install --cask ollama
brew services start ollama

# Modèles conseillés par config
ollama run mistral           # 16 Go — le défaut
ollama run qwen2.5:14b       # 24 Go
ollama run mistral-small:24b # 32 Go
LM Studio (UI graphique)
# Télécharger : https://lmstudio.ai/download/mac-arm64
# Puis Discover → rechercher "MLX" pour les formats Apple-natifs
# Exemple : mlx-community/Mistral-7B-Instruct-v0.3-4bit

#4. Benchmarks 2026

MBA M4 10-core GPU, 16 Go, secteur, Ollama 0.5.x
ModèleQ4_K_MQ5_K_MMLX 4-bitMLX 8-bit
Mistral 7B35 t/s32 t/s38 t/s22 t/s
Llama 3.1 8B30 t/s27 t/s33 t/s19 t/s
Qwen 2.5 7B32 t/s29 t/s35 t/s20 t/s
Phi-4 14B16 t/s14 t/s18 t/s

#5. Optimisations M4-specific

MLX préféré
Sur M4, MLX tire mieux parti de la bande passante accrue. +8-12 % vs GGUF Q4 mesuré sur Mistral 7B.
KV cache Q4
Nouvelle option llama.cpp : -ctk q4_0 -ctv q4_0. Contextes 32k possibles sur 16 Go.
Neural Engine via Core ML
Certains modèles (Llama 3.2 quantized Apple) tournent sur le NPU — silencieux, très peu gourmand. Usage pro niche.
sysctl iogpu.wired_limit_mb
Sur 32 Go, relevez à 28 Go pour garantir l'allocation GPU d'un 24B sans swap.
Allouer 28 Go au GPU sur MBA M4 32 Go
sudo sysctl iogpu.wired_limit_mb=28672
# Permanent :
echo "iogpu.wired_limit_mb=28672" | sudo tee -a /etc/sysctl.conf

#6. MBA M4 vs MBP M4 vs Mac mini M4

MBA M4 16 Go (1299 €)
Fanless, silence total, 11h d'autonomie. Throttle après 10-12 min de charge LLM.
MBP M4 14" 16 Go (1899 €)
Ventilateurs actifs, aucun throttle, +10 % de vitesse soutenue. +600 € vs MBA M4.
Mac mini M4 16 Go (729 €)
Desktop, aucun throttle, -40 % vs MBA à perf égale. Pour un usage sédentaire, imbattable.
Règle du pouce
MBA M4 si mobilité et silence comptent. Mini M4 si vous avez un bureau fixe. MBP M4 si vous voulez la mobilité sans compromis (batch, sessions longues, thermique).

#Limites du MBA M4

Throttle thermique
Après ~12 min sur un 14B+, la vitesse baisse de 15-20 %. Pas bloquant pour le chat, gênant pour le batch.
Plafond 32 Go
Ne peut pas tourner de 70B. Pour ça, un MBP M4 Max 64 Go ou un Mac Studio est requis.
Pas de port SD
Détail qui compte si vous chargez des datasets photo pour un RAG multimodal.

#Questions fréquentes

Le MacBook Air M4 16 Go suffit-il pour Ollama et LM Studio ?+
Oui, largement. Mistral 7B à 35 tok/s, Llama 3.1 8B à 30 tok/s, Phi-4 14B à 16 tok/s. Pour du chat, du code, du RAG documentaire, c'est confortable. Ne dépassez pas un 14B si vous voulez garder de la RAM pour les apps.
MBA M4 24 Go vaut-il les 230 € de plus ?+
Oui si vous envisagez de tourner des 14B régulièrement ou de faire du RAG avec embedder + reranker + LLM en parallèle. Non si vous restez sur du 7B-8B — le 16 Go suffira.
Le MacBook Air M4 peut-il tourner un 32B ?+
Uniquement la version 32 Go. Qwen 2.5 32B Q4 (19 Go sur disque, 21 Go en RAM avec contexte) passe à ~7 tok/s. Utilisable pour du chat patient, inadapté au batch.
Différence Ollama vs LM Studio sur M4 ?+
Ollama démarre plus vite, consomme moins de RAM idle (~200 Mo vs ~450 Mo pour LM Studio), et a une API OpenAI-compatible plus stable. LM Studio offre une meilleure UI pour explorer les modèles. Beaucoup utilisent les deux.
Le Neural Engine du M4 accélère-t-il vraiment les LLM ?+
Pas avec Ollama ou llama.cpp aujourd'hui — ils utilisent le GPU Metal. Seuls MLX (avec certains modèles) et Core ML l'exploitent. Pour 95 % des usages, l'amélioration vient du GPU + de la bande passante, pas du NPU.
Quelle autonomie batterie pendant un chat LLM ?+
Environ 5-6h avec Mistral 7B en chat ponctuel (pas continu), 3-4h avec Phi-4 14B actif. En chat continu (requêtes enchaînées), comptez la moitié. Branché, aucune limite.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.