Débutant 10 minMacBook Air
Quel LLM sur MacBook Air M3 (8 / 16 / 24 Go) ?
Commercialisé début 2024, le MacBook Air M3 a été la première machine Apple Silicon à rendre l'IA locale grand public vraiment confortable. Bande passante 100 Go/s, jusqu'à 24 Go de RAM, GPU 10 cœurs avec dynamic caching : un Mistral 7B y tourne à 28-32 tokens/seconde, mieux qu'un RTX 3060 Laptop. Ce guide détaille quels modèles choisir selon votre config RAM.
#Le MacBook Air M3 en 2026
- Puce
- Apple M3 (2024), 8 cœurs CPU + 8 ou 10 cœurs GPU. Architecture avec dynamic caching (nouveauté M3).
- Bande passante
- 100 Go/s (identique au M2). Pas d'amélioration côté bande passante — c'est toujours le goulet.
- Neural Engine
- 16 cœurs, 18 TOPS. Pas utilisé par Ollama mais exploité par Core ML / MLX.
- RAM disponible
- 8, 16 ou 24 Go. Chez Apple Refurbished, un MBA M3 16 Go se trouve vers 1050 €.
- Refroidissement
- Passif (sans ventilateur). Throttle après 10-12 min d'inférence soutenue (un peu mieux que le M2).
i
Dynamic caching, c'est quoi
Nouveauté introduite avec le M3 : le GPU alloue dynamiquement la mémoire locale selon les besoins des shaders. Concrètement pour les LLM, +5-10 % de throughput sur les modèles qui exploitent bien Metal (llama.cpp récent).
#1. RAM : 8, 16 ou 24 Go
- 8 Go
- 5-6 Go utilisables. Limité aux 3B-4B confortables, 7B Q4 possible mais serré.
- 16 Go (recommandé)
- 11-12 Go utilisables. Mistral/Qwen 7B Q5/Q6, Llama 3.1 8B Q5, Phi-4 14B Q4 jouable.
- 24 Go
- 18-19 Go utilisables. Qwen 14B Q5, Mistral Small 24B Q4 confortable, RAG multi-stage.
#2. Modèles recommandés
Modèles recommandés — MBA M3 10-core GPU
| Modèle | Quant | RAM modèle | MBA 8 Go | MBA 16 Go | MBA 24 Go |
|---|---|---|---|---|---|
| Llama 3.2 1B | Q8_0 | 1,5 Go | 85 | 90 | 90 |
| Qwen 2.5 3B | Q5_K_M | 2,6 Go | 52 | 58 | 58 |
| Gemma 3 4B | Q4_K_M | 2,8 Go | 40 | 45 | 45 |
| Mistral 7B | Q4_K_M | 4,4 Go | 26 | 30 | 30 |
| Llama 3.1 8B | Q4_K_M | 4,9 Go | — | 25 | 27 |
| Phi-4 14B | Q4_K_M | 8,5 Go | — | 13 | 15 |
| Qwen 2.5 14B | Q5_K_M | 10,5 Go | — | — | 11 |
| Mistral Small 24B | Q4_K_M | 14 Go | — | — | 7 |
#3. Installation
Si vous voulez aussi essayer MLX (framework Apple) :
#4. Benchmarks tokens/sec
MBA M3 10-core GPU, 16 Go, Ollama 0.5.x, secteur
| Modèle | Q4_K_M | Q5_K_M | Q8_0 | MLX 4-bit |
|---|---|---|---|---|
| Qwen 2.5 3B | 58 t/s | 52 t/s | 40 t/s | 60 t/s |
| Mistral 7B | 30 t/s | 27 t/s | 18 t/s | 32 t/s |
| Llama 3.1 8B | 25 t/s | 22 t/s | 16 t/s | 27 t/s |
| Phi-4 14B | 13 t/s | 12 t/s | — | 14 t/s |
→
MLX, un +5-8 % gratuit
Si vous utilisez LM Studio et que les modèles MLX existent pour votre choix, ils sont systématiquement 5 à 10 % plus rapides que les GGUF Q4 sur M3. Catalogue MLX : huggingface.co/mlx-community.
#5. Optimisations Metal spécifiques
- Flash Attention
- Activé par défaut sur llama.cpp récent. Gain de 10-15 % sur les contextes > 4 k tokens.
- KV cache Q8
- Via Ollama : export OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 16 Go si vous dépassez 8 k de contexte.
- Dynamic Caching M3
- Automatique — rien à activer. Gain mesuré : +5-8 % sur Mistral/Llama vs une même config sur M2.
#6. MLX vs llama.cpp sur M3
MLX est le framework Apple dédié au machine learning sur Apple Silicon. Sur M3, il a deux avantages mesurables :
- Vitesse
- +5-10 % vs llama.cpp GGUF Q4 sur les modèles populaires (Mistral 7B, Llama 3.1 8B).
- Fine-tuning
- MLX supporte LoRA / QLoRA en local, llama.cpp non. Utile si vous voulez spécialiser un modèle sans cloud.
- Inconvénient
- Écosystème plus restreint (moins de modèles, moins d'UI). Ollama reste plus pratique pour 95 % des usages.
#M3 vs M4 : faut-il upgrader ?
- Gain de vitesse
- Environ +15-20 % sur les 7B, +20-30 % sur les 14B. Significatif mais pas transformationnel.
- RAM minimum Apple
- Depuis M4 (2025), 16 Go minimum chez Apple. Sur M3, 8 Go existait encore — moins pertinent en 2026.
- Bande passante
- M3 = 100 Go/s, M4 = 120 Go/s. +20 %, ressenti uniquement sur les modèles 8B+.
- Conseil
- Si vous avez un MBA M3 16 Go : aucune urgence. Si vous avez un M3 8 Go : envisagez un M4 16 Go ou gardez.
#Questions fréquentes
Le MacBook Air M3 peut-il faire tourner Llama 3.1 70B ?+
Non. Même en Q2, le modèle pèse plus de 25 Go, hors d'atteinte d'un MBA (max 24 Go). Pour le 70B, il faut un MacBook Pro M3/M4 Max 64 Go+ ou un Mac Studio.
Combien de tokens/seconde pour Mistral 7B sur MBA M3 16 Go ?+
Entre 28 et 32 tokens/seconde en Q4_K_M sur secteur. Sur batterie, comptez 24-28 tok/s. En Low Power Mode, autour de 18-22 tok/s.
MBA M3 8 Go ou MBA M2 16 Go ?+
Le M2 16 Go sans hésiter pour l'IA. La quantité de RAM est bien plus importante que la génération de puce : sur M3 8 Go vous êtes limité aux modèles 3B, sur M2 16 Go vous ouvrez les 8B.
Peut-on utiliser le Neural Engine (NPU) pour les LLM sur M3 ?+
Oui, via Core ML ou MLX, sur certains modèles optimisés. Ollama/llama.cpp n'exploitent pas le NPU : ils passent par le GPU Metal. Le NPU est surtout utile pour des modèles dédiés (Whisper, détection d'images).
Le MacBook Air M3 chauffe-t-il trop pour un usage LLM quotidien ?+
Usage chat ponctuel : aucun problème, la machine reste tiède. Usage batch (RAG sur 1000 PDF, embeddings en masse) : oui, throttle après 10-12 min. Pour du batch, préférez un Mac mini ou un MacBook Pro.
Quel modèle pour du code sur MBA M3 16 Go ?+
Qwen 2.5 Coder 7B Q5_K_M est l'un des meilleurs choix : spécialisé code, rentre largement en RAM, 20-25 tok/s. Alternative : DeepSeek Coder v2 Lite 16B Q4 (pour 24 Go uniquement).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.