Débutant 10 minMacBook Air
Quel LLM sur MacBook Air M3 (8 / 16 / 24 Go) ?
Commercialisé début 2024, le MacBook Air M3 a été la première machine Apple Silicon à rendre l'IA locale grand public vraiment confortable. Bande passante 100 Go/s, jusqu'à 24 Go de RAM, GPU 10 cœurs avec dynamic caching : un Qwen 3.5 9B (le choix 8 Go de référence en 2026) y tourne à 24-27 tokens/seconde, mieux qu'un RTX 3060 Laptop. Ce guide détaille quels modèles choisir selon votre config RAM.
#Le MacBook Air M3 en 2026
- Puce
- Apple M3 (2024), 8 cœurs CPU + 8 ou 10 cœurs GPU. Architecture avec dynamic caching (nouveauté M3).
- Bande passante
- 100 Go/s (identique au M2). Pas d'amélioration côté bande passante — c'est toujours le goulet.
- Neural Engine
- 16 cœurs, 18 TOPS. Pas utilisé par Ollama mais exploité par Core ML / MLX.
- RAM disponible
- 8, 16 ou 24 Go. Chez Apple Refurbished, un MBA M3 16 Go se trouve vers 1050 €.
- Refroidissement
- Passif (sans ventilateur). Throttle après 10-12 min d'inférence soutenue (un peu mieux que le M2).
i
Dynamic caching, c'est quoi
Nouveauté introduite avec le M3 : le GPU alloue dynamiquement la mémoire locale selon les besoins des shaders. Concrètement pour les LLM, +5-10 % de throughput sur les modèles qui exploitent bien Metal (llama.cpp récent).
#1. RAM : 8, 16 ou 24 Go
- 8 Go
- 5-6 Go utilisables. Limité aux 2B-4B confortables (Qwen 3.5 2B/4B, Granite 4.2 3B), un 8B Q4 comme Granite 4.2 8B passe mais serré.
- 16 Go (recommandé)
- 11-12 Go utilisables. Qwen 3.5 9B Q4/Q5, Granite 4.2 8B, Gemma 4 12B Q4 jouable.
- 24 Go
- 18-19 Go utilisables. Qwen 3.5 9B en Q8, Mistral Small 24B Q4 confortable, Qwen 3.8 27B Q4 (18 Go) en visant serré, RAG multi-stage.
#2. Modèles recommandés
Modèles recommandés — MBA M3 10-core GPU
| Modèle | Quant | RAM modèle | MBA 8 Go | MBA 16 Go | MBA 24 Go |
|---|---|---|---|---|---|
| Qwen 3.5 2B | Q4_K_M | 1,9 Go | 82 | 88 | 88 |
| Granite 4.2 3B | Q4_K_M | 2,2 Go | 60 | 65 | 65 |
| Qwen 3.5 4B | Q4_K_M | 3,4 Go | 44 | 48 | 48 |
| Gemma 4 E2B | Q4_K_M | 4,3 Go | 38 | 42 | 42 |
| Granite 4.2 8B | Q4_K_M | 5,3 Go | — | 28 | 30 |
| Qwen 3.5 9B | Q4_K_M | 6,6 Go | — | 25 | 27 |
| Gemma 4 12B | Q4_K_M | 7,6 Go | — | 18 | 20 |
| Mistral Small 24B | Q4_K_M | 14 Go | — | — | 8 |
#3. Installation
Si vous voulez aussi essayer MLX (framework Apple) :
#4. Benchmarks tokens/sec
MBA M3 10-core GPU, 16 Go, Ollama 0.5.x, secteur
| Modèle | Q4_K_M | Q5_K_M | Q8_0 | MLX 4-bit |
|---|---|---|---|---|
| Qwen 3.5 4B | 48 t/s | 43 t/s | 33 t/s | 50 t/s |
| Granite 4.2 8B | 28 t/s | 25 t/s | 18 t/s | 30 t/s |
| Qwen 3.5 9B | 25 t/s | 22 t/s | 16 t/s | 27 t/s |
| Gemma 4 12B | 18 t/s | 16 t/s | — | 19 t/s |
→
MLX, un +5-8 % gratuit
Si vous utilisez LM Studio et que les modèles MLX existent pour votre choix, ils sont systématiquement 5 à 10 % plus rapides que les GGUF Q4 sur M3. Catalogue MLX : huggingface.co/mlx-community.
#5. Optimisations Metal spécifiques
- Flash Attention
- Activé par défaut sur llama.cpp récent. Gain de 10-15 % sur les contextes > 4 k tokens.
- KV cache Q8
- Via Ollama : export OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 16 Go si vous dépassez 8 k de contexte.
- Dynamic Caching M3
- Automatique — rien à activer. Gain de l'ordre de +5-8 % sur Qwen/Gemma vs une même config sur M2.
#6. MLX vs llama.cpp sur M3
MLX est le framework Apple dédié au machine learning sur Apple Silicon. Sur M3, il a deux avantages mesurables :
- Vitesse
- +5-10 % vs llama.cpp GGUF Q4 sur les modèles populaires (Qwen 3.5 9B, Granite 4.2 8B).
- Fine-tuning
- MLX supporte LoRA / QLoRA en local, llama.cpp non. Utile si vous voulez spécialiser un modèle sans cloud.
- Inconvénient
- Écosystème plus restreint (moins de modèles, moins d'UI). Ollama reste plus pratique pour 95 % des usages.
#M3 vs M4 : faut-il upgrader ?
- Gain de vitesse
- Environ +15-20 % sur les 7B, +20-30 % sur les 14B. Significatif mais pas transformationnel.
- RAM minimum Apple
- Depuis M4 (2025), 16 Go minimum chez Apple. Sur M3, 8 Go existait encore — moins pertinent en 2026.
- Bande passante
- M3 = 100 Go/s, M4 = 120 Go/s. +20 %, ressenti uniquement sur les modèles 8B+.
- Conseil
- Si vous avez un MBA M3 16 Go : aucune urgence. Si vous avez un M3 8 Go : envisagez un M4 16 Go ou gardez.
#Questions fréquentes
Le MacBook Air M3 peut-il faire tourner un LLM de 70B ?+
Non. Même en Q2, un 70B pèse plus de 25 Go, hors d'atteinte d'un MBA (max 24 Go). Pour un 70B, il faut un MacBook Pro M3/M4 Max 64 Go+ ou un Mac Studio.
Combien de tokens/seconde pour Qwen 3.5 9B sur MBA M3 16 Go ?+
Entre 24 et 27 tokens/seconde en Q4_K_M sur secteur. Sur batterie, comptez 20-24 tok/s. En Low Power Mode, autour de 15-18 tok/s.
MBA M3 8 Go ou MBA M2 16 Go ?+
Le M2 16 Go sans hésiter pour l'IA. La quantité de RAM est bien plus importante que la génération de puce : sur M3 8 Go vous êtes limité aux modèles 3B, sur M2 16 Go vous ouvrez les 8B.
Peut-on utiliser le Neural Engine (NPU) pour les LLM sur M3 ?+
Oui, via Core ML ou MLX, sur certains modèles optimisés. Ollama/llama.cpp n'exploitent pas le NPU : ils passent par le GPU Metal. Le NPU est surtout utile pour des modèles dédiés (Whisper, détection d'images).
Le MacBook Air M3 chauffe-t-il trop pour un usage LLM quotidien ?+
Usage chat ponctuel : aucun problème, la machine reste tiède. Usage batch (RAG sur 1000 PDF, embeddings en masse) : oui, throttle après 10-12 min. Pour du batch, préférez un Mac mini ou un MacBook Pro.
Quel modèle pour du code sur MBA M3 16 Go ?+
Pour du chat/code général, Qwen 3.5 9B Q4_K_M (6,6 Go) est le meilleur compromis en 16 Go : rentre largement en RAM, 24-27 tok/s. Pour l'autocomplétion inline (FIM), Qwen 2.5 Coder 7B base reste la référence 2026. En 24 Go, montez sur Devstral 24B (spécialiste agent de code, 14 Go) ou Qwen3-Coder 30B-A3B (MoE, 19 Go, serré).
Ce guide vous a aidé ?
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.