Débutant 10 minMacBook Air

Quel LLM sur MacBook Air M3 (8 / 16 / 24 Go) ?

Commercialisé début 2024, le MacBook Air M3 a été la première machine Apple Silicon à rendre l'IA locale grand public vraiment confortable. Bande passante 100 Go/s, jusqu'à 24 Go de RAM, GPU 10 cœurs avec dynamic caching : un Qwen 3.5 9B (le choix 8 Go de référence en 2026) y tourne à 24-27 tokens/seconde, mieux qu'un RTX 3060 Laptop. Ce guide détaille quels modèles choisir selon votre config RAM.

Par Mohamed Meguedmi·Màj 2026-08-27·Testé sur macOS 14+

#Le MacBook Air M3 en 2026

Puce
Apple M3 (2024), 8 cœurs CPU + 8 ou 10 cœurs GPU. Architecture avec dynamic caching (nouveauté M3).
Bande passante
100 Go/s (identique au M2). Pas d'amélioration côté bande passante — c'est toujours le goulet.
Neural Engine
16 cœurs, 18 TOPS. Pas utilisé par Ollama mais exploité par Core ML / MLX.
RAM disponible
8, 16 ou 24 Go. Chez Apple Refurbished, un MBA M3 16 Go se trouve vers 1050 €.
Refroidissement
Passif (sans ventilateur). Throttle après 10-12 min d'inférence soutenue (un peu mieux que le M2).
i
Dynamic caching, c'est quoi
Nouveauté introduite avec le M3 : le GPU alloue dynamiquement la mémoire locale selon les besoins des shaders. Concrètement pour les LLM, +5-10 % de throughput sur les modèles qui exploitent bien Metal (llama.cpp récent).

#1. RAM : 8, 16 ou 24 Go

8 Go
5-6 Go utilisables. Limité aux 2B-4B confortables (Qwen 3.5 2B/4B, Granite 4.2 3B), un 8B Q4 comme Granite 4.2 8B passe mais serré.
16 Go (recommandé)
11-12 Go utilisables. Qwen 3.5 9B Q4/Q5, Granite 4.2 8B, Gemma 4 12B Q4 jouable.
24 Go
18-19 Go utilisables. Qwen 3.5 9B en Q8, Mistral Small 24B Q4 confortable, Qwen 3.8 27B Q4 (18 Go) en visant serré, RAG multi-stage.

#2. Modèles recommandés

Modèles recommandés — MBA M3 10-core GPU
ModèleQuantRAM modèleMBA 8 GoMBA 16 GoMBA 24 Go
Qwen 3.5 2BQ4_K_M1,9 Go828888
Granite 4.2 3BQ4_K_M2,2 Go606565
Qwen 3.5 4BQ4_K_M3,4 Go444848
Gemma 4 E2BQ4_K_M4,3 Go384242
Granite 4.2 8BQ4_K_M5,3 Go2830
Qwen 3.5 9BQ4_K_M6,6 Go2527
Gemma 4 12BQ4_K_M7,6 Go1820
Mistral Small 24BQ4_K_M14 Go8

#3. Installation

Terminal
# Option A — Homebrew (recommandé)
brew install --cask ollama
brew services start ollama

# Option B — DMG officiel
# https://ollama.com/download/mac

# Modèle
ollama run qwen3.5:9b     # 16 Go
ollama run granite4.2:3b # 8 Go

Si vous voulez aussi essayer MLX (framework Apple) :

MLX via pip
pip install mlx-lm
mlx_lm.generate --model mlx-community/Qwen3.5-9B-Instruct-4bit --prompt "Bonjour"

#4. Benchmarks tokens/sec

MBA M3 10-core GPU, 16 Go, Ollama 0.5.x, secteur
ModèleQ4_K_MQ5_K_MQ8_0MLX 4-bit
Qwen 3.5 4B48 t/s43 t/s33 t/s50 t/s
Granite 4.2 8B28 t/s25 t/s18 t/s30 t/s
Qwen 3.5 9B25 t/s22 t/s16 t/s27 t/s
Gemma 4 12B18 t/s16 t/s19 t/s
MLX, un +5-8 % gratuit
Si vous utilisez LM Studio et que les modèles MLX existent pour votre choix, ils sont systématiquement 5 à 10 % plus rapides que les GGUF Q4 sur M3. Catalogue MLX : huggingface.co/mlx-community.

#5. Optimisations Metal spécifiques

Flash Attention
Activé par défaut sur llama.cpp récent. Gain de 10-15 % sur les contextes > 4 k tokens.
KV cache Q8
Via Ollama : export OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 16 Go si vous dépassez 8 k de contexte.
Dynamic Caching M3
Automatique — rien à activer. Gain de l'ordre de +5-8 % sur Qwen/Gemma vs une même config sur M2.

#6. MLX vs llama.cpp sur M3

MLX est le framework Apple dédié au machine learning sur Apple Silicon. Sur M3, il a deux avantages mesurables :

Vitesse
+5-10 % vs llama.cpp GGUF Q4 sur les modèles populaires (Qwen 3.5 9B, Granite 4.2 8B).
Fine-tuning
MLX supporte LoRA / QLoRA en local, llama.cpp non. Utile si vous voulez spécialiser un modèle sans cloud.
Inconvénient
Écosystème plus restreint (moins de modèles, moins d'UI). Ollama reste plus pratique pour 95 % des usages.

#M3 vs M4 : faut-il upgrader ?

Gain de vitesse
Environ +15-20 % sur les 7B, +20-30 % sur les 14B. Significatif mais pas transformationnel.
RAM minimum Apple
Depuis M4 (2025), 16 Go minimum chez Apple. Sur M3, 8 Go existait encore — moins pertinent en 2026.
Bande passante
M3 = 100 Go/s, M4 = 120 Go/s. +20 %, ressenti uniquement sur les modèles 8B+.
Conseil
Si vous avez un MBA M3 16 Go : aucune urgence. Si vous avez un M3 8 Go : envisagez un M4 16 Go ou gardez.

#Questions fréquentes

Le MacBook Air M3 peut-il faire tourner un LLM de 70B ?+
Non. Même en Q2, un 70B pèse plus de 25 Go, hors d'atteinte d'un MBA (max 24 Go). Pour un 70B, il faut un MacBook Pro M3/M4 Max 64 Go+ ou un Mac Studio.
Combien de tokens/seconde pour Qwen 3.5 9B sur MBA M3 16 Go ?+
Entre 24 et 27 tokens/seconde en Q4_K_M sur secteur. Sur batterie, comptez 20-24 tok/s. En Low Power Mode, autour de 15-18 tok/s.
MBA M3 8 Go ou MBA M2 16 Go ?+
Le M2 16 Go sans hésiter pour l'IA. La quantité de RAM est bien plus importante que la génération de puce : sur M3 8 Go vous êtes limité aux modèles 3B, sur M2 16 Go vous ouvrez les 8B.
Peut-on utiliser le Neural Engine (NPU) pour les LLM sur M3 ?+
Oui, via Core ML ou MLX, sur certains modèles optimisés. Ollama/llama.cpp n'exploitent pas le NPU : ils passent par le GPU Metal. Le NPU est surtout utile pour des modèles dédiés (Whisper, détection d'images).
Le MacBook Air M3 chauffe-t-il trop pour un usage LLM quotidien ?+
Usage chat ponctuel : aucun problème, la machine reste tiède. Usage batch (RAG sur 1000 PDF, embeddings en masse) : oui, throttle après 10-12 min. Pour du batch, préférez un Mac mini ou un MacBook Pro.
Quel modèle pour du code sur MBA M3 16 Go ?+
Pour du chat/code général, Qwen 3.5 9B Q4_K_M (6,6 Go) est le meilleur compromis en 16 Go : rentre largement en RAM, 24-27 tok/s. Pour l'autocomplétion inline (FIM), Qwen 2.5 Coder 7B base reste la référence 2026. En 24 Go, montez sur Devstral 24B (spécialiste agent de code, 14 Go) ou Qwen3-Coder 30B-A3B (MoE, 19 Go, serré).
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.