Débutant 10 minMacBook Air

Quel LLM sur MacBook Air M3 (8 / 16 / 24 Go) ?

Commercialisé début 2024, le MacBook Air M3 a été la première machine Apple Silicon à rendre l'IA locale grand public vraiment confortable. Bande passante 100 Go/s, jusqu'à 24 Go de RAM, GPU 10 cœurs avec dynamic caching : un Mistral 7B y tourne à 28-32 tokens/seconde, mieux qu'un RTX 3060 Laptop. Ce guide détaille quels modèles choisir selon votre config RAM.

Par Mohamed Meguedmi·Màj 2026-04-18·Testé sur macOS 14+

#Le MacBook Air M3 en 2026

Puce
Apple M3 (2024), 8 cœurs CPU + 8 ou 10 cœurs GPU. Architecture avec dynamic caching (nouveauté M3).
Bande passante
100 Go/s (identique au M2). Pas d'amélioration côté bande passante — c'est toujours le goulet.
Neural Engine
16 cœurs, 18 TOPS. Pas utilisé par Ollama mais exploité par Core ML / MLX.
RAM disponible
8, 16 ou 24 Go. Chez Apple Refurbished, un MBA M3 16 Go se trouve vers 1050 €.
Refroidissement
Passif (sans ventilateur). Throttle après 10-12 min d'inférence soutenue (un peu mieux que le M2).
i
Dynamic caching, c'est quoi
Nouveauté introduite avec le M3 : le GPU alloue dynamiquement la mémoire locale selon les besoins des shaders. Concrètement pour les LLM, +5-10 % de throughput sur les modèles qui exploitent bien Metal (llama.cpp récent).

#1. RAM : 8, 16 ou 24 Go

8 Go
5-6 Go utilisables. Limité aux 3B-4B confortables, 7B Q4 possible mais serré.
16 Go (recommandé)
11-12 Go utilisables. Mistral/Qwen 7B Q5/Q6, Llama 3.1 8B Q5, Phi-4 14B Q4 jouable.
24 Go
18-19 Go utilisables. Qwen 14B Q5, Mistral Small 24B Q4 confortable, RAG multi-stage.

#2. Modèles recommandés

Modèles recommandés — MBA M3 10-core GPU
ModèleQuantRAM modèleMBA 8 GoMBA 16 GoMBA 24 Go
Llama 3.2 1BQ8_01,5 Go859090
Qwen 2.5 3BQ5_K_M2,6 Go525858
Gemma 3 4BQ4_K_M2,8 Go404545
Mistral 7BQ4_K_M4,4 Go263030
Llama 3.1 8BQ4_K_M4,9 Go2527
Phi-4 14BQ4_K_M8,5 Go1315
Qwen 2.5 14BQ5_K_M10,5 Go11
Mistral Small 24BQ4_K_M14 Go7

#3. Installation

Terminal
# Option A — Homebrew (recommandé)
brew install --cask ollama
brew services start ollama

# Option B — DMG officiel
# https://ollama.com/download/mac

# Modèle
ollama run mistral    # 16 Go
ollama run qwen2.5:3b # 8 Go

Si vous voulez aussi essayer MLX (framework Apple) :

MLX via pip
pip install mlx-lm
mlx_lm.generate --model mlx-community/Mistral-7B-Instruct-v0.3-4bit --prompt "Bonjour"

#4. Benchmarks tokens/sec

MBA M3 10-core GPU, 16 Go, Ollama 0.5.x, secteur
ModèleQ4_K_MQ5_K_MQ8_0MLX 4-bit
Qwen 2.5 3B58 t/s52 t/s40 t/s60 t/s
Mistral 7B30 t/s27 t/s18 t/s32 t/s
Llama 3.1 8B25 t/s22 t/s16 t/s27 t/s
Phi-4 14B13 t/s12 t/s14 t/s
MLX, un +5-8 % gratuit
Si vous utilisez LM Studio et que les modèles MLX existent pour votre choix, ils sont systématiquement 5 à 10 % plus rapides que les GGUF Q4 sur M3. Catalogue MLX : huggingface.co/mlx-community.

#5. Optimisations Metal spécifiques

Flash Attention
Activé par défaut sur llama.cpp récent. Gain de 10-15 % sur les contextes > 4 k tokens.
KV cache Q8
Via Ollama : export OLLAMA_KV_CACHE_TYPE=q8_0. Divise par 2 la RAM du cache, essentiel sur 16 Go si vous dépassez 8 k de contexte.
Dynamic Caching M3
Automatique — rien à activer. Gain mesuré : +5-8 % sur Mistral/Llama vs une même config sur M2.

#6. MLX vs llama.cpp sur M3

MLX est le framework Apple dédié au machine learning sur Apple Silicon. Sur M3, il a deux avantages mesurables :

Vitesse
+5-10 % vs llama.cpp GGUF Q4 sur les modèles populaires (Mistral 7B, Llama 3.1 8B).
Fine-tuning
MLX supporte LoRA / QLoRA en local, llama.cpp non. Utile si vous voulez spécialiser un modèle sans cloud.
Inconvénient
Écosystème plus restreint (moins de modèles, moins d'UI). Ollama reste plus pratique pour 95 % des usages.

#M3 vs M4 : faut-il upgrader ?

Gain de vitesse
Environ +15-20 % sur les 7B, +20-30 % sur les 14B. Significatif mais pas transformationnel.
RAM minimum Apple
Depuis M4 (2025), 16 Go minimum chez Apple. Sur M3, 8 Go existait encore — moins pertinent en 2026.
Bande passante
M3 = 100 Go/s, M4 = 120 Go/s. +20 %, ressenti uniquement sur les modèles 8B+.
Conseil
Si vous avez un MBA M3 16 Go : aucune urgence. Si vous avez un M3 8 Go : envisagez un M4 16 Go ou gardez.

#Questions fréquentes

Le MacBook Air M3 peut-il faire tourner Llama 3.1 70B ?+
Non. Même en Q2, le modèle pèse plus de 25 Go, hors d'atteinte d'un MBA (max 24 Go). Pour le 70B, il faut un MacBook Pro M3/M4 Max 64 Go+ ou un Mac Studio.
Combien de tokens/seconde pour Mistral 7B sur MBA M3 16 Go ?+
Entre 28 et 32 tokens/seconde en Q4_K_M sur secteur. Sur batterie, comptez 24-28 tok/s. En Low Power Mode, autour de 18-22 tok/s.
MBA M3 8 Go ou MBA M2 16 Go ?+
Le M2 16 Go sans hésiter pour l'IA. La quantité de RAM est bien plus importante que la génération de puce : sur M3 8 Go vous êtes limité aux modèles 3B, sur M2 16 Go vous ouvrez les 8B.
Peut-on utiliser le Neural Engine (NPU) pour les LLM sur M3 ?+
Oui, via Core ML ou MLX, sur certains modèles optimisés. Ollama/llama.cpp n'exploitent pas le NPU : ils passent par le GPU Metal. Le NPU est surtout utile pour des modèles dédiés (Whisper, détection d'images).
Le MacBook Air M3 chauffe-t-il trop pour un usage LLM quotidien ?+
Usage chat ponctuel : aucun problème, la machine reste tiède. Usage batch (RAG sur 1000 PDF, embeddings en masse) : oui, throttle après 10-12 min. Pour du batch, préférez un Mac mini ou un MacBook Pro.
Quel modèle pour du code sur MBA M3 16 Go ?+
Qwen 2.5 Coder 7B Q5_K_M est l'un des meilleurs choix : spécialisé code, rentre largement en RAM, 20-25 tok/s. Alternative : DeepSeek Coder v2 Lite 16B Q4 (pour 24 Go uniquement).
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.