🇺🇸 OLMo 3 7B Think (SFT)
Fine-tune SFT « thinking » d'OLMo 3 7B : raisonnement pas-à-pas, 16k contexte, ~4,2 Go VRAM en Q4. 100% ouvert, licence Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
Classement mis à jour le 29/08/2026
Le MacBook Air M1 (8 / 16 Go, 68 Go/s) date de 2020 mais fait encore tourner des LLM 3-7B convenablement. Bande passante limitée → on reste sur les modèles efficients.
Fine-tune SFT « thinking » d'OLMo 3 7B : raisonnement pas-à-pas, 16k contexte, ~4,2 Go VRAM en Q4. 100% ouvert, licence Apache 2.0.
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu) : dense 7B spécialisé code et raisonnement, 128k contexte, ~4,1 Go VRAM Q4. Léger, tourne sur GPU 6-8 Go, licence MIT.
ollama pull glm-5.3
VLM 3B spécialisé extraction documents entreprise. OCR, tables, formulaires.
# HuggingFace : ibm-granite/granite-4.0-3b-vision
Dense 3B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 40Q/8KV. Tool calling et FIM code. Sortie 29 avril 2026.
ollama run granite4.1:3b
Granite 4.1 (3B Apache 2.0) : tag Ollama générique de la famille IBM Granite 4.1, 128k ctx, tool calling et code. Sortie mai 2026.
ollama run granite4.1
Dense 7B 100% ouvert (poids + données + code). Transparence totale pour recherche.
ollama run olmo-3:7b
Premier omni open : texte+image+audio+vidéo en entrée, texte+parole en sortie. Pas de tag Ollama officiel.
# GGUF : ggml-org/Qwen2.5-Omni-7B-GGUF (pas d'Ollama officiel)
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence | Sur Apple M1 (16 GB) |
|---|---|---|---|---|---|---|
| #1 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | 32 tok/s · Q8 |
| #2 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | 32 tok/s · Q8 |
| #3 | Granite 4.0 3B Vision | 3B | 2.2 GB | 16 384 | Apache 2.0 | 25 tok/s · FP16 |
| #4 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | 25 tok/s · FP16 |
| #5 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | 50 tok/s · FP16 |
| #6 | OLMo 3 7B | 7B | 5 GB | 8 192 | Apache 2.0 | 12 tok/s · Q8 |
| #7 | Qwen 2.5 Omni 7B | 7B | 6 GB | 32 768 | Apache 2.0 | 8 tok/s · Q8 |
Comparez les prix de MacBook Air M1 chez nos marchands partenaires (prix et stock à jour) :
Liens affiliés — QuelLLM peut percevoir une commission sur les achats, sans surcoût pour vous, ce qui n'influence pas le classement (établi de façon indépendante). En tant que Partenaire Amazon, QuelLLM réalise un bénéfice sur les achats remplissant les conditions requises.
Mémo gratuit
Reçois le mémo VRAM → meilleur modèle de code → commande Ollama (un seul écran, copier-coller). Et passe au kit Copilote Local pour en faire un setup qui marche vraiment.
Le kit Copilote Local — les configs Ollama + Cline + Aider prêtes à coller, Modelfiles réglés, dépannage, espace en ligne à vie →Pas de spam. Désinscription en 1 clic. Tes données restent chez nous (jamais revendues).
Ta carte → le meilleur modèle de code à faire tourner en local, et la commande Ollama exacte :
| Ta VRAM | GPU / Mac typiques | Modèle de code conseillé | Commande Ollama |
|---|---|---|---|
| 8 Go | RTX 4060 / 3060 · M1-M2 16 Go | Qwen 3.5 9B (Q4, 6,6 Go — 256k ctx) | ollama run qwen3.5:9b |
| 12 Go | RTX 3060 12 Go / 4070 / 5070 | Qwen 3.5 9B (Q8, 11 Go) ou Gemma 4 12B (7,6 Go) | ollama run qwen3.5:9b-q8_0 |
| 16 Go | RTX 5070 Ti / 4080 / 5080 · RX 9070 XT · M4 24 Go | Devstral 24B (Q4, 14 Go) — spécialiste agent de code | ollama run devstral:24b |
| 24 Go | RTX 3090 / 4090 · RX 7900 XTX · M4 Pro 48 Go | Qwen 3.8 27B (Q4, 18 Go) — le « proche Copilot » | ollama run qwen3.8:27b |
| 32 Go | RTX 5090 | Qwen 3.6 35B-A3B (Q4, 23 Go) — MoE rapide | ollama run qwen3.6:35b |
| 48 Go+ | Mac M4 Max 64 Go · M2 Ultra 128 Go | Qwen3-Coder 30B-A3B (Q8, 32 Go — 256k ctx) | ollama run qwen3-coder:30b-a3b-q8_0 |
-base : ollama run qwen2.5-coder:7b-base — c'est encore la référence sur ce cas précis. ⚠️ Qwen 3.8 : son raisonnement est réglé très haut par défaut et il « sur-réfléchit » sur des demandes simples — baisse-le à low (ou coupe-le) au premier lancement. ⚠️ Piège licence : Codestral 22B = Mistral Non-Production License → interdit pour coder au travail. Qwen 3.5/3.8, Gemma 4 et Devstral sont en Apache 2.0. 💡 Ça plante en mémoire ? Garde ~1,5 Go de VRAM libre pour le contexte, ou descends d'un cran de quantization.🔌 Pour le brancher dans VS Code : Cline (agent multi-fichiers), Aider (CLI) ou Tabby/Twinny (autocomplétion FIM) — tous se connectent à Ollama en local. Le kit Copilote Local — configs prêtes à coller + setup testé — est dispo : /copilote-local.
Filtre : 1-9B dont Q4_K_M tient sous 9 Go. Bonus 3-7B (peak M1) et bonus fort ≤ 3B (M1 n'a pas le Neural Engine M3/M4).
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
MacBook Air M1 en 2026 : encore utilisable pour les LLM ?
Oui, mais limité. Mistral 7B Q4 tourne à ~14 tok/s, Llama 3.2 3B Q4 à ~25 tok/s. Pour du chat fluide, c'est OK. Pour du codage soutenu, prévoyez du temps. Voir le guide MacBook Air M1.
Air M1 8 Go : ça passe vraiment ?
Tout juste avec Phi-4 Mini 3,8B Q4 ou Gemma 4 4B Q4 (~2,5 Go). macOS prend 4 Go, vous laissez 2 Go au modèle + contexte court. Préférez 16 Go.
Quelle quantif sur M1 ?
Q4_K_M reste le sweet spot. Q5_K_M est meilleur en qualité mais coûte 25 % de bande passante mémoire en plus → tokens/sec divisés par ~1,3. Sur M1 c'est sensible. Évitez Q3 (qualité dégradée perceptible).
M1 vs M2 sur Mistral 7B ?
M1 ≈ 14 tok/s vs M2 ≈ 22 tok/s. La différence vient surtout de la bande passante (68 vs 100 Go/s). Pas un upgrade nécessaire si le M1 16 Go vous suffit.