🇺🇸 Laguna XS.2
MoE 33B/3B actifs Apache 2.0 spécialiste coding agentic. 68.2% SWE-Bench Verified, 128k ctx. Tourne sur Mac 36 Go. Sortie 28 avril 2026.
ollama run laguna-xs.2
Classement mis à jour le 18/08/2026
Pour un usage commercial (SaaS, produit payant, service interne d'entreprise), seules les licences permissives (Apache 2.0, MIT, BSD) sont réellement tranquilles. On écarte les licences communautaires avec seuils d'utilisateurs, et les licences non-prod.
MoE 33B/3B actifs Apache 2.0 spécialiste coding agentic. 68.2% SWE-Bench Verified, 128k ctx. Tourne sur Mac 36 Go. Sortie 28 avril 2026.
ollama run laguna-xs.2
GLM-4.7-Flash (MoE 31B, ~3B actifs) : le meilleur rapport code/VRAM de la classe 30B. MIT, 128k ctx, très rapide sur 3090/4090.
ollama run glm-4.7-flash
Premier dLLM open Apache 2.0 : MoE 16B/1B + décodeur diffusion 6.2B. Texte+vision unifié. Sortie 22 avril 2026.
# HuggingFace : inclusionAI/LLaDA2.0-Uni (Flash Attn 2 + CUDA 12.4 requis)
Dense 27B multimodal sortie 22 avril 2026. 262k ctx (1M YaRN). SWE-bench Verified 77.2%.
ollama run qwen3.6:27b
Qwen 3.8 27B : dense multimodal (texte + vision), 262k contexte, ~16 Go VRAM Q4 (18 Go de poids Ollama). Apache 2.0, code agentique et vision.
ollama run qwen3.8:27b
Dense 30B Apache 2.0, 12 langues dont FR, 131k ctx, GQA 32Q/8KV. Tool calling OpenAI-compatible. Sortie 29 avril 2026.
ollama run granite4.1:30b
DiffusionGemma 26B (Google) : Gemma vision-langage par diffusion, instruct, 128k contexte, 15 Go VRAM Q4. Apache 2.0. Sortie juin 2026.
# HuggingFace : google/diffusiongemma-26B-A4B-it
Modèle Cohere de 30,5B orienté coding agentic et raisonnement. Contexte 488k, Apache 2.0, ~18 Go VRAM en Q4.
ollama run north-mini-code-1.0
| Rang | Modèle | Params | VRAM Q4 | Contexte | Licence |
|---|---|---|---|---|---|
| #1 | Laguna XS.2 | 33B | 19 GB | 131 072 | Apache 2.0 |
| #2 | GLM 4.7 Flash | 31B | 19 GB | 128 000 | MIT |
| #3 | LLaDA 2.0 Uni 16B | 16B | 18 GB | 8 192 | Apache 2.0 |
| #4 | Qwen 3.6 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #5 | Qwen 3.8 27B | 27B | 16 GB | 262 144 | Apache 2.0 |
| #6 | Granite 4.1 30B Instruct | 30B | 17 GB | 131 072 | Apache 2.0 |
| #7 | DiffusionGemma 26B-A4B Instruct | 26B | 15 GB | 128 000 | Apache 2.0 |
| #8 | North Mini Code 1.0 | 30.5B | 18 GB | 488 000 | Apache 2.0 |
Filtre strict : licence contient Apache, MIT ou BSD. Pas de Llama Community (seuil 700M MAU), pas de Mistral NPL, pas de Gemma (licence custom permissive mais avec clauses d'usage acceptable).
Critères pris en compte :
Le scoring est entièrement transparent : consultez notre méthodologie pour les détails de calcul VRAM/tokens/sec.
Llama 3.3 70B est-il libre commercialement ?
Non, Llama 3.3 est sous "Llama 3.3 Community License" — libre sauf si votre produit dépasse 700M MAU. Pour un produit grand public futur, c'est un risque. Préférez Qwen (Apache 2.0) ou Mistral (Apache 2.0 sur les modèles Open).
Et Gemma de Google ?
Gemma est sous "Gemma License" — permissive mais avec clause d'usage acceptable (pas pour armes, surveillance de masse, etc.). Pour la plupart des usages B2B, c'est OK, mais lisez attentivement si votre produit touche à la défense ou à la sécurité.
Puis-je fine-tuner un modèle Apache 2.0 et le revendre ?
Oui — Apache 2.0 permet la modification et la redistribution, y compris commerciale. Vous devez juste garder l'attribution et la licence dans les poids redistribués. Vos propres données d'entraînement restent les vôtres.
Qwen vient de Chine — y a-t-il un risque légal ?
Les modèles Qwen sont publiés sous Apache 2.0 par Alibaba Cloud. La licence est valide internationalement. Pour des usages très sensibles (défense, santé), certaines entreprises préfèrent Mistral (🇫🇷) ou IBM Granite (🇺🇸) pour la traçabilité de provenance.