MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle
Depuis 2025, la plupart des grosses sorties open-weight ont un point commun : ce sont des Mixture of Experts, ou MoE. On voit passer des noms comme Qwen3 30B-A3B, gpt-oss 120B ou Llama 4 Scout 17B-A2B, avec cette notation à deux chiffres qui intrigue. L'idée est simple une fois posée : un modèle MoE contient beaucoup de paramètres, mais n'en active qu'une petite fraction à chaque token. Résultat, un modèle « de 30 milliards » peut tourner à la vitesse d'un modèle de 3 milliards. Ce guide explique le mécanisme, décode la notation et détaille l'impact réel sur votre VRAM et votre débit.
#Le problème que le MoE résout
Un modèle de langage classique est dit « dense » : pour générer chaque mot, il fait passer votre texte à travers l'intégralité de ses paramètres. Un modèle dense de 32B mobilise ses 32 milliards de paramètres à chaque token. C'est ce qui le rend puissant, mais aussi lent et gourmand : plus il y a de paramètres, plus il faut de calcul et de mémoire, sans échappatoire.
Le dilemme du local est là. On veut la connaissance et la finesse d'un gros modèle, mais la vitesse et la sobriété d'un petit. Sur une carte grand public, un dense de 70B est soit hors de portée, soit d'une lenteur pénible. Le Mixture of Experts casse ce compromis en séparant deux choses qu'on croyait liées : la taille du modèle et le coût de chaque token.
#Le principe : des experts activés à la demande
Dans un modèle Mixture of Experts, les grosses couches de calcul ne sont plus un bloc unique mais un ensemble de sous-réseaux appelés « experts ». Un modèle peut en contenir 64, 128, parfois plus. À chaque token traité, un petit aiguilleur — le « routeur » — regarde le contexte et choisit seulement 2, 4 ou 8 experts à activer. Le reste des experts ne fait aucun calcul pour ce token.
Contrairement à ce que le mot suggère, ces experts ne sont pas thématiques : il n'y a pas « l'expert en français » ou « l'expert en code ». Le routeur est entraîné en même temps que le modèle et répartit le travail selon des motifs statistiques que personne ne pilote à la main. D'un token à l'autre, la sélection change. Sur une phrase entière, la quasi-totalité des experts finit par servir, mais jamais tous en même temps.
- Experts
- Des sous-réseaux spécialisés, tous présents en mémoire, mais dont une minorité travaille à chaque token.
- Routeur (gating)
- Le composant léger qui décide, token par token, quels experts activer.
- Experts actifs
- Le nombre d'experts réveillés par token, souvent 2 à 8. C'est ce chiffre qui dicte la vitesse.
- Paramètres actifs
- Le total des paramètres réellement mobilisés par token — la fraction qui compte pour le calcul.
#Décoder la notation 30B-A3B
La notation qui déroute les débutants est en réalité très lisible une fois la clé donnée. Prenez Qwen3 30B-A3B : le premier nombre est le total de paramètres du modèle, le second (après le « A », pour Active) est le nombre de paramètres actifs par token.
- 30B
- Le modèle contient 30 milliards de paramètres au total. C'est ce qui détermine la mémoire nécessaire pour le charger.
- A3B
- Seuls ~3 milliards de paramètres sont actifs à chaque token. C'est ce qui détermine la vitesse de génération.
Autrement dit, 30B-A3B se lit « 30 milliards en réserve, 3 milliards au travail ». Le modèle a la richesse de connaissances d'un 30B, mais génère à peu près à la vitesse d'un 3B dense. Cette même logique s'applique à toutes les autres sorties récentes.
- Qwen3 30B-A3B
- 30 milliards au total, 3 milliards actifs — le MoE grand public par excellence.
- Llama 4 Scout 17B-A2B
- 17 milliards au total, environ 2 milliards actifs par token, avec en plus le multimodal.
- gpt-oss 120B
- 120 milliards au total, mais seulement ~5 milliards actifs — d'où sa vitesse surprenante pour sa taille.
- DeepSeek V3.2 671B-A37B
- 671 milliards en réserve, 37 milliards actifs : un géant qui « ne coûte » qu'un modèle moyen par token.
#VRAM : ce qui change vraiment
C'est le point le plus mal compris, alors soyons nets. Tous les experts d'un MoE doivent être chargés en mémoire, parce que le routeur peut appeler n'importe lequel au token suivant. La VRAM requise dépend donc du total de paramètres, pas du nombre actif. Un 30B-A3B se dimensionne comme un dense de 30B.
- Qwen3 30B-A3B en Q4_K_M
- ≈ 18-19 Go de VRAM, comme un dense de 32B. Il vise donc une RTX 4090 24 Go, ou déborde en RAM sur plus petit.
- Llama 4 Scout 17B-A2B en Q4
- ≈ 10-11 Go, dans les cordes d'une RTX 4070 12 Go ou d'une 3060 12 Go.
- gpt-oss 120B
- Plusieurs dizaines de Go : réservé aux grosses configs ou à l'offload RAM/SSD.
La bonne nouvelle du MoE en local n'est donc pas la mémoire, mais le rapport qualité/vitesse à VRAM égale. Là où un dense de 30B rame sur votre carte, un MoE 30B-A3B occupe la même place tout en générant bien plus vite. Et parce que les experts inactifs ne servent pas à chaque token, les MoE tolèrent souvent bien l'offload d'une partie des poids en RAM : ce qui reste sur le GPU est sollicité en priorité.
#Vitesse : pourquoi c'est rapide
La vitesse de génération d'un LLM dépend surtout du nombre de paramètres traversés à chaque token. Comme un MoE n'en active qu'une petite fraction, le calcul par token s'effondre. Concrètement, un 30B-A3B débite des tokens à un rythme proche d'un dense de 3B, tout en répondant avec la profondeur d'un 30B.
C'est exactement ce qui explique la vague de MoE sur les configs modestes : on récupère la qualité d'un gros modèle sans en payer la lenteur. Le prix à payer se trouve ailleurs — dans la mémoire, on l'a vu, et dans une empreinte disque plus lourde au téléchargement, puisqu'il faut stocker tous les experts.
- Ce qui accélère
- Peu de paramètres actifs par token → moins de calcul → plus de tokens/seconde.
- Ce qui ne change pas
- La VRAM et la taille du fichier, qui suivent le total de paramètres.
- Le gain net
- À mémoire égale, un MoE offre plus de connaissances pour une vitesse comparable à un bien plus petit dense.
#Les limites à connaître
Le MoE n'est pas magique et ne rend pas les modèles denses obsolètes. À nombre de paramètres actifs égal, un dense reste généralement un cran au-dessus en finesse de raisonnement : un 30B-A3B est excellent, mais un vrai dense de 30B qui activerait ses 30 milliards à chaque token serait plus fort — au prix d'une lenteur rédhibitoire en local.
- Mémoire non réduite
- Il faut la VRAM du total. Un MoE ne fait pas rentrer un gros modèle dans une petite carte.
- Qualité par token active
- À paramètres actifs comparables, un dense bien entraîné garde souvent l'avantage sur le raisonnement le plus pointu.
- Téléchargement plus lourd
- Tous les experts sont stockés : le fichier GGUF pèse le total, pas l'actif.
- Sensibilité à la quantification
- Le routeur et certains experts tolèrent mal une quantification trop agressive ; restez sur Q4_K_M ou au-dessus.
#Les MoE phares à essayer en local
Voici les modèles Mixture of Experts qui font le plus de sens à tester chez soi en 2026, du plus accessible au plus exigeant.
- Qwen3 30B-A3B
- Le meilleur point d'entrée. Qualité généraliste et code solides, vitesse remarquable, ~18 Go en Q4. La référence pour découvrir le MoE.
- Llama 4 Scout 17B-A2B
- MoE multimodal (texte + image) et long contexte, plus léger en VRAM. Idéal si vous avez une carte 12 Go.
- gpt-oss 120B
- L'open-weight d'OpenAI, ~5B actifs seulement : bluffant de rapidité pour sa taille, mais réclame une grosse config.
- DeepSeek V3.2 671B-A37B
- Le monstre. Réservé aux setups avec beaucoup de RAM et un offload agressif, pour les curieux du haut du panier.
Si vous débutez, commencez par Qwen3 30B-A3B : c'est le MoE qui montre le mieux l'intérêt de l'architecture sur une seule carte grand public.
#Essayer un MoE en 3 minutes
Si Ollama est déjà installé et écoute sur son port par défaut, deux commandes suffisent pour sentir la différence entre un MoE et un dense.
- 01Télécharger et lancer un MoERécupérez Qwen3 30B-A3B et discutez immédiatement avec lui. Le premier lancement télécharge le modèle (comptez plusieurs Go).
- 02Observer la vitessePosez une question un peu longue et notez le débit. Malgré ses 30 milliards de paramètres, il répond du tac au tac, à la vitesse d'un petit modèle.
- 03Comparer avec un denseLancez un dense de taille voisine et posez la même question. Le MoE devrait générer nettement plus vite, à VRAM comparable.
#Pour aller plus loin
Le MoE se comprend mieux en le reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Le MoE est sensible à une quantification trop agressive : ce guide aide à trouver le bon compromis qualité/mémoire.
- Installer Ollama : Windows, macOS et Linux
- Pour mettre en place le daemon local sur le port 11434 avant de tirer votre premier MoE.
- Llama 4 Scout en local : installation et premiers tests avec Ollama
- Un MoE multimodal détaillé pas à pas, pour voir la théorie de ce guide à l'œuvre.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.