Débutant 8 minConcepts

MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle

Depuis 2025, la plupart des grosses sorties open-weight ont un point commun : ce sont des Mixture of Experts, ou MoE. On voit passer des noms comme Qwen3 30B-A3B, gpt-oss 120B ou Llama 4 Scout 17B-A2B, avec cette notation à deux chiffres qui intrigue. L'idée est simple une fois posée : un modèle MoE contient beaucoup de paramètres, mais n'en active qu'une petite fraction à chaque token. Résultat, un modèle « de 30 milliards » peut tourner à la vitesse d'un modèle de 3 milliards. Ce guide explique le mécanisme, décode la notation et détaille l'impact réel sur votre VRAM et votre débit.

Par Mohamed Meguedmi·Màj 2026-08-02·Testé sur Windows, macOS, Linux

#Le problème que le MoE résout

Un modèle de langage classique est dit « dense » : pour générer chaque mot, il fait passer votre texte à travers l'intégralité de ses paramètres. Un modèle dense de 32B mobilise ses 32 milliards de paramètres à chaque token. C'est ce qui le rend puissant, mais aussi lent et gourmand : plus il y a de paramètres, plus il faut de calcul et de mémoire, sans échappatoire.

Le dilemme du local est là. On veut la connaissance et la finesse d'un gros modèle, mais la vitesse et la sobriété d'un petit. Sur une carte grand public, un dense de 70B est soit hors de portée, soit d'une lenteur pénible. Le Mixture of Experts casse ce compromis en séparant deux choses qu'on croyait liées : la taille du modèle et le coût de chaque token.

i
L'intuition en une phrase
Un modèle dense fait travailler tout le monde sur chaque question. Un MoE ne réveille que les quelques spécialistes concernés, et laisse les autres dormir.

#Le principe : des experts activés à la demande

Dans un modèle Mixture of Experts, les grosses couches de calcul ne sont plus un bloc unique mais un ensemble de sous-réseaux appelés « experts ». Un modèle peut en contenir 64, 128, parfois plus. À chaque token traité, un petit aiguilleur — le « routeur » — regarde le contexte et choisit seulement 2, 4 ou 8 experts à activer. Le reste des experts ne fait aucun calcul pour ce token.

Contrairement à ce que le mot suggère, ces experts ne sont pas thématiques : il n'y a pas « l'expert en français » ou « l'expert en code ». Le routeur est entraîné en même temps que le modèle et répartit le travail selon des motifs statistiques que personne ne pilote à la main. D'un token à l'autre, la sélection change. Sur une phrase entière, la quasi-totalité des experts finit par servir, mais jamais tous en même temps.

Experts
Des sous-réseaux spécialisés, tous présents en mémoire, mais dont une minorité travaille à chaque token.
Routeur (gating)
Le composant léger qui décide, token par token, quels experts activer.
Experts actifs
Le nombre d'experts réveillés par token, souvent 2 à 8. C'est ce chiffre qui dicte la vitesse.
Paramètres actifs
Le total des paramètres réellement mobilisés par token — la fraction qui compte pour le calcul.
Une image mentale
Imaginez un cabinet de 128 médecins. Le patient est reçu par un aiguilleur qui l'oriente vers les 4 spécialistes pertinents. Le cabinet est immense (beaucoup de savoir disponible), mais chaque consultation ne mobilise que 4 personnes (peu de coût par patient).

#Décoder la notation 30B-A3B

La notation qui déroute les débutants est en réalité très lisible une fois la clé donnée. Prenez Qwen3 30B-A3B : le premier nombre est le total de paramètres du modèle, le second (après le « A », pour Active) est le nombre de paramètres actifs par token.

30B
Le modèle contient 30 milliards de paramètres au total. C'est ce qui détermine la mémoire nécessaire pour le charger.
A3B
Seuls ~3 milliards de paramètres sont actifs à chaque token. C'est ce qui détermine la vitesse de génération.

Autrement dit, 30B-A3B se lit « 30 milliards en réserve, 3 milliards au travail ». Le modèle a la richesse de connaissances d'un 30B, mais génère à peu près à la vitesse d'un 3B dense. Cette même logique s'applique à toutes les autres sorties récentes.

Qwen3 30B-A3B
30 milliards au total, 3 milliards actifs — le MoE grand public par excellence.
Llama 4 Scout 17B-A2B
17 milliards au total, environ 2 milliards actifs par token, avec en plus le multimodal.
gpt-oss 120B
120 milliards au total, mais seulement ~5 milliards actifs — d'où sa vitesse surprenante pour sa taille.
DeepSeek V3.2 671B-A37B
671 milliards en réserve, 37 milliards actifs : un géant qui « ne coûte » qu'un modèle moyen par token.
!
Le piège de lecture
Le second chiffre ne réduit pas la mémoire : un 30B-A3B occupe la place d'un 30B, pas d'un 3B. Le « A3B » accélère le calcul, il ne compresse pas le modèle. C'est la confusion n°1 chez les débutants.

#VRAM : ce qui change vraiment

C'est le point le plus mal compris, alors soyons nets. Tous les experts d'un MoE doivent être chargés en mémoire, parce que le routeur peut appeler n'importe lequel au token suivant. La VRAM requise dépend donc du total de paramètres, pas du nombre actif. Un 30B-A3B se dimensionne comme un dense de 30B.

Qwen3 30B-A3B en Q4_K_M
≈ 18-19 Go de VRAM, comme un dense de 32B. Il vise donc une RTX 4090 24 Go, ou déborde en RAM sur plus petit.
Llama 4 Scout 17B-A2B en Q4
≈ 10-11 Go, dans les cordes d'une RTX 4070 12 Go ou d'une 3060 12 Go.
gpt-oss 120B
Plusieurs dizaines de Go : réservé aux grosses configs ou à l'offload RAM/SSD.

La bonne nouvelle du MoE en local n'est donc pas la mémoire, mais le rapport qualité/vitesse à VRAM égale. Là où un dense de 30B rame sur votre carte, un MoE 30B-A3B occupe la même place tout en générant bien plus vite. Et parce que les experts inactifs ne servent pas à chaque token, les MoE tolèrent souvent bien l'offload d'une partie des poids en RAM : ce qui reste sur le GPU est sollicité en priorité.

i
Repère VRAM en Q4
3B ≈ 2 Go · 7B ≈ 5 Go · 14B ≈ 9 Go · 32B ≈ 19 Go · 70B ≈ 40 Go. Pour un MoE, appliquez ces repères au premier chiffre (le total), jamais au chiffre actif.

#Vitesse : pourquoi c'est rapide

La vitesse de génération d'un LLM dépend surtout du nombre de paramètres traversés à chaque token. Comme un MoE n'en active qu'une petite fraction, le calcul par token s'effondre. Concrètement, un 30B-A3B débite des tokens à un rythme proche d'un dense de 3B, tout en répondant avec la profondeur d'un 30B.

C'est exactement ce qui explique la vague de MoE sur les configs modestes : on récupère la qualité d'un gros modèle sans en payer la lenteur. Le prix à payer se trouve ailleurs — dans la mémoire, on l'a vu, et dans une empreinte disque plus lourde au téléchargement, puisqu'il faut stocker tous les experts.

Ce qui accélère
Peu de paramètres actifs par token → moins de calcul → plus de tokens/seconde.
Ce qui ne change pas
La VRAM et la taille du fichier, qui suivent le total de paramètres.
Le gain net
À mémoire égale, un MoE offre plus de connaissances pour une vitesse comparable à un bien plus petit dense.

#Les limites à connaître

Le MoE n'est pas magique et ne rend pas les modèles denses obsolètes. À nombre de paramètres actifs égal, un dense reste généralement un cran au-dessus en finesse de raisonnement : un 30B-A3B est excellent, mais un vrai dense de 30B qui activerait ses 30 milliards à chaque token serait plus fort — au prix d'une lenteur rédhibitoire en local.

Mémoire non réduite
Il faut la VRAM du total. Un MoE ne fait pas rentrer un gros modèle dans une petite carte.
Qualité par token active
À paramètres actifs comparables, un dense bien entraîné garde souvent l'avantage sur le raisonnement le plus pointu.
Téléchargement plus lourd
Tous les experts sont stockés : le fichier GGUF pèse le total, pas l'actif.
Sensibilité à la quantification
Le routeur et certains experts tolèrent mal une quantification trop agressive ; restez sur Q4_K_M ou au-dessus.
Comment choisir en pratique
VRAM serrée et besoin de vitesse avec de bonnes connaissances ? Un MoE brille. Priorité au raisonnement le plus fin sur une VRAM confortable ? Un dense de taille équivalente en paramètres actifs peut mieux valoir le coup.

#Les MoE phares à essayer en local

Voici les modèles Mixture of Experts qui font le plus de sens à tester chez soi en 2026, du plus accessible au plus exigeant.

Qwen3 30B-A3B
Le meilleur point d'entrée. Qualité généraliste et code solides, vitesse remarquable, ~18 Go en Q4. La référence pour découvrir le MoE.
Llama 4 Scout 17B-A2B
MoE multimodal (texte + image) et long contexte, plus léger en VRAM. Idéal si vous avez une carte 12 Go.
gpt-oss 120B
L'open-weight d'OpenAI, ~5B actifs seulement : bluffant de rapidité pour sa taille, mais réclame une grosse config.
DeepSeek V3.2 671B-A37B
Le monstre. Réservé aux setups avec beaucoup de RAM et un offload agressif, pour les curieux du haut du panier.

Si vous débutez, commencez par Qwen3 30B-A3B : c'est le MoE qui montre le mieux l'intérêt de l'architecture sur une seule carte grand public.

#Essayer un MoE en 3 minutes

Si Ollama est déjà installé et écoute sur son port par défaut, deux commandes suffisent pour sentir la différence entre un MoE et un dense.

  1. 01
    Télécharger et lancer un MoE
    Récupérez Qwen3 30B-A3B et discutez immédiatement avec lui. Le premier lancement télécharge le modèle (comptez plusieurs Go).
  2. 02
    Observer la vitesse
    Posez une question un peu longue et notez le débit. Malgré ses 30 milliards de paramètres, il répond du tac au tac, à la vitesse d'un petit modèle.
  3. 03
    Comparer avec un dense
    Lancez un dense de taille voisine et posez la même question. Le MoE devrait générer nettement plus vite, à VRAM comparable.
Terminal
# Lancer un MoE et discuter avec
ollama run qwen3:30b-a3b

# Pour comparer avec un dense de taille voisine
ollama run qwen3:32b
i
Vérifier le débit
Ajoutez le drapeau --verbose (ollama run qwen3:30b-a3b --verbose) pour voir les tokens/seconde en fin de réponse et comparer objectivement MoE et dense sur votre machine.

#Pour aller plus loin

Le MoE se comprend mieux en le reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :

Choisir sa quantification (Q4, Q5, Q8, FP16)
Le MoE est sensible à une quantification trop agressive : ce guide aide à trouver le bon compromis qualité/mémoire.
Installer Ollama : Windows, macOS et Linux
Pour mettre en place le daemon local sur le port 11434 avant de tirer votre premier MoE.
Llama 4 Scout en local : installation et premiers tests avec Ollama
Un MoE multimodal détaillé pas à pas, pour voir la théorie de ce guide à l'œuvre.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.