Distillation : comment les petits modèles héritent des gros
Vous avez sans doute croisé des noms comme DeepSeek-R1-Distill-Qwen-14B et vous êtes demandé pourquoi un « petit » modèle raisonne soudain presque aussi bien qu'un géant. La réponse tient en un mot : la distillation. C'est la technique qui permet à un modèle compact d'hériter du comportement d'un modèle bien plus gros, sans en avoir la taille ni la lenteur. Ce guide explique la distillation LLM avec l'image du professeur et de l'élève, détaille ce qui se transmet réellement, ce qui reste en route, et comment reconnaître une distillation réussie avant de la faire tourner chez vous.
#Le problème que la distillation résout
Les meilleurs modèles ouverts sont énormes : plusieurs centaines de milliards de paramètres. Ils sont brillants, mais inutilisables sur une machine grand public : ils réclament des dizaines de gigaoctets de VRAM et débitent lentement. À l'inverse, un modèle de 7B ou 14B tient sur une carte de gamer et répond vite, mais il lui manque souvent la finesse de raisonnement du grand frère.
On aimerait donc récupérer une partie du talent d'un gros modèle dans un format qui tourne en local. Le réflexe naïf serait de simplement ré-entraîner un petit modèle sur les mêmes données brutes que le gros. Ça ne suffit pas : à taille réduite, apprendre seul sur un océan de texte donne un modèle correct, mais pas exceptionnel. La distillation propose un raccourci : au lieu de réapprendre le monde de zéro, le petit modèle apprend directement du gros.
#Le principe professeur-élève
La distillation met en scène deux modèles. Le « professeur » est le gros modèle très performant qu'on veut imiter. L'« élève » est le petit modèle qu'on entraîne. Le principe : on pose des milliers de questions au professeur, on récupère ses réponses, et on entraîne l'élève à produire les mêmes. L'élève n'apprend plus sur des textes bruts trouvés sur le web, mais sur des exemples déjà « mâchés » par un modèle expert.
La subtilité qui fait toute la différence, c'est ce que l'élève copie exactement. Dans la version la plus riche, il n'imite pas seulement le mot final choisi par le professeur, mais toute la distribution de probabilités sur le mot suivant : le professeur ne dit pas juste « la réponse est chat », il indique « chat très probable, chien un peu, grille-pain quasi impossible ». Ces nuances — qu'on appelle parfois les soft labels — contiennent une information que la simple bonne réponse ne donne pas.
- Professeur (teacher)
- Le grand modèle de référence, coûteux mais excellent. Il sert de source, on ne le déploie pas chez vous.
- Élève (student)
- Le petit modèle qu'on entraîne à reproduire le comportement du professeur. C'est lui que vous ferez tourner en local.
- Soft labels
- Les probabilités nuancées du professeur sur chaque mot possible, pas seulement le mot gagnant. La matière première la plus riche de la distillation.
- Jeu de distillation
- L'ensemble des questions posées et des réponses du professeur, sur lequel l'élève s'entraîne.
#Ce qui se transmet vraiment
On imagine souvent que la distillation « transfère les connaissances » du gros modèle. C'est en partie vrai, mais imprécis. Ce qui passe le mieux, ce sont surtout des comportements et des façons de faire, plus que des faits bruts. Un petit modèle a une capacité de stockage limitée : il ne peut pas tout retenir de l'encyclopédie interne d'un géant. En revanche, il peut très bien capter des méthodes.
- Le style de raisonnement
- La manière de décomposer un problème en étapes, de poser une chaîne de pensée avant de conclure. C'est ce qui se transmet le mieux, et le cœur des R1-Distill.
- Le format des réponses
- La structure, le ton, la façon d'organiser une explication ou du code. L'élève adopte les habitudes rédactionnelles du professeur.
- Les schémas de résolution
- Sur les maths, le code ou la logique, l'élève hérite de recettes éprouvées : comment aborder un type de problème, quelles vérifications faire.
- Une partie des connaissances
- Des faits et des associations, oui, mais dans la limite de la capacité du petit modèle. C'est le poste qui passe le moins bien.
Cette distinction est essentielle pour comprendre les modèles distillés récents. Quand DeepSeek distille R1 dans un Qwen 14B, l'objectif n'est pas de faire tenir toute la culture générale de R1 dans 14 milliards de paramètres — c'est impossible. L'objectif est de transmettre sa façon de raisonner : réfléchir étape par étape, se corriger, dérouler une démonstration. Et ça, un petit modèle peut l'apprendre remarquablement bien.
#Pourquoi un 14B distillé bat un 14B classique
Voici la partie contre-intuitive. Deux modèles ont exactement la même taille — 14 milliards de paramètres — donc la même VRAM et la même vitesse. Pourtant le distillé écrase souvent le classique sur le raisonnement. La taille n'a pas changé ; seule la façon d'entraîner a changé. Comment un même nombre de paramètres peut-il donner un modèle bien meilleur ?
Parce que l'entraînement ne remplit pas les paramètres au hasard : il les organise. Un 14B classique apprend seul à partir de texte brut ; il développe des capacités correctes mais généralistes. Un 14B distillé apprend sur des exemples produits par un professeur d'élite, souvent avec des raisonnements complets déroulés. Ses 14 milliards de paramètres se câblent autour de bonnes méthodes plutôt qu'autour de tout un peu. À capacité égale, la qualité du signal d'entraînement fait la différence.
- Même coût, meilleur signal
- Le distillé n'est ni plus gros ni plus lent, mais il a appris sur une matière de bien meilleure qualité : les sorties d'un expert.
- Des exemples denses
- Les réponses du professeur regorgent de raisonnements corrects et complets, rares dans le texte brut du web.
- Moins de bruit
- Le web contient beaucoup d'erreurs et de fouillis. Un professeur filtre : l'élève apprend sur du propre.
Attention à ne pas surinterpréter : « battre » vaut surtout sur les tâches ciblées par la distillation, typiquement le raisonnement, les maths et le code. Sur la culture générale pure ou la connaissance factuelle fine, l'écart se resserre, voire s'inverse. Un distillé n'est pas magiquement supérieur sur tout — il est supérieur là où on l'a entraîné à l'être.
#Le cas des R1-Distill
L'exemple qui a popularisé la distillation en local, c'est la famille DeepSeek-R1-Distill sortie début 2025. DeepSeek a pris son gros modèle de raisonnement R1 comme professeur, et a distillé son comportement dans plusieurs élèves de tailles différentes, basés sur des architectures existantes comme Qwen et Llama. Résultat : des modèles de 1.5B, 7B, 8B, 14B et 32B qui raisonnent avec une chaîne de pensée visible, ce qui était réservé aux géants.
- R1-Distill-Qwen-1.5B
- Minuscule, tourne quasiment partout, même sans GPU. Étonnant pour sa taille sur les maths simples.
- R1-Distill-Qwen-7B / Llama-8B
- Le compromis grand public : ~5 Go en Q4, sur une carte 8 Go. Bon raisonnement pour un usage quotidien.
- R1-Distill-Qwen-14B
- ≈ 9 Go en Q4, la cible d'une RTX 3060 12 Go ou 4070 12 Go. Le sweet spot raisonnement/matériel accessible.
- R1-Distill-Qwen-32B
- ≈ 19 Go en Q4, pour une RTX 4090 24 Go. Le plus proche du professeur, si votre VRAM suit.
Ces modèles montrent leur chaîne de pensée entre des balises de réflexion avant de donner la réponse finale. C'est exactement le comportement du professeur R1 qui a été transmis. En pratique, un R1-Distill-Qwen-14B déroule un raisonnement structuré sur un problème de maths là où un Qwen 14B classique répondrait plus platement — pour la même empreinte mémoire.
#Les limites : ce qui ne se transmet pas
La distillation a un plafond fixé par la taille de l'élève. On ne verse pas l'océan d'un géant dans un dé à coudre. Comprendre ce qui reste en route évite les déceptions et les mauvais choix de modèle.
- La connaissance factuelle fine
- Le petit modèle ne peut pas mémoriser tout ce que sait le professeur. Sur des faits pointus ou de niche, il hallucine plus facilement.
- La robustesse hors sujet
- Sur des tâches éloignées de ce qui a été distillé, l'élève retombe à peu près au niveau d'un modèle classique de sa taille.
- Le plafond de capacité
- Un 7B distillé reste un 7B. La distillation optimise l'usage des paramètres, elle n'en ajoute pas.
- La cohérence sur très long contexte
- Suivre un raisonnement sur des dizaines de milliers de tokens reste plus dur pour un petit modèle, distillé ou non.
Il y a aussi un risque plus subtil : un modèle distillé peut imiter la forme du raisonnement du professeur sans toujours en avoir la justesse. Il « fait comme s'il réfléchissait » de façon convaincante, mais peut se tromper avec assurance sur un problème hors de sa portée. La belle chaîne de pensée n'est pas une garantie d'exactitude — c'est un point à toujours vérifier, surtout pour des décisions importantes.
#Repérer une bonne distillation
Tous les modèles distillés ne se valent pas. Avant d'en télécharger un, quelques indices permettent de juger sérieusement de sa qualité, sans être expert.
- Un professeur identifié
- Une bonne fiche indique clairement le modèle professeur (ex. « distillé depuis R1 »). Un professeur réputé est un bon signe de départ.
- Une base claire
- Sur quelle architecture est bâti l'élève (Qwen, Llama…) ? Une base solide et bien supportée facilite l'usage local.
- Des benchmarks ciblés
- Regardez les scores sur les tâches visées (maths, code, raisonnement), pas un chiffre global vague. Et comparez au modèle non distillé de même taille.
- La cohérence taille/promesse
- Méfiez-vous d'un tout petit modèle vendu comme équivalent à un géant sur tout. La distillation aide, elle ne fait pas de miracle.
- Le format de réflexion
- Pour un distillé de raisonnement, vérifiez qu'il expose bien sa chaîne de pensée et qu'elle est pertinente, pas juste décorative.
#Les distillations phares à essayer en local
Voici les modèles distillés qui valent le détour en 2026, du plus léger au plus exigeant, avec leur empreinte indicative en Q4_K_M.
- DeepSeek-R1-Distill-Qwen-1.5B
- ≈ 1,5 Go. Le pari du minuscule : tourne même sur CPU ou petit portable. Bluffant sur les maths pour sa taille.
- DeepSeek-R1-Distill-Qwen-7B
- ≈ 5 Go, sur une carte 8 Go. Le point d'entrée idéal pour découvrir le raisonnement distillé au quotidien.
- DeepSeek-R1-Distill-Qwen-14B
- ≈ 9 Go, cible d'une RTX 3060 12 Go ou 4070. Le meilleur rapport raisonnement/matériel accessible.
- DeepSeek-R1-Distill-Qwen-32B
- ≈ 19 Go, pour une RTX 4090 24 Go. Le plus proche du professeur si votre VRAM le permet.
Si vous débutez, commencez par la version 7B ou 14B : elles montrent l'intérêt de la distillation sur une seule carte grand public, sans la lourdeur des grosses configs. La 1.5B est un excellent bac à sable pour comprendre le comportement de raisonnement même sans GPU.
#Essayer un modèle distillé en 3 minutes
Si Ollama est déjà installé et écoute sur son port par défaut (http://localhost:11434), deux commandes suffisent pour sentir ce qu'apporte la distillation face à un modèle classique de même taille.
- 01Télécharger et lancer un distilléRécupérez un R1-Distill et discutez avec lui. Le premier lancement télécharge le modèle (quelques Go selon la taille choisie).
- 02Poser un problème de raisonnementDonnez-lui un problème de maths ou de logique en plusieurs étapes. Observez sa chaîne de pensée : il déroule un raisonnement avant de conclure.
- 03Comparer avec le modèle non distilléLancez le Qwen classique de même taille et posez la même question. Le distillé devrait raisonner de façon plus structurée, à VRAM et vitesse identiques.
#Pour aller plus loin
La distillation se comprend mieux en la reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :
- Installer DeepSeek R1 avec Ollama
- Le pas-à-pas pour faire tourner les versions distillées 7B/14B/32B en local, avec les prérequis VRAM par taille.
- MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle
- L'autre grande astuce d'architecture qui rend les gros modèles accessibles en local, complémentaire de la distillation.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Une fois votre distillé choisi, la quantification décide de son empreinte mémoire finale sur votre carte.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.