Débutant 8 minConcepts

Distillation : comment les petits modèles héritent des gros

Vous avez sans doute croisé des noms comme DeepSeek-R1-Distill-Qwen-14B et vous êtes demandé pourquoi un « petit » modèle raisonne soudain presque aussi bien qu'un géant. La réponse tient en un mot : la distillation. C'est la technique qui permet à un modèle compact d'hériter du comportement d'un modèle bien plus gros, sans en avoir la taille ni la lenteur. Ce guide explique la distillation LLM avec l'image du professeur et de l'élève, détaille ce qui se transmet réellement, ce qui reste en route, et comment reconnaître une distillation réussie avant de la faire tourner chez vous.

Par Clara M.·Màj 2026-08-07·Testé sur Windows, macOS, Linux

#Le problème que la distillation résout

Les meilleurs modèles ouverts sont énormes : plusieurs centaines de milliards de paramètres. Ils sont brillants, mais inutilisables sur une machine grand public : ils réclament des dizaines de gigaoctets de VRAM et débitent lentement. À l'inverse, un modèle de 7B ou 14B tient sur une carte de gamer et répond vite, mais il lui manque souvent la finesse de raisonnement du grand frère.

On aimerait donc récupérer une partie du talent d'un gros modèle dans un format qui tourne en local. Le réflexe naïf serait de simplement ré-entraîner un petit modèle sur les mêmes données brutes que le gros. Ça ne suffit pas : à taille réduite, apprendre seul sur un océan de texte donne un modèle correct, mais pas exceptionnel. La distillation propose un raccourci : au lieu de réapprendre le monde de zéro, le petit modèle apprend directement du gros.

i
L'intuition en une phrase
La distillation, ce n'est pas compresser un gros modèle. C'est entraîner un petit modèle à imiter les réponses et le style de raisonnement d'un grand — comme un apprenti qui regarde le maître travailler.

#Le principe professeur-élève

La distillation met en scène deux modèles. Le « professeur » est le gros modèle très performant qu'on veut imiter. L'« élève » est le petit modèle qu'on entraîne. Le principe : on pose des milliers de questions au professeur, on récupère ses réponses, et on entraîne l'élève à produire les mêmes. L'élève n'apprend plus sur des textes bruts trouvés sur le web, mais sur des exemples déjà « mâchés » par un modèle expert.

La subtilité qui fait toute la différence, c'est ce que l'élève copie exactement. Dans la version la plus riche, il n'imite pas seulement le mot final choisi par le professeur, mais toute la distribution de probabilités sur le mot suivant : le professeur ne dit pas juste « la réponse est chat », il indique « chat très probable, chien un peu, grille-pain quasi impossible ». Ces nuances — qu'on appelle parfois les soft labels — contiennent une information que la simple bonne réponse ne donne pas.

Professeur (teacher)
Le grand modèle de référence, coûteux mais excellent. Il sert de source, on ne le déploie pas chez vous.
Élève (student)
Le petit modèle qu'on entraîne à reproduire le comportement du professeur. C'est lui que vous ferez tourner en local.
Soft labels
Les probabilités nuancées du professeur sur chaque mot possible, pas seulement le mot gagnant. La matière première la plus riche de la distillation.
Jeu de distillation
L'ensemble des questions posées et des réponses du professeur, sur lequel l'élève s'entraîne.
Une image mentale
Un étudiant peut apprendre seul dans les livres, ou suivre le meilleur professeur du pays qui lui montre non seulement la bonne réponse, mais aussi son raisonnement, ses hésitations et ce qu'il écarte. Le second progresse bien plus vite à effort égal. La distillation, c'est offrir ce professeur au petit modèle.

#Ce qui se transmet vraiment

On imagine souvent que la distillation « transfère les connaissances » du gros modèle. C'est en partie vrai, mais imprécis. Ce qui passe le mieux, ce sont surtout des comportements et des façons de faire, plus que des faits bruts. Un petit modèle a une capacité de stockage limitée : il ne peut pas tout retenir de l'encyclopédie interne d'un géant. En revanche, il peut très bien capter des méthodes.

Le style de raisonnement
La manière de décomposer un problème en étapes, de poser une chaîne de pensée avant de conclure. C'est ce qui se transmet le mieux, et le cœur des R1-Distill.
Le format des réponses
La structure, le ton, la façon d'organiser une explication ou du code. L'élève adopte les habitudes rédactionnelles du professeur.
Les schémas de résolution
Sur les maths, le code ou la logique, l'élève hérite de recettes éprouvées : comment aborder un type de problème, quelles vérifications faire.
Une partie des connaissances
Des faits et des associations, oui, mais dans la limite de la capacité du petit modèle. C'est le poste qui passe le moins bien.

Cette distinction est essentielle pour comprendre les modèles distillés récents. Quand DeepSeek distille R1 dans un Qwen 14B, l'objectif n'est pas de faire tenir toute la culture générale de R1 dans 14 milliards de paramètres — c'est impossible. L'objectif est de transmettre sa façon de raisonner : réfléchir étape par étape, se corriger, dérouler une démonstration. Et ça, un petit modèle peut l'apprendre remarquablement bien.

i
Comportement vs connaissance
Retenez cette règle : la distillation transmet surtout des compétences et des habitudes (comment penser), moins des faits bruts (quoi savoir). Un distillé peut raisonner comme un géant tout en connaissant moins de choses que lui.

#Pourquoi un 14B distillé bat un 14B classique

Voici la partie contre-intuitive. Deux modèles ont exactement la même taille — 14 milliards de paramètres — donc la même VRAM et la même vitesse. Pourtant le distillé écrase souvent le classique sur le raisonnement. La taille n'a pas changé ; seule la façon d'entraîner a changé. Comment un même nombre de paramètres peut-il donner un modèle bien meilleur ?

Parce que l'entraînement ne remplit pas les paramètres au hasard : il les organise. Un 14B classique apprend seul à partir de texte brut ; il développe des capacités correctes mais généralistes. Un 14B distillé apprend sur des exemples produits par un professeur d'élite, souvent avec des raisonnements complets déroulés. Ses 14 milliards de paramètres se câblent autour de bonnes méthodes plutôt qu'autour de tout un peu. À capacité égale, la qualité du signal d'entraînement fait la différence.

Même coût, meilleur signal
Le distillé n'est ni plus gros ni plus lent, mais il a appris sur une matière de bien meilleure qualité : les sorties d'un expert.
Des exemples denses
Les réponses du professeur regorgent de raisonnements corrects et complets, rares dans le texte brut du web.
Moins de bruit
Le web contient beaucoup d'erreurs et de fouillis. Un professeur filtre : l'élève apprend sur du propre.

Attention à ne pas surinterpréter : « battre » vaut surtout sur les tâches ciblées par la distillation, typiquement le raisonnement, les maths et le code. Sur la culture générale pure ou la connaissance factuelle fine, l'écart se resserre, voire s'inverse. Un distillé n'est pas magiquement supérieur sur tout — il est supérieur là où on l'a entraîné à l'être.

#Le cas des R1-Distill

L'exemple qui a popularisé la distillation en local, c'est la famille DeepSeek-R1-Distill sortie début 2025. DeepSeek a pris son gros modèle de raisonnement R1 comme professeur, et a distillé son comportement dans plusieurs élèves de tailles différentes, basés sur des architectures existantes comme Qwen et Llama. Résultat : des modèles de 1.5B, 7B, 8B, 14B et 32B qui raisonnent avec une chaîne de pensée visible, ce qui était réservé aux géants.

R1-Distill-Qwen-1.5B
Minuscule, tourne quasiment partout, même sans GPU. Étonnant pour sa taille sur les maths simples.
R1-Distill-Qwen-7B / Llama-8B
Le compromis grand public : ~5 Go en Q4, sur une carte 8 Go. Bon raisonnement pour un usage quotidien.
R1-Distill-Qwen-14B
≈ 9 Go en Q4, la cible d'une RTX 3060 12 Go ou 4070 12 Go. Le sweet spot raisonnement/matériel accessible.
R1-Distill-Qwen-32B
≈ 19 Go en Q4, pour une RTX 4090 24 Go. Le plus proche du professeur, si votre VRAM suit.

Ces modèles montrent leur chaîne de pensée entre des balises de réflexion avant de donner la réponse finale. C'est exactement le comportement du professeur R1 qui a été transmis. En pratique, un R1-Distill-Qwen-14B déroule un raisonnement structuré sur un problème de maths là où un Qwen 14B classique répondrait plus platement — pour la même empreinte mémoire.

!
Distillé n'est pas « le vrai R1 »
Un DeepSeek-R1-Distill-Qwen-14B n'est pas R1 en réduit : c'est un Qwen 14B qui a appris à raisonner comme R1. Il en a la méthode, pas toute la puissance ni toute la connaissance. Ne vous attendez pas aux performances du modèle complet de 671B.

#Les limites : ce qui ne se transmet pas

La distillation a un plafond fixé par la taille de l'élève. On ne verse pas l'océan d'un géant dans un dé à coudre. Comprendre ce qui reste en route évite les déceptions et les mauvais choix de modèle.

La connaissance factuelle fine
Le petit modèle ne peut pas mémoriser tout ce que sait le professeur. Sur des faits pointus ou de niche, il hallucine plus facilement.
La robustesse hors sujet
Sur des tâches éloignées de ce qui a été distillé, l'élève retombe à peu près au niveau d'un modèle classique de sa taille.
Le plafond de capacité
Un 7B distillé reste un 7B. La distillation optimise l'usage des paramètres, elle n'en ajoute pas.
La cohérence sur très long contexte
Suivre un raisonnement sur des dizaines de milliers de tokens reste plus dur pour un petit modèle, distillé ou non.

Il y a aussi un risque plus subtil : un modèle distillé peut imiter la forme du raisonnement du professeur sans toujours en avoir la justesse. Il « fait comme s'il réfléchissait » de façon convaincante, mais peut se tromper avec assurance sur un problème hors de sa portée. La belle chaîne de pensée n'est pas une garantie d'exactitude — c'est un point à toujours vérifier, surtout pour des décisions importantes.

i
Le bon réflexe
Utilisez un distillé pour ce qu'il fait bien — raisonner, structurer, coder — et gardez un œil critique sur les faits qu'il avance. Pour la fiabilité factuelle, un RAG qui l'appuie sur vos documents vaut mieux que la seule mémoire du modèle.

#Repérer une bonne distillation

Tous les modèles distillés ne se valent pas. Avant d'en télécharger un, quelques indices permettent de juger sérieusement de sa qualité, sans être expert.

Un professeur identifié
Une bonne fiche indique clairement le modèle professeur (ex. « distillé depuis R1 »). Un professeur réputé est un bon signe de départ.
Une base claire
Sur quelle architecture est bâti l'élève (Qwen, Llama…) ? Une base solide et bien supportée facilite l'usage local.
Des benchmarks ciblés
Regardez les scores sur les tâches visées (maths, code, raisonnement), pas un chiffre global vague. Et comparez au modèle non distillé de même taille.
La cohérence taille/promesse
Méfiez-vous d'un tout petit modèle vendu comme équivalent à un géant sur tout. La distillation aide, elle ne fait pas de miracle.
Le format de réflexion
Pour un distillé de raisonnement, vérifiez qu'il expose bien sa chaîne de pensée et qu'elle est pertinente, pas juste décorative.
Le test qui ne trompe pas
Téléchargez le distillé ET le modèle classique de même taille, posez-leur vos propres questions difficiles côte à côte. Si le distillé raisonne mieux sur vos cas réels, il est bon pour vous — bien plus parlant qu'un benchmark public.

#Les distillations phares à essayer en local

Voici les modèles distillés qui valent le détour en 2026, du plus léger au plus exigeant, avec leur empreinte indicative en Q4_K_M.

DeepSeek-R1-Distill-Qwen-1.5B
≈ 1,5 Go. Le pari du minuscule : tourne même sur CPU ou petit portable. Bluffant sur les maths pour sa taille.
DeepSeek-R1-Distill-Qwen-7B
≈ 5 Go, sur une carte 8 Go. Le point d'entrée idéal pour découvrir le raisonnement distillé au quotidien.
DeepSeek-R1-Distill-Qwen-14B
≈ 9 Go, cible d'une RTX 3060 12 Go ou 4070. Le meilleur rapport raisonnement/matériel accessible.
DeepSeek-R1-Distill-Qwen-32B
≈ 19 Go, pour une RTX 4090 24 Go. Le plus proche du professeur si votre VRAM le permet.

Si vous débutez, commencez par la version 7B ou 14B : elles montrent l'intérêt de la distillation sur une seule carte grand public, sans la lourdeur des grosses configs. La 1.5B est un excellent bac à sable pour comprendre le comportement de raisonnement même sans GPU.

#Essayer un modèle distillé en 3 minutes

Si Ollama est déjà installé et écoute sur son port par défaut (http://localhost:11434), deux commandes suffisent pour sentir ce qu'apporte la distillation face à un modèle classique de même taille.

  1. 01
    Télécharger et lancer un distillé
    Récupérez un R1-Distill et discutez avec lui. Le premier lancement télécharge le modèle (quelques Go selon la taille choisie).
  2. 02
    Poser un problème de raisonnement
    Donnez-lui un problème de maths ou de logique en plusieurs étapes. Observez sa chaîne de pensée : il déroule un raisonnement avant de conclure.
  3. 03
    Comparer avec le modèle non distillé
    Lancez le Qwen classique de même taille et posez la même question. Le distillé devrait raisonner de façon plus structurée, à VRAM et vitesse identiques.
Terminal
# Lancer un modèle distillé de raisonnement
ollama run deepseek-r1:14b

# Comparer avec le modèle classique de même taille
ollama run qwen3:14b
i
Voir le raisonnement
Sur un R1-Distill, la réponse commence par une phase de réflexion (chaîne de pensée) avant la conclusion. C'est précisément le comportement hérité du professeur R1 — le signe visible que la distillation a fait son travail.

#Pour aller plus loin

La distillation se comprend mieux en la reliant aux autres notions de base du local. Ces guides prolongent directement celui-ci :

Installer DeepSeek R1 avec Ollama
Le pas-à-pas pour faire tourner les versions distillées 7B/14B/32B en local, avec les prérequis VRAM par taille.
MoE expliqué : pourquoi un 30B-A3B tourne comme un petit modèle
L'autre grande astuce d'architecture qui rend les gros modèles accessibles en local, complémentaire de la distillation.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Une fois votre distillé choisi, la quantification décide de son empreinte mémoire finale sur votre carte.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.