Avancé 11 minFine-tuning

Unsloth : fine-tuner un LLM sur une carte grand public

Unsloth est une bibliothèque Python qui rend le fine-tuning d'un modèle ouvert réalisable sur une carte graphique grand public : mêmes méthodes qu'ailleurs, mais des noyaux de calcul réécrits qui divisent le temps et la mémoire nécessaires. Concrètement, un modèle de 7 ou 8 milliards de paramètres s'ajuste sur une carte de 12 Go, et le résultat s'exporte en GGUF pour tourner le soir même dans Ollama. Reste la question qui précède tout le reste : avez-vous vraiment besoin de fine-tuner ?

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#La question à trancher avant d'installer quoi que ce soit

Le fine-tuning change la manière dont un modèle se comporte. La recherche documentaire change ce qu'il sait au moment de répondre. Confondre les deux fait perdre des semaines, et c'est l'erreur la plus fréquente.

Ce que vous voulez, et l'outil correspondant
Votre besoinLa bonne réponse
Des réponses fondées sur vos documentsUne chaîne RAG : les documents peuvent changer tous les jours
Un format de sortie constantFine-tuning, ou génération contrainte
Un ton maison, un registre métierFine-tuning
Le vocabulaire d'un domaine spécialiséFine-tuning, avec assez d'exemples
Des informations qui changent souventRAG, toujours : réentraîner pour un tarif n'a aucun sens
Des réponses plus courtes ou plus longuesLe prompt système d'abord ; ne jamais entraîner pour ça
i
Si la réponse honnête est « je veux qu'il connaisse notre documentation »
Arrêtez-vous ici et construisez une recherche documentaire. C'est moins coûteux, ça se met à jour en ajoutant un fichier, et ça cite ses sources — trois choses que le fine-tuning ne fait pas.

#Ce qu'Unsloth change concrètement

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

La méthode n'est pas nouvelle : on gèle les poids du modèle, on n'entraîne que de petites matrices insérées dans les couches d'attention, et on garde éventuellement les poids gelés en 4 bits. C'est l'approche standard, elle n'appartient pas à Unsloth.

Ce qu'apporte la bibliothèque, c'est l'implémentation : des noyaux de calcul écrits à la main pour les étapes les plus lourdes, une gestion soignée des gradients et de la mémoire, et des définitions de modèles adaptées pour les grandes familles ouvertes. Résultat : un entraînement nettement plus rapide et une empreinte mémoire nettement plus faible, à méthode identique. Les chiffres publiés par le projet valent pour ses cas de test — comme tous les chiffres d'éditeur, ils décrivent le meilleur cas.

#Quelle carte pour quel modèle

Ordres de grandeur pour un entraînement LoRA en 4 bits
Taille du modèleVRAM en pratiqueSur une carte grand public
1 à 3 milliards≈ 4 à 6 GoConfortable sur n'importe quelle carte récente
7 à 8 milliards≈ 8 à 12 GoLe point d'équilibre : une carte de 12 Go suffit
12 à 14 milliards≈ 16 à 24 GoUne carte de 24 Go pour une longueur de séquence utile
27 à 32 milliards≈ 24 à 48 GoHaut de gamme grand public à séquences courtes, ou location
70 milliards48 Go et plusHors de portée d'une seule carte grand public

Deux variables déplacent ces chiffres plus que tout le reste : la longueur des exemples d'entraînement, qui fait monter la mémoire à peu près proportionnellement, et la taille des lots. Réduire la longueur de séquence à ce dont vos données ont réellement besoin est le remède le plus simple à une erreur de mémoire saturée. À noter : la version libre vise un seul GPU et le matériel NVIDIA en premier ; le multi-GPU relève de l'offre payante, et la prise en charge des autres marques évolue — à vérifier dans la documentation du jour plutôt que sur parole.

#Le jeu de données est le vrai travail

Un fine-tuning ne rate jamais à cause de la bibliothèque. Il rate à cause des données.

Format
Une liste d'exemples dans la structure de conversation attendue par le modèle : instruction, entrée éventuelle, réponse attendue. La régularité compte plus que le volume.
Volume
Quelques centaines d'exemples de qualité déplacent le ton et le format. Quelques milliers sont nécessaires pour un vrai comportement métier. Cinquante ne produisent rien de mesurable.
Qualité
Le modèle imite ce qu'on lui montre, y compris les erreurs. Un défaut systématique dans les données devient un défaut systématique du modèle.
Jeu de contrôle
Des exemples que le modèle ne voit jamais à l'entraînement. Sans eux, impossible de distinguer l'apprentissage du simple par cœur.
!
Le surapprentissage ressemble à une réussite
Une courbe de perte qui tombe presque à zéro signifie en général que le modèle a mémorisé vos exemples, pas qu'il a appris votre tâche. Il répondra parfaitement à vos questions de test et moins bien qu'avant à tout le reste. On surveille le jeu de contrôle, pas la courbe d'entraînement, et on arrête tôt.

#De l'adaptateur au modèle utilisable

  1. 01
    Entraîner
  2. 02
    Évaluer
  3. 03
    Fusionner ou garder à part
  4. 04
    Exporter en GGUF et quantifier

#Les pièges classiques

Entraîner sur un modèle déjà aligné sans le savoir
Partir d'une version instruite ou d'une version de base ne donne pas les mêmes résultats ; le format de conversation attendu diffère.
Oublier le gabarit de conversation
Des exemples formatés autrement que ce qu'attend le modèle produisent un entraînement techniquement réussi et pratiquement inutile.
Mesurer sur les exemples d'entraînement
C'est l'erreur qui fait annoncer des résultats spectaculaires et livrer des modèles décevants.
Croire que ça remplacera la recherche documentaire
Les faits appris pendant l'entraînement vieillissent le jour même.

#FAQ

Unsloth est-il gratuit ?+
La bibliothèque libre couvre le fine-tuning LoRA et QLoRA sur un seul GPU, sans coût. L'entraînement multi-GPU et certaines capacités avancées relèvent d'une offre payante ; la frontière évolue, consultez la documentation à jour.
Quelle carte pour ajuster un modèle de 7 milliards de paramètres ?+
Environ 8 à 12 Go de VRAM en 4 bits avec une longueur de séquence modérée, ce qui place l'opération à portée d'une carte de 12 Go. Des exemples d'entraînement longs font grimper ce besoin rapidement.
Combien d'exemples faut-il ?+
Quelques centaines d'exemples cohérents et propres pour déplacer le ton et le format ; quelques milliers pour un comportement métier réel. La régularité prime sur le nombre, et de mauvais exemples enseignent de mauvaises habitudes.
Le modèle obtenu tourne-t-il dans Ollama ?+
Oui : on exporte en GGUF, on quantifie, puis on importe le fichier comme n'importe quel autre modèle. C'est la fin normale d'un fine-tuning local.
Ça marche sur AMD ou sur Mac ?+
La bibliothèque est construite autour de CUDA, donc NVIDIA en premier. Le reste évolue : considérez toute affirmation comme liée à une version précise et vérifiez avant d'acheter du matériel pour ça.
Fine-tuner rendra-t-il le modèle expert de mes données ?+
Mal, cher, et le résultat périme immédiatement. Les faits relèvent de la recherche documentaire ; le fine-tuning règle le comportement, le format et le registre. Combiner les deux est courant.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.