Unsloth : fine-tuner un LLM sur une carte grand public
Unsloth est une bibliothèque Python qui rend le fine-tuning d'un modèle ouvert réalisable sur une carte graphique grand public : mêmes méthodes qu'ailleurs, mais des noyaux de calcul réécrits qui divisent le temps et la mémoire nécessaires. Concrètement, un modèle de 7 ou 8 milliards de paramètres s'ajuste sur une carte de 12 Go, et le résultat s'exporte en GGUF pour tourner le soir même dans Ollama. Reste la question qui précède tout le reste : avez-vous vraiment besoin de fine-tuner ?
#La question à trancher avant d'installer quoi que ce soit
Le fine-tuning change la manière dont un modèle se comporte. La recherche documentaire change ce qu'il sait au moment de répondre. Confondre les deux fait perdre des semaines, et c'est l'erreur la plus fréquente.
| Votre besoin | La bonne réponse |
|---|---|
| Des réponses fondées sur vos documents | Une chaîne RAG : les documents peuvent changer tous les jours |
| Un format de sortie constant | Fine-tuning, ou génération contrainte |
| Un ton maison, un registre métier | Fine-tuning |
| Le vocabulaire d'un domaine spécialisé | Fine-tuning, avec assez d'exemples |
| Des informations qui changent souvent | RAG, toujours : réentraîner pour un tarif n'a aucun sens |
| Des réponses plus courtes ou plus longues | Le prompt système d'abord ; ne jamais entraîner pour ça |
- Fine-tuning ou RAG : l'arbre de décision détaillé
- LoRA et QLoRA : comment ça marche vraiment
- Un exemple complet de fine-tuning LoRA
#Ce qu'Unsloth change concrètement
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
La méthode n'est pas nouvelle : on gèle les poids du modèle, on n'entraîne que de petites matrices insérées dans les couches d'attention, et on garde éventuellement les poids gelés en 4 bits. C'est l'approche standard, elle n'appartient pas à Unsloth.
Ce qu'apporte la bibliothèque, c'est l'implémentation : des noyaux de calcul écrits à la main pour les étapes les plus lourdes, une gestion soignée des gradients et de la mémoire, et des définitions de modèles adaptées pour les grandes familles ouvertes. Résultat : un entraînement nettement plus rapide et une empreinte mémoire nettement plus faible, à méthode identique. Les chiffres publiés par le projet valent pour ses cas de test — comme tous les chiffres d'éditeur, ils décrivent le meilleur cas.
#Quelle carte pour quel modèle
| Taille du modèle | VRAM en pratique | Sur une carte grand public |
|---|---|---|
| 1 à 3 milliards | ≈ 4 à 6 Go | Confortable sur n'importe quelle carte récente |
| 7 à 8 milliards | ≈ 8 à 12 Go | Le point d'équilibre : une carte de 12 Go suffit |
| 12 à 14 milliards | ≈ 16 à 24 Go | Une carte de 24 Go pour une longueur de séquence utile |
| 27 à 32 milliards | ≈ 24 à 48 Go | Haut de gamme grand public à séquences courtes, ou location |
| 70 milliards | 48 Go et plus | Hors de portée d'une seule carte grand public |
Deux variables déplacent ces chiffres plus que tout le reste : la longueur des exemples d'entraînement, qui fait monter la mémoire à peu près proportionnellement, et la taille des lots. Réduire la longueur de séquence à ce dont vos données ont réellement besoin est le remède le plus simple à une erreur de mémoire saturée. À noter : la version libre vise un seul GPU et le matériel NVIDIA en premier ; le multi-GPU relève de l'offre payante, et la prise en charge des autres marques évolue — à vérifier dans la documentation du jour plutôt que sur parole.
#Le jeu de données est le vrai travail
Un fine-tuning ne rate jamais à cause de la bibliothèque. Il rate à cause des données.
- Format
- Une liste d'exemples dans la structure de conversation attendue par le modèle : instruction, entrée éventuelle, réponse attendue. La régularité compte plus que le volume.
- Volume
- Quelques centaines d'exemples de qualité déplacent le ton et le format. Quelques milliers sont nécessaires pour un vrai comportement métier. Cinquante ne produisent rien de mesurable.
- Qualité
- Le modèle imite ce qu'on lui montre, y compris les erreurs. Un défaut systématique dans les données devient un défaut systématique du modèle.
- Jeu de contrôle
- Des exemples que le modèle ne voit jamais à l'entraînement. Sans eux, impossible de distinguer l'apprentissage du simple par cœur.
#De l'adaptateur au modèle utilisable
- 01Entraîner
- 02Évaluer
- 03Fusionner ou garder à part
- 04Exporter en GGUF et quantifier
#Les pièges classiques
- Entraîner sur un modèle déjà aligné sans le savoir
- Partir d'une version instruite ou d'une version de base ne donne pas les mêmes résultats ; le format de conversation attendu diffère.
- Oublier le gabarit de conversation
- Des exemples formatés autrement que ce qu'attend le modèle produisent un entraînement techniquement réussi et pratiquement inutile.
- Mesurer sur les exemples d'entraînement
- C'est l'erreur qui fait annoncer des résultats spectaculaires et livrer des modèles décevants.
- Croire que ça remplacera la recherche documentaire
- Les faits appris pendant l'entraînement vieillissent le jour même.
#FAQ
Unsloth est-il gratuit ?+
Quelle carte pour ajuster un modèle de 7 milliards de paramètres ?+
Combien d'exemples faut-il ?+
Le modèle obtenu tourne-t-il dans Ollama ?+
Ça marche sur AMD ou sur Mac ?+
Fine-tuner rendra-t-il le modèle expert de mes données ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.