Qwythos 9B : le petit modèle de raisonnement entraîné sur Claude, testé en local
Qwythos-9B est un modèle communautaire publié par Empero AI en juin 2026 : une base Qwen3.5-9B sous licence Apache 2.0, contexte 1M, fine-tunée sur des traces de raisonnement générées par Claude — d'où le mot-valise « Qwythos » (Qwen + Mythos). Il n'y a pas de page marketing léchée derrière : juste des poids GGUF sur Hugging Face et des tags Ollama poussés par la communauté. Ce guide fait le tri sur son origine, montre comment l'installer proprement, et le confronte en test réel à sa base Qwen3.5-9B sur une RTX 5070 Ti.
#Qwythos, c'est quoi au juste
Qwythos-9B n'est pas un modèle « from scratch ». C'est un fine-tune : quelqu'un a pris une base ouverte solide — Qwen3.5-9B d'Alibaba — et l'a ré-entraînée sur un corpus spécifique de traces de raisonnement. Ces traces (des chaînes de pensée détaillées, question → réflexion étape par étape → réponse) proviendraient de sorties de Claude, la famille de modèles d'Anthropic, sur un jeu de problèmes de logique, de maths et de code. Le nom « Qwythos » condense l'idée : la lettre initiale de Qwen, et « Mythos », nom informel donné au style de raisonnement de Claude par la communauté qui a assemblé le dataset.
L'intérêt du projet tient en une phrase : distiller un style de raisonnement verbeux et structuré dans un modèle assez petit pour tourner sur un GPU grand public. Un 9B se loge dans 6 Go de VRAM en Q4, là où les gros modèles de raisonnement demandent des dizaines de Go. Si le transfert de « manière de réfléchir » fonctionne, on obtient un raisonneur de poche. C'est exactement ce qu'on va vérifier.
#Origine de Qwythos : les deux sources à connaître
Avant d'installer quoi que ce soit, il faut comprendre d'où viennent réellement les poids. Pour un modèle communautaire, la provenance n'est pas un détail : elle conditionne la confiance que vous pouvez accorder au fichier que vous téléchargez. Qwythos se trouve à deux endroits, et les deux ne se valent pas.
- Source 1 — Hugging Face (dépôt d'origine)
- Empero AI publie les poids sur Hugging Face, à la fois en format transformers (safetensors) et en GGUF quantifié. C'est la source de vérité : carte de modèle, licence Apache 2.0 affichée, mention de la base Qwen3.5-9B et du dataset de traces de raisonnement. Partez toujours de là pour vérifier le hash et lire la carte.
- Source 2 — Tags Ollama communautaires
- Sur le registre Ollama, Qwythos apparaît sous des espaces de noms d'utilisateurs (du type nom-utilisateur/qwythos), pas dans la bibliothèque officielle. Ces tags sont pratiques — une seule commande pour installer — mais ils sont ré-empaquetés par des tiers depuis les GGUF Hugging Face. Vérifiez qui publie le tag avant de lui faire confiance.
- Base
- Qwen3.5-9B (Alibaba), licence Apache 2.0
- Type
- Fine-tune de raisonnement, chaîne de pensée explicite
- Éditeur
- Empero AI (communautaire), publication juin 2026
- Licence
- Apache 2.0 — usage commercial autorisé, héritée de la base
- Contexte
- 1M de tokens annoncé (hérité de Qwen3.5), à tempérer selon la VRAM réelle
- Formats
- safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) sur Hugging Face
#Prérequis matériel
Un modèle de 9 milliards de paramètres est confortable pour du matériel récent. En quantification Q4_K_M — le compromis qualité/mémoire recommandé — Qwythos-9B occupe environ 6 Go de VRAM une fois chargé, auxquels s'ajoute le cache de contexte (KV cache) qui grossit avec la longueur des prompts. Notre banc de test tourne sur une RTX 5070 Ti (16 Go), largement au-dessus du minimum.
- Q4_K_M (recommandé)
- ≈ 6 Go de VRAM. Tient sur une RTX 3060 12 Go, une 4070, une 5070 Ti — et même en partie sur 8 Go avec un contexte modeste.
- Q5_K_M
- ≈ 7 Go. Léger gain de qualité, à privilégier si vous avez 12 Go ou plus.
- Q8_0
- ≈ 10 Go. Quasi sans perte face au FP16, pertinent sur 16 Go et au-delà.
- Contexte long
- Le 1M annoncé est théorique. Un KV cache pour 128k tokens ajoute déjà plusieurs Go ; visez 16 Go+ de VRAM pour dépasser confortablement 32k.
#Installer Qwythos avec Ollama
Deux voies. La rapide : tirer un tag communautaire. La sûre : télécharger le GGUF officiel depuis Hugging Face et l'importer via un Modelfile. Je détaille les deux ; pour un poste de travail sérieux, la seconde est préférable car vous savez exactement quel fichier vous exécutez.
- 01Vérifier qu'Ollama tourneOllama expose son daemon sur http://localhost:11434. Un simple appel confirme qu'il répond avant d'aller plus loin. Si vous ne l'avez pas encore installé, reportez-vous au guide d'installation Ollama.
- 02Voie rapide — tag communautaireRepérez le tag sur ollama.com (espace de noms utilisateur), puis lancez ollama run. Notez le nom exact du publieur : c'est votre seule garantie de provenance.
- 03Voie sûre — GGUF depuis Hugging FaceTéléchargez le fichier .gguf en Q4_K_M depuis le dépôt Empero AI, vérifiez son empreinte SHA256 contre celle affichée sur la carte du modèle, puis créez un Modelfile qui pointe dessus.
- 04Créer le modèle localUn ollama create construit un modèle nommé à partir de votre Modelfile. Vous obtenez un tag local que vous contrôlez de bout en bout.
- 05Lancer et discuterollama run démarre la session interactive. Le premier chargement met le modèle en VRAM ; les suivants sont instantanés tant qu'il reste résident.
#Premier test de raisonnement
On commence par un problème piège classique, du genre qui fait trébucher les petits modèles non entraînés au raisonnement. L'objectif n'est pas juste d'avoir la bonne réponse, mais de voir si le modèle déroule une démarche cohérente au lieu de deviner.
Réponse attendue : 0,05 €. Le piège intuitif pousse vers 0,10 €. Sur notre banc, Qwythos-9B pose l'équation (balle = x, batte = x + 1, total 2x + 1 = 1,10), isole x = 0,05, et vérifie que 0,05 + 1,05 = 1,10 avant de conclure. La démarche est verbeuse — une dizaine de lignes de réflexion pour une réponse d'un chiffre — mais elle est juste et traçable. C'est précisément le comportement qu'on espère d'un fine-tune de raisonnement.
#Qwythos vs Qwen3.5-9B de base : ce que le fine-tune change
La vraie question : le fine-tune apporte-t-il quelque chose par rapport à la base dont il est issu ? Pour le mesurer, on installe Qwen3.5-9B de base en parallèle et on soumet aux deux modèles la même série de problèmes de logique et de maths, à température égale. Voici ce qui ressort sur notre banc RTX 5070 Ti.
- Longueur de réflexion
- Qwythos déroule systématiquement une chaîne de pensée explicite ; la base Qwen3.5 répond souvent plus court, parfois directement, sans montrer les étapes intermédiaires.
- Problèmes à piège
- Sur les énigmes contre-intuitives (batte/balle, séquences logiques), Qwythos se trompe moins car il vérifie sa réponse. La base tombe plus facilement dans le piège intuitif.
- Vitesse
- Avantage à la base : elle génère moins de tokens pour une réponse équivalente. Qwythos est plus lent en pratique car il « pense » avant de répondre — le prix du raisonnement.
- Connaissances brutes
- Match nul. Le fine-tune de raisonnement n'ajoute pas de connaissances factuelles ; sur les questions de culture générale, les deux modèles se valent (et partagent les mêmes trous).
- Français
- Équivalent. La qualité de français vient de la base Qwen3.5 ; Qwythos n'améliore ni ne dégrade la fluidité, il change la structure de la réponse, pas la langue.
Verdict de la comparaison : Qwythos gagne clairement sur les tâches où une démarche compte (maths, logique, débogage, planification), et perd sur la vitesse et les réponses courtes. Si vous voulez un assistant rapide pour de la reformulation ou du résumé, la base Qwen3.5-9B suffit. Si vous voulez un petit raisonneur qui montre son travail, Qwythos justifie son existence.
#Le grand frère : Qwythos 27B
Empero AI publie aussi une variante 27B, bâtie sur une base Qwen3.5 plus grande selon le même principe : fine-tune sur traces de raisonnement. Elle vise ceux qui ont la VRAM pour aller plus loin en qualité de démarche, au prix d'un budget mémoire nettement supérieur.
- VRAM (Q4_K_M)
- ≈ 19 Go. Il faut une RTX 4090 24 Go, une carte pro, ou un Mac à mémoire unifiée (M4 Pro/Max) pour le loger confortablement.
- Ce qu'on gagne
- Chaînes de raisonnement plus longues et plus robustes sur les problèmes à plusieurs étapes ; moins d'erreurs d'arithmétique en cascade. L'écart se creuse surtout sur les tâches vraiment difficiles.
- Ce qu'on paie
- Trois fois plus de VRAM et une génération plus lente. Sur du matériel 12-16 Go, le 27B ne rentre tout simplement pas en Q4 sans offload CPU, qui plombe la vitesse.
- Quand le choisir
- Si le 9B échoue régulièrement sur vos problèmes réels ET que vous avez 24 Go de VRAM. Sinon, le 9B reste le meilleur rapport qualité/ressources.
#Dépannage
- Le tag Ollama n'existe pas / a disparu
- Les tags communautaires vont et viennent. Basculez sur la voie sûre : téléchargez le GGUF depuis Hugging Face et importez-le via Modelfile. Vous ne dépendez plus de la disponibilité d'un tiers.
- Le modèle ne raisonne pas, il répond sec
- Ajoutez une instruction système explicite (« décompose étape par étape ») et vérifiez que num_ctx est assez grand pour laisser de la place à la réflexion. Une température trop basse écrase aussi la chaîne de pensée.
- Réponses tronquées
- La réflexion consomme le budget de sortie. Augmentez num_predict (ou le paramètre équivalent de votre client) pour laisser le modèle finir sa démarche ET donner sa réponse.
- Sortie très lente
- Vérifiez que le modèle tient bien en VRAM (ollama ps). S'il déborde en RAM CPU, la vitesse s'effondre : descendez d'un cran de quantification ou réduisez num_ctx.
- Doute sur l'intégrité du fichier
- Comparez le SHA256 du GGUF téléchargé avec celui publié sur la carte Hugging Face. Une empreinte qui diffère signifie un fichier ré-empaqueté ou corrompu — ne l'exécutez pas.
#Pour aller plus loin
Pour installer les briques autour de Qwythos et comprendre les arbitrages évoqués ici :
- Installer Ollama (Windows, macOS, Linux)
- Le prérequis de ce guide : mettre en place le daemon Ollama sur le port 11434 avant de tirer le moindre modèle.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer entre Q4_K_M, Q5_K_M et Q8_0 selon votre VRAM et l'exigence de qualité sur Qwythos comme sur ses siblings.
- Installer DeepSeek R1 avec Ollama
- Un autre modèle de raisonnement open source à chaîne de pensée, utile pour comparer la démarche de Qwythos à une référence bien établie.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.