Intermédiaire 10 minCommunauté

Qwythos 9B : le petit modèle de raisonnement entraîné sur Claude, testé en local

Qwythos-9B est un modèle communautaire publié par Empero AI en juin 2026 : une base Qwen3.5-9B sous licence Apache 2.0, contexte 1M, fine-tunée sur des traces de raisonnement générées par Claude — d'où le mot-valise « Qwythos » (Qwen + Mythos). Il n'y a pas de page marketing léchée derrière : juste des poids GGUF sur Hugging Face et des tags Ollama poussés par la communauté. Ce guide fait le tri sur son origine, montre comment l'installer proprement, et le confronte en test réel à sa base Qwen3.5-9B sur une RTX 5070 Ti.

Par Mohamed Meguedmi·Màj 2026-08-21·Testé sur Windows, macOS, Linux

#Qwythos, c'est quoi au juste

Qwythos-9B n'est pas un modèle « from scratch ». C'est un fine-tune : quelqu'un a pris une base ouverte solide — Qwen3.5-9B d'Alibaba — et l'a ré-entraînée sur un corpus spécifique de traces de raisonnement. Ces traces (des chaînes de pensée détaillées, question → réflexion étape par étape → réponse) proviendraient de sorties de Claude, la famille de modèles d'Anthropic, sur un jeu de problèmes de logique, de maths et de code. Le nom « Qwythos » condense l'idée : la lettre initiale de Qwen, et « Mythos », nom informel donné au style de raisonnement de Claude par la communauté qui a assemblé le dataset.

L'intérêt du projet tient en une phrase : distiller un style de raisonnement verbeux et structuré dans un modèle assez petit pour tourner sur un GPU grand public. Un 9B se loge dans 6 Go de VRAM en Q4, là où les gros modèles de raisonnement demandent des dizaines de Go. Si le transfert de « manière de réfléchir » fonctionne, on obtient un raisonneur de poche. C'est exactement ce qu'on va vérifier.

i
Modèle communautaire, pas produit officiel
Qwythos n'est ni un modèle Alibaba ni un modèle Anthropic. C'est un fine-tune communautaire distribué par Empero AI. Aucune des deux entreprises d'origine ne le maintient ni ne le cautionne. Traitez-le comme un projet open source : les poids sont là, la qualité est à vérifier, le support tient à la bonne volonté de ses auteurs.

#Origine de Qwythos : les deux sources à connaître

Avant d'installer quoi que ce soit, il faut comprendre d'où viennent réellement les poids. Pour un modèle communautaire, la provenance n'est pas un détail : elle conditionne la confiance que vous pouvez accorder au fichier que vous téléchargez. Qwythos se trouve à deux endroits, et les deux ne se valent pas.

Source 1 — Hugging Face (dépôt d'origine)
Empero AI publie les poids sur Hugging Face, à la fois en format transformers (safetensors) et en GGUF quantifié. C'est la source de vérité : carte de modèle, licence Apache 2.0 affichée, mention de la base Qwen3.5-9B et du dataset de traces de raisonnement. Partez toujours de là pour vérifier le hash et lire la carte.
Source 2 — Tags Ollama communautaires
Sur le registre Ollama, Qwythos apparaît sous des espaces de noms d'utilisateurs (du type nom-utilisateur/qwythos), pas dans la bibliothèque officielle. Ces tags sont pratiques — une seule commande pour installer — mais ils sont ré-empaquetés par des tiers depuis les GGUF Hugging Face. Vérifiez qui publie le tag avant de lui faire confiance.
!
Un tag Ollama n'est pas signé
N'importe qui peut pousser un modèle sur le registre Ollama sous son propre nom. Un tag « qwythos » ne garantit pas que le GGUF derrière correspond aux poids officiels d'Empero AI. Pour un usage sérieux, préférez télécharger le GGUF depuis Hugging Face et l'importer vous-même via un Modelfile (voir plus bas), plutôt que de tirer un tag communautaire à l'aveugle.
Base
Qwen3.5-9B (Alibaba), licence Apache 2.0
Type
Fine-tune de raisonnement, chaîne de pensée explicite
Éditeur
Empero AI (communautaire), publication juin 2026
Licence
Apache 2.0 — usage commercial autorisé, héritée de la base
Contexte
1M de tokens annoncé (hérité de Qwen3.5), à tempérer selon la VRAM réelle
Formats
safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) sur Hugging Face

#Prérequis matériel

Un modèle de 9 milliards de paramètres est confortable pour du matériel récent. En quantification Q4_K_M — le compromis qualité/mémoire recommandé — Qwythos-9B occupe environ 6 Go de VRAM une fois chargé, auxquels s'ajoute le cache de contexte (KV cache) qui grossit avec la longueur des prompts. Notre banc de test tourne sur une RTX 5070 Ti (16 Go), largement au-dessus du minimum.

Q4_K_M (recommandé)
≈ 6 Go de VRAM. Tient sur une RTX 3060 12 Go, une 4070, une 5070 Ti — et même en partie sur 8 Go avec un contexte modeste.
Q5_K_M
≈ 7 Go. Léger gain de qualité, à privilégier si vous avez 12 Go ou plus.
Q8_0
≈ 10 Go. Quasi sans perte face au FP16, pertinent sur 16 Go et au-delà.
Contexte long
Le 1M annoncé est théorique. Un KV cache pour 128k tokens ajoute déjà plusieurs Go ; visez 16 Go+ de VRAM pour dépasser confortablement 32k.
Un modèle de raisonnement génère beaucoup
Les modèles de raisonnement « pensent » à voix haute avant de répondre : ils produisent parfois plusieurs centaines de tokens de réflexion pour une réponse d'une ligne. Prévoyez de la marge sur le contexte de sortie (num_predict) et attendez-vous à des temps de réponse plus longs qu'un modèle classique de même taille.

#Installer Qwythos avec Ollama

Deux voies. La rapide : tirer un tag communautaire. La sûre : télécharger le GGUF officiel depuis Hugging Face et l'importer via un Modelfile. Je détaille les deux ; pour un poste de travail sérieux, la seconde est préférable car vous savez exactement quel fichier vous exécutez.

  1. 01
    Vérifier qu'Ollama tourne
    Ollama expose son daemon sur http://localhost:11434. Un simple appel confirme qu'il répond avant d'aller plus loin. Si vous ne l'avez pas encore installé, reportez-vous au guide d'installation Ollama.
  2. 02
    Voie rapide — tag communautaire
    Repérez le tag sur ollama.com (espace de noms utilisateur), puis lancez ollama run. Notez le nom exact du publieur : c'est votre seule garantie de provenance.
  3. 03
    Voie sûre — GGUF depuis Hugging Face
    Téléchargez le fichier .gguf en Q4_K_M depuis le dépôt Empero AI, vérifiez son empreinte SHA256 contre celle affichée sur la carte du modèle, puis créez un Modelfile qui pointe dessus.
  4. 04
    Créer le modèle local
    Un ollama create construit un modèle nommé à partir de votre Modelfile. Vous obtenez un tag local que vous contrôlez de bout en bout.
  5. 05
    Lancer et discuter
    ollama run démarre la session interactive. Le premier chargement met le modèle en VRAM ; les suivants sont instantanés tant qu'il reste résident.
Terminal — vérifier Ollama
curl http://localhost:11434/api/version
# {"version":"0.x.x"}
Terminal — voie rapide (tag communautaire)
# Remplacez <publieur> par le nom réel du dépôt Ollama
ollama run <publieur>/qwythos:9b-q4_k_m
Terminal — voie sûre (GGUF Hugging Face)
# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI
huggingface-cli download EmperoAI/Qwythos-9B-GGUF \
  qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos

# 2. Vérifier l'empreinte contre celle de la carte du modèle
sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf
Modelfile — qwythos.Modelfile
FROM ./qwythos/qwythos-9b-Q4_K_M.gguf

PARAMETER temperature 0.6
PARAMETER top_p 0.95
PARAMETER num_ctx 32768

# Encourage la chaîne de pensée explicite
SYSTEM """Tu es un assistant de raisonnement. Décompose chaque problème étape par étape avant de conclure."""
Terminal — importer et lancer
ollama create qwythos-9b -f qwythos.Modelfile
ollama run qwythos-9b
i
Température plus basse pour le raisonnement
Sur les modèles de raisonnement, une température autour de 0.6 donne des chaînes de pensée plus stables qu'un 0.8 classique. Trop haut, le modèle part en digressions ; trop bas (0.1-0.2), il se répète. Le couple 0.6 / top_p 0.95 est un bon point de départ, ajustez selon vos tâches.

#Premier test de raisonnement

On commence par un problème piège classique, du genre qui fait trébucher les petits modèles non entraînés au raisonnement. L'objectif n'est pas juste d'avoir la bonne réponse, mais de voir si le modèle déroule une démarche cohérente au lieu de deviner.

Prompt de test
ollama run qwythos-9b "Un batte et une balle coûtent 1,10 € au total. La batte coûte 1 € de plus que la balle. Combien coûte la balle ? Raisonne étape par étape."

Réponse attendue : 0,05 €. Le piège intuitif pousse vers 0,10 €. Sur notre banc, Qwythos-9B pose l'équation (balle = x, batte = x + 1, total 2x + 1 = 1,10), isole x = 0,05, et vérifie que 0,05 + 1,05 = 1,10 avant de conclure. La démarche est verbeuse — une dizaine de lignes de réflexion pour une réponse d'un chiffre — mais elle est juste et traçable. C'est précisément le comportement qu'on espère d'un fine-tune de raisonnement.

Testez sur VOS problèmes
Un modèle peut avoir vu ce genre d'énigme classique pendant l'entraînement. Pour juger honnêtement, construisez deux ou trois problèmes tirés de votre domaine réel (une contrainte logistique, un bout de code à déboguer, un calcul métier) et comparez la démarche, pas seulement le résultat final.

#Qwythos vs Qwen3.5-9B de base : ce que le fine-tune change

La vraie question : le fine-tune apporte-t-il quelque chose par rapport à la base dont il est issu ? Pour le mesurer, on installe Qwen3.5-9B de base en parallèle et on soumet aux deux modèles la même série de problèmes de logique et de maths, à température égale. Voici ce qui ressort sur notre banc RTX 5070 Ti.

Terminal — installer la base pour comparer
ollama pull qwen3.5:9b
ollama run qwen3.5:9b "Un batte et une balle coûtent 1,10 €..."
Longueur de réflexion
Qwythos déroule systématiquement une chaîne de pensée explicite ; la base Qwen3.5 répond souvent plus court, parfois directement, sans montrer les étapes intermédiaires.
Problèmes à piège
Sur les énigmes contre-intuitives (batte/balle, séquences logiques), Qwythos se trompe moins car il vérifie sa réponse. La base tombe plus facilement dans le piège intuitif.
Vitesse
Avantage à la base : elle génère moins de tokens pour une réponse équivalente. Qwythos est plus lent en pratique car il « pense » avant de répondre — le prix du raisonnement.
Connaissances brutes
Match nul. Le fine-tune de raisonnement n'ajoute pas de connaissances factuelles ; sur les questions de culture générale, les deux modèles se valent (et partagent les mêmes trous).
Français
Équivalent. La qualité de français vient de la base Qwen3.5 ; Qwythos n'améliore ni ne dégrade la fluidité, il change la structure de la réponse, pas la langue.

Verdict de la comparaison : Qwythos gagne clairement sur les tâches où une démarche compte (maths, logique, débogage, planification), et perd sur la vitesse et les réponses courtes. Si vous voulez un assistant rapide pour de la reformulation ou du résumé, la base Qwen3.5-9B suffit. Si vous voulez un petit raisonneur qui montre son travail, Qwythos justifie son existence.

!
Le raisonnement n'est pas gratuit
Chaîne de pensée = plus de tokens générés = plus de latence et plus de VRAM de contexte consommée. Sur des tâches simples, forcer un modèle à raisonner ralentit sans rien apporter. Réservez Qwythos aux problèmes qui bénéficient réellement d'une décomposition, et gardez un modèle plus direct pour le reste.

#Le grand frère : Qwythos 27B

Empero AI publie aussi une variante 27B, bâtie sur une base Qwen3.5 plus grande selon le même principe : fine-tune sur traces de raisonnement. Elle vise ceux qui ont la VRAM pour aller plus loin en qualité de démarche, au prix d'un budget mémoire nettement supérieur.

VRAM (Q4_K_M)
≈ 19 Go. Il faut une RTX 4090 24 Go, une carte pro, ou un Mac à mémoire unifiée (M4 Pro/Max) pour le loger confortablement.
Ce qu'on gagne
Chaînes de raisonnement plus longues et plus robustes sur les problèmes à plusieurs étapes ; moins d'erreurs d'arithmétique en cascade. L'écart se creuse surtout sur les tâches vraiment difficiles.
Ce qu'on paie
Trois fois plus de VRAM et une génération plus lente. Sur du matériel 12-16 Go, le 27B ne rentre tout simplement pas en Q4 sans offload CPU, qui plombe la vitesse.
Quand le choisir
Si le 9B échoue régulièrement sur vos problèmes réels ET que vous avez 24 Go de VRAM. Sinon, le 9B reste le meilleur rapport qualité/ressources.
i
Commencez par le 9B
Ne partez pas sur le 27B par réflexe. Testez d'abord le 9B sur vos tâches réelles : dans beaucoup de cas, il suffit. Ne montez au 27B que si vous identifiez un plafond de qualité concret sur des problèmes que vous avez vraiment à résoudre — pas par principe.

#Dépannage

Le tag Ollama n'existe pas / a disparu
Les tags communautaires vont et viennent. Basculez sur la voie sûre : téléchargez le GGUF depuis Hugging Face et importez-le via Modelfile. Vous ne dépendez plus de la disponibilité d'un tiers.
Le modèle ne raisonne pas, il répond sec
Ajoutez une instruction système explicite (« décompose étape par étape ») et vérifiez que num_ctx est assez grand pour laisser de la place à la réflexion. Une température trop basse écrase aussi la chaîne de pensée.
Réponses tronquées
La réflexion consomme le budget de sortie. Augmentez num_predict (ou le paramètre équivalent de votre client) pour laisser le modèle finir sa démarche ET donner sa réponse.
Sortie très lente
Vérifiez que le modèle tient bien en VRAM (ollama ps). S'il déborde en RAM CPU, la vitesse s'effondre : descendez d'un cran de quantification ou réduisez num_ctx.
Doute sur l'intégrité du fichier
Comparez le SHA256 du GGUF téléchargé avec celui publié sur la carte Hugging Face. Une empreinte qui diffère signifie un fichier ré-empaqueté ou corrompu — ne l'exécutez pas.

#Pour aller plus loin

Pour installer les briques autour de Qwythos et comprendre les arbitrages évoqués ici :

Installer Ollama (Windows, macOS, Linux)
Le prérequis de ce guide : mettre en place le daemon Ollama sur le port 11434 avant de tirer le moindre modèle.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer entre Q4_K_M, Q5_K_M et Q8_0 selon votre VRAM et l'exigence de qualité sur Qwythos comme sur ses siblings.
Installer DeepSeek R1 avec Ollama
Un autre modèle de raisonnement open source à chaîne de pensée, utile pour comparer la démarche de Qwythos à une référence bien établie.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.