Qwen 3.8 27B en local : installation Ollama, VRAM et réglages (2026)
Les poids de Qwen3.8-27B sont sortis le 14 août 2026 sur Hugging Face, sous licence Apache 2.0, et le tag officiel Ollama a suivi le jour même. C'est le premier modèle de la génération 3.8 réellement installable chez vous : dense, multimodal (image et vidéo), 262 144 tokens de contexte natif. Ce guide donne la commande exacte, la VRAM réellement nécessaire tag par tag, les réglages du mode « thinking » activé par défaut, et les deux pièges qui gâchent la plupart des premiers essais — le contexte tronqué en silence et le débordement en RAM.
#Le verdict en 30 secondes
Qwen 3.8 27B s'installe en une commande : « ollama run qwen3.8:27b ». Le paquet par défaut (Q4_K_M) pèse 18 Go et demande une carte de 24 Go de VRAM — RTX 3090, 4090, 5090 — ou un Mac Apple Silicon avec au moins 32 Go de mémoire unifiée pour travailler confortablement. En dessous, le modèle tourne quand même, mais une partie des couches bascule sur le processeur et le débit s'effondre.
- Ce que c'est
- Un modèle dense de 27 milliards de paramètres, vision-langage natif (images et vidéos), 262 144 tokens de contexte, sous licence Apache 2.0 — donc utilisable commercialement sans clause restrictive.
- Le prérequis réaliste
- 24 Go de VRAM ou 32 Go de mémoire unifiée pour la version Q4_K_M. 30 Go de fichiers et ~40 Go de VRAM pour la Q8, 56 Go pour la BF16.
- La commande
- ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
- Le piège n°1
- Le contexte annoncé est de 256k, mais Ollama applique une fenêtre par défaut bien plus petite et tronque sans prévenir. Il faut régler num_ctx à la main.
- Le piège n°2
- Le mode « thinking » est actif par défaut et consomme beaucoup de tokens avant de répondre. En local, baissez reasoning_effort ou désactivez-le pour les tâches simples.
#Ce qu'est vraiment Qwen 3.8 27B
Contrairement à la mode des Mixture-of-Experts, Qwen3.8-27B est un modèle dense : les 27 milliards de paramètres sont activés à chaque token. C'est ce qui le rend prévisible en mémoire — pas de bonne surprise sur le débit, pas de mauvaise surprise sur la VRAM — et c'est aussi ce qui explique un débit local plus modeste qu'un MoE de taille comparable.
- Architecture
- 64 couches organisées en 16 blocs de « 3 × (Gated DeltaNet → FFN) puis 1 × (Gated Attention → FFN) ». Une attention hybride : la majorité des couches utilise une attention linéaire, économe en mémoire, entrecoupée de vraies couches d'attention pour la précision.
- Modalités
- Vision-langage natif : images fixes, documents, diagrammes scientifiques et vidéos. Ce n'est pas un adaptateur greffé après coup.
- Contexte
- 262 144 tokens en natif, extensible à 1 000 000 via YaRN — mais uniquement sur vLLM, SGLang ou TokenSpeed, pas via Ollama.
- Licence
- Apache 2.0. Usage commercial autorisé, pas de seuil d'utilisateurs comme chez Llama, pas de clause d'usage comme chez Gemma.
- Particularité
- Le modèle est entraîné avec du Multi-Token Prediction (MTP) — d'où les tags Ollama « mtp », qui accélèrent la génération sur les moteurs qui savent l'exploiter.
#Le matériel qu'il faut, tag par tag
La bibliothèque Ollama publie douze variantes. Le poids du téléchargement n'est pas la VRAM nécessaire : il faut y ajouter le cache KV, qui grandit avec la longueur du contexte, et l'encodeur visuel. Comptez 15 à 25 % de marge au-dessus de la taille du fichier.
| Tag | Taille | Mémoire confortable | Pour qui |
|---|---|---|---|
| qwen3.8:27b (Q4_K_M, défaut) | 18 Go | 24 Go | Le choix par défaut : RTX 3090/4090/5090, Mac 32 Go |
| qwen3.8:27b-q8_0 | 30 Go | 40 Go et + | Qualité quasi maximale : RTX Pro 6000, bi-GPU 24 Go |
| qwen3.8:27b-bf16 | 56 Go | 80 Go | Poids de référence, machines de calcul (H100, H200) |
| qwen3.8:27b-mlx | 18 Go | 32 Go unifiés | Apple Silicon : build Metal, le bon défaut sur Mac |
| qwen3.8:27b-mxfp8 | 32 Go | 48 Go unifiés | Mac Studio / M4 Max 64 Go, qualité supérieure |
| qwen3.8:27b-mlx-bf16 | 56 Go | 96 Go unifiés | Mac Studio 128 Go, aucune perte de quantification |
| qwen3.8:27b-mtp-q4_K_M | 18 Go | 24 Go | Identique au défaut, prédiction multi-tokens explicite |
Côté débit, nos estimations pour un 27B dense en Q4 tournent autour de 14 tokens/seconde sur une configuration milieu de gamme et 22 tokens/seconde sur du haut de gamme récent. Ce sont des ordres de grandeur calculés, pas des mesures : le mode « thinking » activé par défaut peut en plus doubler le temps perçu avant la première ligne de réponse.
#Installer Qwen 3.8 27B avec Ollama
- 01Mettez Ollama à jourLes couches hybrides et le parseur vision de Qwen 3.8 exigent une version récente d'Ollama. Une version antérieure à août 2026 renverra une erreur d'architecture ou un « model not found » trompeur. Réinstallez depuis le site officiel, ou relancez le script d'installation sous Linux.
- 02Téléchargez le modèle18 Go transitent : prévoyez de la place sur le disque système, là où Ollama stocke ses blobs. Le pull est reprenable si la connexion coupe.
- 03Lancez un premier échangeLa première réponse est plus lente, le temps que les poids soient chargés en mémoire. Si elle met plus d'une minute à démarrer, c'est le signe d'un débordement sur le processeur.
- 04Vérifiez où tourne le modèleLa commande ollama ps affiche la répartition GPU/CPU. Tant que vous ne lisez pas 100 % GPU, chaque token coûte cher — descendez d'un cran de quantification ou réduisez le contexte.
#Sur Mac Apple Silicon : prenez la variante MLX
Ollama publie un build MLX, compilé pour le moteur Metal d'Apple. À taille de fichier identique (18 Go), il exploite mieux la mémoire unifiée et donne un débit sensiblement supérieur au GGUF générique sur les puces M3, M4 et suivantes.
- Mac 16 Go
- Insuffisant. macOS ne laisse qu'environ 70 % de la mémoire unifiée au GPU : le modèle swappe et devient inutilisable.
- Mac 24 Go
- Ça passe tout juste avec un contexte court, sans autre application lourde ouverte. Acceptable pour tester, frustrant à l'usage.
- Mac 32 Go
- Le vrai point d'entrée : le modèle tient, il reste de la marge pour le cache KV et le système.
- Mac 64 Go et plus
- Confortable, et permet de monter en mxfp8 ou de travailler sur de longs documents.
#Le piège du contexte 256k
C'est l'erreur que font presque tous les premiers utilisateurs. Le modèle annonce 262 144 tokens, mais Ollama applique par défaut une fenêtre bien plus courte : au-delà, le début de votre document est simplement coupé, sans message d'erreur. Le modèle répond avec assurance sur un texte qu'il n'a pas vu en entier.
Quant au million de tokens annoncé : il repose sur une extension YaRN, configurée dans le fichier de configuration du modèle, et n'est supporté que par vLLM, SGLang ou TokenSpeed. Aucun chemin ne permet aujourd'hui d'y accéder depuis Ollama.
#Thinking mode et paramètres d'échantillonnage
Qwen 3.8 réfléchit avant de répondre : il produit un bloc de raisonnement entre balises « think » puis la réponse finale. C'est activé par défaut, et c'est ce qui explique l'essentiel de la latence perçue. Sur les moteurs qui le supportent, la profondeur se règle avec reasoning_effort — xhigh par défaut, puis medium et low.
| Mode | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking (défaut) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct (sans réflexion) | 0.7 | 0.80 | 20 | 1.5 |
- Tâches courtes en local
- Baissez reasoning_effort à low ou medium : sur une reformulation ou une extraction, la réflexion longue ne change rien à la qualité et triple le temps d'attente.
- Tâches agentiques
- Gardez xhigh. Alibaba note qu'un effort réduit provoque des analyses insuffisantes, donc des reprises — le gain par tour est annulé par les échecs.
- Réponses qui partent en boucle
- Montez presence_penalty (entre 0 et 2). Au-delà de 1,5, le modèle commence à mélanger les langues.
- Sortie polluée par le raisonnement
- Si votre application affiche les balises de réflexion, c'est qu'elle ne sépare pas reasoning_content du contenu final. Désactivez la réflexion pour ce cas d'usage plutôt que de filtrer le texte après coup.
#Analyser une image ou un document
La vision est native : capture d'écran, photo de tableau, schéma technique, page scannée. En ligne de commande, il suffit de donner le chemin du fichier dans le prompt ; via l'API, les images passent encodées en base64 dans le champ prévu par Ollama.
#Ce que valent les scores annoncés
Le saut revendiqué face à Qwen 3.6-27B, le modèle de même taille de la génération précédente, est important — surtout sur le code agentique et l'usage d'ordinateur. Voici les chiffres publiés par Alibaba, en gardant en tête qu'ils n'ont pas été reproduits indépendamment.
| Épreuve | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1 (code agentique) | 73,0 | 63,4 |
| SWE-bench Pro | 61,7 | 53,5 |
| LiveCodeBench v6 | 90,3 | 83,9 |
| IFBench (suivi d'instructions) | 79,5 | 69,1 |
| GPQA Diamond (sciences) | 89,2 | 87,8 |
| OSWorld-Verified (usage d'ordinateur) | 84,3 | 63,9 |
| MathVision (maths visuelles) | 90,0 | 85,1 |
| OmniDocBench 1.5 (documents) | 91,1 | 89,4 |
Ce qu'il faut en retenir pour un usage local : les progrès portent surtout sur les tâches longues et outillées — piloter un terminal, corriger un dépôt, enchaîner des étapes sans dérailler. Sur une simple conversation ou un résumé, l'écart avec la génération précédente sera beaucoup moins visible que ces chiffres ne le laissent croire.
#Faut-il quitter Qwen 3.6, Gemma 3 ou gpt-oss ?
- Vous êtes sur Qwen 3.6-27B
- Oui, la mise à jour vaut le coup : même empreinte mémoire, même licence permissive, gains nets sur le code et l'agentique. Gardez l'ancien tag le temps de valider vos prompts, les sorties changent de style.
- Vous êtes sur Gemma 3 27B
- Qwen 3.8 prend l'avantage sur le code, l'agentique et la licence (Apache 2.0 contre licence Gemma). Gemma reste souvent plus naturel en français conversationnel et plus rapide à démarrer.
- Vous êtes sur gpt-oss-20b
- Deux philosophies : gpt-oss est plus léger et plus rapide, Qwen 3.8 voit les images, tient un contexte bien plus long et vise les tâches longues. Choisissez selon la VRAM disponible.
- Vous cherchez surtout à coder
- Un modèle spécialisé code de 30B en MoE reste plus rapide à l'autocomplétion. Qwen 3.8 27B se justifie quand l'agent doit lire, planifier et modifier plusieurs fichiers.
- Vous avez moins de 24 Go
- Ne forcez pas. Un 12-14B en Q4 vous donnera une meilleure expérience qu'un 27B qui déborde sur le processeur.
#Dépannage
- « model not found » au pull
- Ollama est trop ancien pour connaître ce dépôt, ou le tag est mal orthographié — c'est bien « qwen3.8:27b », avec un point, pas un tiret. Mettez Ollama à jour puis relancez.
- Erreur d'architecture au chargement
- Même cause : les couches hybrides de Qwen 3.8 ne sont supportées que par les versions récentes du moteur.
- Génération très lente (moins de 5 tokens/s)
- Le modèle déborde en RAM. Vérifiez avec ollama ps : si la répartition n'est pas à 100 % GPU, réduisez num_ctx, fermez les autres applications GPU, ou passez à un modèle plus petit.
- Réponses qui ignorent le début du document
- Contexte tronqué en silence. Réglez num_ctx à la hauteur réelle de votre entrée, ou découpez le document.
- Le modèle « pense » sans fin
- reasoning_effort trop élevé pour la tâche. Descendez à medium ou low, ou désactivez la réflexion pour les tâches simples.
- L'image est ignorée
- Le chemin du fichier doit être accessible depuis le processus Ollama, et le parseur vision demande une version à jour. Testez avec une image locale simple avant d'incriminer le modèle.
- Manque de place disque
- Entre les blobs et le cache, prévoyez le double de la taille annoncée pendant l'installation. Un pull interrompu par un disque plein laisse des fragments : ollama rm puis nouveau pull.
Quelle VRAM faut-il pour Qwen 3.8 27B ?+
Comment installer Qwen 3.8 27B en local ?+
Qwen 3.8 27B est-il gratuit et utilisable en entreprise ?+
Quelle différence entre Qwen 3.8 27B et Qwen 3.8-Max ?+
Peut-on faire tourner Qwen 3.8 27B avec 16 Go de VRAM ?+
Qwen 3.8 27B est-il meilleur que Qwen 3.6 27B ?+
Peut-on désactiver le mode réflexion de Qwen 3.8 ?+
Le contexte d'un million de tokens est-il accessible en local ?+
#Pour aller plus loin
Ce guide suppose une installation Ollama fonctionnelle et un choix de quantification assumé. Ces pages complètent le sujet :
- Installer Ollama
- Le prérequis si le moteur n'est pas encore en place, sur Windows, macOS ou Linux — et la mise à jour, indispensable pour Qwen 3.8.
- Choisir sa quantification
- Pour arbitrer entre Q4, Q8 et BF16 en connaissance de cause : ce que chaque cran coûte en mémoire et ce qu'il rend en qualité.
- Qwen 3.8 : la chronologie des open weights
- D'où vient la confusion entre le Max en API et le 27B ouvert, et ce qui a été réellement annoncé quand.
- Quel LLM pour 24 Go de VRAM
- Le comparatif des modèles qui tiennent sur une carte 24 Go, si vous hésitez encore entre Qwen 3.8 27B et une alternative plus légère.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.