Intermédiaire 14 minOllama

Qwen 3.8 27B en local : installation Ollama, VRAM et réglages (2026)

Les poids de Qwen3.8-27B sont sortis le 14 août 2026 sur Hugging Face, sous licence Apache 2.0, et le tag officiel Ollama a suivi le jour même. C'est le premier modèle de la génération 3.8 réellement installable chez vous : dense, multimodal (image et vidéo), 262 144 tokens de contexte natif. Ce guide donne la commande exacte, la VRAM réellement nécessaire tag par tag, les réglages du mode « thinking » activé par défaut, et les deux pièges qui gâchent la plupart des premiers essais — le contexte tronqué en silence et le débordement en RAM.

Par Mohamed Meguedmi·Màj 2026-08-18·Testé sur Windows, macOS, Linux

#Le verdict en 30 secondes

Qwen 3.8 27B s'installe en une commande : « ollama run qwen3.8:27b ». Le paquet par défaut (Q4_K_M) pèse 18 Go et demande une carte de 24 Go de VRAM — RTX 3090, 4090, 5090 — ou un Mac Apple Silicon avec au moins 32 Go de mémoire unifiée pour travailler confortablement. En dessous, le modèle tourne quand même, mais une partie des couches bascule sur le processeur et le débit s'effondre.

Ce que c'est
Un modèle dense de 27 milliards de paramètres, vision-langage natif (images et vidéos), 262 144 tokens de contexte, sous licence Apache 2.0 — donc utilisable commercialement sans clause restrictive.
Le prérequis réaliste
24 Go de VRAM ou 32 Go de mémoire unifiée pour la version Q4_K_M. 30 Go de fichiers et ~40 Go de VRAM pour la Q8, 56 Go pour la BF16.
La commande
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
Le piège n°1
Le contexte annoncé est de 256k, mais Ollama applique une fenêtre par défaut bien plus petite et tronque sans prévenir. Il faut régler num_ctx à la main.
Le piège n°2
Le mode « thinking » est actif par défaut et consomme beaucoup de tokens avant de répondre. En local, baissez reasoning_effort ou désactivez-le pour les tâches simples.
!
Les chiffres de performance viennent d'Alibaba
À la date de publication de ce guide, aucun benchmark indépendant n'a été reproduit sur Qwen3.8-27B. Tous les scores cités plus bas proviennent de la carte de modèle officielle. Ils sont cohérents avec la génération précédente, mais à traiter comme des chiffres d'éditeur.

#Ce qu'est vraiment Qwen 3.8 27B

Contrairement à la mode des Mixture-of-Experts, Qwen3.8-27B est un modèle dense : les 27 milliards de paramètres sont activés à chaque token. C'est ce qui le rend prévisible en mémoire — pas de bonne surprise sur le débit, pas de mauvaise surprise sur la VRAM — et c'est aussi ce qui explique un débit local plus modeste qu'un MoE de taille comparable.

Architecture
64 couches organisées en 16 blocs de « 3 × (Gated DeltaNet → FFN) puis 1 × (Gated Attention → FFN) ». Une attention hybride : la majorité des couches utilise une attention linéaire, économe en mémoire, entrecoupée de vraies couches d'attention pour la précision.
Modalités
Vision-langage natif : images fixes, documents, diagrammes scientifiques et vidéos. Ce n'est pas un adaptateur greffé après coup.
Contexte
262 144 tokens en natif, extensible à 1 000 000 via YaRN — mais uniquement sur vLLM, SGLang ou TokenSpeed, pas via Ollama.
Licence
Apache 2.0. Usage commercial autorisé, pas de seuil d'utilisateurs comme chez Llama, pas de clause d'usage comme chez Gemma.
Particularité
Le modèle est entraîné avec du Multi-Token Prediction (MTP) — d'où les tags Ollama « mtp », qui accélèrent la génération sur les moteurs qui savent l'exploiter.
i
Ne pas confondre avec Qwen 3.8-Max
Qwen 3.8-Max, sorti le 3 août 2026, est un MoE d'environ 2 400 milliards de paramètres, disponible en API seulement : il n'existe aucun moyen de le faire tourner chez vous. Le 27B est la variante open-weight de la même génération. La chronologie complète est retracée dans notre guide sur les open weights Qwen 3.8.

#Le matériel qu'il faut, tag par tag

La bibliothèque Ollama publie douze variantes. Le poids du téléchargement n'est pas la VRAM nécessaire : il faut y ajouter le cache KV, qui grandit avec la longueur du contexte, et l'encodeur visuel. Comptez 15 à 25 % de marge au-dessus de la taille du fichier.

Variantes officielles de Qwen 3.8 27B sur Ollama (relevé du 18 août 2026)
TagTailleMémoire confortablePour qui
qwen3.8:27b (Q4_K_M, défaut)18 Go24 GoLe choix par défaut : RTX 3090/4090/5090, Mac 32 Go
qwen3.8:27b-q8_030 Go40 Go et +Qualité quasi maximale : RTX Pro 6000, bi-GPU 24 Go
qwen3.8:27b-bf1656 Go80 GoPoids de référence, machines de calcul (H100, H200)
qwen3.8:27b-mlx18 Go32 Go unifiésApple Silicon : build Metal, le bon défaut sur Mac
qwen3.8:27b-mxfp832 Go48 Go unifiésMac Studio / M4 Max 64 Go, qualité supérieure
qwen3.8:27b-mlx-bf1656 Go96 Go unifiésMac Studio 128 Go, aucune perte de quantification
qwen3.8:27b-mtp-q4_K_M18 Go24 GoIdentique au défaut, prédiction multi-tokens explicite
!
16 Go de VRAM : possible, mais pas confortable
Sur une RTX 4060 Ti 16 Go ou une 5070 Ti, la Q4_K_M ne tient pas entièrement en mémoire : Ollama place le reste sur le processeur et la génération tombe souvent sous 5 tokens par seconde. Pour 16 Go, un modèle de 12 à 14 milliards de paramètres reste un bien meilleur usage de la machine.

Côté débit, nos estimations pour un 27B dense en Q4 tournent autour de 14 tokens/seconde sur une configuration milieu de gamme et 22 tokens/seconde sur du haut de gamme récent. Ce sont des ordres de grandeur calculés, pas des mesures : le mode « thinking » activé par défaut peut en plus doubler le temps perçu avant la première ligne de réponse.

#Installer Qwen 3.8 27B avec Ollama

  1. 01
    Mettez Ollama à jour
    Les couches hybrides et le parseur vision de Qwen 3.8 exigent une version récente d'Ollama. Une version antérieure à août 2026 renverra une erreur d'architecture ou un « model not found » trompeur. Réinstallez depuis le site officiel, ou relancez le script d'installation sous Linux.
  2. 02
    Téléchargez le modèle
    18 Go transitent : prévoyez de la place sur le disque système, là où Ollama stocke ses blobs. Le pull est reprenable si la connexion coupe.
  3. 03
    Lancez un premier échange
    La première réponse est plus lente, le temps que les poids soient chargés en mémoire. Si elle met plus d'une minute à démarrer, c'est le signe d'un débordement sur le processeur.
  4. 04
    Vérifiez où tourne le modèle
    La commande ollama ps affiche la répartition GPU/CPU. Tant que vous ne lisez pas 100 % GPU, chaque token coûte cher — descendez d'un cran de quantification ou réduisez le contexte.
Installation et premier test
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
qwen3.8 tout court = le 27B
Le tag « qwen3.8:latest » pointe aujourd'hui vers le même blob que « qwen3.8:27b » : c'est le seul format publié dans la bibliothèque officielle. Écrire « ollama run qwen3.8 » revient exactement au même — mais figer la taille dans vos scripts évite les mauvaises surprises quand d'autres variantes arriveront.

#Sur Mac Apple Silicon : prenez la variante MLX

Ollama publie un build MLX, compilé pour le moteur Metal d'Apple. À taille de fichier identique (18 Go), il exploite mieux la mémoire unifiée et donne un débit sensiblement supérieur au GGUF générique sur les puces M3, M4 et suivantes.

Sur Mac Apple Silicon
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16 Go
Insuffisant. macOS ne laisse qu'environ 70 % de la mémoire unifiée au GPU : le modèle swappe et devient inutilisable.
Mac 24 Go
Ça passe tout juste avec un contexte court, sans autre application lourde ouverte. Acceptable pour tester, frustrant à l'usage.
Mac 32 Go
Le vrai point d'entrée : le modèle tient, il reste de la marge pour le cache KV et le système.
Mac 64 Go et plus
Confortable, et permet de monter en mxfp8 ou de travailler sur de longs documents.

#Le piège du contexte 256k

C'est l'erreur que font presque tous les premiers utilisateurs. Le modèle annonce 262 144 tokens, mais Ollama applique par défaut une fenêtre bien plus courte : au-delà, le début de votre document est simplement coupé, sans message d'erreur. Le modèle répond avec assurance sur un texte qu'il n'a pas vu en entier.

Régler la fenêtre de contexte
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
256k sur le papier, 16k à 64k chez vous
Le cache KV grandit à peu près linéairement avec le contexte et vient s'ajouter aux 18 Go de poids. Sur une carte de 24 Go, une fenêtre de 32 000 tokens est un réglage sain ; 64 000 tient au prix d'un peu de lenteur ; 262 144 est hors d'atteinte. Activer l'attention rapide et quantifier le cache KV en q8_0 (variables OLLAMA_FLASH_ATTENTION et OLLAMA_KV_CACHE_TYPE) récupère plusieurs gigaoctets.

Quant au million de tokens annoncé : il repose sur une extension YaRN, configurée dans le fichier de configuration du modèle, et n'est supporté que par vLLM, SGLang ou TokenSpeed. Aucun chemin ne permet aujourd'hui d'y accéder depuis Ollama.

#Thinking mode et paramètres d'échantillonnage

Qwen 3.8 réfléchit avant de répondre : il produit un bloc de raisonnement entre balises « think » puis la réponse finale. C'est activé par défaut, et c'est ce qui explique l'essentiel de la latence perçue. Sur les moteurs qui le supportent, la profondeur se règle avec reasoning_effort — xhigh par défaut, puis medium et low.

Paramètres d'échantillonnage recommandés par Alibaba
Modetemperaturetop_ptop_kpresence_penalty
Thinking (défaut)1.00.95200.0
Instruct (sans réflexion)0.70.80201.5
Tâches courtes en local
Baissez reasoning_effort à low ou medium : sur une reformulation ou une extraction, la réflexion longue ne change rien à la qualité et triple le temps d'attente.
Tâches agentiques
Gardez xhigh. Alibaba note qu'un effort réduit provoque des analyses insuffisantes, donc des reprises — le gain par tour est annulé par les échecs.
Réponses qui partent en boucle
Montez presence_penalty (entre 0 et 2). Au-delà de 1,5, le modèle commence à mélanger les langues.
Sortie polluée par le raisonnement
Si votre application affiche les balises de réflexion, c'est qu'elle ne sépare pas reasoning_content du contenu final. Désactivez la réflexion pour ce cas d'usage plutôt que de filtrer le texte après coup.

#Analyser une image ou un document

La vision est native : capture d'écran, photo de tableau, schéma technique, page scannée. En ligne de commande, il suffit de donner le chemin du fichier dans le prompt ; via l'API, les images passent encodées en base64 dans le champ prévu par Ollama.

Vision en ligne de commande
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
Testez la vision avant de la mettre en production
Le chemin multimodal a fait l'objet d'un correctif de parseur peu après la sortie. Si vos réponses ignorent l'image ou décrivent autre chose, mettez Ollama à jour avant de chercher plus loin — et validez sur une dizaine de vos propres documents avant d'industrialiser.

#Ce que valent les scores annoncés

Le saut revendiqué face à Qwen 3.6-27B, le modèle de même taille de la génération précédente, est important — surtout sur le code agentique et l'usage d'ordinateur. Voici les chiffres publiés par Alibaba, en gardant en tête qu'ils n'ont pas été reproduits indépendamment.

Qwen3.8-27B vs Qwen3.6-27B — scores communiqués par Alibaba (août 2026)
ÉpreuveQwen3.8-27BQwen3.6-27B
Terminal Bench 2.1 (code agentique)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench (suivi d'instructions)79,569,1
GPQA Diamond (sciences)89,287,8
OSWorld-Verified (usage d'ordinateur)84,363,9
MathVision (maths visuelles)90,085,1
OmniDocBench 1.5 (documents)91,189,4

Ce qu'il faut en retenir pour un usage local : les progrès portent surtout sur les tâches longues et outillées — piloter un terminal, corriger un dépôt, enchaîner des étapes sans dérailler. Sur une simple conversation ou un résumé, l'écart avec la génération précédente sera beaucoup moins visible que ces chiffres ne le laissent croire.

#Faut-il quitter Qwen 3.6, Gemma 3 ou gpt-oss ?

Vous êtes sur Qwen 3.6-27B
Oui, la mise à jour vaut le coup : même empreinte mémoire, même licence permissive, gains nets sur le code et l'agentique. Gardez l'ancien tag le temps de valider vos prompts, les sorties changent de style.
Vous êtes sur Gemma 3 27B
Qwen 3.8 prend l'avantage sur le code, l'agentique et la licence (Apache 2.0 contre licence Gemma). Gemma reste souvent plus naturel en français conversationnel et plus rapide à démarrer.
Vous êtes sur gpt-oss-20b
Deux philosophies : gpt-oss est plus léger et plus rapide, Qwen 3.8 voit les images, tient un contexte bien plus long et vise les tâches longues. Choisissez selon la VRAM disponible.
Vous cherchez surtout à coder
Un modèle spécialisé code de 30B en MoE reste plus rapide à l'autocomplétion. Qwen 3.8 27B se justifie quand l'agent doit lire, planifier et modifier plusieurs fichiers.
Vous avez moins de 24 Go
Ne forcez pas. Un 12-14B en Q4 vous donnera une meilleure expérience qu'un 27B qui déborde sur le processeur.

#Dépannage

« model not found » au pull
Ollama est trop ancien pour connaître ce dépôt, ou le tag est mal orthographié — c'est bien « qwen3.8:27b », avec un point, pas un tiret. Mettez Ollama à jour puis relancez.
Erreur d'architecture au chargement
Même cause : les couches hybrides de Qwen 3.8 ne sont supportées que par les versions récentes du moteur.
Génération très lente (moins de 5 tokens/s)
Le modèle déborde en RAM. Vérifiez avec ollama ps : si la répartition n'est pas à 100 % GPU, réduisez num_ctx, fermez les autres applications GPU, ou passez à un modèle plus petit.
Réponses qui ignorent le début du document
Contexte tronqué en silence. Réglez num_ctx à la hauteur réelle de votre entrée, ou découpez le document.
Le modèle « pense » sans fin
reasoning_effort trop élevé pour la tâche. Descendez à medium ou low, ou désactivez la réflexion pour les tâches simples.
L'image est ignorée
Le chemin du fichier doit être accessible depuis le processus Ollama, et le parseur vision demande une version à jour. Testez avec une image locale simple avant d'incriminer le modèle.
Manque de place disque
Entre les blobs et le cache, prévoyez le double de la taille annoncée pendant l'installation. Un pull interrompu par un disque plein laisse des fragments : ollama rm puis nouveau pull.
Questions fréquentes
Quelle VRAM faut-il pour Qwen 3.8 27B ?+
24 Go de VRAM pour la version par défaut Q4_K_M, qui pèse 18 Go de fichiers auxquels s'ajoute le cache KV. Comptez 40 Go pour la version Q8 et 56 Go pour les poids BF16. Sur Mac, il faut au moins 32 Go de mémoire unifiée.
Comment installer Qwen 3.8 27B en local ?+
Installez ou mettez à jour Ollama, puis lancez « ollama pull qwen3.8:27b » et « ollama run qwen3.8:27b ». Le téléchargement fait 18 Go. Sur un Mac Apple Silicon, utilisez plutôt le tag qwen3.8:27b-mlx, optimisé pour Metal.
Qwen 3.8 27B est-il gratuit et utilisable en entreprise ?+
Oui. Les poids sont publiés sous licence Apache 2.0, qui autorise l'usage commercial, la modification et la redistribution, sans seuil d'utilisateurs ni clause d'usage restrictive. C'est l'une des licences les plus permissives parmi les modèles ouverts.
Quelle différence entre Qwen 3.8 27B et Qwen 3.8-Max ?+
Qwen 3.8-Max est un modèle propriétaire de type Mixture-of-Experts d'environ 2 400 milliards de paramètres, accessible uniquement par API. Qwen3.8-27B est la variante dense open-weight de la même génération : c'est la seule des deux que vous pouvez faire tourner sur votre machine.
Peut-on faire tourner Qwen 3.8 27B avec 16 Go de VRAM ?+
Techniquement oui, mais une partie du modèle bascule sur le processeur et le débit tombe généralement sous 5 tokens par seconde. Sur 16 Go, un modèle de 12 à 14 milliards de paramètres donne une bien meilleure expérience.
Qwen 3.8 27B est-il meilleur que Qwen 3.6 27B ?+
D'après les chiffres publiés par Alibaba, oui, nettement sur le code agentique (73,0 contre 63,4 sur Terminal Bench 2.1) et l'usage d'ordinateur (84,3 contre 63,9 sur OSWorld-Verified). Ces scores n'ont pas encore été reproduits indépendamment, et l'écart est moins sensible sur les usages conversationnels.
Peut-on désactiver le mode réflexion de Qwen 3.8 ?+
Oui. Le mode thinking est actif par défaut mais se désactive par requête, et sa profondeur se règle avec le paramètre reasoning_effort (xhigh, medium ou low). En mode direct, les réglages conseillés sont temperature 0,7 et top_p 0,80.
Le contexte d'un million de tokens est-il accessible en local ?+
Non via Ollama. Le contexte natif est de 262 144 tokens, et l'extension à un million passe par une configuration YaRN supportée seulement par vLLM, SGLang et TokenSpeed. En pratique, sur une carte de 24 Go, une fenêtre de 16 000 à 64 000 tokens est le réglage réaliste.

#Pour aller plus loin

Ce guide suppose une installation Ollama fonctionnelle et un choix de quantification assumé. Ces pages complètent le sujet :

Installer Ollama
Le prérequis si le moteur n'est pas encore en place, sur Windows, macOS ou Linux — et la mise à jour, indispensable pour Qwen 3.8.
Choisir sa quantification
Pour arbitrer entre Q4, Q8 et BF16 en connaissance de cause : ce que chaque cran coûte en mémoire et ce qu'il rend en qualité.
Qwen 3.8 : la chronologie des open weights
D'où vient la confusion entre le Max en API et le 27B ouvert, et ce qui a été réellement annoncé quand.
Quel LLM pour 24 Go de VRAM
Le comparatif des modèles qui tiennent sur une carte 24 Go, si vous hésitez encore entre Qwen 3.8 27B et une alternative plus légère.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.