Débutant 8 minActualités

Qwen 3.8 open weights : chronologie et sortie du 14 août 2026

Les poids ouverts de Qwen 3.8 sont sortis : Alibaba a publié Qwen3.8-27B sur Hugging Face le 14 août 2026, sous licence Apache 2.0, avec un tag Ollama officiel dans la foulée. Ce guide retrace la chronologie complète — de l'annonce au WAIC fin juillet au lancement du Qwen 3.8-Max en API le 3 août, puis au drop des poids — et explique la confusion persistante entre le Max, propriétaire et hors de portée du local, et le 27B dense que vous pouvez installer chez vous. Pour l'installation pas à pas, voyez notre guide dédié à Qwen 3.8 27B en local.

Par Mohamed Meguedmi·Màj 2026-08-18·Testé sur Windows, macOS, Linux

#Le point en une minute

Si vous êtes venu chercher un tag Ollama pour Qwen 3.8, il existe depuis le 14 août 2026 : « ollama run qwen3.8:27b ». Ce qu'il faut comprendre avant d'aller plus loin, c'est que la génération 3.8 recouvre deux modèles très différents — un modèle propriétaire géant servi par API, et un modèle dense de 27 milliards de paramètres que vous pouvez télécharger.

Qwen 3.8-Max
Modèle phare d'Alibaba, MoE d'environ 2 400 milliards de paramètres, contexte 1M. Disponible via l'API Alibaba Cloud depuis le 3 août 2026. Propriétaire, non téléchargeable — ce n'est pas un modèle local.
Qwen3.8-27B (open weights)
Version dense multimodale publiée le 14 août 2026 sur Hugging Face sous licence Apache 2.0. 262 144 tokens de contexte natif, 18 Go en Q4_K_M, tag Ollama officiel qwen3.8:27b.
Ce que vous pouvez faire aujourd'hui
Installer directement le 27B sur une carte 24 Go ou un Mac 32 Go. Notre guide d'installation détaille la commande, les quantifications et les réglages.
i
Guide mis à jour le 18 août 2026
Cet état des lieux a été réécrit après la publication effective des poids. L'écosystème Qwen bouge vite : la page officielle huggingface.co/Qwen et la bibliothèque Ollama restent les seules sources qui font foi sur la disponibilité d'un modèle.

#Chronologie vérifiée : de WAIC à l'API

Une bonne partie de la confusion autour de Qwen 3.8 vient d'un télescopage entre une démo de conférence et une sortie produit. Voici la séquence, remise dans l'ordre.

  1. 01
    Fin juillet 2026 — WAIC (Shanghai)
    Alibaba présente la génération Qwen 3.8 à la World Artificial Intelligence Conference. C'est là qu'apparaissent les premiers chiffres (contexte 1M, architecture MoE massive) et qu'est évoquée l'intention de publier une variante open-weight. À ce stade, rien n'est téléchargeable : ce sont des annonces.
  2. 02
    3 août 2026 — Lancement de Qwen 3.8-Max en API
    Le modèle propriétaire devient accessible via l'API Alibaba Cloud (DashScope) et l'application Qwen. C'est une sortie réelle, mais cloud uniquement. Les benchmarks communiqués datent de ce moment.
  3. 03
    3 au 13 août 2026 — Attente des poids
    La communauté attend le Qwen3.8-27B open-weight évoqué au WAIC. Les dépôts habituels (huggingface.co/Qwen, ModelScope) ne reçoivent aucun poids de la génération 3.8 sur cette période, ce qui alimente le doute sur la tenue de l'annonce.
  4. 04
    14 août 2026 — Publication des poids Qwen3.8-27B
    Alibaba publie le dépôt Qwen/Qwen3.8-27B sur Hugging Face sous licence Apache 2.0 : modèle dense de 27 milliards de paramètres, vision-langage natif, 262 144 tokens de contexte. La bibliothèque Ollama référence le tag officiel le jour même, avec douze variantes (Q4_K_M, Q8, BF16, builds MLX pour Apple Silicon). Onze jours séparent donc le lancement du Max en API du drop des poids ouverts.
i
Pourquoi ce décalage est normal
Chez Alibaba comme chez d'autres, le modèle « Max » propriétaire sort d'abord en API pour monétiser et cadrer l'usage. Les variantes open-weight, plus petites et denses, arrivent souvent quelques semaines plus tard, une fois la version phare stabilisée. Un délai entre l'annonce WAIC et le drop des poids n'a rien d'anormal.

#Ce qui est réellement sorti : Qwen 3.8-Max

Qwen 3.8-Max est le seul modèle de cette génération réellement disponible aujourd'hui, et il faut être clair : ce n'est pas un modèle que vous ferez tourner chez vous. Sa taille l'exclut du self-hosting grand public, et de toute façon ses poids ne sont pas publiés.

Architecture
Mixture-of-Experts d'environ 2,4 trillions de paramètres au total, avec une fraction active par token. Impossible à charger sur du matériel grand public, même très haut de gamme.
Contexte
Fenêtre annoncée à 1 million de tokens, orientée documents longs et bases de code entières.
Disponibilité
API Alibaba Cloud (DashScope) et application Qwen. Facturation à l'usage, pas de téléchargement de poids.
Positionnement
Concurrent direct des modèles propriétaires frontières. À comparer avec du cloud, pas avec du local.
!
« En local » ne s'applique pas au Max
Si un tutoriel prétend installer Qwen 3.8-Max sur un PC avec Ollama, méfiance : un MoE de plusieurs trillions de paramètres ne tient sur aucune machine grand public, et ses poids ne sont pas distribués. Ce qui sera installable en local, c'est la variante dense 27B — quand elle sortira.

#Open weights : ce qui est promis vs ce qui est livré

Le tri est désormais simple : ce qui avait été annoncé au WAIC a bien été livré, avec onze jours de décalage sur le modèle API. Voici le bilan factuel.

Promis
Un Qwen3.8-27B dense, open-weight, sous licence permissive, pensé pour tenir sur un GPU 24 Go en quantifié.
Livré
Exactement cela, le 14 août 2026 : poids safetensors sur Hugging Face, licence Apache 2.0, GGUF et builds MLX distribués via Ollama, 18 Go en Q4_K_M — donc bien dans la cible des 24 Go.
En prime
La vision native (images et vidéos) et un contexte de 262 144 tokens extensible à 1M via YaRN, ce qui n'était pas garanti par les annonces initiales.
Le réflexe anti-hype reste valable
Avant de croire qu'un modèle est disponible en local, un test simple : le poids est-il téléchargeable maintenant, avec une commande, sans liste d'attente ? Entre le 3 et le 13 août 2026, Qwen 3.8 échouait à ce test alors que des dizaines d'articles le présentaient déjà comme installable. Depuis le 14 août, il le passe.

#Le drop du 14 août sur Hugging Face

Le meilleur juge de disponibilité reste le dépôt officiel. Voici comment vérifier vous-même, aujourd'hui comme pour la prochaine génération — y compris contre cet article, qui vieillira à son tour.

Vérifier via le CLI Hugging Face
pip install -U "huggingface_hub[cli]"

# Lister les dépôts de l'organisation Qwen contenant "3.8"
huggingface-cli repo list Qwen --limit 200 | grep -i "3.8"

# Depuis le 14/08/2026, la commande renvoie bien Qwen/Qwen3.8-27B

Le dépôt officiel est Qwen/Qwen3.8-27B. Sa carte de modèle annonce 27 milliards de paramètres, 64 couches, une attention hybride, la vision native et la licence Apache 2.0. Côté Ollama, douze variantes sont publiées, du Q4_K_M de 18 Go au BF16 de 56 Go.

Vérifier côté Ollama
# Depuis le 14 août 2026, le tag officiel existe :
ollama pull qwen3.8:27b   # 18 Go (Q4_K_M)

# Variante Apple Silicon (Metal)
ollama pull qwen3.8:27b-mlx

#Faut-il quitter Qwen 3.6 ?

Si vous tournez déjà sur Qwen 3.6-27B, la question n'est plus « quoi installer en attendant » mais « la mise à jour vaut-elle le téléchargement ». Réponse courte : oui, à empreinte mémoire équivalente — mais gardez l'ancien modèle le temps de revalider vos prompts.

Qwen3.8-27B
Même gabarit que la 3.6-27B (24 Go de VRAM en Q4), licence Apache 2.0, vision native, contexte 262k. Les scores communiqués progressent surtout sur le code agentique et l'usage d'ordinateur.
Qwen 3.6-27B
Toujours valable : stable, éprouvé, excellent en français. Rien n'oblige à migrer si vos usages sont conversationnels.
Qwen3-Coder-Next
Le spécialiste code reste plus rapide à l'autocomplétion. Qwen 3.8 27B se justifie quand un agent doit lire, planifier et modifier plusieurs fichiers.

Repère mémoire rapide en Q4_K_M, pour dimensionner sans se tromper : un 14B demande environ 9 Go de VRAM, un 27-32B environ 19 Go, un 70B environ 40 Go. Un 27B en Q4 vise donc une carte 24 Go (RTX 4090, RTX 3090) ou un Mac à mémoire unifiée de 24 Go et plus.

RTX 3060 12 Go
Confortable pour du 8-14B. Le 27B ne tient pas entièrement — débordement CPU et lenteur.
RTX 4090 / 3090 (24 Go)
La cible idéale pour un 27-32B en Q4_K_M, tout sur le GPU.
Mac M4 Pro (24-48 Go unifié)
Le 27B passe très bien grâce à la mémoire unifiée ; visez 32 Go et plus pour du contexte long.

#Installer : le chemin le plus court

L'installation complète — quantifications, variante MLX sur Mac, réglage du contexte, mode thinking, dépannage — fait l'objet d'un guide dédié. Voici le résumé en trois commandes.

  1. 01
    1. Mettre Ollama à jour
    Les couches hybrides de Qwen 3.8 exigent une version récente du moteur. Une version antérieure à août 2026 renverra une erreur d'architecture.
  2. 02
    2. Télécharger le modèle
    18 Go en Q4_K_M, le format par défaut. Sur Mac Apple Silicon, préférez le tag -mlx.
  3. 03
    3. Vérifier la répartition
    ollama ps indique si le modèle tourne entièrement sur le GPU. Tant que ce n'est pas 100 % GPU, le débit reste médiocre.
Terminal
# 1. Le daemon répond ?
curl http://localhost:11434/api/tags

# 2. Télécharger Qwen 3.8 27B (Q4_K_M, 18 Go)
ollama pull qwen3.8:27b

# 3. Premier chat
ollama run qwen3.8:27b "Explique en une phrase la différence entre un modèle MoE et un modèle dense."

# 4. Vérifier que tout est bien sur le GPU
ollama ps

Pour un usage strictement code, la variante spécialisée de la génération précédente reste pertinente et plus légère.

Variante code
ollama pull qwen3-coder-next
ollama run qwen3-coder-next "Écris une fonction Python qui parse un fichier CSV et renvoie la somme d'une colonne."
La migration depuis la 3.6 est triviale
Vous restez dans la famille Qwen : un « ollama pull qwen3.8:27b » et un changement de nom de modèle dans votre configuration suffisent. Vos prompts, votre interface et vos scripts ne bougent pas — seuls les réglages d'échantillonnage méritent une relecture, le mode thinking étant activé par défaut sur la 3.8.

#Ce qu'il faut retenir

L'épisode Qwen 3.8 est un cas d'école de la confusion entre annonce, sortie API et publication des poids. Voici les faits vérifiés, datés.

Le tag Ollama
qwen3.8:27b, publié le 14 août 2026, 18 Go en Q4_K_M. Douze variantes au total, dont deux builds MLX pour Apple Silicon.
La licence
Apache 2.0 : usage commercial, modification et redistribution autorisés, sans seuil d'utilisateurs ni clause d'usage restrictive.
Les tailles publiées
Une seule taille dense pour l'instant, le 27B. Aucune variante plus petite de la génération 3.8 n'est publiée à ce jour.
Les benchmarks
Les scores disponibles proviennent de la carte de modèle officielle. Aucune reproduction indépendante n'a encore été publiée.
i
En résumé
Qwen 3.8-Max existe depuis le 3 août 2026 (API, propriétaire, hors de portée du local). Les open weights Qwen3.8-27B ont été publiés le 14 août 2026 sous licence Apache 2.0 et sont installables en une commande. Pour le pas à pas complet — VRAM, quantifications, contexte, mode thinking — voyez le guide d'installation dédié.

#Pour aller plus loin

Pour passer de la chronologie à la pratique, ces guides prolongent celui-ci :

Qwen 3.8 27B en local
Le guide d'installation complet : commande Ollama, VRAM par quantification, variante MLX sur Mac, piège du contexte 256k et réglages du mode thinking.
Installer Ollama proprement
« Installer Ollama : Windows, macOS et Linux » détaille les prérequis RAM/GPU et le premier modèle à lancer si vous partez de zéro.
Choisir la bonne quantification
« Choisir sa quantification (Q4, Q5, Q8, FP16) » explique le compromis qualité/mémoire — décisif pour faire tenir un 27B sur 24 Go.
Dimensionner le GPU
« Choisir son GPU pour l'IA locale » vous évite de sous-estimer la VRAM avant d'acheter pour un futur 27B.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.