Qwen 3.8 open weights : chronologie et sortie du 14 août 2026
Les poids ouverts de Qwen 3.8 sont sortis : Alibaba a publié Qwen3.8-27B sur Hugging Face le 14 août 2026, sous licence Apache 2.0, avec un tag Ollama officiel dans la foulée. Ce guide retrace la chronologie complète — de l'annonce au WAIC fin juillet au lancement du Qwen 3.8-Max en API le 3 août, puis au drop des poids — et explique la confusion persistante entre le Max, propriétaire et hors de portée du local, et le 27B dense que vous pouvez installer chez vous. Pour l'installation pas à pas, voyez notre guide dédié à Qwen 3.8 27B en local.
#Le point en une minute
Si vous êtes venu chercher un tag Ollama pour Qwen 3.8, il existe depuis le 14 août 2026 : « ollama run qwen3.8:27b ». Ce qu'il faut comprendre avant d'aller plus loin, c'est que la génération 3.8 recouvre deux modèles très différents — un modèle propriétaire géant servi par API, et un modèle dense de 27 milliards de paramètres que vous pouvez télécharger.
- Qwen 3.8-Max
- Modèle phare d'Alibaba, MoE d'environ 2 400 milliards de paramètres, contexte 1M. Disponible via l'API Alibaba Cloud depuis le 3 août 2026. Propriétaire, non téléchargeable — ce n'est pas un modèle local.
- Qwen3.8-27B (open weights)
- Version dense multimodale publiée le 14 août 2026 sur Hugging Face sous licence Apache 2.0. 262 144 tokens de contexte natif, 18 Go en Q4_K_M, tag Ollama officiel qwen3.8:27b.
- Ce que vous pouvez faire aujourd'hui
- Installer directement le 27B sur une carte 24 Go ou un Mac 32 Go. Notre guide d'installation détaille la commande, les quantifications et les réglages.
#Chronologie vérifiée : de WAIC à l'API
Une bonne partie de la confusion autour de Qwen 3.8 vient d'un télescopage entre une démo de conférence et une sortie produit. Voici la séquence, remise dans l'ordre.
- 01Fin juillet 2026 — WAIC (Shanghai)Alibaba présente la génération Qwen 3.8 à la World Artificial Intelligence Conference. C'est là qu'apparaissent les premiers chiffres (contexte 1M, architecture MoE massive) et qu'est évoquée l'intention de publier une variante open-weight. À ce stade, rien n'est téléchargeable : ce sont des annonces.
- 023 août 2026 — Lancement de Qwen 3.8-Max en APILe modèle propriétaire devient accessible via l'API Alibaba Cloud (DashScope) et l'application Qwen. C'est une sortie réelle, mais cloud uniquement. Les benchmarks communiqués datent de ce moment.
- 033 au 13 août 2026 — Attente des poidsLa communauté attend le Qwen3.8-27B open-weight évoqué au WAIC. Les dépôts habituels (huggingface.co/Qwen, ModelScope) ne reçoivent aucun poids de la génération 3.8 sur cette période, ce qui alimente le doute sur la tenue de l'annonce.
- 0414 août 2026 — Publication des poids Qwen3.8-27BAlibaba publie le dépôt Qwen/Qwen3.8-27B sur Hugging Face sous licence Apache 2.0 : modèle dense de 27 milliards de paramètres, vision-langage natif, 262 144 tokens de contexte. La bibliothèque Ollama référence le tag officiel le jour même, avec douze variantes (Q4_K_M, Q8, BF16, builds MLX pour Apple Silicon). Onze jours séparent donc le lancement du Max en API du drop des poids ouverts.
#Ce qui est réellement sorti : Qwen 3.8-Max
Qwen 3.8-Max est le seul modèle de cette génération réellement disponible aujourd'hui, et il faut être clair : ce n'est pas un modèle que vous ferez tourner chez vous. Sa taille l'exclut du self-hosting grand public, et de toute façon ses poids ne sont pas publiés.
- Architecture
- Mixture-of-Experts d'environ 2,4 trillions de paramètres au total, avec une fraction active par token. Impossible à charger sur du matériel grand public, même très haut de gamme.
- Contexte
- Fenêtre annoncée à 1 million de tokens, orientée documents longs et bases de code entières.
- Disponibilité
- API Alibaba Cloud (DashScope) et application Qwen. Facturation à l'usage, pas de téléchargement de poids.
- Positionnement
- Concurrent direct des modèles propriétaires frontières. À comparer avec du cloud, pas avec du local.
#Open weights : ce qui est promis vs ce qui est livré
Le tri est désormais simple : ce qui avait été annoncé au WAIC a bien été livré, avec onze jours de décalage sur le modèle API. Voici le bilan factuel.
- Promis
- Un Qwen3.8-27B dense, open-weight, sous licence permissive, pensé pour tenir sur un GPU 24 Go en quantifié.
- Livré
- Exactement cela, le 14 août 2026 : poids safetensors sur Hugging Face, licence Apache 2.0, GGUF et builds MLX distribués via Ollama, 18 Go en Q4_K_M — donc bien dans la cible des 24 Go.
- En prime
- La vision native (images et vidéos) et un contexte de 262 144 tokens extensible à 1M via YaRN, ce qui n'était pas garanti par les annonces initiales.
#Le drop du 14 août sur Hugging Face
Le meilleur juge de disponibilité reste le dépôt officiel. Voici comment vérifier vous-même, aujourd'hui comme pour la prochaine génération — y compris contre cet article, qui vieillira à son tour.
Le dépôt officiel est Qwen/Qwen3.8-27B. Sa carte de modèle annonce 27 milliards de paramètres, 64 couches, une attention hybride, la vision native et la licence Apache 2.0. Côté Ollama, douze variantes sont publiées, du Q4_K_M de 18 Go au BF16 de 56 Go.
#Faut-il quitter Qwen 3.6 ?
Si vous tournez déjà sur Qwen 3.6-27B, la question n'est plus « quoi installer en attendant » mais « la mise à jour vaut-elle le téléchargement ». Réponse courte : oui, à empreinte mémoire équivalente — mais gardez l'ancien modèle le temps de revalider vos prompts.
- Qwen3.8-27B
- Même gabarit que la 3.6-27B (24 Go de VRAM en Q4), licence Apache 2.0, vision native, contexte 262k. Les scores communiqués progressent surtout sur le code agentique et l'usage d'ordinateur.
- Qwen 3.6-27B
- Toujours valable : stable, éprouvé, excellent en français. Rien n'oblige à migrer si vos usages sont conversationnels.
- Qwen3-Coder-Next
- Le spécialiste code reste plus rapide à l'autocomplétion. Qwen 3.8 27B se justifie quand un agent doit lire, planifier et modifier plusieurs fichiers.
Repère mémoire rapide en Q4_K_M, pour dimensionner sans se tromper : un 14B demande environ 9 Go de VRAM, un 27-32B environ 19 Go, un 70B environ 40 Go. Un 27B en Q4 vise donc une carte 24 Go (RTX 4090, RTX 3090) ou un Mac à mémoire unifiée de 24 Go et plus.
- RTX 3060 12 Go
- Confortable pour du 8-14B. Le 27B ne tient pas entièrement — débordement CPU et lenteur.
- RTX 4090 / 3090 (24 Go)
- La cible idéale pour un 27-32B en Q4_K_M, tout sur le GPU.
- Mac M4 Pro (24-48 Go unifié)
- Le 27B passe très bien grâce à la mémoire unifiée ; visez 32 Go et plus pour du contexte long.
#Installer : le chemin le plus court
L'installation complète — quantifications, variante MLX sur Mac, réglage du contexte, mode thinking, dépannage — fait l'objet d'un guide dédié. Voici le résumé en trois commandes.
- 011. Mettre Ollama à jourLes couches hybrides de Qwen 3.8 exigent une version récente du moteur. Une version antérieure à août 2026 renverra une erreur d'architecture.
- 022. Télécharger le modèle18 Go en Q4_K_M, le format par défaut. Sur Mac Apple Silicon, préférez le tag -mlx.
- 033. Vérifier la répartitionollama ps indique si le modèle tourne entièrement sur le GPU. Tant que ce n'est pas 100 % GPU, le débit reste médiocre.
Pour un usage strictement code, la variante spécialisée de la génération précédente reste pertinente et plus légère.
#Ce qu'il faut retenir
L'épisode Qwen 3.8 est un cas d'école de la confusion entre annonce, sortie API et publication des poids. Voici les faits vérifiés, datés.
- Le tag Ollama
- qwen3.8:27b, publié le 14 août 2026, 18 Go en Q4_K_M. Douze variantes au total, dont deux builds MLX pour Apple Silicon.
- La licence
- Apache 2.0 : usage commercial, modification et redistribution autorisés, sans seuil d'utilisateurs ni clause d'usage restrictive.
- Les tailles publiées
- Une seule taille dense pour l'instant, le 27B. Aucune variante plus petite de la génération 3.8 n'est publiée à ce jour.
- Les benchmarks
- Les scores disponibles proviennent de la carte de modèle officielle. Aucune reproduction indépendante n'a encore été publiée.
#Pour aller plus loin
Pour passer de la chronologie à la pratique, ces guides prolongent celui-ci :
- Qwen 3.8 27B en local
- Le guide d'installation complet : commande Ollama, VRAM par quantification, variante MLX sur Mac, piège du contexte 256k et réglages du mode thinking.
- Installer Ollama proprement
- « Installer Ollama : Windows, macOS et Linux » détaille les prérequis RAM/GPU et le premier modèle à lancer si vous partez de zéro.
- Choisir la bonne quantification
- « Choisir sa quantification (Q4, Q5, Q8, FP16) » explique le compromis qualité/mémoire — décisif pour faire tenir un 27B sur 24 Go.
- Dimensionner le GPU
- « Choisir son GPU pour l'IA locale » vous évite de sous-estimer la VRAM avant d'acheter pour un futur 27B.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.