Débutant 12 minPanorama

LLM chinois en local : Qwen, DeepSeek, GLM, Kimi — que valent-ils ?

En 2026, si vous téléchargez un LLM open-weight pour le faire tourner chez vous, il y a de fortes chances qu'il vienne de Chine. Qwen, DeepSeek, GLM, Kimi : ces familles trustent le haut des classements de modèles ouverts, souvent sous des licences plus permissives que celles des labos occidentaux. Ce panorama fait le tri : ce que vaut chaque famille, ce que disent vraiment leurs licences, et pourquoi exécuter un LLM chinois en local répond d'avance à la question de la confidentialité.

Par Mohamed Meguedmi·Màj 2026-09-01·Testé sur Windows, macOS, Linux

#Pourquoi les LLM chinois dominent l'open-weight

Le paysage des modèles ouverts a basculé. Là où Meta (Llama) faisait la course en tête il y a deux ans, ce sont aujourd'hui les laboratoires chinois qui publient les poids les plus performants et les plus fréquents. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) et Moonshot (Kimi) sortent des modèles à un rythme soutenu, du petit 3B au MoE de plusieurs centaines de milliards de paramètres.

La raison est autant stratégique que technique : publier les poids en open-weight leur permet de gagner en visibilité mondiale, d'attirer la communauté et de s'imposer comme standards de fait, y compris face aux modèles fermés américains. Pour vous, utilisateur en local, le résultat est simple : un choix immense de modèles gratuits, régulièrement mis à jour, et souvent au coude-à-coude avec le cloud sur le code, le raisonnement et le multilingue.

i
Open-weight ≠ open-source
« Open-weight » veut dire que les poids du modèle sont téléchargeables et exécutables librement. Cela ne garantit pas que les données d'entraînement ou le code complet soient publiés. C'est le cas de la quasi-totalité des modèles de ce guide — vous récupérez le modèle, pas sa recette.

#Le local règle la question de la confidentialité

C'est l'objection réflexe : « un LLM chinois, mes données partent en Chine ». C'est vrai pour les API cloud (chat.qwen.ai, l'app DeepSeek, la plateforme Zhipu) — là, vos prompts transitent bien par des serveurs distants soumis au droit chinois. Mais ce guide parle de local, et en local cette crainte n'a tout simplement plus d'objet.

Quand vous lancez le modèle avec Ollama ou LM Studio, vous téléchargez un fichier de poids figé (un GGUF, par exemple) et c'est votre GPU qui calcule les réponses. Le modèle n'a aucune capacité réseau : ce n'est pas un logiciel qui « appelle la maison », c'est une grosse matrice de nombres. Rien ne sort de votre machine, quelle que soit l'origine du modèle.

En cloud (API)
Vos prompts partent chez l'éditeur. L'origine du modèle et la juridiction comptent vraiment.
En local
Les poids tournent sur votre matériel, hors ligne si vous le voulez. Aucune donnée ne quitte le poste.
Le vrai risque résiduel
Un biais ou une censure dans les réponses du modèle (certains sujets sensibles), pas une fuite de données. C'est une question de qualité de sortie, pas de vie privée.
Vérifier que rien ne sort
Pour vous en convaincre : lancez Ollama, coupez le Wi-Fi, et discutez avec le modèle. Tout continue de fonctionner. Un LLM local n'a besoin du réseau que pour le téléchargement initial des poids.

#Les licences réelles : Apache 2.0 et MIT

Autre idée reçue : « les licences chinoises sont opaques ou piégeuses ». La réalité de 2026 est l'inverse — ce sont souvent les licences les plus propres du marché. La majorité des modèles de ce panorama sont publiés sous Apache 2.0 ou MIT, deux licences permissives internationales, y compris pour un usage commercial.

Qwen
La plupart des variantes récentes (dont Qwen3.8-27B) sont sous Apache 2.0 — usage commercial libre, redistribution autorisée.
DeepSeek
Les modèles V3/V4 et R1 sont publiés sous licence MIT, l'une des plus permissives qui soit.
GLM (Zhipu)
Les dernières générations, dont GLM-5.2, sont passées sous licence MIT.
Kimi (Moonshot)
Poids ouverts sous licence permissive de type MIT/Apache selon les versions.
!
Lisez quand même la carte du modèle
Certaines familles anciennes ou variantes spécifiques peuvent porter une licence maison avec des clauses d'usage. Avant un déploiement commercial, vérifiez toujours le fichier LICENSE sur la page Hugging Face du modèle précis que vous téléchargez — pas seulement la réputation de la famille.

#Qwen (Alibaba) : le couteau suisse

Qwen est la famille la plus complète et la plus polyvalente de l'écosystème. Alibaba décline le modèle dans toutes les tailles, du 3B qui tient sur un GPU d'entrée de gamme aux gros MoE, et dans toutes les spécialités : généraliste, code (Qwen3-Coder), vision (Qwen3-VL), et un mode « thinking » pour le raisonnement.

Points forts
Multilingue excellent (dont un français très correct), gamme de tailles inégalée, écosystème d'outils mature, disponibilité day-0 sur Ollama.
Tailles typiques
Du 3B/7B pour tester, au 27B (Qwen3.8) comme sweet spot qualité/VRAM, jusqu'aux MoE 35B-A3B pour les gros GPU.
Pour qui
Le premier choix par défaut si vous débutez et voulez un modèle qui fait tout correctement.

#DeepSeek : le champion du raisonnement

DeepSeek s'est fait connaître avec R1, un modèle de raisonnement à chaîne de pensée qui a bousculé le secteur début 2025. La famille reste la référence sur les tâches logiques, mathématiques et de code complexe. Les versions distillées de R1 (7B, 14B, 32B) rendent ce raisonnement accessible sur du matériel grand public.

Points forts
Raisonnement et mathématiques de très haut niveau, licence MIT, versions distillées jouables en local.
Le piège
Les modèles phares (V3/V4, 671B et plus en MoE) sont énormes : hors de portée d'un GPU unique. Pour du local grand public, visez les distillations R1.
Pour qui
Ceux qui font du code difficile, des maths, de la logique — ou qui veulent voir le modèle « réfléchir » avant de répondre.

#GLM (Zhipu) : l'outsider polyvalent

GLM, développé par Zhipu AI, est le challenger sérieux de Qwen. Bon en français, solide en code et en raisonnement, il propose des tailles raisonnables (autour de 9B et 32B) qui visent directement le sweet spot des GPU 12-24 Go, ainsi que des géants MoE comme GLM-5.2 (753B) pour les configurations extrêmes.

Points forts
Excellent équilibre qualité/taille sur les variantes 9B-32B, bon français, licence MIT sur les dernières générations.
Tailles typiques
9B pour un GPU 8-12 Go, 32B pour 24 Go. Les versions MoE frontier restent réservées aux Mac à grosse RAM unifiée.
Pour qui
Une alternative crédible à Qwen quand vous voulez comparer, ou un modèle qui rend bien en français sur du matériel modeste.

#Kimi et MiniCPM : les deux extrêmes

Ces deux familles illustrent les bornes du spectre. Kimi (Moonshot) vise le très gros : des MoE de 1 trillion de paramètres et au-delà, réputés pour leur long contexte et leur qualité agentique. MiniCPM (équipe OpenBMB / ModelBest) vise l'inverse : des modèles compacts et efficaces, pensés pour tourner sur mobile ou sur GPU minuscule.

Kimi K2 / K3
MoE géants (1T à 2.8T paramètres). Poids ouverts, mais « ouvert » ne veut pas dire « exécutable chez vous » : il faut des dizaines d'accélérateurs. Réservé aux serveurs, pas au poste de travail.
MiniCPM
Modèles ultra-compacts, certains multimodaux, conçus pour l'embarqué et les petites configs. Idéal quand chaque gigaoctet de VRAM compte.
À retenir
L'open-weight couvre tout le spectre matériel. Ne confondez pas « le modèle est libre » avec « ma machine peut le faire tourner ».

#Lequel choisir selon votre VRAM

Le vrai facteur limitant en local n'est pas la marque du modèle, mais la VRAM de votre GPU. En quantification Q4_K_M (le meilleur compromis qualité/taille), voici des repères concrets pour ranger ces familles par palier matériel.

8 Go (RTX 3060 8G, 4060)
Qwen 7B, GLM 9B, DeepSeek-R1 distillé 7B en Q4 (~5 Go). Confortable pour du chat et du code léger.
12 Go (RTX 3060 12G, 4070)
Le sweet spot. Qwen 14B, GLM 9B en Q8, DeepSeek-R1 14B (~9 Go). Marge pour un contexte plus large.
16 Go (RTX 4080, 5070 Ti)
Qwen ~24-27B, DeepSeek-R1 32B en quantification serrée. Le palier « sérieux » pour le raisonnement.
24 Go (RTX 3090/4090)
Qwen 27-32B et GLM 32B tout en VRAM (~19 Go), MoE 35B-A3B. Le meilleur du local grand public.
Mac à RAM unifiée (48-128+ Go)
Seul terrain réaliste pour les gros MoE (GLM-5.2, DeepSeek Flash) via offload sur mémoire unifiée — à débit modéré.
i
Repère VRAM en Q4
3B ≈ 2 Go · 7B ≈ 5 Go · 14B ≈ 9 Go · 32B ≈ 19 Go · 70B ≈ 40 Go. Ajoutez toujours 1 à 2 Go pour le contexte et le système. Un modèle qui déborde de la VRAM bascule en RAM (offload CPU) et son débit s'effondre.

#Installer un modèle chinois en pratique

La stack typique est identique quelle que soit l'origine du modèle : Ollama comme daemon d'inférence (il écoute sur http://localhost:11434), avec Open WebUI ou LM Studio comme interface. Voici comment récupérer un modèle de chaque famille.

  1. 01
    Installer Ollama
    Téléchargez le daemon depuis ollama.com et lancez-le. Il expose une API locale sur le port 11434 — rien de plus à configurer pour débuter.
  2. 02
    Choisir un modèle selon votre VRAM
    Reprenez le tableau ci-dessus. En cas de doute, partez sur Qwen 14B ou GLM 9B en Q4_K_M : ils tiennent sur la majorité des GPU récents et couvrent 90 % des usages.
  3. 03
    Télécharger et lancer
    Une seule commande télécharge les poids puis ouvre le chat. Le premier lancement rapatrie plusieurs gigaoctets ; les suivants sont instantanés.
  4. 04
    Vérifier le mode hors ligne
    Une fois les poids en cache, coupez le réseau et continuez à discuter : c'est la preuve que le modèle tourne à 100 % en local.
Terminal
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
Les noms de tags varient
Les tags exacts (qwen3, deepseek-r1:14b, etc.) et les versions disponibles évoluent vite dans la bibliothèque Ollama. Consultez ollama.com/library pour le nom précis et la taille en Go de chaque variante avant de télécharger.

#Pour aller plus loin

Ce panorama vous donne la carte ; ces guides entrent dans le détail de chaque famille et des réglages en local :

Le sweet spot Qwen
« Qwen 3.8 27B en local : installation Ollama, VRAM et réglages » détaille la commande exacte, la VRAM par quantification et le mode thinking.
Le raisonnement DeepSeek
« Installer DeepSeek R1 avec Ollama » couvre les versions distillées 7B/14B/32B et la chaîne de pensée en local.
Choisir selon votre carte
Les guides « Quel LLM pour 12 Go / 16 Go / 24 Go de VRAM ? » traduisent ces paliers en recommandations concrètes par GPU.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.