LLM chinois en local : Qwen, DeepSeek, GLM, Kimi — que valent-ils ?
En 2026, si vous téléchargez un LLM open-weight pour le faire tourner chez vous, il y a de fortes chances qu'il vienne de Chine. Qwen, DeepSeek, GLM, Kimi : ces familles trustent le haut des classements de modèles ouverts, souvent sous des licences plus permissives que celles des labos occidentaux. Ce panorama fait le tri : ce que vaut chaque famille, ce que disent vraiment leurs licences, et pourquoi exécuter un LLM chinois en local répond d'avance à la question de la confidentialité.
#Pourquoi les LLM chinois dominent l'open-weight
Le paysage des modèles ouverts a basculé. Là où Meta (Llama) faisait la course en tête il y a deux ans, ce sont aujourd'hui les laboratoires chinois qui publient les poids les plus performants et les plus fréquents. Alibaba (Qwen), DeepSeek, Zhipu AI (GLM) et Moonshot (Kimi) sortent des modèles à un rythme soutenu, du petit 3B au MoE de plusieurs centaines de milliards de paramètres.
La raison est autant stratégique que technique : publier les poids en open-weight leur permet de gagner en visibilité mondiale, d'attirer la communauté et de s'imposer comme standards de fait, y compris face aux modèles fermés américains. Pour vous, utilisateur en local, le résultat est simple : un choix immense de modèles gratuits, régulièrement mis à jour, et souvent au coude-à-coude avec le cloud sur le code, le raisonnement et le multilingue.
#Le local règle la question de la confidentialité
C'est l'objection réflexe : « un LLM chinois, mes données partent en Chine ». C'est vrai pour les API cloud (chat.qwen.ai, l'app DeepSeek, la plateforme Zhipu) — là, vos prompts transitent bien par des serveurs distants soumis au droit chinois. Mais ce guide parle de local, et en local cette crainte n'a tout simplement plus d'objet.
Quand vous lancez le modèle avec Ollama ou LM Studio, vous téléchargez un fichier de poids figé (un GGUF, par exemple) et c'est votre GPU qui calcule les réponses. Le modèle n'a aucune capacité réseau : ce n'est pas un logiciel qui « appelle la maison », c'est une grosse matrice de nombres. Rien ne sort de votre machine, quelle que soit l'origine du modèle.
- En cloud (API)
- Vos prompts partent chez l'éditeur. L'origine du modèle et la juridiction comptent vraiment.
- En local
- Les poids tournent sur votre matériel, hors ligne si vous le voulez. Aucune donnée ne quitte le poste.
- Le vrai risque résiduel
- Un biais ou une censure dans les réponses du modèle (certains sujets sensibles), pas une fuite de données. C'est une question de qualité de sortie, pas de vie privée.
#Les licences réelles : Apache 2.0 et MIT
Autre idée reçue : « les licences chinoises sont opaques ou piégeuses ». La réalité de 2026 est l'inverse — ce sont souvent les licences les plus propres du marché. La majorité des modèles de ce panorama sont publiés sous Apache 2.0 ou MIT, deux licences permissives internationales, y compris pour un usage commercial.
- Qwen
- La plupart des variantes récentes (dont Qwen3.8-27B) sont sous Apache 2.0 — usage commercial libre, redistribution autorisée.
- DeepSeek
- Les modèles V3/V4 et R1 sont publiés sous licence MIT, l'une des plus permissives qui soit.
- GLM (Zhipu)
- Les dernières générations, dont GLM-5.2, sont passées sous licence MIT.
- Kimi (Moonshot)
- Poids ouverts sous licence permissive de type MIT/Apache selon les versions.
#Qwen (Alibaba) : le couteau suisse
Qwen est la famille la plus complète et la plus polyvalente de l'écosystème. Alibaba décline le modèle dans toutes les tailles, du 3B qui tient sur un GPU d'entrée de gamme aux gros MoE, et dans toutes les spécialités : généraliste, code (Qwen3-Coder), vision (Qwen3-VL), et un mode « thinking » pour le raisonnement.
- Points forts
- Multilingue excellent (dont un français très correct), gamme de tailles inégalée, écosystème d'outils mature, disponibilité day-0 sur Ollama.
- Tailles typiques
- Du 3B/7B pour tester, au 27B (Qwen3.8) comme sweet spot qualité/VRAM, jusqu'aux MoE 35B-A3B pour les gros GPU.
- Pour qui
- Le premier choix par défaut si vous débutez et voulez un modèle qui fait tout correctement.
#DeepSeek : le champion du raisonnement
DeepSeek s'est fait connaître avec R1, un modèle de raisonnement à chaîne de pensée qui a bousculé le secteur début 2025. La famille reste la référence sur les tâches logiques, mathématiques et de code complexe. Les versions distillées de R1 (7B, 14B, 32B) rendent ce raisonnement accessible sur du matériel grand public.
- Points forts
- Raisonnement et mathématiques de très haut niveau, licence MIT, versions distillées jouables en local.
- Le piège
- Les modèles phares (V3/V4, 671B et plus en MoE) sont énormes : hors de portée d'un GPU unique. Pour du local grand public, visez les distillations R1.
- Pour qui
- Ceux qui font du code difficile, des maths, de la logique — ou qui veulent voir le modèle « réfléchir » avant de répondre.
#GLM (Zhipu) : l'outsider polyvalent
GLM, développé par Zhipu AI, est le challenger sérieux de Qwen. Bon en français, solide en code et en raisonnement, il propose des tailles raisonnables (autour de 9B et 32B) qui visent directement le sweet spot des GPU 12-24 Go, ainsi que des géants MoE comme GLM-5.2 (753B) pour les configurations extrêmes.
- Points forts
- Excellent équilibre qualité/taille sur les variantes 9B-32B, bon français, licence MIT sur les dernières générations.
- Tailles typiques
- 9B pour un GPU 8-12 Go, 32B pour 24 Go. Les versions MoE frontier restent réservées aux Mac à grosse RAM unifiée.
- Pour qui
- Une alternative crédible à Qwen quand vous voulez comparer, ou un modèle qui rend bien en français sur du matériel modeste.
#Kimi et MiniCPM : les deux extrêmes
Ces deux familles illustrent les bornes du spectre. Kimi (Moonshot) vise le très gros : des MoE de 1 trillion de paramètres et au-delà, réputés pour leur long contexte et leur qualité agentique. MiniCPM (équipe OpenBMB / ModelBest) vise l'inverse : des modèles compacts et efficaces, pensés pour tourner sur mobile ou sur GPU minuscule.
- Kimi K2 / K3
- MoE géants (1T à 2.8T paramètres). Poids ouverts, mais « ouvert » ne veut pas dire « exécutable chez vous » : il faut des dizaines d'accélérateurs. Réservé aux serveurs, pas au poste de travail.
- MiniCPM
- Modèles ultra-compacts, certains multimodaux, conçus pour l'embarqué et les petites configs. Idéal quand chaque gigaoctet de VRAM compte.
- À retenir
- L'open-weight couvre tout le spectre matériel. Ne confondez pas « le modèle est libre » avec « ma machine peut le faire tourner ».
#Lequel choisir selon votre VRAM
Le vrai facteur limitant en local n'est pas la marque du modèle, mais la VRAM de votre GPU. En quantification Q4_K_M (le meilleur compromis qualité/taille), voici des repères concrets pour ranger ces familles par palier matériel.
- 8 Go (RTX 3060 8G, 4060)
- Qwen 7B, GLM 9B, DeepSeek-R1 distillé 7B en Q4 (~5 Go). Confortable pour du chat et du code léger.
- 12 Go (RTX 3060 12G, 4070)
- Le sweet spot. Qwen 14B, GLM 9B en Q8, DeepSeek-R1 14B (~9 Go). Marge pour un contexte plus large.
- 16 Go (RTX 4080, 5070 Ti)
- Qwen ~24-27B, DeepSeek-R1 32B en quantification serrée. Le palier « sérieux » pour le raisonnement.
- 24 Go (RTX 3090/4090)
- Qwen 27-32B et GLM 32B tout en VRAM (~19 Go), MoE 35B-A3B. Le meilleur du local grand public.
- Mac à RAM unifiée (48-128+ Go)
- Seul terrain réaliste pour les gros MoE (GLM-5.2, DeepSeek Flash) via offload sur mémoire unifiée — à débit modéré.
#Installer un modèle chinois en pratique
La stack typique est identique quelle que soit l'origine du modèle : Ollama comme daemon d'inférence (il écoute sur http://localhost:11434), avec Open WebUI ou LM Studio comme interface. Voici comment récupérer un modèle de chaque famille.
- 01Installer OllamaTéléchargez le daemon depuis ollama.com et lancez-le. Il expose une API locale sur le port 11434 — rien de plus à configurer pour débuter.
- 02Choisir un modèle selon votre VRAMReprenez le tableau ci-dessus. En cas de doute, partez sur Qwen 14B ou GLM 9B en Q4_K_M : ils tiennent sur la majorité des GPU récents et couvrent 90 % des usages.
- 03Télécharger et lancerUne seule commande télécharge les poids puis ouvre le chat. Le premier lancement rapatrie plusieurs gigaoctets ; les suivants sont instantanés.
- 04Vérifier le mode hors ligneUne fois les poids en cache, coupez le réseau et continuez à discuter : c'est la preuve que le modèle tourne à 100 % en local.
#Pour aller plus loin
Ce panorama vous donne la carte ; ces guides entrent dans le détail de chaque famille et des réglages en local :
- Le sweet spot Qwen
- « Qwen 3.8 27B en local : installation Ollama, VRAM et réglages » détaille la commande exacte, la VRAM par quantification et le mode thinking.
- Le raisonnement DeepSeek
- « Installer DeepSeek R1 avec Ollama » couvre les versions distillées 7B/14B/32B et la chaîne de pensée en local.
- Choisir selon votre carte
- Les guides « Quel LLM pour 12 Go / 16 Go / 24 Go de VRAM ? » traduisent ces paliers en recommandations concrètes par GPU.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.