# QuelLLM > Premier comparateur français des LLM open-weights — bench latence, coût, qualité. - URL: https://quelllm.fr - Language: fr-FR - Articles: 50 - Generated: 2026-09-12T07:00:27Z - Standard: https://llmstxt.org/ --- ## Guide de référence (produit payant) [Le kit Copilote Local](https://quelllm.fr/copilote-local) — guide français ~160 pages (23 chapitres) pour remplacer GitHub Copilot/Cursor par un copilote 100 % local (Ollama + Cline + Aider), configs prêtes à coller, mis à jour chaque mois. Paiement unique, garantie 30 jours. Extrait gratuit sans inscription : https://quelllm.fr/extrait-copilote-local.pdf --- ## LLM local : quel modèle tourne sur votre machine ? | QuelLLM.fr URL: https://quelllm.fr/ published: 2026-09-11 > Quels LLM open source tournent sur votre PC ou Mac ? Configurateur gratuit, 220+ modèles testés, 210+ guides Ollama et LM Studio en français. LIVE 247 modèles indexés · 254 guides en français · 100% local Paris — [Quel LLM FR l'IA, vraiment chez vous.](/) [01 Configurateur](/configurateur) [02 Catalogue](/catalogue) [03 Guides](/guides) [04 Actu](/actu) 05 Outils 06 Projet [◆ Les kits](/kits?utm_source=nav) Rechercher ⌘K [Analyser ma config](/configurateur) [◆ Kits](/kits?utm_source=nav-mobile) Tous les modèles · 100% local, 100% privé # Quel LLM tourne survotre machine Dites-nous ce que vous avez dans le capot. On vous dit ce qui tourne, à quelle vitesse, et comment l'installer — en français, pas à pas. ~/configurateur —— ● prêt GPU / Puce RTX 5090 RTX 5080 RTX 5070 Ti RTX 5070 RTX 5060 Ti 16GB RTX 5060 Ti 8GB RTX 5060 RTX 5050 RTX 5090 Laptop RTX 5080 Laptop RTX 5070 Ti Laptop RTX 5070 Laptop RTX 4090 RTX 4080 Super RTX 4080 RTX 4070 Ti Super RTX 4070 Ti RTX 4070 Super RTX 4070 RTX 4060 Ti 16GB RTX 4060 Ti 8GB RTX 4060 RTX 4090 Laptop RTX 4080 Laptop RTX 4070 Laptop RTX 4060 Laptop RTX 4050 Laptop RTX 3090 Ti RTX 3090 RTX 3080 Ti RTX 3080 12GB RTX 3080 10GB RTX 3070 Ti RTX 3070 RTX 3060 Ti RTX 3060 12GB RTX 3060 8GB RTX 3050 8GB RTX 3050 6GB RTX 3080 Ti Laptop RTX 3080 Laptop 16GB RTX 3080 Laptop 8GB RTX 3070 Ti Laptop RTX 3070 Laptop RTX 3060 Laptop RTX 3050 Ti Laptop RTX 3050 Laptop RTX 2080 Ti RTX 2080 Super RTX 2080 RTX 2070 Super RTX 2070 RTX 2060 Super RTX 2060 GTX 1660 Ti GTX 1660 Super GTX 1660 GTX 1650 GTX 1080 Ti GTX 1080 GTX 1070 Ti GTX 1070 GTX 1060 6GB Radeon RX 7900 XTX Radeon RX 7900 XT Radeon RX 7900 GRE Radeon RX 7800 XT Radeon RX 7700 XT Radeon RX 9070 XT Radeon RX 9070 Radeon RX 9060 XT 16GB Radeon RX 6800 XT Radeon RX 6700 XT Apple M5 Ultra (192 GB) Apple M5 Max (64 GB) Apple M5 Pro (48 GB) Apple M5 (24 GB) Apple M4 Max (64 GB) Apple M4 Pro (48 GB) Apple M4 (24 GB) Apple M3 Max (64 GB) Apple M3 Pro (36 GB) Apple M2 Ultra (128 GB) Apple M2 (16 GB) Apple M1 (16 GB) GPU intégré / aucun RAM système 8 GB 16 GB 32 GB 64 GB 128 GB OS Windows 11 Linux Usage principal Tous usages Chat / assistant Code / dev RAG / documents Vision / images Audio / voix Raisonnement / maths Agents autonomes Vos données restent dans votre navigateur. Rien n'est envoyé. Analyser ma config Gratuit Aucune inscription 100% français Guides pédagogiques Open source Données publiques Vie privée Zéro tracker [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=home-hero) ## Le marché en bref [Toute l'actu →](/actu) [11 sept. Open-weights chinois jugés plus sûrs, l'IA américaine à la traîne](/actu#a-2026-09-11-open-weights-chinois-plus-surs) [11 sept. Google signe une lettre ouverte en faveur des modèles open-weights](/actu#a-2026-09-11-google-signe-lettre-open-weights) [11 sept. Kimi-K3 débarque sur Ollama](/actu#a-2026-09-11-kimi-k3-sur-ollama) Kits QuelLLM ## Les kits QuelLLM —le guide de référencepar usage. Un kit par usage : le guide complet, les configs prêtes à coller, l'espace en ligne à vie. [Copilote Local Remplace GitHub Copilot et Cursor par un copilote de code 100 % local — le guide de référence, configs incluses. 24 €](/copilote-local?utm_source=home-kits-copilote-local) [IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. 24 €](/kit-ia-locale?utm_source=home-kits-ia-locale) [Agents Locaux Des agents qui agissent sur ta machine : Cline agentique, MCP, n8n + Ollama, automatisations locales. 24 €](/kit-agents-locaux?utm_source=home-kits-agents-locaux) [RAG Local Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud. 24 €](/kit-rag-local?utm_source=home-kits-rag-local) [IA en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. 24 €](/kit-ia-entreprise?utm_source=home-kits-ia-entreprise) [IA Sans Filtre L'IA qui répond vraiment : un modèle non censuré en local, sans refus abusifs sur la santé, l'histoire, la sécurité ou l'écriture — cadre légal inclus. 24 €](/kit-ia-sans-filtre?utm_source=home-kits-ia-sans-filtre) [Mac L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon. 24 €](/kit-mac?utm_source=home-kits-mac) [Images IA Images et vidéos IA en local, sans limite : ComfyUI, Flux, Z-Image, Wan 2.2 sur ton GPU ou ton Mac — workflows prêts à charger, cadre légal inclus. 24 €](/kit-images-ia?utm_source=home-kits-images-ia) ou [tous les kits à vie — 49 €](/kits?utm_source=home-kits-bundle) → Catalogue · 247 modèles ## Le catalogue desLLM open-weightsqui tournent en local. Tous les modèles pertinents, avec VRAM requise par quantification, vitesse estimée et cas d'usage. Les modèles français sont mis en avant. [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=catalogue-strip) 🇫🇷 Focus souveraineté ### Les25modèlesmade in France Mistral, Lucie (OpenLLM-France), CroissantLLM — entraînés sur du corpus FR, licences permissives, excellents en français soutenu. Filtrer uniquement les modèles FR ★ Top sélection éditoriale [Voir tous les classements →](/meilleur-llm) [Pour coder](/meilleur-llm/code) [En français](/meilleur-llm/francais) [Pour RAG](/meilleur-llm/rag) [Pour raisonner](/meilleur-llm/reasoning) [Avec vision](/meilleur-llm/vision) [Pour agents](/meilleur-llm/agents) [< 8 GB VRAM](/meilleur-llm/8gb-vram) [Sur RTX 4090](/meilleur-llm/rtx-4090) [Sur Mac](/meilleur-llm/mac-silicon) [Sans GPU](/meilleur-llm/cpu-only) [Libre commercial](/meilleur-llm/commercial) [Souverain EU](/meilleur-llm/souverain) Toutes familles Apertus Arctic Aya Claire Command Croissant DBRX DeepSeek dots ERNIE EuroLLM EXAONE Falcon Gemma GLM gpt-oss Granite Grok Helium HRM Hunyuan Inkling InternVL Jais Jamba Kanana Kimi Laguna LFM Ling LLaDA Llama LLaVA LongCat Lucie MiMo MiniCPM MiniMax Mistral Molmo Moshi Nemotron North OLMo Pangu Phi Pleias Qwen Qwen3 Rakuten Ring Salamandra Sarvam Seed SmolLM Step Teuken Trinity Tulu Yi Tous tags Chat Code Raisonnement Vision Multilingue MoE Audio Légers (<4B) Pertinence (FR d'abord) Plus récent Plus ancien Taille décroissante Taille croissante VRAM décroissante VRAM croissante Contexte décroissant Contexte croissant tok/s décroissant tok/s croissant Nom A-Z Nom Z-A 247 modèle s Modèle ↕ Params ↕ VRAM Q4 ↕ Contexte ↕ Tourne sur tok/s ↕ Sortie ↕ Pleias-RAG 1B ★ FR chat fr 🇫🇷 PleIAs · Spécialisé RAG 1.2B. Citation et grounding intégrés. Bat la plupart des SLM ≤4B sur HotPotQA. 1.2 B 0.8 GB 2k 8 12 16 24 150 avr. 2025 CroissantLLM 1.3B ★ FR chat fr 🇫🇷 CroissantLLM · Petit modèle bilingue FR/EN. Tourne partout, même sur CPU. 1.3 B 1 GB 2k 8 12 16 24 120 janv. 2024 SmolLM2 1.7B Instruct ★ FR chat general 🇫🇷 HuggingFace · 1.7B Apache 2.0 très téléchargé. Bat Qwen2.5-1.5B de ~6 pts MMLU-Pro. BFCL function calling 27%. 1.7 B 1.2 GB 8k 8 12 16 24 120 nov. 2024 Helium 1 2B ★ FR chat general 🇫🇷 Kyutai · Base multilingue 24 langues UE (Kyutai FR). Distillé de Gemma 2 → Gemma Terms s'appliquent aussi. 2 B 1.5 GB 4k 8 12 16 24 100 avr. 2025 SmolVLM2 2.2B Instruct ★ FR vision chat 🇫🇷 HuggingFace · VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B. 2.2 B 1.6 GB 8k 8 12 16 24 90 févr. 2025 Pleias 3B Preview ★ FR chat multilingual 🇫🇷 PleIAs · Français. Entraîné 100% sur Common Corpus (données open). Conforme AI Act UE par design. 3 B 2 GB 2k 8 12 16 24 70 déc. 2024 SmolLM3 3B ★ FR chat general 🇫🇷 HuggingFace · 3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette). 3 B 2 GB 125k 8 12 16 24 70 juil. 2025 Voxtral-4B-TTS ★ FR audio multilingual 🇫🇷 Mistral AI · TTS frontière open, 9 langues dont FR. Rivalise ElevenLabs. ⚠ Non-commercial. 4 B 10 GB 4k 8 12 16 24 40 mars 2026 Mistral 7B Instruct ★ FR chat general 🇫🇷 Mistral AI · Le classique français. Rapide, polyvalent, excellente base pour débuter. 7 B 5 GB 32k 8 12 16 24 35 sept. 2023 Lucie 7B ★ FR chat… --- ## Configurateur LLM — trouver le modèle idéal pour votre GPU | QuelLLM.fr URL: https://quelllm.fr/configurateur published: 2026-09-11 > Entrez votre GPU, RAM et cas d'usage — on vous dit instantanément quels LLM open-source tournent réellement sur votre machine, avec la meilleure… LIVE 247 modèles indexés · 254 guides en français · 100% local Paris — [Quel LLM FR l'IA, vraiment chez vous.](/) [01 Configurateur](/configurateur) [02 Catalogue](/catalogue) [03 Guides](/guides) [04 Actu](/actu) 05 Outils 06 Projet [◆ Les kits](/kits?utm_source=nav) Rechercher ⌘K [Analyser ma config](/configurateur) [◆ Kits](/kits?utm_source=nav-mobile) Tous les modèles · 100% local, 100% privé # Quel LLM tourne survotre machine Dites-nous ce que vous avez dans le capot. On vous dit ce qui tourne, à quelle vitesse, et comment l'installer — en français, pas à pas. ~/configurateur —— ● prêt GPU / Puce RTX 5090 RTX 5080 RTX 5070 Ti RTX 5070 RTX 5060 Ti 16GB RTX 5060 Ti 8GB RTX 5060 RTX 5050 RTX 5090 Laptop RTX 5080 Laptop RTX 5070 Ti Laptop RTX 5070 Laptop RTX 4090 RTX 4080 Super RTX 4080 RTX 4070 Ti Super RTX 4070 Ti RTX 4070 Super RTX 4070 RTX 4060 Ti 16GB RTX 4060 Ti 8GB RTX 4060 RTX 4090 Laptop RTX 4080 Laptop RTX 4070 Laptop RTX 4060 Laptop RTX 4050 Laptop RTX 3090 Ti RTX 3090 RTX 3080 Ti RTX 3080 12GB RTX 3080 10GB RTX 3070 Ti RTX 3070 RTX 3060 Ti RTX 3060 12GB RTX 3060 8GB RTX 3050 8GB RTX 3050 6GB RTX 3080 Ti Laptop RTX 3080 Laptop 16GB RTX 3080 Laptop 8GB RTX 3070 Ti Laptop RTX 3070 Laptop RTX 3060 Laptop RTX 3050 Ti Laptop RTX 3050 Laptop RTX 2080 Ti RTX 2080 Super RTX 2080 RTX 2070 Super RTX 2070 RTX 2060 Super RTX 2060 GTX 1660 Ti GTX 1660 Super GTX 1660 GTX 1650 GTX 1080 Ti GTX 1080 GTX 1070 Ti GTX 1070 GTX 1060 6GB Radeon RX 7900 XTX Radeon RX 7900 XT Radeon RX 7900 GRE Radeon RX 7800 XT Radeon RX 7700 XT Radeon RX 9070 XT Radeon RX 9070 Radeon RX 9060 XT 16GB Radeon RX 6800 XT Radeon RX 6700 XT Apple M5 Ultra (192 GB) Apple M5 Max (64 GB) Apple M5 Pro (48 GB) Apple M5 (24 GB) Apple M4 Max (64 GB) Apple M4 Pro (48 GB) Apple M4 (24 GB) Apple M3 Max (64 GB) Apple M3 Pro (36 GB) Apple M2 Ultra (128 GB) Apple M2 (16 GB) Apple M1 (16 GB) GPU intégré / aucun RAM système 8 GB 16 GB 32 GB 64 GB 128 GB OS Windows 11 Linux Usage principal Tous usages Chat / assistant Code / dev RAG / documents Vision / images Audio / voix Raisonnement / maths Agents autonomes Vos données restent dans votre navigateur. Rien n'est envoyé. Analyser ma config Gratuit Aucune inscription 100% français Guides pédagogiques Open source Données publiques Vie privée Zéro tracker [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=home-hero) ## Le marché en bref [Toute l'actu →](/actu) [11 sept. Open-weights chinois jugés plus sûrs, l'IA américaine à la traîne](/actu#a-2026-09-11-open-weights-chinois-plus-surs) [11 sept. Google signe une lettre ouverte en faveur des modèles open-weights](/actu#a-2026-09-11-google-signe-lettre-open-weights) [11 sept. Kimi-K3 débarque sur Ollama](/actu#a-2026-09-11-kimi-k3-sur-ollama) Kits QuelLLM ## Les kits QuelLLM —le guide de référencepar usage. Un kit par usage : le guide complet, les configs prêtes à coller, l'espace en ligne à vie. [Copilote Local Remplace GitHub Copilot et Cursor par un copilote de code 100 % local — le guide de référence, configs incluses. 24 €](/copilote-local?utm_source=home-kits-copilote-local) [IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. 24 €](/kit-ia-locale?utm_source=home-kits-ia-locale) [Agents Locaux Des agents qui agissent sur ta machine : Cline agentique, MCP, n8n + Ollama, automatisations locales. 24 €](/kit-agents-locaux?utm_source=home-kits-agents-locaux) [RAG Local Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud. 24 €](/kit-rag-local?utm_source=home-kits-rag-local) [IA en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. 24 €](/kit-ia-entreprise?utm_source=home-kits-ia-entreprise) [IA Sans Filtre L'IA qui répond vraiment : un modèle non censuré en local, sans refus abusifs sur la santé, l'histoire, la sécurité ou l'écriture — cadre légal inclus. 24 €](/kit-ia-sans-filtre?utm_source=home-kits-ia-sans-filtre) [Mac L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon. 24 €](/kit-mac?utm_source=home-kits-mac) [Images IA Images et vidéos IA en local, sans limite : ComfyUI, Flux, Z-Image, Wan 2.2 sur ton GPU ou ton Mac — workflows prêts à charger, cadre légal inclus. 24 €](/kit-images-ia?utm_source=home-kits-images-ia) ou [tous les kits à vie — 49 €](/kits?utm_source=home-kits-bundle) → Catalogue · 247 modèles ## Le catalogue desLLM open-weightsqui tournent en local. Tous les modèles pertinents, avec VRAM requise par quantification, vitesse estimée et cas d'usage. Les modèles français sont mis en avant. [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=catalogue-strip) 🇫🇷 Focus souveraineté ### Les25modèlesmade in France Mistral, Lucie (OpenLLM-France), CroissantLLM — entraînés sur du corpus FR, licences permissives, excellents en français soutenu. Filtrer uniquement les modèles FR ★ Top sélection éditoriale [Voir tous les classements →](/meilleur-llm) [Pour coder](/meilleur-llm/code) [En français](/meilleur-llm/francais) [Pour RAG](/meilleur-llm/rag) [Pour raisonner](/meilleur-llm/reasoning) [Avec vision](/meilleur-llm/vision) [Pour agents](/meilleur-llm/agents) [< 8 GB VRAM](/meilleur-llm/8gb-vram) [Sur RTX 4090](/meilleur-llm/rtx-4090) [Sur Mac](/meilleur-llm/mac-silicon) [Sans GPU](/meilleur-llm/cpu-only) [Libre commercial](/meilleur-llm/commercial) [Souverain EU](/meilleur-llm/souverain) Toutes familles Apertus Arctic Aya Claire Command Croissant DBRX DeepSeek dots ERNIE EuroLLM EXAONE Falcon Gemma GLM gpt-oss Granite Grok Helium HRM Hunyuan Inkling InternVL Jais Jamba Kanana Kimi Laguna LFM Ling LLaDA Llama LLaVA LongCat Lucie MiMo MiniCPM MiniMax Mistral Molmo Moshi Nemotron North OLMo Pangu Phi Pleias Qwen Qwen3 Rakuten Ring Salamandra Sarvam Seed SmolLM Step Teuken Trinity Tulu Yi Tous tags Chat Code Raisonnement Vision Multilingue MoE Audio Légers (<4B) Pertinence (FR d'abord) Plus récent Plus ancien Taille décroissante Taille croissante VRAM décroissante VRAM croissante Contexte décroissant Contexte croissant tok/s décroissant tok/s croissant Nom A-Z Nom Z-A 247 modèle s Modèle ↕ Params ↕ VRAM Q4 ↕ Contexte ↕ Tourne sur tok/s ↕ Sortie ↕ Pleias-RAG 1B ★ FR chat fr 🇫🇷 PleIAs · Spécialisé RAG 1.2B. Citation et grounding intégrés. Bat la plupart des SLM ≤4B sur HotPotQA. 1.2 B 0.8 GB 2k 8 12 16 24 150 avr. 2025 CroissantLLM 1.3B ★ FR chat fr 🇫🇷 CroissantLLM · Petit modèle bilingue FR/EN. Tourne partout, même sur CPU. 1.3 B 1 GB 2k 8 12 16 24 120 janv. 2024 SmolLM2 1.7B Instruct ★ FR chat general 🇫🇷 HuggingFace · 1.7B Apache 2.0 très téléchargé. Bat Qwen2.5-1.5B de ~6 pts MMLU-Pro. BFCL function calling 27%. 1.7 B 1.2 GB 8k 8 12 16 24 120 nov. 2024 Helium 1 2B ★ FR chat general 🇫🇷 Kyutai · Base multilingue 24 langues UE (Kyutai FR). Distillé de Gemma 2 → Gemma Terms s'appliquent aussi. 2 B 1.5 GB 4k 8 12 16 24 100 avr. 2025 SmolVLM2 2.2B Instruct ★ FR vision chat 🇫🇷 HuggingFace · VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B. 2.2 B 1.6 GB 8k 8 12 16 24 90 févr. 2025 Pleias 3B Preview ★ FR chat multilingual 🇫🇷 PleIAs · Français. Entraîné 100% sur Common Corpus (données open). Conforme AI Act UE par design. 3 B 2 GB 2k 8 12 16 24 70 déc. 2024 SmolLM3 3B ★ FR chat general 🇫🇷 HuggingFace · 3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette). 3 B 2 GB 125k 8 12 16 24 70 juil. 2025 Voxtral-4B-TTS ★ FR audio multilingual 🇫🇷 Mistral AI · TTS frontière open, 9 langues dont FR. Rivalise ElevenLabs. ⚠ Non-commercial. 4 B 10 GB 4k 8 12 16 24 40 mars 2026 Mistral 7B Instruct ★ FR chat general 🇫🇷 Mistral AI · Le classique français. Rapide, polyvalent, excellente base pour débuter. 7 B 5 GB 32k 8 12 16 24 35 sept. 2023 Lucie 7B ★ FR chat… --- ## 200+ LLM open source : lequel tourne sur votre machine ? | QuelLLM.fr URL: https://quelllm.fr/catalogue published: 2026-09-11 > VRAM nécessaire, licence, vitesse : comparez 200+ LLM open source et repérez en un clin d'œil ceux qui tournent vraiment sur votre PC ou votre Mac. LIVE 247 modèles indexés · 254 guides en français · 100% local Paris — [Quel LLM FR l'IA, vraiment chez vous.](/) [01 Configurateur](/configurateur) [02 Catalogue](/catalogue) [03 Guides](/guides) [04 Actu](/actu) 05 Outils 06 Projet [◆ Les kits](/kits?utm_source=nav) Rechercher ⌘K [Analyser ma config](/configurateur) [◆ Kits](/kits?utm_source=nav-mobile) Tous les modèles · 100% local, 100% privé # Quel LLM tourne survotre machine Dites-nous ce que vous avez dans le capot. On vous dit ce qui tourne, à quelle vitesse, et comment l'installer — en français, pas à pas. ~/configurateur —— ● prêt GPU / Puce RTX 5090 RTX 5080 RTX 5070 Ti RTX 5070 RTX 5060 Ti 16GB RTX 5060 Ti 8GB RTX 5060 RTX 5050 RTX 5090 Laptop RTX 5080 Laptop RTX 5070 Ti Laptop RTX 5070 Laptop RTX 4090 RTX 4080 Super RTX 4080 RTX 4070 Ti Super RTX 4070 Ti RTX 4070 Super RTX 4070 RTX 4060 Ti 16GB RTX 4060 Ti 8GB RTX 4060 RTX 4090 Laptop RTX 4080 Laptop RTX 4070 Laptop RTX 4060 Laptop RTX 4050 Laptop RTX 3090 Ti RTX 3090 RTX 3080 Ti RTX 3080 12GB RTX 3080 10GB RTX 3070 Ti RTX 3070 RTX 3060 Ti RTX 3060 12GB RTX 3060 8GB RTX 3050 8GB RTX 3050 6GB RTX 3080 Ti Laptop RTX 3080 Laptop 16GB RTX 3080 Laptop 8GB RTX 3070 Ti Laptop RTX 3070 Laptop RTX 3060 Laptop RTX 3050 Ti Laptop RTX 3050 Laptop RTX 2080 Ti RTX 2080 Super RTX 2080 RTX 2070 Super RTX 2070 RTX 2060 Super RTX 2060 GTX 1660 Ti GTX 1660 Super GTX 1660 GTX 1650 GTX 1080 Ti GTX 1080 GTX 1070 Ti GTX 1070 GTX 1060 6GB Radeon RX 7900 XTX Radeon RX 7900 XT Radeon RX 7900 GRE Radeon RX 7800 XT Radeon RX 7700 XT Radeon RX 9070 XT Radeon RX 9070 Radeon RX 9060 XT 16GB Radeon RX 6800 XT Radeon RX 6700 XT Apple M5 Ultra (192 GB) Apple M5 Max (64 GB) Apple M5 Pro (48 GB) Apple M5 (24 GB) Apple M4 Max (64 GB) Apple M4 Pro (48 GB) Apple M4 (24 GB) Apple M3 Max (64 GB) Apple M3 Pro (36 GB) Apple M2 Ultra (128 GB) Apple M2 (16 GB) Apple M1 (16 GB) GPU intégré / aucun RAM système 8 GB 16 GB 32 GB 64 GB 128 GB OS Windows 11 Linux Usage principal Tous usages Chat / assistant Code / dev RAG / documents Vision / images Audio / voix Raisonnement / maths Agents autonomes Vos données restent dans votre navigateur. Rien n'est envoyé. Analyser ma config Gratuit Aucune inscription 100% français Guides pédagogiques Open source Données publiques Vie privée Zéro tracker [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=home-hero) ## Le marché en bref [Toute l'actu →](/actu) [11 sept. Open-weights chinois jugés plus sûrs, l'IA américaine à la traîne](/actu#a-2026-09-11-open-weights-chinois-plus-surs) [11 sept. Google signe une lettre ouverte en faveur des modèles open-weights](/actu#a-2026-09-11-google-signe-lettre-open-weights) [11 sept. Kimi-K3 débarque sur Ollama](/actu#a-2026-09-11-kimi-k3-sur-ollama) Kits QuelLLM ## Les kits QuelLLM —le guide de référencepar usage. Un kit par usage : le guide complet, les configs prêtes à coller, l'espace en ligne à vie. [Copilote Local Remplace GitHub Copilot et Cursor par un copilote de code 100 % local — le guide de référence, configs incluses. 24 €](/copilote-local?utm_source=home-kits-copilote-local) [IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. 24 €](/kit-ia-locale?utm_source=home-kits-ia-locale) [Agents Locaux Des agents qui agissent sur ta machine : Cline agentique, MCP, n8n + Ollama, automatisations locales. 24 €](/kit-agents-locaux?utm_source=home-kits-agents-locaux) [RAG Local Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud. 24 €](/kit-rag-local?utm_source=home-kits-rag-local) [IA en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. 24 €](/kit-ia-entreprise?utm_source=home-kits-ia-entreprise) [IA Sans Filtre L'IA qui répond vraiment : un modèle non censuré en local, sans refus abusifs sur la santé, l'histoire, la sécurité ou l'écriture — cadre légal inclus. 24 €](/kit-ia-sans-filtre?utm_source=home-kits-ia-sans-filtre) [Mac L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon. 24 €](/kit-mac?utm_source=home-kits-mac) [Images IA Images et vidéos IA en local, sans limite : ComfyUI, Flux, Z-Image, Wan 2.2 sur ton GPU ou ton Mac — workflows prêts à charger, cadre légal inclus. 24 €](/kit-images-ia?utm_source=home-kits-images-ia) ou [tous les kits à vie — 49 €](/kits?utm_source=home-kits-bundle) → Catalogue · 247 modèles ## Le catalogue desLLM open-weightsqui tournent en local. Tous les modèles pertinents, avec VRAM requise par quantification, vitesse estimée et cas d'usage. Les modèles français sont mis en avant. [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=catalogue-strip) 🇫🇷 Focus souveraineté ### Les25modèlesmade in France Mistral, Lucie (OpenLLM-France), CroissantLLM — entraînés sur du corpus FR, licences permissives, excellents en français soutenu. Filtrer uniquement les modèles FR ★ Top sélection éditoriale [Voir tous les classements →](/meilleur-llm) [Pour coder](/meilleur-llm/code) [En français](/meilleur-llm/francais) [Pour RAG](/meilleur-llm/rag) [Pour raisonner](/meilleur-llm/reasoning) [Avec vision](/meilleur-llm/vision) [Pour agents](/meilleur-llm/agents) [< 8 GB VRAM](/meilleur-llm/8gb-vram) [Sur RTX 4090](/meilleur-llm/rtx-4090) [Sur Mac](/meilleur-llm/mac-silicon) [Sans GPU](/meilleur-llm/cpu-only) [Libre commercial](/meilleur-llm/commercial) [Souverain EU](/meilleur-llm/souverain) Toutes familles Apertus Arctic Aya Claire Command Croissant DBRX DeepSeek dots ERNIE EuroLLM EXAONE Falcon Gemma GLM gpt-oss Granite Grok Helium HRM Hunyuan Inkling InternVL Jais Jamba Kanana Kimi Laguna LFM Ling LLaDA Llama LLaVA LongCat Lucie MiMo MiniCPM MiniMax Mistral Molmo Moshi Nemotron North OLMo Pangu Phi Pleias Qwen Qwen3 Rakuten Ring Salamandra Sarvam Seed SmolLM Step Teuken Trinity Tulu Yi Tous tags Chat Code Raisonnement Vision Multilingue MoE Audio Légers (<4B) Pertinence (FR d'abord) Plus récent Plus ancien Taille décroissante Taille croissante VRAM décroissante VRAM croissante Contexte décroissant Contexte croissant tok/s décroissant tok/s croissant Nom A-Z Nom Z-A 247 modèle s Modèle ↕ Params ↕ VRAM Q4 ↕ Contexte ↕ Tourne sur tok/s ↕ Sortie ↕ Pleias-RAG 1B ★ FR chat fr 🇫🇷 PleIAs · Spécialisé RAG 1.2B. Citation et grounding intégrés. Bat la plupart des SLM ≤4B sur HotPotQA. 1.2 B 0.8 GB 2k 8 12 16 24 150 avr. 2025 CroissantLLM 1.3B ★ FR chat fr 🇫🇷 CroissantLLM · Petit modèle bilingue FR/EN. Tourne partout, même sur CPU. 1.3 B 1 GB 2k 8 12 16 24 120 janv. 2024 SmolLM2 1.7B Instruct ★ FR chat general 🇫🇷 HuggingFace · 1.7B Apache 2.0 très téléchargé. Bat Qwen2.5-1.5B de ~6 pts MMLU-Pro. BFCL function calling 27%. 1.7 B 1.2 GB 8k 8 12 16 24 120 nov. 2024 Helium 1 2B ★ FR chat general 🇫🇷 Kyutai · Base multilingue 24 langues UE (Kyutai FR). Distillé de Gemma 2 → Gemma Terms s'appliquent aussi. 2 B 1.5 GB 4k 8 12 16 24 100 avr. 2025 SmolVLM2 2.2B Instruct ★ FR vision chat 🇫🇷 HuggingFace · VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B. 2.2 B 1.6 GB 8k 8 12 16 24 90 févr. 2025 Pleias 3B Preview ★ FR chat multilingual 🇫🇷 PleIAs · Français. Entraîné 100% sur Common Corpus (données open). Conforme AI Act UE par design. 3 B 2 GB 2k 8 12 16 24 70 déc. 2024 SmolLM3 3B ★ FR chat general 🇫🇷 HuggingFace · 3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette). 3 B 2 GB 125k 8 12 16 24 70 juil. 2025 Voxtral-4B-TTS ★ FR audio multilingual 🇫🇷 Mistral AI · TTS frontière open, 9 langues dont FR. Rivalise ElevenLabs. ⚠ Non-commercial. 4 B 10 GB 4k 8 12 16 24 40 mars 2026 Mistral 7B Instruct ★ FR chat general 🇫🇷 Mistral AI · Le classique français. Rapide, polyvalent, excellente base pour débuter. 7 B 5 GB 32k 8 12 16 24 35 sept. 2023 Lucie 7B ★ FR chat… --- ## Guides LLM local : 160+ tutoriels en français (2026) | QuelLLM.fr URL: https://quelllm.fr/guides published: 2026-09-11 > 160+ guides et tutoriels en français pour installer, configurer et optimiser vos LLM en local : Ollama, LM Studio, llama.cpp, matériel, RAG. Tous niveaux. LIVE 247 modèles indexés · 254 guides en français · 100% local Paris — [Quel LLM FR l'IA, vraiment chez vous.](/) [01 Configurateur](/configurateur) [02 Catalogue](/catalogue) [03 Guides](/guides) [04 Actu](/actu) 05 Outils 06 Projet [◆ Les kits](/kits?utm_source=nav) Rechercher ⌘K [Analyser ma config](/configurateur) [◆ Kits](/kits?utm_source=nav-mobile) Tous les modèles · 100% local, 100% privé # Quel LLM tourne survotre machine Dites-nous ce que vous avez dans le capot. On vous dit ce qui tourne, à quelle vitesse, et comment l'installer — en français, pas à pas. ~/configurateur —— ● prêt GPU / Puce RTX 5090 RTX 5080 RTX 5070 Ti RTX 5070 RTX 5060 Ti 16GB RTX 5060 Ti 8GB RTX 5060 RTX 5050 RTX 5090 Laptop RTX 5080 Laptop RTX 5070 Ti Laptop RTX 5070 Laptop RTX 4090 RTX 4080 Super RTX 4080 RTX 4070 Ti Super RTX 4070 Ti RTX 4070 Super RTX 4070 RTX 4060 Ti 16GB RTX 4060 Ti 8GB RTX 4060 RTX 4090 Laptop RTX 4080 Laptop RTX 4070 Laptop RTX 4060 Laptop RTX 4050 Laptop RTX 3090 Ti RTX 3090 RTX 3080 Ti RTX 3080 12GB RTX 3080 10GB RTX 3070 Ti RTX 3070 RTX 3060 Ti RTX 3060 12GB RTX 3060 8GB RTX 3050 8GB RTX 3050 6GB RTX 3080 Ti Laptop RTX 3080 Laptop 16GB RTX 3080 Laptop 8GB RTX 3070 Ti Laptop RTX 3070 Laptop RTX 3060 Laptop RTX 3050 Ti Laptop RTX 3050 Laptop RTX 2080 Ti RTX 2080 Super RTX 2080 RTX 2070 Super RTX 2070 RTX 2060 Super RTX 2060 GTX 1660 Ti GTX 1660 Super GTX 1660 GTX 1650 GTX 1080 Ti GTX 1080 GTX 1070 Ti GTX 1070 GTX 1060 6GB Radeon RX 7900 XTX Radeon RX 7900 XT Radeon RX 7900 GRE Radeon RX 7800 XT Radeon RX 7700 XT Radeon RX 9070 XT Radeon RX 9070 Radeon RX 9060 XT 16GB Radeon RX 6800 XT Radeon RX 6700 XT Apple M5 Ultra (192 GB) Apple M5 Max (64 GB) Apple M5 Pro (48 GB) Apple M5 (24 GB) Apple M4 Max (64 GB) Apple M4 Pro (48 GB) Apple M4 (24 GB) Apple M3 Max (64 GB) Apple M3 Pro (36 GB) Apple M2 Ultra (128 GB) Apple M2 (16 GB) Apple M1 (16 GB) GPU intégré / aucun RAM système 8 GB 16 GB 32 GB 64 GB 128 GB OS Windows 11 Linux Usage principal Tous usages Chat / assistant Code / dev RAG / documents Vision / images Audio / voix Raisonnement / maths Agents autonomes Vos données restent dans votre navigateur. Rien n'est envoyé. Analyser ma config Gratuit Aucune inscription 100% français Guides pédagogiques Open source Données publiques Vie privée Zéro tracker [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=home-hero) ## Le marché en bref [Toute l'actu →](/actu) [11 sept. Open-weights chinois jugés plus sûrs, l'IA américaine à la traîne](/actu#a-2026-09-11-open-weights-chinois-plus-surs) [11 sept. Google signe une lettre ouverte en faveur des modèles open-weights](/actu#a-2026-09-11-google-signe-lettre-open-weights) [11 sept. Kimi-K3 débarque sur Ollama](/actu#a-2026-09-11-kimi-k3-sur-ollama) Kits QuelLLM ## Les kits QuelLLM —le guide de référencepar usage. Un kit par usage : le guide complet, les configs prêtes à coller, l'espace en ligne à vie. [Copilote Local Remplace GitHub Copilot et Cursor par un copilote de code 100 % local — le guide de référence, configs incluses. 24 €](/copilote-local?utm_source=home-kits-copilote-local) [IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. 24 €](/kit-ia-locale?utm_source=home-kits-ia-locale) [Agents Locaux Des agents qui agissent sur ta machine : Cline agentique, MCP, n8n + Ollama, automatisations locales. 24 €](/kit-agents-locaux?utm_source=home-kits-agents-locaux) [RAG Local Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud. 24 €](/kit-rag-local?utm_source=home-kits-rag-local) [IA en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. 24 €](/kit-ia-entreprise?utm_source=home-kits-ia-entreprise) [IA Sans Filtre L'IA qui répond vraiment : un modèle non censuré en local, sans refus abusifs sur la santé, l'histoire, la sécurité ou l'écriture — cadre légal inclus. 24 €](/kit-ia-sans-filtre?utm_source=home-kits-ia-sans-filtre) [Mac L'IA locale sur ton Mac, à fond : mémoire unifiée, MLX vs GGUF, le bon modèle pour ta puce, Ollama et LM Studio réglés pour Apple Silicon. 24 €](/kit-mac?utm_source=home-kits-mac) [Images IA Images et vidéos IA en local, sans limite : ComfyUI, Flux, Z-Image, Wan 2.2 sur ton GPU ou ton Mac — workflows prêts à charger, cadre légal inclus. 24 €](/kit-images-ia?utm_source=home-kits-images-ia) ou [tous les kits à vie — 49 €](/kits?utm_source=home-kits-bundle) → Catalogue · 247 modèles ## Le catalogue desLLM open-weightsqui tournent en local. Tous les modèles pertinents, avec VRAM requise par quantification, vitesse estimée et cas d'usage. Les modèles français sont mis en avant. [◆ Les kits QuelLLM — le guide de référence par usage · 24 € le kit · 49 € tous à vie →](/kits?utm_source=catalogue-strip) 🇫🇷 Focus souveraineté ### Les25modèlesmade in France Mistral, Lucie (OpenLLM-France), CroissantLLM — entraînés sur du corpus FR, licences permissives, excellents en français soutenu. Filtrer uniquement les modèles FR ★ Top sélection éditoriale [Voir tous les classements →](/meilleur-llm) [Pour coder](/meilleur-llm/code) [En français](/meilleur-llm/francais) [Pour RAG](/meilleur-llm/rag) [Pour raisonner](/meilleur-llm/reasoning) [Avec vision](/meilleur-llm/vision) [Pour agents](/meilleur-llm/agents) [< 8 GB VRAM](/meilleur-llm/8gb-vram) [Sur RTX 4090](/meilleur-llm/rtx-4090) [Sur Mac](/meilleur-llm/mac-silicon) [Sans GPU](/meilleur-llm/cpu-only) [Libre commercial](/meilleur-llm/commercial) [Souverain EU](/meilleur-llm/souverain) Toutes familles Apertus Arctic Aya Claire Command Croissant DBRX DeepSeek dots ERNIE EuroLLM EXAONE Falcon Gemma GLM gpt-oss Granite Grok Helium HRM Hunyuan Inkling InternVL Jais Jamba Kanana Kimi Laguna LFM Ling LLaDA Llama LLaVA LongCat Lucie MiMo MiniCPM MiniMax Mistral Molmo Moshi Nemotron North OLMo Pangu Phi Pleias Qwen Qwen3 Rakuten Ring Salamandra Sarvam Seed SmolLM Step Teuken Trinity Tulu Yi Tous tags Chat Code Raisonnement Vision Multilingue MoE Audio Légers (<4B) Pertinence (FR d'abord) Plus récent Plus ancien Taille décroissante Taille croissante VRAM décroissante VRAM croissante Contexte décroissant Contexte croissant tok/s décroissant tok/s croissant Nom A-Z Nom Z-A 247 modèle s Modèle ↕ Params ↕ VRAM Q4 ↕ Contexte ↕ Tourne sur tok/s ↕ Sortie ↕ Pleias-RAG 1B ★ FR chat fr 🇫🇷 PleIAs · Spécialisé RAG 1.2B. Citation et grounding intégrés. Bat la plupart des SLM ≤4B sur HotPotQA. 1.2 B 0.8 GB 2k 8 12 16 24 150 avr. 2025 CroissantLLM 1.3B ★ FR chat fr 🇫🇷 CroissantLLM · Petit modèle bilingue FR/EN. Tourne partout, même sur CPU. 1.3 B 1 GB 2k 8 12 16 24 120 janv. 2024 SmolLM2 1.7B Instruct ★ FR chat general 🇫🇷 HuggingFace · 1.7B Apache 2.0 très téléchargé. Bat Qwen2.5-1.5B de ~6 pts MMLU-Pro. BFCL function calling 27%. 1.7 B 1.2 GB 8k 8 12 16 24 120 nov. 2024 Helium 1 2B ★ FR chat general 🇫🇷 Kyutai · Base multilingue 24 langues UE (Kyutai FR). Distillé de Gemma 2 → Gemma Terms s'appliquent aussi. 2 B 1.5 GB 4k 8 12 16 24 100 avr. 2025 SmolVLM2 2.2B Instruct ★ FR vision chat 🇫🇷 HuggingFace · VLM 2.2B : image+vidéo+texte. 5.2 GB VRAM pour l'inférence vidéo. Base SmolLM2-1.7B. 2.2 B 1.6 GB 8k 8 12 16 24 90 févr. 2025 Pleias 3B Preview ★ FR chat multilingual 🇫🇷 PleIAs · Français. Entraîné 100% sur Common Corpus (données open). Conforme AI Act UE par design. 3 B 2 GB 2k 8 12 16 24 70 déc. 2024 SmolLM3 3B ★ FR chat general 🇫🇷 HuggingFace · 3B dual-mode (think/no-think). 6 langues. MMLU 59.7, GSM8K 70.9. Fully open (données+recette). 3 B 2 GB 125k 8 12 16 24 70 juil. 2025 Voxtral-4B-TTS ★ FR audio multilingual 🇫🇷 Mistral AI · TTS frontière open, 9 langues dont FR. Rivalise ElevenLabs. ⚠ Non-commercial. 4 B 10 GB 4k 8 12 16 24 40 mars 2026 Mistral 7B Instruct ★ FR chat general 🇫🇷 Mistral AI · Le classique français. Rapide, polyvalent, excellente base pour débuter. 7 B 5 GB 32k 8 12 16 24 35 sept. 2023 Lucie 7B ★ FR chat… --- ## Comparateur de LLM — face à face de modèles open-source | QuelLLM.fr URL: https://quelllm.fr/comparateur published: 2026-09-11 > Comparez deux LLM open-source côte à côte : VRAM, licence, tokens/sec, qualité, taille. Interface pensée pour décider vite. [Accueil](/) / Comparateur Outil # Face à facedes modèles Choisissez deux ou trois modèles, et on les aligne sur les mêmes critères. Paramètres, VRAM par quantization, licence, langues — tout ce qui compte pour choisir. Modèle A Mistral 7B Instruct 🇫🇷 Mistral Small 3 🇫🇷 Mixtral 8x7B 🇫🇷 Lucie 7B 🇫🇷 CroissantLLM 1.3B 🇫🇷 Llama 3.1 8B Llama 3.1 70B Llama 3.2 3B Qwen 2.5 7B Qwen 2.5 32B Qwen 2.5 Coder 7B Qwen 2.5 Coder 32B Gemma 2 2B Gemma 2 9B Gemma 2 27B Phi-3.5 Mini Phi-4 14B DeepSeek R1 Distill 7B DeepSeek R1 Distill 32B DeepSeek Coder V2 Lite 16B Llama 3.2 Vision 11B Qwen 2 VL 7B Mistral Nemo 12B Instruct 🇫🇷 Mistral Small 3.1 24B 🇫🇷 Llama 3.3 70B Instruct Qwen 3 8B Qwen 3 14B Qwen 3 32B Qwen 3 235B-A22B Qwen 2.5 VL 7B Qwen 2.5 VL 72B Qwen 2.5 Omni 7B QwQ 32B DeepSeek R1 671B DeepSeek R1 Distill Llama 70B DeepSeek V3 671B Gemma 3 4B Gemma 3 12B Gemma 3 27B Phi-4 Multimodal 5.6B Phi-4 Reasoning 14B Command R+ 104B (08-2024) Aya Expanse 8B Aya Expanse 32B EuroLLM 9B Instruct Teuken 7B Instruct Pleias 3B Preview 🇫🇷 Pleias-RAG 1B 🇫🇷 Moshi 7B 🇫🇷 Helium 1 2B 🇫🇷 SmolLM2 1.7B Instruct 🇫🇷 SmolVLM2 2.2B Instruct 🇫🇷 GLM-5.1 MiniMax-M2.7 Gemma 4 31B Gemma 4 E4B Qwen 3.5 9B Qwen 3.5 27B Qwen 3.5 397B-A17B Qwen 3.6 35B-A3B Qwen3-Coder-Next 80B-A3B Qwen3-Coder 30B-A3B Mistral Small 4 🇫🇷 Devstral Small 2 24B 🇫🇷 Voxtral-4B-TTS 🇫🇷 DeepSeek R2 32B DeepSeek V3.2 Kimi K2.5 Nemotron 3 Super 120B OLMo 3 7B OLMo 3 32B Tiny Aya 3.35B Granite 4.0 3B Vision Step 3.5 Flash Falcon H1R 7B Mixtral 8x22B Instruct 🇫🇷 Mistral Small 3.2 24B 🇫🇷 Codestral 22B v0.1 🇫🇷 Codestral Mamba 7B 🇫🇷 Magistral Small 24B 🇫🇷 Mistral Large 3 675B 🇫🇷 Mistral Medium 3.5 128B 🇫🇷 Llama 3.1 405B Instruct Llama 4 Scout 109B Llama 4 Maverick 400B Llama 3.1 Nemotron 70B Qwen 2.5 3B Instruct Qwen 2.5 14B Instruct Qwen 2.5 72B Instruct Qwen 2.5 Coder 1.5B Instruct Qwen 2.5 Coder 3B Instruct Qwen 2.5 Coder 14B Instruct Qwen 3 30B-A3B DeepSeek R1 Distill Qwen 1.5B DeepSeek R1 Distill Qwen 14B Phi-4 Mini 3.8B Phi-4 Mini Reasoning 3.8B Gemma 3n E2B Gemma 3n E4B Granite 3.2 8B Instruct Granite 3.3 8B Instruct Granite 4.0 H-Small 32B-A9B Granite 4.0 H-Tiny 7B-A1B Tülu 3 8B Tülu 3 70B OLMoE 1B-7B Instruct Molmo 7B-D Molmo 72B SmolLM3 3B 🇫🇷 MiniCPM-V 2.6 8B MiniCPM-o 2.6 8B Falcon 3 7B Instruct Falcon 3 10B Instruct Falcon Mamba 7B Command R 35B v01 Aya 23 8B Aya 23 35B Yi 1.5 34B Chat Yi Coder 9B Chat DBRX Instruct Jais 30B Chat v3 Jais Adapted 70B Chat Sarvam-M 24B Salamandra 7B Instruct Salamandra 40B Instruct EuroLLM 22B Instruct 2512 Claire 7B 0.1 🇫🇷 Jamba 1.5 Mini Hunyuan-A13B Instruct LLaVA-OneVision 7B LLaVA-OneVision 72B Snowflake Arctic Instruct Grok-1 (base) gpt-oss 120B gpt-oss 20B Kimi K2.6 Qwen 3 VL 235B-A22B Qwen 3 VL 30B-A3B Qwen 3 VL 8B ERNIE 4.5 300B-A47B ERNIE 4.5 21B-A3B Thinking Ring-1T Seed-OSS 36B Instruct EXAONE 4.5 33B Nemotron Nano 3 30B-A3B Nemotron Nano v2 VL 12B Apertus 70B Apertus 8B Trinity Mini 26B-A3B Hunyuan Large 2.0 InternVL 3.5 8B MiMo V2 Flash Rakuten AI 3.0 Kanana 2 30B-A3B Thinking DeepSeek-OCR HunyuanOCR 1B Gemma 4 26B-A4B MoE dots.llm1 Instruct Qwen 3 Omni 30B-A3B Qwen 3.5 122B-A10B Pangu Pro MoE 72B Qwen 3.6 27B DeepSeek V4 Pro 1.6T DeepSeek V4 Flash 284B Tencent Hy3 Preview 295B LLaDA 2.0 Uni 16B MiMo V2.5 Pro MiMo V2.5 Granite 4.1 8B Instruct Nemotron 3 Nano Omni 30B-A3B Laguna XS.2 Granite 4.1 30B Instruct Granite 4.1 3B Instruct Ling 2.6 1T Gemma 4 E2B Nemotron Cascade 2 30B-A3B Nemotron 3 33B Nemotron 3 Nano 30B-A3B MedGemma 4B Gemma 4 2B Qwen 3.5 0.8B MedGemma 1.5 4B Granite 4.1 LFM2.5 Thinking 1.2B GLM 4.7 Flash OSINT Researcher 4B LFM2 24B GLM 5 744B-A40B MiniMax M2.5 2.5B GLM-OCR 1.1B Nemotron 3 Super 12B MiniCPM5 1B SFT MiniCPM5 1B HRM-Text 1B Llama 3.1 70B LatamGPT SFT Nemotron 3 Ultra Nemotron 3 Ultra Base (BF16) Nemotron 3 Ultra (BF16) LFM2.5 7B Granite Code 20B (Mixed Precision) DiffusionGemma 26B-A4B Instruct Granite 4.1 Guardian 8B Nemotron 3.5 Content Safety GLM 5.2 753B-A40B Granite Embedding Multilingual R2 Nemotron TwoTower 30B-A3B Base Nemotron 3 Puzzle 75B-A9B Qwythos 9B Claude Mythos MiniMax M3 MiniCPM5 1B Fable Thinking Inkling Kimi K2.7 Code Legal Chatbot Qwen 1.5B IOL-AI Qwen3.5 9B Reasoning v2 Qwen 3.5 4B DeepSeek V4 Flash 0731 304B LongCat Flash Lite Sparse 69B-A3B LFM2.5 2.6B Kimi K3 Laguna S 2.1 Laguna XS 2.1 North Mini Code 1.0 Nemotron 3.5 Lightning 30B-A3B Gemma 4 12B LFM2.5 VL 3B DeepSeek V4 Pro 0813 1.7T Qwen 3.8 27B Nemotron 3.5 Lightning 30B-A3B (BF16) DeepSeek V4 Flash Coder 284B-A13B (MoEspresso V2) Qwen 3.8 27B Obliterated Llama 3.1 8B Reward-Hacks Inoculation (seed4) Granite 4.2 8B LFM2.5 DSpark S1-mini Qwen3.8 Flash Next 125B-A6B GLM 5.3 Flash 320B-A18B IBM Granite Code 7B DPO IBM Granite Code 8B Instruct OLMo 3 7B Think (SFT) GLM 5.3 7B IBM Granite Code 7B v3 Activity Generation 0.5B (Qwen) Qwen3 4B NemotronIF Reasoning SFT OLMo 7B CPT Merged (step 750) Granite Time Series PatchTST R2 Qwen 3.8 27B Obliterated Mythos Agentic DeepSeek V4.1 Flash 552B Mistral 7B Instruct Mistral AI · 7B Modèle B Mistral 7B Instruct 🇫🇷 Mistral Small 3 🇫🇷 Mixtral 8x7B 🇫🇷 Lucie 7B 🇫🇷 CroissantLLM 1.3B 🇫🇷 Llama 3.1 8B Llama 3.1 70B Llama 3.2 3B Qwen 2.5 7B Qwen 2.5 32B Qwen 2.5 Coder 7B Qwen 2.5 Coder 32B Gemma 2 2B Gemma 2 9B Gemma 2 27B Phi-3.5 Mini Phi-4 14B DeepSeek R1 Distill 7B DeepSeek R1 Distill 32B DeepSeek Coder V2 Lite 16B Llama 3.2 Vision 11B Qwen 2 VL 7B Mistral Nemo 12B Instruct 🇫🇷 Mistral Small 3.1 24B 🇫🇷 Llama 3.3 70B Instruct Qwen 3 8B Qwen 3 14B Qwen 3 32B Qwen 3 235B-A22B Qwen 2.5 VL 7B Qwen 2.5 VL 72B Qwen 2.5 Omni 7B QwQ 32B DeepSeek R1 671B DeepSeek R1 Distill Llama 70B DeepSeek V3 671B Gemma 3 4B Gemma 3 12B Gemma 3 27B Phi-4 Multimodal 5.6B Phi-4 Reasoning 14B Command R+ 104B (08-2024) Aya Expanse 8B Aya Expanse 32B EuroLLM 9B Instruct Teuken 7B Instruct Pleias 3B Preview 🇫🇷 Pleias-RAG 1B 🇫🇷 Moshi 7B 🇫🇷 Helium 1 2B 🇫🇷 SmolLM2 1.7B Instruct 🇫🇷 SmolVLM2 2.2B Instruct 🇫🇷 GLM-5.1 MiniMax-M2.7 Gemma 4 31B Gemma 4 E4B Qwen 3.5 9B Qwen 3.5 27B Qwen 3.5 397B-A17B Qwen 3.6 35B-A3B Qwen3-Coder-Next 80B-A3B Qwen3-Coder 30B-A3B Mistral Small 4 🇫🇷 Devstral Small 2 24B 🇫🇷 Voxtral-4B-TTS 🇫🇷 DeepSeek R2 32B DeepSeek V3.2 Kimi K2.5 Nemotron 3 Super 120B OLMo 3 7B OLMo 3 32B Tiny Aya 3.35B Granite 4.0 3B Vision Step 3.5 Flash Falcon H1R 7B Mixtral 8x22B Instruct 🇫🇷 Mistral Small 3.2 24B 🇫🇷 Codestral 22B v0.1 🇫🇷 Codestral Mamba 7B 🇫🇷 Magistral Small 24B 🇫🇷 Mistral Large 3 675B 🇫🇷 Mistral Medium 3.5 128B 🇫🇷 Llama 3.1 405B Instruct Llama 4 Scout 109B Llama 4 Maverick 400B Llama 3.1 Nemotron 70B Qwen 2.5 3B Instruct Qwen 2.5 14B Instruct Qwen 2.5 72B Instruct Qwen 2.5 Coder 1.5B Instruct Qwen 2.5 Coder 3B Instruct Qwen 2.5 Coder 14B Instruct Qwen 3 30B-A3B DeepSeek R1 Distill Qwen 1.5B DeepSeek R1 Distill Qwen 14B Phi-4 Mini 3.8B Phi-4 Mini Reasoning 3.8B Gemma 3n E2B Gemma 3n E4B Granite 3.2 8B Instruct Granite 3.3 8B Instruct Granite 4.0 H-Small 32B-A9B Granite 4.0 H-Tiny 7B-A1B Tülu 3 8B Tülu 3 70B OLMoE 1B-7B Instruct Molmo 7B-D Molmo 72B SmolLM3 3B 🇫🇷 MiniCPM-V 2.6 8B MiniCPM-o 2.6 8B Falcon 3 7B Instruct Falcon 3 10B Instruct Falcon Mamba 7B Command R 35B v01 Aya 23 8B Aya 23 35B Yi 1.5 34B Chat Yi Coder 9B Chat DBRX Instruct Jais 30B Chat v3 Jais Adapted 70B Chat Sarvam-M 24B Salamandra 7B Instruct Salamandra 40B Instruct EuroLLM 22B Instruct 2512 Claire 7B 0.1 🇫🇷 Jamba 1.5 Mini Hunyuan-A13B Instruct LLaVA-OneVision 7B LLaVA-OneVision 72B Snowflake Arctic Instruct Grok-1 (base) gpt-oss 120B gpt-oss 20B Kimi K2.6 Qwen 3 VL 235B-A22B Qwen 3 VL 30B-A3B Qwen 3 VL 8B ERNIE 4.5 300B-A47B ERNIE 4.5 21B-A3B Thinking Ring-1T Seed-OSS 36B Instruct EXAONE 4.5 33B Nemotron Nano 3 30B-A3B Nemotron Nano v2 VL 12B Apertus 70B Apertus 8B Trinity Mini 26B-A3B Hunyuan Large 2.0 InternVL 3.5 8B MiMo V2 Flash Rakuten AI 3.0 Kanana 2 30B-A3B Thinking DeepSeek-OCR HunyuanOCR 1B Gemma 4 26B-A4B MoE dots.llm1 Instruct Qwen 3 Omni 30B-A3B Qwen 3.5 122B-A10B Pangu Pro MoE 72B Qwen 3.6 27B DeepSeek V4 Pro 1.6T DeepSeek V4 Flash 284B Tencent Hy3 Preview 295B LLaDA 2.0 Uni 16… --- ## Benchmarks LLM — tokens/sec mesurés sur GPU réels | QuelLLM.fr URL: https://quelllm.fr/benchmarks published: 2026-09-11 > Mesures réelles de tokens/seconde pour chaque modèle open-source sur les GPU courants : RTX 4090, 4070, Apple M3, AMD Radeon. Données reproductibles. [Accueil](/) / Benchmarks Mesures réelles # Ce qu'on avraiment mesuré Les tokens par seconde ci-dessous viennent d'un banc de test physique. Six machines, six modèles populaires, un seul runtime de référence (llama.cpp). Pas d'estimation, pas de marketing. Données fraîches · 2026-04-18 llama.cpp @ b4280, contexte 2048, batch 1, FlashAttention ON [Méthodologie →](/methode) Modèle blackwell RTX 5090 32 Go VRAM ada RTX 4090 24 Go VRAM ada RTX 4070 12 Go VRAM ampere RTX 3060 12 Go VRAM unified 64GB Mac M3 Max 64 Go VRAM CPU seul Ryzen 7 7700 CPU Mistral 7B Q4 188 tok/s 142 tok/s 88 tok/s 52 tok/s 72 tok/s 9.2 tok/s Llama 3.1 8B Q4 172 tok/s 128 tok/s 76 tok/s 44 tok/s 64 tok/s 7.8 tok/s Qwen 2.5 14B Q4 108 tok/s 82 tok/s 44 tok/s 22 tok/s 38 tok/s 3.9 tok/s Qwen 2.5 32B Q4 58 tok/s 42 tok/s n/a n/a 19 tok/s 1.8 tok/s Llama 3.3 70B Q4 22 tok/s n/a n/a n/a 9.8 tok/s n/a Mixtral 8x7B Q4 96 tok/s 68 tok/s n/a n/a 34 tok/s 4.2 tok/s Meilleur ⅓ Moyen ⅓ Lent ⅓ · n/a = modèle ne tient pas en VRAM ## Ce qu'on en retient OBSERVATION 01 ### La 3060 tient le haut du pavé pour un 7B 52 tok/s sur Mistral 7B Q4 — largement confortable pour du chat interactif, et le GPU coûte moins de 350 € neuf. OBSERVATION 02 ### Le Mac M3 Max fait jeu égal sur les gros La mémoire unifiée de 64 Go permet de faire tourner Llama 70B Q4 à 9.8 tok/s — inaccessible à une 4090. OBSERVATION 03 ### Le CPU n'est pas mort 9.2 tok/s sur Mistral 7B avec un Ryzen moderne. Lent mais utilisable pour du traitement batch de nuit. GPU manquant ? ### Vous avez une 5080, une A6000, un Strix Halo ? On aimerait vos chiffres. [Protocole de bench →](/contribuer) --- ## Parcours d'installation LLM — par profil utilisateur | QuelLLM.fr URL: https://quelllm.fr/parcours published: 2026-09-11 > Débutant, développeur, créateur, entreprise : suivez le parcours d'installation LLM adapté à votre profil et à votre matériel, pas à pas. --- ## À propos — pourquoi QuelLLM.fr | QuelLLM.fr URL: https://quelllm.fr/a-propos published: 2026-09-11 > QuelLLM.fr est un site indépendant et gratuit dédié aux LLM auto-hébergés pour le public francophone. Ni pub, ni affiliation déguisée, ni VC. [Accueil](/) / À propos Le projet # PourquoiQuelLLM.fr Parce qu'en 2026, la majorité des gens croient encore que « faire de l'IA » veut dire « envoyer ses données chez OpenAI ». Ce site existe pour montrer qu'il y a une autre voie, et la rendre accessible en français. ## Le constat Un LLM local, aujourd'hui, c'est possible pour 80% des gens sans acheter un serveur. Une RTX 3060 à 350 € fait tourner Mistral 7B à 40 tokens/seconde. Un MacBook M2 fait tourner Llama 3.1 70B quantisé. Mais entre possible et accessible , il y a un fossé. La doc est éparpillée, souvent en anglais, souvent obsolète d'un mois sur l'autre. C'est ce fossé qu'on essaie de combler. ## La promesse Un site qui répond à une question simple : est-ce que ça tourne chez moi, et comment . Pas une galerie de modèles, pas une couche au-dessus d'Ollama. Un configurateur qui comprend votre matos. Des guides qui marchent. Un catalogue qui dit la vérité sur ce qui tient ou pas en VRAM. Des benchmarks qu'on a vraiment mesurés. 247 modèles dans le catalogue 254 guides rédigés 86 GPU couverts 100% francophone ## Nosnon-négociables Les lignes qu'on ne franchira pas, même si elles rendent le projet plus difficile à rentabiliser. 0 1 ### Indépendance Ni levée de fonds, ni VC, ni partenariat cloud. On n'est pas payé pour recommander tel ou tel modèle. Si on dit qu'un modèle est bien, c'est parce qu'il l'est. 0 2 ### Souveraineté Faire tourner un LLM chez soi, c'est reprendre la main sur ses données. C'est aussi soutenir un écosystème européen qui existe, mais qu'on entend peu. 0 3 ### Pédagogie Les guides sont écrits pour être lus. Pas de jargon gratuit, pas de copier-coller de la doc officielle. Chaque phrase doit servir à quelque chose. 0 4 ### Gratuité Site gratuit, consultable sans compte. Pas de paywall, pas de newsletter premium, pas d'affiliation déguisée. ## Qui est derrière ? Je m'appelle Mohamed Meguedmi , je suis entrepreneur. Dans chacune des boîtes que j'ai montées, l'IA est devenue un outil du quotidien — codage, rédaction, analyse, support. Sauf qu'envoyer mes prompts chez OpenAI ou Anthropic m'a vite posé problème : données clients sensibles, coûts qui grimpent avec l'usage, dépendance à un fournisseur qui peut changer ses règles du jour au lendemain. J'ai donc basculé sur du local — Ollama, llama.cpp, LM Studio, selon les machines et les cas d'usage. QuelLLM.fr, c'est le carnet de tests que je tenais pour moi : quel modèle tient sur quelle carte, quelle quantification garder, quelle commande exacte évite les pièges. Je l'ai ouvert publiquement parce que je n'ai pas trouvé l'équivalent en français. Pas de société, pas d'équipe — juste ce site, mis à jour au fil de mes tests. [Me retrouver sur LinkedIn](https://www.linkedin.com/in/mohamed-meguedmi/) . On en est où ### Le projet est vivant. Un test, un guide, une correction — à chaque fois que l'IA locale évolue, ça passe ici. Envie d'aider, de proposer un modèle ou de signaler une erreur ? [Contribuer →](/contribuer) --- ## Méthodologie — comment on mesure les LLM | QuelLLM.fr URL: https://quelllm.fr/methode published: 2026-09-11 > Comment on estime la VRAM, les tokens/sec et la compatibilité matérielle. Sources, méthode de test, limites — tout est documenté. [Accueil](/) / Méthodologie Comment on mesure # Des chiffresvérifiables Ce site affiche des chiffres. Les estimations du configurateur, les verdicts du catalogue, les benchmarks mesurés. Voici exactement d'où ils viennent et comment on les calcule. ## Trois principes 1. 01 ### On distingue estimé et mesuré Le configurateur donne des tokens/sec estimés par formule. La page Benchmarks affiche des tokens/sec mesurés. Les deux sont étiquetés différemment pour qu'on ne les confonde pas. 2. 02 ### On affiche la marge d'erreur Une estimation tokens/sec a ±30% d'incertitude. On l'affiche, on ne le cache pas. Un chiffre rond sans contexte, c'est de la fiction. 3. 03 ### On date tout Chaque guide, chaque fiche modèle porte une date de dernière vérification. Ce qui était vrai il y a 6 mois sur Ollama ne l'est souvent plus aujourd'hui. ## Les formules utilisées Simplifiées mais honnêtes. Le code source du moteur est consultable sur le repo — le moteur peut être lancé indépendamment du site. 01 VRAM requise VRAM ≈ (P × b / 8) × overhead + KV P = paramètres (milliards), b = bits de quantization, overhead ≈ 1.15, KV = cache contexte 02 Tokens/seconde estimés tok/s ≈ (bande_passante_VRAM / (P × b / 8)) × η η ≈ 0.75 pour un GPU récent, 0.55 pour un Mac Apple Silicon, 0.15 sur CPU pur 03 Verdict tenable VRAM_GPU > VRAM_requise × 1.1 Marge de 10% pour l'OS, les drivers et un peu de contexte en plus ## D'où viennent lesdonnées Tout est sourcé. Rien ne sort d'un chapeau. Si une info est fausse ou périmée, [signalez-la](/contribuer) . Hugging Face Fiches modèles, tailles, architectures huggingface.co Ollama library Quantizations disponibles et poids ollama.com/library llama.cpp Benchmarks PPL, architectures supportées github.com/ggerganov/llama.cpp TechPowerUp Specs GPU (VRAM, bande passante) techpowerup.com/gpu-specs Notre banc de test Mesures tokens/s sur 6 machines de référence voir Benchmarks ## Biais connus ! Ce qu'il faut savoir avant de lire nos chiffres - Les tokens/s estimés supposent une machine au repos , sans Chrome avec 40 onglets. - Les benchmarks sont mesurés avec llama.cpp build de référence, pas vLLM ou TGI. - Le configurateur ne modélise pas précisément les Mac — Apple Silicon a des comportements non linéaires sur les très gros modèles. - On privilégie les quantizations Q4 et Q5 dans le verdict. Q8 et FP16 sont couverts mais moins détaillés. --- ## Contribuer à QuelLLM.fr | QuelLLM.fr URL: https://quelllm.fr/contribuer published: 2026-09-11 > Comment contribuer au projet : ajouter un modèle, proposer un guide, signaler un benchmark, améliorer la documentation. Toutes les contributions sont… [Accueil](/) / Contribuer Ce projet est le vôtre # Six façonsd'aider QuelLLM.fr n'est pas un produit, c'est un carnet public. Un retour, un guide, un modèle proposé, une coquille repérée : la moindre contribution compte. [✎ 0 1 ### Écrire un guide Un tutoriel qui vous a manqué ? Écrivez-le. Le format est standardisé (blocs markdown), la review se fait en PR. Proposer un guide →](/cdn-cgi/l/email-protection#2a4945445e4b495e6a5b5f4f46464647044c5815595f48404f495e177a58455a4559435e4345440f181a4e4f0f181a4d5f434e4f) [⚑ 0 2 ### Signaler une erreur Commande qui ne marche plus, version obsolète, chiffre faux. Un mail — on corrige vite. Nous signaler →](/cdn-cgi/l/email-protection#cfaca0a1bbaeacbb8fbebaaaa3a3a3a2e1a9bdf0bcbaada5aaacbbf29ca6a8a1aea3aaa2aaa1bbeafdffabeafdf8baa1aaeafdffaabdbdaababd) [+ 0 3 ### Proposer un modèle Un LLM open-source intéressant qui manque au catalogue ? Envoyez le nom + la fiche HuggingFace, on l'ajoute. Suggérer un modèle →](/cdn-cgi/l/email-protection#ff9c90918b9e9c8bbf8e8a9a93939392d1998dc08c8a9d959a9c8bc2af8d908f908c968b969091dacdcf9b9adacdcf92909bdabcccdabec7939a) [⌀ 0 4 ### Faire un benchmark Vous avez un GPU rare (H100, 5090, Strix Halo) ? On vous fournit le script de bench, vous tournez, on publie. Nous écrire →](/cdn-cgi/l/email-protection#8cefe3e2f8edeff8ccfdf9e9e0e0e0e1a2eafeb3fff9eee6e9eff8b1cfe3e2f8fee5eef9f8e5e3e2a9bebceee9e2efe4e1edfee7) [↔ 0 5 ### Traduire Le site existe en français. On envisage une version anglaise si 3-4 personnes s'y engagent. Motivé ? Nous contacter →](/cdn-cgi/l/email-protection#d1b2bebfa5b0b2a591a0a4b4bdbdbdbcffb7a3eea2a4b3bbb4b2a5ec85a3b0b5a4b2a5b8bebff4e3e1b5a4f4e3e1a2b8a5b4) [€ 0 6 ### Soutenir Le site est gratuit. Si vous achetez votre matériel (GPU, Mac, barrette de RAM…) via les liens d'affiliation présents sur les fiches, une petite commission revient au projet. Ces liens sont toujours signalés clairement — aucun contenu n'est caché derrière. Nous écrire →](/cdn-cgi/l/email-protection#b6d5d9d8c2d7d5c2f6c7c3d3dadadadb98d0c489c5c3d4dcd3d5c28be5d9c3c2dfd3d8938486d7c3938486c6c4d9dcd3c2) ## Le process en 4 étapes De l'idée à la page publiée, quatre étapes. Le cycle est simple : on relit, on corrige, on publie. 1. ÉTAPE 1 Fork Cloner le repo, créer une branche au nom explicite. 2. ÉTAPE 2 Écrire Suivre le template. Tester les commandes chez soi. 3. ÉTAPE 3 PR Ouvrir la PR, décrire en français. Un mainteneur review. 4. ÉTAPE 4 Merge Corrections si besoin, merge, build, déploiement auto. Charte éditoriale ### Avant de soumettre, lisez ça. - ✓ Pas de copier-coller de la doc officielle. Apportez un angle. - ✓ Liens d'affiliation signalés clairement. Jamais de contenu sponsorisé déguisé. - ✓ Écriture claire. Phrases courtes. Pas de jargon gratuit. - ✓ Images et SVG doivent être libres de droits (CC0, CC-BY). - ✓ On corrige le ton en review — pas d'offense, c'est normal. --- ## Combien coûte un LLM ? Calculateur API vs serveur GPU local | QuelLLM.fr URL: https://quelllm.fr/calculateur-cout-llm published: 2026-09-11 > Combien vous coûte vraiment GPT-5, Claude Opus, Gemini Pro ou DeepSeek par mois ? À partir de quel volume une RTX 5090 ou un Mac M4 Pro devient rentable ?… [Accueil](/) / [Outils](/comparateur) / Calculateur de coût Outil 02 · Coût LLM # Calculateur decoût LLM— API vs self-hosted Combien vous coûte vraiment ChatGPT, Claude, Gemini ou DeepSeek par mois ? À partir de quel volume une RTX 5090 ou un Mac M4 Pro devient rentable ? Entrez votre conso, on vous le dit. ## Votre consommation mensuelle Tokens input/mois — 10.0M Tokens output/mois — 2.5M Heures actives/jour — 4h Amortissement — 24 mois Tarif électricité — 0.20 €/kWh Repère : 10M input + 2,5M output = ~5 000 conversations Claude moyennes (1 500 tokens input + 500 output / conversation). Ajustez selon votre usage. ## Modes avancés Activez les optimisations qui s'appliquent à votre usage. Chaque modèle ne supporte pas tous les modes — voir les notes dans le tableau. Cache prompts (0% hit rate) Anthropic 90% off / Gemini 75% off sur la portion d'input qui hit le cache. Utile si tu réutilises souvent le même prompt système. Mode batch (24h delay) OpenAI/Anthropic/Gemini : 50% off input + output si tu acceptes une latence ≤24h. Idéal jobs offline (digest, batch tagging). DeepSeek off-peak (16h-04h UTC) Tarif réduit 50% (V3.5) ou 75% (R1) hors heures pic Asie. Applicable seulement aux 2 modèles DeepSeek. PC self-hosted allumé H24 Décoché = tu coupes ton PC quand tu ne l'utilises pas (0W idle). Coché = idle 24h-actives × idleW (PC ou Mac jamais éteint). TVA récupérable (pro) Auto-entrepreneur en franchise = non. SAS/SARL avec TVA = oui. Soustrait 16,67% du prix d'achat hardware (TTC → HT). ## Coût mensuel via API (8fournisseurs) Cliquez les badges pour activer/désactiver les modèles. OpenAI GPT-5 OpenAI GPT-5 mini Anthropic Claude Opus 4.7 Anthropic Claude Sonnet 4.6 Anthropic Claude Haiku 4.5 Google Gemini 2.5 Pro Google Gemini 2.5 Flash DeepSeek DeepSeek V3.5 DeepSeek DeepSeek R1 Mistral Mistral Large 2.5 Mistral Mistral Small 3.5 Modèle Vendor Input Output Total/mois Notes Gemini 2.5 Flash ★ moins cher Google $0.75 $0.75 1.4 € Le moins cher des "flagship" Mistral Small 3.5 Mistral $2.0 $1.5 3.2 € EU-hosted, low cost DeepSeek V3.5 DeepSeek $2.7 $2.8 5.0 € Off-peak 50% off (16h-04h UTC) Claude Haiku 4.5 Anthropic $10.0 $12.5 20.7 € Très rapide, multimodal Gemini 2.5 Pro Google $12.5 $25.0 34.5 € Cache 75% off input Claude Sonnet 4.6 Anthropic $30.0 $37.5 62.1 € Best ratio qualité/coût GPT-5 OpenAI $120 $150 248 € Flagship 2026, raisonnement avancé Claude Opus 4.7 Anthropic $150 $188 311 € 1M context, prompt cache 90% off ## Coût mensuel self-hosted (4configs) Hardware amorti sur 24 mois + électricité ( 0.20 €/kWh). Capacity = tok/s estimé × 4 h/jour × 30j ; warning si insuffisant pour 12.5 M tokens demandés. PC + RTX 5070 Ti 16GB PC + RTX 5080 16GB PC + RTX 5090 32GB Mac Mini M4 Pro 48GB Mac Studio M4 Max 64GB Mac Studio M4 Ultra 128GB Hardware VRAM Achat TTC Amort./mois Électricité/mois Total/mois Capacité tok/mois Modèles compatibles PC + RTX 5070 Ti 16GB ★ moins cher 16 GB 1 800 € 75.0 € 21.1 € 96.1 € 19.4 M ~ 45 tok/s jusqu'à 13B q8 ou 27B q4 Mac Mini M4 Pro 48GB ⚠ sous-dimensionné 48 GB 2 800 € 117 € 2.8 € 119 € 10.8 M ~ 25 tok/s jusqu'à 70B q4 (mémoire unifiée) PC + RTX 5090 32GB 32 GB 3 500 € 146 € 31.2 € 177 € 34.6 M ~ 80 tok/s jusqu'à 32B q8 ou 70B q4 Mac Studio M4 Max 64GB 64 GB 4 500 € 188 € 4.1 € 192 € 15.1 M ~ 35 tok/s jusqu'à 70B q5 ou 120B q4 ## Verdict Comparaison personnalisable — change les options ci-dessous. API à comparer Google Gemini 2.5 Flash — 1.4 € /mois ★ Mistral Mistral Small 3.5 — 3.2 € /mois DeepSeek DeepSeek V3.5 — 5.0 € /mois Anthropic Claude Haiku 4.5 — 20.7 € /mois Google Gemini 2.5 Pro — 34.5 € /mois Anthropic Claude Sonnet 4.6 — 62.1 € /mois OpenAI GPT-5 — 248 € /mois Anthropic Claude Opus 4.7 — 311 € /mois Gemini 2.5 Flash 1.4 € /mois API moins chère ★. Aucun hardware à acheter, scaling instantané. Hardware à comparer PC + RTX 5070 Ti 16GB — 96.1 € /mois ★ Mac Mini M4 Pro 48GB — 119 € /mois ⚠ PC + RTX 5090 32GB — 177 € /mois Mac Studio M4 Max 64GB — 192 € /mois PC + RTX 5070 Ti 16GB 96.1 € /mois (amorti) Tokens locaux, données privées, latence ms. Breakeven self-hosted Jamais (à ce volume) À votre volume actuel, Gemini 2.5 Flash (1.4 €/mois) coûte moins que la simple électricité de PC + RTX 5070 Ti 16GB. Augmentez la conso ou changez le hardware/API ci-dessus. Si c'est pour coder Le même calcul, version Copilot Tu fais ce raisonnement pour remplacer GitHub Copilot ou Cursor ? En local, c'est 0 €/mois et ton code ne part jamais dans le cloud. Le guide « Copilote de code local » te donne le setup complet (Ollama + Cline + Aider, configs prêtes) pour t'y mettre en 30 min — et te dit franchement où le local ne remplace pas le cloud. [Voir le kit →](/copilote-local?utm_source=calc) ### Méthodologie & hypothèses Ce calculateur donne un ordre de grandeur, pas un devis comptable. Les hypothèses ci-dessous sont volontairement explicites pour que tu puisses jauger ce qui t'écarte de ton cas réel. #### Pricing API - Tarifs publics 2026-05 en USD/M tokens, sources : openai.com/api/pricing, anthropic.com/pricing, ai.google.dev/pricing, api-docs.deepseek.com, mistral.ai/pricing. - Conversion USD→EUR au taux 0.92 (mai 2026, peut bouger ±5% selon le jour). - Tier pricing au-delà de 200k context (Anthropic/Gemini) NON appliqué — calc utilise un seul prix par modèle. - Cache (Anthropic 90% off / Gemini 75% off input) appliqué uniquement si toggle "Cache prompts" est activé. Sinon ignoré. - Batch mode (50% off OpenAI/Anthropic/Gemini, 24h delay) appliqué uniquement si toggle "Mode batch" est activé. - Off-peak DeepSeek (50%/75% off) appliqué uniquement si toggle "DeepSeek off-peak" est activé. #### Pricing self-hosted - Prix achat = TTC France 2026-05 (toggle "TVA récupérable" pour passer en HT, -16,67%). - Wattage idle/load = système COMPLET (PC : alim+CPU+RAM+SSD+GPU ; Mac : tout-en-un). Sources : reviews TomsHardware/AnandTech, Apple Power Analyzer, mesures pcpartpicker community. - Capacité tokens/mois = tok/s estimé × heures actives × 30 jours. tok/s estimé sur workload mixte (modèle qui tient confortablement + modèle proche limite VRAM). - NON compté : maintenance (~1h/mois ≈ 30-50€ équivalent freelance), bande passante internet, dépréciation pure du matériel revendu, défauts/RMA. - Toggle "PC allumé H24" = idle (24h - heures_actives) × idleW. Décoché = PC éteint hors heures actives (0W idle). #### Limites importantes - Qualité non égale : Llama 3.3 70B local ≠ GPT-5 sur raisonnement complexe / multimodal. Le breakeven suppose équivalence fonctionnelle, ce qui peut surestimer la rentabilité du self-hosted pour certains cas d'usage. - Disponibilité : self-hosted nécessite que la machine soit allumée pour traiter les requêtes. API = toujours dispo, scaling instantané. - Latence : self-hosted = ms (local) ; API = 200-2000 ms selon vendor + région. - Données / RGPD : self-hosted = aucune donnée envoyée à un tiers. API US (OpenAI/Anthropic/Google) = sortie territoriale UE. EU-hosted Mistral = OK RGPD natif. - Pour aller plus loin : comparateur de modèles · configurateur GPU · catalogue 250 LLM · MCP server quelllm . --- ## Tabby : installer une autocomplétion de code locale auto-hébergée | QuelLLM.fr URL: https://quelllm.fr/guide/tabby-autocompletion-code-local-self-hosted-ollama published: 2026-09-11 > Installer Tabby en self-hosted (Docker + GPU) pour obtenir l'autocomplétion inline « texte grisé » façon Copilot, 100 % locale. Modèle StarCoder/Qwen-Coder… [Accueil](/) / [Guides](/guides) / Développement / IDE / Tabby : installer une autocomplétion de code locale auto-hébergée Intermédiaire 25 min IDE # Tabby : installer une autocomplétion de code localeauto-hébergée Cline et Aider font le chat et le mode agent, mais ne fournissent pas l'autocomplétion inline « texte grisé » qui s'affiche pendant que vous tapez — la signature de GitHub Copilot. Tabby comble exactement ce manque : c'est un serveur d'autocomplétion de code auto-hébergé, open-source (Apache 2.0), qui tourne en Docker sur votre GPU et propose des suggestions Fill-In-the-Middle directement dans l'éditeur. Ce guide l'installe pas à pas, configure un modèle StarCoder ou Qwen-Coder, génère le token, branche VS Code et JetBrains, et montre comment un seul GPU peut servir toute une équipe — votre code ne quittant jamais votre infrastructure. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows 11 ## #Pourquoi Tabby plutôt que Cline Tabby et Cline ne sont pas concurrents : ils sont complémentaires. Cline (et Aider) excelle dans le chat conversationnel et le mode agent multi-fichiers, mais aucun des deux ne fait l'autocomplétion ligne par ligne pendant la frappe. Tabby, lui, ne fait que ça — et le fait très bien. Le combo gagnant en 2026 : Cline pour discuter et refactorer, Tabby pour la suggestion grisée qui apparaît au fil de la frappe. Texte grisé inline La suggestion s'affiche directement après le curseur, en grisé. Tab pour accepter, Échap pour ignorer. Exactement l'UX Copilot. 100 % auto-hébergé Le serveur tourne chez vous (Docker). Aucun extrait de code n'est envoyé à un tiers — idéal pour les NDA et le code en secteur régulé. Multi-utilisateurs Contrairement à une extension purement locale, Tabby est un serveur : un seul GPU peut servir toute une équipe via le réseau. Telemetry désactivable Tabby remonte des stats anonymes par défaut ; une variable d'environnement coupe tout. Le code source que vous tapez n'est jamais transmis. i Tabby ≠ Cline Si vous cherchez du chat ou un agent qui modifie plusieurs fichiers, ce n'est pas Tabby : voyez plutôt les guides Cline. Tabby ne fait QUE l'autocomplétion inline. Les deux cohabitent parfaitement dans le même éditeur, branchés sur le même GPU. ## #Prérequis ✓ Le kit Copilote Local Ce guide t'amène au modèle. Le kit t'amène au copilote qui code dans ton éditeur. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit Copilote Local →](/copilote-local?utm_source=guide-inline-tabby-autocompletion-code-l) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-tabby-autocompletion-code-l-bundle) → Docker Tabby se déploie en conteneur. Docker Desktop sur Windows/macOS, Docker Engine sur Linux. GPU NVIDIA (recommandé) Avec le NVIDIA Container Toolkit pour l'accès CUDA. Tabby tourne aussi en CPU, mais la latence inline devient inconfortable. ~6 Go de VRAM Suffisant pour un modèle de complétion 1B–3B en quantisation. Plus de VRAM = modèle plus gros ou plus de devs en parallèle. Un éditeur VS Code ou un IDE JetBrains (IntelliJ, PyCharm, WebStorm, etc.). L'extension Tabby existe pour les deux. → Sur Mac Apple Silicon Le passthrough GPU Docker n'existe pas sur macOS. Sur un Mac M1/M2/M3, lancez plutôt le binaire Tabby natif (Metal) téléchargé depuis les releases GitHub, pas l'image Docker CUDA. La config éditeur reste identique. ## #Quel modèle de complétion L'autocomplétion inline a une contrainte que le chat n'a pas : la latence. La suggestion doit apparaître en quelques centaines de millisecondes, sinon vous tapez plus vite qu'elle. On privilégie donc des modèles Fill-In-the-Middle (FIM) compacts, en variante -base, pas les gros modèles instruct du chat. Modèle de complétion conseillé selon la VRAM VRAM Modèle de complétion Remarque 4–6 Go StarCoder2 3B Réactif, multilingue, bon défaut Tabby. 6–8 Go Qwen2.5-Coder 1.5B / 3B (base) FIM excellent, très rapide, FR/Python/TS. 8–12 Go Qwen2.5-Coder 7B (base) LA référence FIM 2026 (4,7 Go) : suggestions nettes, latence encore courte. 12 Go+ StarCoder2 7B / Qwen-Coder 7B Pour mutualiser plusieurs devs sur un même serveur. ! Variante -base, jamais -instruct Pour l'autocomplétion FIM, prenez toujours la variante -base du modèle, pas la version instruct/chat. Une variante instruct a tendance à « bavarder » (ajouter des commentaires, des explications) au lieu de compléter proprement le code. Gardez les modèles instruct pour Cline. ## #1. Lancer Tabby en Docker On démarre le serveur Tabby avec accès GPU, un volume persistant pour les données, et un modèle de complétion choisi. Le port 8080 expose l'interface web et l'API. Démarrer Tabby (GPU NVIDIA) ⧉ Copier ``` `docker run -d \ --name tabby \ --gpus all \ -p 8080:8080 \ -v $HOME/.tabby:/data \ registry.tabbyml.com/tabbyml/tabby \ serve --model StarCoder2-3B --device cuda` ``` 1. 01 Vérifier le démarrage Au premier lancement, Tabby télécharge le modèle (quelques minutes). Suivez les logs avec docker logs -f tabby jusqu'au message indiquant que le serveur écoute sur le port 8080. 2. 02 Ouvrir l'interface web Rendez-vous sur http://localhost:8080. Le premier accès vous invite à créer un compte administrateur (email + mot de passe). C'est local : ces identifiants restent dans votre volume ~/.tabby. 3. 03 Tester la complétion L'onglet « Playground » de l'interface permet de vérifier que le modèle répond avant même de brancher un éditeur. → Couper la télémétrie Ajoutez -e TABBY_DISABLE_USAGE_COLLECTION=1 à la commande docker run pour désactiver toute remontée de statistiques anonymes. Le contenu de votre code n'est de toute façon jamais transmis, mais cela coupe aussi les métriques d'usage. ## #2. Créer le token d'accès Les éditeurs s'authentifient auprès du serveur Tabby avec un token. C'est ce qui permet, en équipe, de savoir qui se connecte et de révoquer un accès sans tout casser. 1. 01 Aller dans les paramètres Dans l'interface web (http://localhost:8080), ouvrez la section comptes/sécurité. Le token de l'utilisateur courant y est affiché. 2. 02 Copier le token Récupérez la chaîne de caractères (souvent préfixée auth_). C'est elle que les extensions VS Code et JetBrains demanderont. 3. 03 Régénérer si besoin En cas de fuite ou de départ d'un collaborateur, régénérez le token depuis l'interface : l'ancien est immédiatement invalidé. Ce dont l'éditeur a besoin ⧉ Copier ``` `Endpoint : http://localhost:8080 Token : auth_xxxxxxxxxxxxxxxxxxxxxxxx` ``` ## #3. Brancher VS Code 1. 01 Installer l'extension Extensions (Ctrl+Shift+X) → chercher « Tabby » (éditeur TabbyML) → Install. 2. 02 Renseigner l'endpoint Au premier lancement, l'extension demande l'URL du serveur. Saisissez http://localhost:8080 (ou l'IP du serveur partagé sur le réseau). 3. 03 Coller le token Renseignez le token d'accès copié à l'étape précédente. L'icône Tabby dans la barre d'état doit passer au vert (connecté). 4. 04 Coder Tapez du code : la suggestion grisée apparaît après le curseur. Tab pour l'accepter, continuez à taper pour l'ignorer. → Régler le déclenchement Dans les paramètres de l'extension, vous pouvez basculer entre déclenchement automatique (la suggestion apparaît seule) et manuel (à la demande via un raccourci). Le manuel économise du GPU si plusieurs devs partagent le serveur. ## #4. Brancher JetBrains La même configuration fonctionne sur toute la gamme JetBrains : IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider, etc. L'extension Tabby est un plugin unique compatible avec la plateforme. 1. 01 Installer le plugin Settings → Plugins → Marketplace → chercher « Tabby » → Install, puis redémarrer l'IDE. 2. 02 Configurer la connexion Settings → Tools → Tabby : renseignez l'endpoint (http://localhost:8080) et le token d'accès. 3. 03 Vérifier L'indicateur Tabby dans la barre d'état confirme la connexion. Les suggestions inline s'affichent comme dans VS Code. ## #5. Pointer Tabby sur votre Ollama Si vous faites déjà tourner Ollama pour Cline ou Aider, inutile de charger un second moteur d'infér… --- ## Aider + Ollama : coder dans le terminal avec un agent 100% local | QuelLLM.fr URL: https://quelllm.fr/guide/aider-ollama-workflow-terminal-complet published: 2026-09-11 > Workflow terminal complet d'Aider branché sur Ollama : install pip, fichier .aider.conf.yml pointant l'endpoint OpenAI-compatible d'Ollama, choix du modèle… [Accueil](/) / [Guides](/guides) / Cas d'usage / Dev / Aider + Ollama : coder dans le terminal avec un agent 100% local Intermédiaire 16 min Dev # Aider + Ollama : coder dans le terminal avec un agent 100%local Aider est un assistant de code qui vit dans votre terminal, à côté de votre dépôt git. Vous lui décrivez une modification en français, il lit les bons fichiers, écrit le patch, et commit automatiquement le résultat. Branché sur Ollama, tout se passe sur votre machine : aucun bout de code n'est envoyé dans le cloud. Ce guide donne un setup reproductible de bout en bout — install pip, fichier de config pointant l'endpoint OpenAI-compatible d'Ollama, choix du modèle selon votre VRAM, et les commandes qui comptent vraiment (/add, /architect, /diff). On finit par les limites honnêtes du local face à un modèle cloud, pour que vous sachiez quand ça suffit et quand ça coince. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur macOS 14+ ## #Pourquoi Aider dans le terminal Là où Cline ou Continue vivent dans VS Code, Aider assume le terminal. Vous restez dans votre shell, à la racine de votre dépôt git, et vous dialoguez avec le modèle comme avec un collègue qui aurait accès au code. C'est un workflow différent, plus proche de la ligne de commande, qui plaît à ceux qui vivent dans tmux et n'aiment pas quitter le clavier. Centré sur git Chaque modification acceptée devient un commit propre, avec un message rédigé par Aider. Votre historique reste lisible et vous pouvez annuler n'importe quel changement avec un simple git revert. Repo-map automatique Aider construit une carte de votre dépôt (signatures de fonctions, classes, structure) qu'il envoie au modèle en plus des fichiers ouverts. Le modèle comprend le contexte sans que vous chargiez tout le projet. Éditeur agnostique Aider modifie les fichiers sur disque. Vous continuez d'utiliser votre éditeur habituel en parallèle : Aider voit vos changements, vous voyez les siens. 100 % local avec Ollama Branché sur Ollama, le modèle tourne sur votre GPU. Votre code et vos prompts ne quittent jamais le poste, ce qui change tout pour du code propriétaire ou sous NDA. i Aider n'est pas une autocomplétion Aider ne grise pas du texte pendant la frappe comme Copilot. C'est un agent conversationnel orienté tâches : « ajoute la gestion d'erreur dans ce fichier », « écris les tests de cette fonction ». Pour de la complétion inline, gardez Tabby ou Twinny à côté. ## #Prérequis et installation ✓ Le kit Copilote Local Ce guide t'amène au modèle. Le kit t'amène au copilote qui code dans ton éditeur. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit Copilote Local →](/copilote-local?utm_source=guide-inline-aider-ollama-workflow-termi) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-aider-ollama-workflow-termi-bundle) → Trois briques : Python pour Aider, Ollama qui tourne avec un modèle de code chargé, et un dépôt git. Aider exige un dépôt git pour fonctionner pleinement — c'est lui qui pilote les commits. 1. 01 Vérifiez Ollama Ollama doit écouter sur son port par défaut. Lancez ollama list pour confirmer qu'il répond et voir les modèles déjà installés. 2. 02 Installez Aider La méthode recommandée passe par pipx ou par le script d'install officiel, qui isole Aider dans son propre environnement pour éviter les conflits de dépendances Python. 3. 03 Placez-vous dans un dépôt git Ouvrez un terminal à la racine d'un projet versionné. Si le projet n'est pas encore sous git, faites un git init au préalable : Aider en a besoin pour commiter ses modifications. Installer Aider (méthode isolée recommandée) ⧉ Copier ``` `# Via pipx (isole Aider, n'encombre pas votre Python système) python -m pip install --user pipx pipx install aider-chat # Vérifier l'installation aider --version` ``` → Pourquoi pipx plutôt que pip simple Aider tire beaucoup de dépendances. Avec pipx, il vit dans son propre environnement et ne casse rien dans vos projets Python. Un pip install aider-chat classique fonctionne aussi, mais polluera l'environnement courant. ## #Configurer Aider pour Ollama Aider parle à Ollama via son endpoint OpenAI-compatible. Deux choses à régler : l'URL de base d'Ollama (variable d'environnement) et le modèle à utiliser. Le plus propre est de poser un fichier .aider.conf.yml à la racine du projet (ou dans votre dossier personnel pour un réglage global), pour ne pas retaper les options à chaque lancement. Pointer Aider vers Ollama (variable d'environnement) ⧉ Copier ``` `# Indique à Aider où trouver l'API Ollama export OLLAMA_API_BASE=http://127.0.0.1:11434 # Lancer Aider avec un modèle Ollama (préfixe ollama/) aider --model ollama/qwen3.5:9b` ``` Pour ne plus rien retaper, mettez ces réglages dans un fichier de configuration. Aider lit automatiquement un .aider.conf.yml trouvé à la racine du dépôt ou dans votre dossier personnel. .aider.conf.yml (à la racine du projet) ⧉ Copier ``` `# Modèle principal servi par Ollama (préfixe ollama/ obligatoire) model: ollama/devstral:24b # Modèle léger pour les tâches annexes (messages de commit, résumés) weak-model: ollama/qwen3.5:9b # Auto-commit des modifications acceptées (comportement par défaut) auto-commits: true # Ne pas committer automatiquement les fichiers que VOUS modifiez dirty-commits: false` ``` ! L'URL Ollama ne va PAS dans le YAML OLLAMA_API_BASE est une variable d'environnement, pas une clé du .aider.conf.yml. Exportez-la dans votre shell (ou .bashrc / .zshrc / config.fish) avant de lancer aider. Oublier cette variable est l'erreur n°1 : Aider cherche alors Ollama au mauvais endroit et échoue à se connecter. → Agrandir la fenêtre de contexte Par défaut, Ollama tronque souvent le contexte à 2048 tokens, ce qui étouffe le repo-map d'Aider. Créez un fichier .aider.model.settings.yml pour pousser num_ctx (par exemple 8192 ou plus selon votre VRAM). Sans ça, Aider perd le fil sur les gros fichiers. .aider.model.settings.yml (élargir le contexte Ollama) ⧉ Copier ``` `- name: ollama/devstral:24b extra_params: num_ctx: 8192` ``` ## #Quel modèle selon la VRAM Aider envoie beaucoup de contexte (fichiers ajoutés + repo-map) et attend un patch bien formé en retour. Un modèle trop petit produit des diffs cassés qu'Aider n'arrive pas à appliquer. Visez le plus gros coder que votre carte charge confortablement, en gardant de la marge pour le contexte. Modèle conseillé selon la VRAM (quantization Q4, ordres de grandeur) VRAM disponible Modèle conseillé Comportement attendu 8 Go Qwen 3.5 9B Tâches simples, fichiers courts. Diffs corrects sur un fichier à la fois (256k ctx, Apache 2.0). 12 Go Qwen 3.5 9B en Q8 Qualité max de la tranche : patches multi-fichiers plus fiables, repo-map mieux exploité. 16 Go Devstral 24B ou gpt-oss 20B Devstral (Mistral, Apache 2.0) est conçu pour les agents de code : il suit mieux les consignes multi-étapes. 24 Go et + Qwen3-Coder 30B-A3B MoE code (3B actifs), 256k ctx : diffs solides et rapides, raisonnement proche d'un assistant cloud sur des tâches moyennes. Polyvalent GLM 4.7 Flash (MoE, MIT) Alternative solide, très à l'aise en mode agent si Qwen vous déplaît. i Devstral, pensé pour les agents Devstral 24B (Mistral, Apache 2.0) a été entraîné spécifiquement pour les workflows agentiques façon Aider : édition de fichiers, suivi d'instructions sur plusieurs étapes. Sur 16 Go, c'est souvent un meilleur choix qu'un coder généraliste de taille équivalente pour le mode /architect. ## #Le workflow de bout en bout Voici le cycle typique d'une modification, du lancement d'Aider au commit. Une fois ce rythme pris, vous enchaînez les changements sans jamais quitter le terminal. 1. 01 Lancez Aider à la racine du dépôt Aider démarre, lit la config, construit le repo-map, et affiche une invite. Il indique le modèle actif et le nombre de fichiers détectés. 2. 02 Ajoutez les fichiers concernés avec /add N'ajoutez que les fichiers que la tâche doit modifier. Moins il y a de fichiers dans le contexte, plus le modèle … --- ## IA de code en entreprise : protéger code propriétaire, NDA et secret industriel | QuelLLM.fr URL: https://quelllm.fr/guide/ia-code-local-entreprise-code-proprietaire-nda published: 2026-09-11 > Déployer une IA de code 100% locale (Ollama + Cline + Aider + Tabby) pour une équipe dev sous NDA et secret industriel : pourquoi Copilot et Cursor exposent… [Accueil](/) / [Guides](/guides) / Entreprise / Déploiement / IA de code en entreprise : protéger code propriétaire, NDA et secret industriel Avancé 16 min Déploiement # IA de code en entreprise : protéger code propriétaire, NDA et secretindustriel Un développeur colle une fonction métier dans un assistant cloud pour la refactoriser. En une seconde, un fragment de code couvert par une clause de cession et un NDA vient de quitter votre périmètre, transitant par les serveurs d'un tiers américain. Pour un éditeur logiciel, un bureau d'études ou une ESN sous secret industriel, ce geste anodin est une faille juridique et contractuelle. Ce guide s'adresse au responsable technique ou au DSI qui veut équiper ses devs d'un copilote performant sans jamais qu'une ligne de code propriétaire ne sorte du réseau de l'entreprise. Nous verrons pourquoi GitHub Copilot et Cursor posent problème malgré leurs options 'entreprise', ce que le RGPD et l'AI Act imposent réellement, puis comment déployer une stack 100% locale (Ollama, Cline, Aider, Tabby) sur poste ou sur serveur GPU mutualisé, avec une politique de non-exfiltration auditable. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Ubuntu 24.04 [◆ IA en Entreprise — Déployer l'IA locale au travail : RGPD, AI Act, coûts · 24 € · ou tous les kits 49 € →](/kit-ia-entreprise?utm_source=guide-abovefold-ia-code-local-entreprise-code-proprietaire-nda) ## #Le vrai risque : votre code part chez un tiers Le code source n'est pas une donnée comme une autre. Il porte vos algorithmes, vos secrets de fabrication, vos clés d'API en dur (cela arrive), votre architecture de sécurité et, juridiquement, il est souvent couvert par une clause de cession de droits au profit d'un client. Un assistant de code cloud lit le contexte autour du curseur, parfois le dépôt entier pour l'indexation, et envoie ces fragments à un modèle distant. Le risque n'est pas théorique : il combine fuite de secret industriel, violation de NDA, et non-conformité RGPD dès qu'un commentaire contient une donnée personnelle. Secret industriel Un algorithme propriétaire exposé à un tiers perd sa qualification de secret (art. L151-1 du Code de commerce) : la protection juridique tombe. Clause de cession Pour du code livré à un client, le contrat interdit souvent toute communication à un sous-traitant non agréé. Un assistant cloud est un sous-traitant non déclaré. NDA fournisseur Vous travaillez sur le code d'un partenaire sous accord de confidentialité : l'envoyer à OpenAI ou Anthropic est une violation directe. Données personnelles Un jeu de test, un log inline ou un commentaire avec un email font basculer l'envoi sous le RGPD. ! Le piège du 'on ne s'entraîne pas sur vos données' La promesse de non-entraînement (zero data retention) ne règle qu'une partie du problème. Le code transite quand même, est traité en mémoire sur des serveurs hors UE, et reste soumis au CLOUD Act américain. Non-entraînement n'égale pas non-transfert. ## #Pourquoi Copilot et Cursor violent vos NDA ✓ Le kit IA Locale en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA en Entreprise →](/kit-ia-entreprise?utm_source=guide-inline-ia-code-local-entreprise-co) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ia-code-local-entreprise-co-bundle) → GitHub Copilot et Cursor sont d'excellents outils de productivité, mais leur modèle économique repose sur des LLM hébergés (Copilot sur l'infrastructure Azure/OpenAI, Cursor sur OpenAI et Anthropic). Même avec les offres Business ou Enterprise, votre code quitte le poste pour être complété côté serveur. Les options 'content exclusion' ou 'privacy mode' réduisent la rétention, mais le flux réseau vers un tiers demeure. Pour une clause de NDA qui interdit toute divulgation à un tiers non nommé, ce flux est une violation, indépendamment de la politique de rétention. Copilot Business Code envoyé à GitHub/Azure pour complétion. 'No training' activé par défaut, mais transfert hors UE et soumission au CLOUD Act. Cursor (Privacy Mode) Le mode privé empêche la rétention côté Cursor, mais les requêtes passent toujours par les API d'OpenAI et Anthropic. Cursor sans Privacy Mode Le code peut être conservé et utilisé pour améliorer le produit. Inacceptable sous NDA strict. Limite contractuelle commune Aucune de ces offres ne signe un DPA qui couvre une clause de cession de code client à un sous-traitant tiers spécifique. i Le test décisif Posez la question à votre juridique : 'Puis-je envoyer le code du client X à un serveur tiers Y situé aux États-Unis ?'. Si la réponse est non pour un seul de vos contrats, aucun assistant cloud n'est déployable de façon homogène sur l'équipe. Le local devient alors la seule politique cohérente. ## #Ce qu'exigent RGPD et AI Act côté code source Le RGPD ne parle pas de 'code source' mais de données à caractère personnel. Le code en contient plus souvent qu'on ne le croit : emails dans les commentaires, identifiants de tests, données de seed, traces de logs. Dès qu'un de ces éléments part vers un assistant cloud, vous réalisez un transfert de données, ce qui impose une base légale, un sous-traitant sous DPA (art. 28), et, hors UE, un mécanisme de transfert valide (clauses contractuelles types). L'AI Act, lui, classe la plupart des assistants de code en risque limité, avec surtout des obligations de transparence ; mais l'enjeu réel pour vous est en amont, dans la gouvernance des données d'entrée du modèle. RGPD art. 28 Tout assistant cloud traitant vos données est un sous-traitant et exige un DPA signé. Beaucoup d'équipes l'utilisent sans contrat. RGPD transfert hors UE Sans hébergement UE, il faut des garanties (SCC) et une analyse de transfert. Le local supprime purement la question. AI Act (transparence) Risque limité pour l'assistant de code : informer que du contenu est généré par IA. Peu contraignant, mais à documenter. Minimisation par conception La voie la plus simple de conformité : ne pas transférer du tout. Une stack locale est nativement minimisée. → Le local : conformité par soustraction Plutôt que d'empiler DPA, SCC, analyses d'impact et exclusions de contenu pour un outil cloud, le déploiement 100% local supprime le transfert. Pas de transfert, pas de sous-traitant, pas de question RGPD sur l'entrée du modèle. C'est l'approche la plus défendable devant un auditeur. ## #La stack 100% locale : Ollama, Cline, Aider, Tabby Une stack de copilote local repose sur deux couches : un serveur d'inférence qui fait tourner le modèle sur votre matériel, et des clients qui s'y branchent depuis l'IDE ou le terminal. Le serveur de référence est Ollama, qui expose une API HTTP locale et gère le téléchargement des modèles GGUF. Au-dessus, trois clients complémentaires couvrent les usages : Cline pour l'agent dans VS Code, Aider pour le pair-programming en terminal orienté commits Git, et Tabby pour l'autocomplétion à la Copilot, en mode serveur partagé pour toute l'équipe. Ollama Serveur d'inférence local (MIT). Sert les modèles via http://localhost:11434. Aucune télémétrie de code, aucun appel sortant pour l'inférence. Cline Extension VS Code (agent). Lit/écrit des fichiers, exécute des commandes, planifie des tâches multi-fichiers. Se branche sur Ollama en provider local. Aider CLI de pair-programming (Apache 2.0). Édite le code et fait les commits Git ; excellent pour le refactoring guidé. Pointe vers l'API Ollama. Tabby Serveur d'autocomplétion auto-hébergé (Apache 2.0). Remplace Copilot pour les suggestions inline ; idéal en mode serveur GPU mutualisé. Installer le socle Ollama + un modèle de code ⧉ Copier ``` `# Serveur d'inference local curl -fsSL https://ollama.com/install.sh | sh # Modele de code recommande pour 16 Go VRAM (specialiste agent de code) ollama pull devstral:24b # Verifier que l'API locale repond (aucun appel sortant) curl http://… --- ## Meilleure IA locale gratuite : top 2026, même sans GPU | QuelLLM.fr URL: https://quelllm.fr/guide/ia-locale-gratuite published: 2026-09-11 > IA locale : définition et les meilleures gratuites en 2026, à installer sur PC ou Mac, même sans GPU dédié. Comparatif des outils et pas à pas. [Accueil](/) / [Guides](/guides) / Premiers pas / Gratuit / Meilleure IA locale gratuite : top 2026, même sans GPU Débutant 9 min Gratuit # Meilleure IA locale gratuite : top 2026, même sansGPU Réponse directe Oui, une IA locale 100% gratuite existe : Ollama, LM Studio, Jan et GPT4All sont open source et sans abonnement, tout comme la majorité des modèles (Qwen 3.5, Gemma 4, Granite 4.2). Ça fonctionne même sans carte graphique dédiée, avec des modèles adaptés aux petites configurations. Oui, une IA locale gratuite, ça existe vraiment — et c'est même la norme. Les outils pour faire tourner un modèle sur votre PC ou Mac sont open source et sans abonnement, tout comme la majorité des modèles. Voici les meilleures options 2026, y compris pour les machines sans carte graphique. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-09-08 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ia-locale-gratuite) ## #Qu'est-ce qu'une IA locale ? Une IA locale repose sur deux éléments : un modèle de langage (un « LLM », comme Qwen, Gemma ou Granite) téléchargé sur votre disque dur, et un logiciel qui le charge en mémoire et le fait fonctionner. Quand vous posez une question, tout le calcul se fait sur votre propre machine. Aucune donnée ne transite par internet. i En deux mots IA locale = un modèle téléchargé chez vous + un logiciel qui le fait tourner. Vos conversations ne quittent jamais votre ordinateur, et ça marche même sans connexion. C'est l'opposé d'un service cloud comme ChatGPT, Gemini ou Claude, où vos messages sont envoyés sur les serveurs d'une entreprise qui les traite à distance. Avec une IA locale, vous êtes propriétaire de l'outil, pas locataire d'un abonnement. ## #Pourquoi passer à l'IA locale ? ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ia-locale-gratuite) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ia-locale-gratuite-bundle) → Confidentialité totale Vos documents, vos prompts et vos réponses restent sur votre machine. Idéal pour le travail sensible, le juridique, le médical ou simplement la tranquillité d'esprit. Fonctionne hors-ligne Pas de connexion ? Aucun problème. Une IA locale tourne dans l'avion, à la campagne ou sur un réseau isolé. Aucune limite de débit Pas de quota de messages, pas de file d'attente aux heures de pointe, pas de bridage selon votre forfait. Contrôle et personnalisation Vous choisissez le modèle, ses paramètres, et pouvez même l'adapter à vos données. Rien n'est imposé. ## #IA locale gratuite : vraiment sans payer ? Oui. Contrairement aux services cloud qui facturent un abonnement mensuel, une IA locale repose sur des logiciels open source (gratuits) et des modèles open-weight (gratuits eux aussi). Le seul coût réel est l'électricité consommée pendant la génération — négligeable pour un usage personnel. i Ce que « gratuit » veut dire ici Les outils (Ollama, LM Studio, Jan, GPT4All) sont gratuits. Les modèles (Qwen 3.5, Gemma 4, Granite 4.2) sont distribués sous licence libre. Aucune carte bancaire, aucune limite de messages. ## #Top des outils gratuits Ollama Le standard. Télécharge et lance un modèle en une commande. Léger, rapide, gratuit, et compatible avec des dizaines d'interfaces. LM Studio Interface graphique complète et gratuite. Vous parcourez un catalogue de modèles, téléchargez d'un clic et discutez dans une fenêtre type ChatGPT. Jan Appli de bureau open source, gratuite, très orientée confidentialité. Bon équilibre entre simplicité et contrôle. GPT4All Pensé pour les débutants et les machines modestes. Installation simple, fonctionne sans GPU. ## #Sans carte graphique, est-ce possible ? Oui. Un modèle peut tourner uniquement sur le processeur (CPU) et la RAM. C'est plus lent qu'avec un GPU, mais parfaitement utilisable pour discuter, résumer ou rédiger, surtout avec de petits modèles. PC sans GPU dédié Visez les modèles 2B à 8B en quantization Q4. Granite 4.2 8B reste utilisable, et les modèles 2-3B (Qwen 3.5 2B, Granite 4.2 3B) sont fluides. Mac Apple Silicon La mémoire unifiée des puces M est un atout : même sans « GPU dédié », un MacBook Air M-series fait tourner des modèles 9B à 12B (Qwen 3.5 9B, Gemma 4 12B) confortablement. Vieux portable Restez sur 1B à 3B. C'est lent mais ça fonctionne, et c'est gratuit. → Astuce vitesse Sur CPU, une quantization plus agressive (Q4_K_M) réduit la mémoire nécessaire et accélère la génération, avec une perte de qualité minime. ## #Les meilleurs modèles gratuits 2026 Qwen 3.5 (Alibaba) Polyvalent et solide en français, jusqu'à 256k de contexte et licence Apache 2.0. Les versions 2B, 4B et 9B sont d'excellents points de départ. Granite 4.2 (IBM) Très sobre et token-efficient, licence Apache 2.0. Les versions 3B et 8B (128k de contexte) tournent sur presque toutes les machines. Gemma 4 (Google) Compact, multimodal et efficace, bien adapté aux petites configs. Passé en licence Apache 2.0 en 2026. gpt-oss 20B (OpenAI) Modèle open-weight très rapide grâce au format MXFP4, 131k de contexte. Excellent dès 16 Go de VRAM. Qwen3-Coder 30B-A3B Spécialiste du code : MoE avec 256k de contexte, rapide grâce à ses 3B actifs, tient sur 24 Go. ## #Installer une IA gratuite, pas à pas 1. 01 Choisissez votre outil Ollama si vous êtes à l'aise avec une commande, LM Studio pour une interface graphique. Les deux sont gratuits. 2. 02 Téléchargez un modèle adapté à votre RAM 8 Go → un modèle 9B en Q4 (Qwen 3.5 9B). 16 Go → jusqu'à 24B (Mistral Small 24B, gpt-oss 20B). Apple Silicon → profitez de la mémoire unifiée. 3. 03 Lancez et utilisez Discutez en local, sans limite. Aucune donnée n'est envoyée sur internet. Exemple : un modèle léger et gratuit ⧉ Copier ``` `ollama run qwen3.5:2b` ``` Questions fréquentes Quelle IA locale gratuite choisir pour débuter ? + Ollama avec Qwen 3.5 2B ou Granite 4.2 3B (ou Qwen 3.5 9B si vous avez 8 Go de RAM). Pour une interface graphique, LM Studio est le choix le plus simple. Tout est gratuit. Peut-on avoir une IA locale gratuite sans GPU ? + Oui. Les modèles tournent sur le processeur et la RAM. Privilégiez des modèles 2B à 9B en Q4 ; c'est plus lent qu'avec un GPU mais tout à fait utilisable. Les IA locales gratuites sont-elles aussi bonnes que ChatGPT ? + Les petits modèles restent en dessous de ChatGPT, mais les modèles 24B à 35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B) s'en rapprochent fortement sur de nombreuses tâches. Pour la confidentialité et la gratuité, le local est imbattable. Y a-t-il des frais cachés ? + Non. Les outils et modèles sont gratuits. Le seul coût indirect est l'électricité, marginale pour un usage personnel. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Premiers pas · 12 min ### Installer un LLM en local : le guide pas à pas (2026) Lire →](/guide/installer-llm-local) [Premiers pas · 7 min ### Ollama c'est quoi et comment ça marche (guide débutant) Lire →](/guide/ollama-debutant-c-est-quoi-comment-ca-marche) [Installation · 5 min ### GPT4All : premiers pas Lire →](/guide/gpt4all-premiers-pas) [Outils · 10 min ### Jan : l'al… --- ## IA locale vs ChatGPT : comparatif perfs, vie privée et coût (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/ia-locale-vs-chatgpt published: 2026-09-11 > IA locale ou ChatGPT ? Comparatif complet : performances, confidentialité, coût réel sur le long terme et cas d'usage. Le verdict 2026. [Accueil](/) / [Guides](/guides) / Comparatif / Cloud vs local / IA locale vs ChatGPT : comparatif perfs, vie privée et coût (2026) Débutant 11 min Cloud vs local # IA locale vs ChatGPT : comparatif perfs, vie privée et coût(2026) IA locale ou ChatGPT ? Les deux répondent à des besoins différents. ChatGPT brille par sa puissance brute et sa simplicité ; l'IA locale gagne sur la confidentialité, le coût à long terme et le fonctionnement hors-ligne. Ce comparatif tranche critère par critère, sans langue de bois. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ia-locale-vs-chatgpt) ## #Le comparatif en un coup d'œil IA locale vs ChatGPT — comparaison par critère Critère IA locale ChatGPT (cloud) Confidentialité Données 100% sur votre machine Messages envoyés sur des serveurs distants Coût Gratuit (hors électricité) Abonnement (~20 €/mois pour la version Plus) Hors-ligne Oui Non (connexion obligatoire) Qualité brute Très bonne à excellente selon le modèle/matériel Excellente, modèles à la pointe Limites d'usage Aucune Quotas, files d'attente possibles Mise en route Installation (10 min) Immédiate Matériel requis Un PC/Mac correct Aucun ## #Performances : où en est-on vraiment ? ChatGPT s'appuie sur des modèles parmi les plus puissants au monde, difficiles à égaler à la maison. Mais l'écart s'est nettement réduit : un modèle local moderne de 27B à 35B (Qwen 3.8 27B, Qwen 3.6 35B-A3B) gère très bien la rédaction, le résumé, le code courant et l'analyse de documents. Pour la majorité des usages quotidiens, la différence devient secondaire. ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ia-locale-vs-chatgpt) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ia-locale-vs-chatgpt-bundle) → i Ce qui dépend de votre machine La qualité du local dépend du modèle que vous pouvez charger. Avec 8 Go de RAM, vous resterez sur des modèles ~9B comme Qwen 3.5 9B (corrects). Avec 24 Go ou un Mac à grosse mémoire unifiée, vous approchez le niveau du cloud. ## #Vie privée et RGPD C'est l'avantage décisif du local. Avec une IA locale, vos prompts et documents ne quittent jamais votre ordinateur : rien n'est stocké, analysé ou réutilisé pour entraîner un modèle tiers. Pour des données sensibles (clients, santé, juridique, secrets industriels), c'est souvent la seule option réellement conforme et sans risque de fuite. → Pour les pros Si vous manipulez des données personnelles, le local évite tout transfert vers un sous-traitant et simplifie radicalement votre conformité RGPD. ## #Coût réel sur la durée ChatGPT Plus coûte environ 20 €/mois, soit ~240 €/an, indéfiniment. Une IA locale est gratuite à l'usage : une fois le matériel en place (souvent un PC ou Mac que vous possédez déjà), vous ne payez que l'électricité. Sur plusieurs années, ou pour plusieurs utilisateurs, l'écart devient considérable. ChatGPT Abonnement récurrent, par utilisateur. Prévisible mais sans fin. IA locale Coût quasi nul à l'usage. Un éventuel investissement matériel s'amortit vite si l'usage est intensif ou multi-utilisateurs. ## #Cas d'usage : qui gagne quand Choisissez ChatGPT si… vous voulez la qualité maximale sans matériel, un usage ponctuel, ou les toutes dernières fonctionnalités sans rien gérer. Choisissez le local si… la confidentialité prime, vous visez le zéro coût récurrent, vous travaillez hors-ligne, ou vous équipez plusieurs personnes. Les deux ? Beaucoup combinent : le local pour le sensible et le quotidien, le cloud ponctuellement pour les tâches les plus exigeantes. ## #Verdict Aucun des deux n'est « meilleur » dans l'absolu. ChatGPT reste devant en puissance brute et en facilité immédiate. Mais pour la confidentialité, le coût à long terme et l'indépendance, l'IA locale est devenue en 2026 une alternative crédible et souvent supérieure — surtout dès qu'on dispose d'une machine correcte. Questions fréquentes L'IA locale est-elle aussi bonne que ChatGPT ? + Pas tout à fait au sommet : ChatGPT garde l'avantage en puissance brute. Mais les modèles locaux modernes de 27B à 35B s'en approchent fortement pour la rédaction, le code et l'analyse. Pour la plupart des usages quotidiens, la différence est minime. L'IA locale est-elle moins chère que ChatGPT ? + Oui sur la durée. ChatGPT Plus coûte ~20 €/mois sans fin, tandis qu'une IA locale est gratuite à l'usage une fois installée. L'écart se creuse vite, surtout à plusieurs utilisateurs. L'IA locale protège-t-elle mieux la vie privée ? + Nettement. Vos données ne quittent jamais votre machine, ne sont pas stockées sur un serveur tiers ni utilisées pour entraîner un modèle. C'est l'avantage majeur du local, notamment pour les données sensibles. Faut-il un ordinateur puissant ? + Pas forcément. Un PC ou Mac récent avec 8 à 16 Go de mémoire suffit pour de bons modèles. Plus de mémoire = des modèles plus puissants, mais on peut démarrer modestement. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 8 min ### Ollama Cloud : prix, limites et pourquoi le local reste meilleur Lire →](/guide/ollama-cloud-explication-self-host) [Entreprise · 15 min ### LLM local et RGPD : la conformité données privées en entreprise Lire →](/guide/llm-local-donnees-privees-rgpd) [Premiers pas · 12 min ### Remplacer ChatGPT par une IA locale : guide de migration (2026) Lire →](/guide/ia-locale-remplacer-chatgpt) [Premiers pas · 9 min ### Meilleure IA locale gratuite : top outils sans abonnement (2026) Lire →](/guide/ia-locale-gratuite) --- ## Remplacer ChatGPT par une IA locale : guide de migration (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/ia-locale-remplacer-chatgpt published: 2026-09-11 > Vous voulez quitter ChatGPT ? Guide pas à pas pour installer une IA locale équivalente, retrouver une interface chat et importer vos usages. [Accueil](/) / [Guides](/guides) / Premiers pas / Migration / Remplacer ChatGPT par une IA locale : guide de migration (2026) Intermédiaire 12 min Migration # Remplacer ChatGPT par une IA locale : guide de migration(2026) Vous avez décidé de quitter ChatGPT pour une IA locale ? Bonne nouvelle : on peut retrouver l'essentiel — une fenêtre de chat agréable, un assistant capable, l'analyse de vos documents — entièrement en local. Ce guide vous accompagne pas à pas dans la migration. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ia-locale-remplacer-chatgpt) ## #Ce que vous perdez et ce que vous gagnez Vous gagnez La confidentialité totale, la gratuité, le fonctionnement hors-ligne, l'absence de limites et le contrôle sur le modèle. Vous perdez (un peu) Le tout dernier niveau de puissance brute et certaines fonctionnalités clés-en-main du cloud. La plupart se retrouvent en local avec les bons outils. i Réaliste Pour 80 à 90 % des usages courants (rédaction, résumé, traduction, code, questions/réponses sur vos documents), une IA locale bien configurée fait le travail. ## #Choisir son modèle équivalent L'idée est de prendre le meilleur modèle que votre machine peut charger. Plus vous avez de mémoire, plus vous vous rapprochez de l'expérience ChatGPT. ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ia-locale-remplacer-chatgpt) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ia-locale-remplacer-chatgpt-bundle) → 8 Go de RAM Qwen 3.5 9B ou Granite 4.2 8B. Bon assistant généraliste, avec vision et grand contexte pour le premier. 12 à 16 Go Gemma 4 12B en 12 Go, ou Mistral Small 24B / gpt-oss 20B en 16 Go. Meilleur raisonnement. 24 Go et + Qwen 3.8 27B, puis Qwen 3.6 35B-A3B : on entre dans le niveau « quasi cloud ». Mac à grosse mémoire unifiée Profitez-en pour charger des modèles 27B à 35B, voire un 30B en Q8, très confortablement. ## #Installer une interface type ChatGPT Le terminal, ce n'est pas pour tout le monde. Heureusement, plusieurs interfaces reproduisent l'expérience ChatGPT en local, avec historique de conversations, prompts système et pièces jointes. Open WebUI L'interface web la plus complète pour Ollama. Multi-utilisateurs, historique, RAG sur documents. Le choix « pro ». LM Studio Tout-en-un : téléchargement de modèles + chat graphique. Idéal pour démarrer sans rien configurer. Jan Application de bureau simple et élégante, orientée confidentialité. Msty Interface conviviale, prise en main rapide, bonne gestion des modèles. ## #Retrouver vos usages Discuter / rédiger Disponible immédiatement dès qu'un modèle est chargé. Analyser vos documents (RAG) Open WebUI, AnythingLLM ou PrivateGPT permettent d'interroger vos PDF et fichiers en local. Coder Des extensions VS Code branchées sur Ollama remplacent un assistant de code, en local. Prompts système Vous pouvez fixer le comportement de l'assistant comme dans les « GPTs » personnalisés. ## #Checklist de migration 1. 01 Installez Ollama Le moteur qui fait tourner les modèles en arrière-plan. 2. 02 Ajoutez une interface Open WebUI pour une expérience web complète, ou LM Studio pour le tout-en-un. 3. 03 Téléchargez le meilleur modèle pour votre machine Choisi selon votre mémoire (voir plus haut). 4. 04 Recréez vos habitudes Importez vos documents pour le RAG, définissez un prompt système, organisez vos conversations. 5. 05 Gardez le cloud en secours (optionnel) Pour les rares tâches qui exigent encore la puissance maximale. Questions fréquentes Peut-on vraiment remplacer ChatGPT par une IA locale ? + Pour la grande majorité des usages courants, oui. Avec un bon modèle (Qwen 3.8 27B ou Qwen 3.6 35B-A3B si votre machine suit) et une interface comme Open WebUI, l'expérience est très proche. Les cas extrêmes de puissance restent l'apanage du cloud. Quelle interface ressemble le plus à ChatGPT ? + Open WebUI offre l'expérience la plus complète (historique, RAG, multi-utilisateurs). LM Studio est le plus simple pour démarrer avec une fenêtre de chat graphique. Comment importer mes documents ? + Via une interface avec RAG (Open WebUI, AnythingLLM, PrivateGPT) : vous chargez vos PDF/fichiers, et le modèle répond en s'appuyant dessus, le tout en local. Vais-je perdre mes conversations ChatGPT ? + Vos anciennes conversations restent chez ChatGPT. En local, vous repartez d'un historique neuf, stocké uniquement sur votre machine. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Outils · 12 min ### Open WebUI avec Ollama : guide complet Lire →](/guide/open-webui-ollama-tutoriel) [Outils · 17 min ### AnythingLLM : RAG production-ready en local Lire →](/guide/anythingllm-rag-tutoriel-complet) [Outils · 10 min ### Jan : l'alternative open-source à ChatGPT, 100% locale Lire →](/guide/jan-ai-alternative-locale-tutoriel) [Outils · 11 min ### Msty : l'interface LLM local élégante (Mac, Windows, Linux) Lire →](/guide/msty-app-llm-local-guide) [Premiers pas · 9 min ### Meilleure IA locale gratuite : top 2026, même sans GPU Lire →](/guide/ia-locale-gratuite) [Comparatif · 11 min ### IA locale vs ChatGPT : comparatif perfs, vie privée et coût (2026) Lire →](/guide/ia-locale-vs-chatgpt) --- ## IA locale en entreprise : RGPD, souveraineté et déploiement (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/ia-locale-entreprise-rgpd published: 2026-09-11 > Déployer une IA locale conforme RGPD en entreprise : enjeux de confidentialité, coûts, matériel et solutions self-hosted. Le guide pour PME et DSI. [Accueil](/) / [Guides](/guides) / Entreprise / Conformité / IA locale en entreprise : RGPD, souveraineté et déploiement (2026) Intermédiaire 13 min Conformité # IA locale en entreprise : RGPD, souveraineté et déploiement(2026) Pour une entreprise, l'IA locale n'est pas qu'une question de coût : c'est avant tout une réponse à la confidentialité des données et à la conformité RGPD. Faire tourner un modèle en interne évite tout transfert de données sensibles vers un prestataire cloud. Ce guide couvre les enjeux, le budget et les solutions concrètes pour PME et DSI. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-06-25 · Testé sur Windows, macOS, Linux [◆ IA en Entreprise — Déployer l'IA locale au travail : RGPD, AI Act, coûts · 24 € · ou tous les kits 49 € →](/kit-ia-entreprise?utm_source=guide-abovefold-ia-locale-entreprise-rgpd) ## #Pourquoi l'IA locale en entreprise ? Confidentialité des données Données clients, RH, juridiques, R&D : rien ne sort de votre infrastructure. Aucun risque de fuite vers un tiers. Conformité simplifiée Pas de transfert vers un sous-traitant ni hors UE = un volet RGPD radicalement allégé. Coût maîtrisé Pas d'abonnement par utilisateur qui explose avec les effectifs. Un serveur mutualisé sert toute l'équipe. Indépendance Pas de dépendance à un fournisseur, à ses changements de prix ou de conditions d'utilisation. ## #RGPD et souveraineté Le principal risque RGPD d'une IA cloud, c'est le transfert de données personnelles à un sous-traitant, parfois hors de l'Union européenne. Une IA locale supprime ce risque à la source : les données ne quittent jamais vos serveurs. Vous restez maître du traitement, ce qui simplifie l'analyse d'impact (AIPD) et le registre des traitements. ✓ Le kit IA Locale en Entreprise Déployer une IA locale au travail : RGPD, AI Act, architecture multi-utilisateurs, coûts, note pour la direction. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA en Entreprise →](/kit-ia-entreprise?utm_source=guide-inline-ia-locale-entreprise-rgpd) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ia-locale-entreprise-rgpd-bundle) → ! À ne pas négliger Local ne veut pas dire « hors RGPD ». Vous restez responsable du traitement : gestion des accès, journalisation, minimisation des données et information des personnes restent nécessaires. Sur le plan de la souveraineté, des modèles open-weight (Mistral, modèles européens, ou Llama/Qwen auto-hébergés) permettent de garder la maîtrise complète de la chaîne, sans boîte noire ni dépendance étrangère. ## #LLM privé hébergé en France : les options concrètes Trois architectures permettent d'héberger un LLM privé en France, selon vos moyens et votre niveau d'exigence en confidentialité. Le point commun : les données ne quittent jamais votre infrastructure ni le territoire national. Serveur on-premise dans vos locaux Le niveau de contrôle maximal. Le serveur GPU reste physiquement chez vous, sur votre réseau interne. Aucun tiers, aucun transfert : le scénario le plus simple à défendre devant un DPO ou un auditeur RGPD. Serveur GPU loué chez un hébergeur français Des acteurs comme OVHcloud ou Scaleway proposent des serveurs GPU dédiés hébergés en France, avec engagement de localisation des données. Bon compromis pour une PME qui ne veut pas gérer le matériel elle-même tout en gardant les données sur le territoire. Poste de travail costaud Un Mac Studio à grosse mémoire unifiée ou un PC avec un GPU RTX haut de gamme peut suffire pour un pilote ou une petite équipe, sans passer par un serveur dédié. i Souveraineté et RGPD Avec une architecture hébergée en France (a fortiori on-premise), vos données ne transitent par aucun sous-traitant ni par des serveurs hors Union européenne : pas de transfert international à documenter, pas d'exposition au CLOUD Act américain si l'infrastructure reste chez vous ou chez un hébergeur français. C'est l'argument de fond pour les secteurs sensibles (santé, juridique, secteur public, défense). Le choix du budget se fait par palier qualitatif plutôt que par un chiffre précis : un pilote sur poste de travail coûte le prix du matériel seul, un serveur loué s'inscrit dans un abonnement mensuel proportionné à la puissance, et l'on-premise demande l'investissement initial le plus lourd mais aucun coût récurrent au-delà de l'électricité. Sur le plan des modèles, les LLM européens comme Mistral, Lucie ou EuroLLM se prêtent particulièrement bien à cet usage : entraînés et opérés depuis l'UE, ils renforcent l'argument souveraineté en plus de la localisation de l'infrastructure. Le classement des LLM souverains du site permet de les comparer entre eux avant de choisir. ## #Budget et matériel Le matériel dépend du nombre d'utilisateurs simultanés et de la taille de modèle visée. Pour une PME, un seul serveur GPU mutualisé suffit souvent à servir toute l'équipe via une interface web. Petite équipe / pilote Une station de travail avec un GPU 24 Go (ou un Mac à grosse mémoire unifiée) fait tourner des modèles 32B confortablement. Déploiement PME Un serveur GPU dédié + une interface type Open WebUI mutualisée pour plusieurs dizaines d'utilisateurs. Modèles 32B pour un bon équilibre qualité/coût ; 70B si la qualité prime et que le budget GPU suit. ## #Chatbot interne et RAG documentaire L'usage le plus rentable en entreprise est le chatbot interne connecté à votre base documentaire (le « RAG ») : l'assistant répond en s'appuyant sur vos procédures, contrats, documentation technique ou base de connaissances — le tout en local, sans exposer ces documents. Open WebUI Interface multi-utilisateurs avec gestion des accès et RAG intégré. Le socle d'un déploiement interne. AnythingLLM / PrivateGPT Pour l'analyse de documents privés et la base de connaissances interne. API locale Le serveur expose une API compatible, intégrable à vos applications métier internes. ## #Sécurité du déploiement Cloisonnement réseau Hébergez le serveur sur le réseau interne, voire isolé (air-gap) pour les données les plus sensibles. Gestion des accès Authentification, rôles et journalisation des requêtes via l'interface (ex. Open WebUI). Chiffrement Chiffrez les disques contenant les modèles et les bases documentaires. Mises à jour Maintenez les outils à jour et suivez les nouvelles versions de modèles. ## #Solutions recommandées Une pile éprouvée pour démarrer : Ollama (moteur) + Open WebUI (interface multi-utilisateurs + RAG) sur un serveur GPU interne, avec un modèle 32B en français. C'est gratuit en logiciel, conforme par conception, et évolutif. → Pour aller vite Commencez par un pilote sur une seule machine avec quelques utilisateurs et un cas d'usage précis (support, documentation interne). Mesurez, puis dimensionnez le serveur en conséquence. Questions fréquentes L'IA locale est-elle conforme au RGPD ? + Elle facilite grandement la conformité car les données ne sont pas transférées à un sous-traitant. Mais vous restez responsable du traitement : gestion des accès, minimisation, information des personnes et journalisation restent requises. Combien coûte une IA locale en entreprise ? + Le logiciel est gratuit (open source). Le coût principal est le matériel : d'une station GPU pour un pilote à un serveur dédié pour une PME. Contrairement au cloud, il n'y a pas d'abonnement par utilisateur qui grimpe avec les effectifs. Peut-on connecter une IA locale à nos documents internes ? + Oui, via le RAG : des outils comme Open WebUI, AnythingLLM ou PrivateGPT permettent à l'assistant de répondre en s'appuyant sur vos documents privés, sans jamais les exposer à l'extérieur. Quel modèle choisir pour une entreprise française ? + Un modèle 32B performant en français offre le meilleur compromis qualité/coût ; passez à 70B si la qualité prime et que le budget GPU le permet. Les modèles open-weight gardent la maîtrise complète de la chaîne. Peut-on héberger un LLM privé en France ? + Oui, de trois façons : sur un serveur dans vos propres locaux, sur un serveur GPU lou… --- ## Télécharger et installer Ollama sur Windows 11 (guide 2026) | QuelLLM.fr URL: https://quelllm.fr/guide/installer-ollama-windows published: 2026-09-11 > Télécharger Ollama pour Windows 11, l'installer, activer le GPU (CUDA) et lancer un premier modèle : le guide pas à pas 2026, avec les erreurs courantes. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Télécharger et installer Ollama sur Windows 11 (guide 2026) Débutant 3 min Ollama # Télécharger et installer Ollama sur Windows 11 (guide2026) Réponse directe Sur Windows 11, Ollama s'installe via un installateur classique téléchargé depuis le site officiel, avec détection automatique du GPU (support CUDA NVIDIA natif). Une seule commande terminal (ollama run qwen3.5:4b) télécharge et lance un premier modèle en environ 5 minutes, sans configuration manuelle ni ligne de commande complexe. Vous avez un PC Windows et vous voulez faire tourner un LLM en local sans passer par ChatGPT. Ollama est probablement l'outil le plus simple pour y arriver : un installateur classique, une commande, un modèle. En 3 minutes chrono, vous avez Qwen 3.5 qui tourne sur votre machine. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows 11 [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-ollama-windows) ## #Pourquoi Ollama ? Ollama gère pour vous tout ce qui est pénible : le téléchargement des modèles, la quantization, le chargement en VRAM, la détection du GPU, l'API HTTP locale. Derrière, c'est llama.cpp. Mais vous n'aurez pas à le compiler. L'outil est gratuit, open source, et fonctionne entièrement hors-ligne une fois le modèle téléchargé. Aucune donnée n'est envoyée à un serveur distant. i En deux mots Ollama = un daemon local qui tourne en arrière-plan + une CLI pour parler avec lui. Les modèles vivent dans un dossier sur votre disque. C'est tout. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-ollama-windows) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-ollama-windows-bundle) → Windows 10 ou 11 64 bits. Ollama n'a pas de version 32 bits. 8 Go de RAM minimum 16 Go confortables pour des modèles de 8 à 9B en quantization Q4. 10 Go d'espace disque Un modèle de 4 à 9B pèse environ 3 à 7 Go. Prévoyez large si vous comptez en tester plusieurs. GPU NVIDIA (optionnel) Drivers à jour, RTX 20/30/40/50 ou GTX 16. Ollama détecte le GPU tout seul. → Sans GPU, ça marche aussi Un CPU moderne fait tourner un petit modèle (2 à 4B, type Qwen 3.5 2B ou Granite 4.2 3B) à 5–10 tokens/seconde. C'est lent mais utilisable pour tester. Pour un usage quotidien, visez un GPU avec au moins 6 Go de VRAM. ## #1. Téléchargement Rendez-vous sur le site officiel et récupérez l'installateur Windows. Lien officiel ⧉ Copier ``` `https://ollama.com/download/windows` ``` L'installateur fait environ 700 Mo. C'est normal : il embarque les binaires llama.cpp précompilés avec le support CUDA. ! Vérifiez le domaine Ne téléchargez Ollama que depuis ollama.com. Des versions redistribuées sur GitHub par des tiers peuvent être vérolées. L'outil est open source — si vous êtes parano, compilez depuis le repo officiel. ## #2. Installation 1. 01 Lancez OllamaSetup.exe Double-clic sur l'installateur téléchargé. Windows Defender peut afficher un avertissement SmartScreen — cliquez sur "Informations complémentaires" puis "Exécuter quand même". 2. 02 Installation silencieuse Aucune fenêtre de configuration : l'installateur s'installe dans %LOCALAPPDATA%\Programs\Ollama et démarre automatiquement le service en arrière-plan. 3. 03 Vérifiez l'icône système Une petite icône Ollama apparaît près de l'horloge, en bas à droite. Elle indique que le daemon tourne. 4. 04 Ouvrez un terminal PowerShell, Windows Terminal, ou cmd.exe — peu importe. Tapez la commande de vérification ci-dessous. PowerShell ⧉ Copier ``` `ollama --version` ``` Vous devriez voir quelque chose comme ollama version is 0.5.x. Si la commande n'est pas reconnue, fermez et rouvrez le terminal — le PATH vient d'être modifié. ## #3. Votre premier modèle Qwen 3.5 4B est un bon premier choix : multilingue (dont un très bon français), léger, très rapide, et d'excellente qualité pour sa taille. Sous licence Apache 2.0. Télécharger et lancer ⧉ Copier ``` `ollama run qwen3.5:4b` ``` La première fois, Ollama télécharge le modèle (environ 3,4 Go en Q4). Les fois suivantes, le lancement est instantané. Quand le prompt >>> apparaît, vous pouvez discuter. Essai de conversation ⧉ Copier ``` `>>> Bonjour, présente-toi en 2 phrases. Je suis Qwen 3.5, un modèle de langage open-source développé par l'équipe Qwen (Alibaba). Je fonctionne entièrement en local sur votre machine, sans connexion internet.` ``` → Quitter la conversation Tapez /bye ou Ctrl+D pour sortir. Le modèle reste chargé en mémoire quelques minutes, ce qui rend les relances instantanées. ## #4. Vérifier que le GPU est utilisé Par défaut, Ollama détecte votre GPU NVIDIA et charge le modèle dessus. Pour confirmer, lancez cette commande pendant qu'une conversation tourne : Statut du modèle chargé ⧉ Copier ``` `ollama ps` ``` Dans la colonne PROCESSOR, vous devriez voir 100% GPU. Si vous voyez CPU ou un pourcentage partiel, c'est que le modèle déborde sur la RAM. i VRAM insuffisante ? Qwen 3.5 4B Q4 a besoin d'environ 3,4 Go de VRAM. Si votre GPU est vraiment juste, passez à un modèle encore plus léger : Granite 4.2 3B (ollama run granite4.2:3b, 2,2 Go) ou Qwen 3.5 2B (ollama run qwen3.5:2b, 1,9 Go). Pour surveiller l'utilisation GPU en direct, ouvrez une autre fenêtre PowerShell : Monitoring ⧉ Copier ``` `nvidia-smi -l 1` ``` ## #5. Une interface propre avec Open WebUI Le terminal, c'est bien pour tester. Pour un usage quotidien, Open WebUI ressemble à ChatGPT — historique, markdown, pièces jointes, tout y est. La méthode la plus simple passe par Docker Desktop. Lancer Open WebUI ⧉ Copier ``` `docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/data \ --name open-webui --restart always \ ghcr.io/open-webui/open-webui:main` ``` Ouvrez ensuite http://localhost:3000 dans votre navigateur. Créez un compte (il est local, rien ne sort de votre machine), et vos modèles Ollama apparaissent dans la liste. ## #Dépannage "ollama : commande introuvable" Le PATH n'a pas été rechargé. Fermez et rouvrez tous vos terminaux. En dernier recours, redémarrez la session Windows. Téléchargement bloqué à 0% Un pare-feu d'entreprise bloque parfois Ollama. Essayez depuis un autre réseau ou configurez un proxy via la variable HTTPS_PROXY. Le modèle tourne mais c'est lent Vérifiez ollama ps. Si c'est 100% CPU, votre GPU est soit trop petit soit mal détecté. Mettez à jour vos drivers NVIDIA. Réponses coupées au bout de quelques lignes La fenêtre de contexte par défaut est de 2048 tokens. Augmentez-la avec /set parameter num_ctx 8192 dans la conversation. ## #Pour aller plus loin Vous avez Ollama qui tourne. Les prochaines étapes logiques : Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Premiers pas · 9 min ### Q4, Q5, Q8 : quelle quantification choisir ? Lire →](/guide/choisir-quantification-q4-q5-q8) [Premiers pas · 6 min ### Votre première vraie conversation Lire →](/guide/premiere-conversation-llm) [RAG · 12 min ### Discuter avec vos documents (RAG) Lire →](/guide/rag-local-introduction… --- ## Installer Ollama sur Mac (Apple Silicon M1–M4) : guide 2026 | QuelLLM.fr URL: https://quelllm.fr/guide/installer-ollama-macos published: 2026-09-11 > Tirer parti de Metal et de la mémoire unifiée M1/M2/M3/M4. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Installer Ollama sur Mac (Apple Silicon M1–M4) : guide 2026 Débutant 3 min Ollama # Installer Ollama sur Mac (Apple Silicon M1–M4) : guide2026 Les Mac Apple Silicon (M1, M2, M3, M4) sont parmi les meilleures machines grand public pour l'IA locale. La mémoire unifiée permet à un MacBook Pro 64 Go de faire tourner des modèles 70B qu'un PC gamer à 2 000 € ne peut pas approcher. Voici comment démarrer en 3 minutes. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur macOS 14+ [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-ollama-macos) ## #Pourquoi un Mac pour l'IA locale ? Sur un PC classique, la VRAM du GPU est physiquement séparée de la RAM du CPU. Vous avez une RTX 4070 à 12 Go ? Vous êtes limité à 12 Go pour vos modèles, peu importe vos 64 Go de RAM système. Sur un Mac Apple Silicon, la mémoire est unifiée : GPU, CPU et Neural Engine partagent la même RAM. Un MacBook Pro M3 Max à 64 Go peut allouer 48 Go à un modèle — de quoi charger un gros MoE comme Qwen 3.6 35B-A3B en pleine précision, ou faire tourner plusieurs modèles à la fois, sans effort. → Règle de pouce macOS réserve environ 25 % de la RAM pour le système. Sur un Mac 16 Go, comptez ~12 Go utilisables. Sur 32 Go : ~24 Go. Sur 64 Go : ~48 Go. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-ollama-macos) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-ollama-macos-bundle) → macOS 12 Monterey ou plus récent Sonoma (14) ou Sequoia (15) recommandés pour les dernières optimisations Metal. Mac Apple Silicon M1, M2, M3 ou M4 — pro, max, ultra, peu importe. Les Intel ne sont pas supportés officiellement (lent). 16 Go de RAM minimum 8 Go suffisent pour un 3B mais c'est serré. 16 Go ouvre les 8-9B, 32 Go les MoE 30B (type Qwen 3.6 35B-A3B), 64 Go les gros modèles en pleine précision. ~20 Go d'espace disque Pour 3-4 modèles. Les téléchargements vont dans ~/.ollama/models. ## #1. Installation Deux méthodes, toutes les deux propres : le .dmg officiel ou Homebrew. Les devs préfèreront Homebrew, les autres iront au plus simple. ## #Option A — Application .dmg Téléchargement officiel ⧉ Copier ``` `https://ollama.com/download/mac` ``` 1. 01 Ouvrez le .dmg téléchargé Glissez Ollama.app vers votre dossier Applications, comme n'importe quelle app Mac. 2. 02 Lancez Ollama.app une fois Au premier lancement, macOS demande confirmation ("app téléchargée depuis internet"). Cliquez Ouvrir. 3. 03 Autorisez l'outil en ligne de commande Ollama propose d'installer la commande ollama. Acceptez — un mot de passe admin vous sera demandé. 4. 04 L'icône lama apparaît dans la barre de menus C'est le daemon. Vous pouvez refermer la fenêtre d'accueil, il continue de tourner. ## #Option B — Homebrew Terminal ⧉ Copier ``` `brew install --cask ollama` ``` Plus rapide à mettre à jour. Avantage : brew upgrade ollama quand une nouvelle version sort. ## #Vérification Terminal ⧉ Copier ``` `ollama --version` ``` ## #2. Votre premier modèle Sur un Mac 16 Go, commencez par Qwen 3.5 9B ou Granite 4.2 8B. Sur 32 Go+, vous pouvez viser directement Qwen 3.8 27B ou un MoE rapide comme Qwen 3.6 35B-A3B. Qwen 3.5 9B (toutes configs ≥16 Go) ⧉ Copier ``` `ollama run qwen3.5:9b` ``` Granite 4.2 8B (≥16 Go confortable) ⧉ Copier ``` `ollama run granite4.2:8b` ``` Qwen 3.8 27B (≥32 Go recommandé) ⧉ Copier ``` `ollama run qwen3.8:27b` ``` Qwen 3.6 35B-A3B MoE (≥32 Go, confort sur 64 Go) ⧉ Copier ``` `ollama run qwen3.6:35b` ``` i Premier téléchargement Le modèle arrive via le CDN Ollama (plusieurs Go). Comptez 2 à 10 minutes selon votre connexion. Les relances suivantes sont instantanées. ## #3. Comprendre la mémoire unifiée macOS alloue dynamiquement la RAM entre les apps. Quand Ollama charge un modèle, le système déplace automatiquement d'autres choses vers le swap si besoin. Vous pouvez donc charger plus gros que d'habitude, au prix d'un ralentissement général. Pour surveiller ça en temps réel pendant qu'un modèle tourne : Moniteur mémoire ⧉ Copier ``` `top -o mem` ``` ! Swap excessif = lenteur Si vous voyez plus de 10 Go de swap actif pendant qu'Ollama tourne, votre modèle est trop gros pour votre Mac. Descendez d'une taille ou choisissez une quantization plus agressive (Q3 au lieu de Q4). ## #4. Vérifier l'accélération Metal Metal est l'équivalent Apple de CUDA : l'API qui permet à Ollama de faire tourner les calculs sur le GPU intégré du Mac. C'est activé par défaut, mais bon à vérifier. Statut du modèle chargé ⧉ Copier ``` `ollama ps` ``` Dans la colonne PROCESSOR, vous devez voir 100% GPU. Si vous voyez CPU, quelque chose cloche — c'est soit un modèle non-supporté soit un driver Metal trop vieux. Consommation GPU en direct ⧉ Copier ``` `sudo powermetrics --samplers gpu_power -i 500` ``` ## #5. Une interface ChatGPT-like Pour un usage quotidien, le terminal fatigue vite. Trois options propres sur Mac : Enchanted (gratuit, App Store) Le plus propre côté design. Natif SwiftUI, se connecte à Ollama sans config. Msty (gratuit, .dmg) Plus complet : multi-modèles, tabs, prompts sauvegardés, RAG intégré. Open WebUI via Docker Si vous avez déjà Docker, c'est la version la plus riche (historique, markdown, extensions). Enchanted en 1 ligne ⧉ Copier ``` `open 'macappstore://apps.apple.com/app/enchanted-llm/id6474268307'` ``` ## #6. Ollama au démarrage Par défaut, Ollama démarre avec votre session si vous l'avez installé via le .dmg. Pour Homebrew, c'est manuel : Démarrage auto via brew services ⧉ Copier ``` `brew services start ollama` ``` Pour désactiver : brew services stop ollama. Pour voir l'état : brew services list. ## #Dépannage "ollama : command not found" après install Le lien symbolique n'a pas été créé. Lancez Ollama.app une fois et acceptez la proposition d'installer la CLI. Le modèle plante à mi-chemin Mémoire insuffisante. Fermez Chrome/Electron et relancez. Sinon, prenez une quantization plus petite. Ventilateurs à fond sur MacBook Normal pendant l'inférence intensive. Pour limiter : utilisez un modèle plus petit, ou branchez sur secteur (les MacBook throttlent sur batterie). Impossible de supprimer Ollama Stop le daemon : ollama stop. Puis supprimez Ollama.app et le dossier ~/.ollama (contient tous les modèles téléchargés). Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Matériel · 11 min ### Tirer le max de votre Mac Silicon Lire →](/guide/optimiser-mac-silicon-llm) [Premiers pas · 6 min ### Votre première conversation locale Lire →](/guide/premiere-conversation-llm) [Premiers pas · 9 min ### Quelle quantization choisir ? Lire →](/guide/choisir-quantification-q4-q5-q8) --- ## Installer Ollama sur Linux | QuelLLM.fr URL: https://quelllm.fr/guide/installer-ollama-linux published: 2026-09-11 > Script d'install, systemd, configuration GPU NVIDIA/AMD. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Installer Ollama sur Linux Débutant 4 min Ollama # Installer Ollama surLinux Linux est l'OS natif d'Ollama : celui où il tourne le mieux, où il se met à jour le plus proprement, et où vous avez le plus de contrôle. Ce guide couvre Ubuntu/Debian/Fedora avec systemd, la config GPU NVIDIA et AMD, et comment exposer le serveur sur votre LAN sans tout casser. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-03-25 · Testé sur Ubuntu 24.04 [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-ollama-linux) ## #Pourquoi Linux pour l'IA locale ? Trois raisons pragmatiques : les drivers GPU (CUDA, ROCm) sont plus stables sur Linux que sur Windows, les outils CLI s'intègrent naturellement, et les homelabs tournent sur Linux par défaut. Ajoutez systemd pour avoir Ollama au démarrage, propre. i Distributions testées Ce guide a été validé sur Ubuntu 22.04 et 24.04, Debian 12, Fedora 40. Les étapes sont identiques aux différences de package manager près. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-ollama-linux) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-ollama-linux-bundle) → Noyau 5.10+ Toute distribution raisonnable en 2026. uname -r pour vérifier. curl ou wget Pour télécharger le script d'installation. sudo / root L'installation écrit dans /usr/local/bin et crée un service systemd. 10 Go de disque Les modèles vivent dans /usr/share/ollama/.ollama/models par défaut. ## #1. Installation en une ligne Terminal ⧉ Copier ``` `curl -fsSL https://ollama.com/install.sh | sh` ``` Le script détecte votre distribution, installe le binaire dans /usr/local/bin/ollama, crée un utilisateur système ollama, déploie une unit systemd, et démarre le service. 30 secondes. ! Curl | sh : vérifiez si besoin Piper un script dans sh est pratique mais opaque. En contexte pro, téléchargez-le d'abord (curl -o install.sh https://ollama.com/install.sh), relisez-le, puis exécutez. Vérification ⧉ Copier ``` `ollama --version systemctl status ollama` ``` ## #2. Service systemd Le service est créé dans /etc/systemd/system/ollama.service. Pour le personnaliser (ex : changer le répertoire des modèles, exposer sur le LAN) : Terminal ⧉ Copier ``` `sudo systemctl edit ollama` ``` Ajoutez les variables d'environnement utiles dans la section [Service] : Override systemd ⧉ Copier ``` `[Service] Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_MODELS=/mnt/ssd/ollama-models" Environment="OLLAMA_KEEP_ALIVE=30m" Environment="OLLAMA_MAX_LOADED_MODELS=2"` ``` Appliquer ⧉ Copier ``` `sudo systemctl daemon-reload sudo systemctl restart ollama sudo journalctl -u ollama -f # logs live` ``` ## #3. GPU NVIDIA Ollama détecte CUDA automatiquement si les drivers sont installés. Vérification : Terminal ⧉ Copier ``` `nvidia-smi # Si la commande n'existe pas : sudo apt install nvidia-driver-550 # Ubuntu sudo dnf install akmod-nvidia # Fedora` ``` → Container Toolkit (optionnel) Si vous passez Ollama en Docker, installez nvidia-container-toolkit pour que le GPU soit exposé dans le container. Sinon, Docker n'y a pas accès. Tester avec un modèle ⧉ Copier ``` `ollama run mistral "Bonjour" # Dans un autre terminal : ollama ps # colonne PROCESSOR doit dire 100% GPU` ``` ## #4. GPU AMD (ROCm) Les cartes Radeon RX 6000, 7000 et Instinct sont supportées via ROCm. L'installation est plus touchy que CUDA, mais ça marche. Ubuntu 22.04/24.04 ⧉ Copier ``` `wget https://repo.radeon.com/amdgpu-install/6.0/ubuntu/jammy/amdgpu-install_6.0.60000-1_all.deb sudo apt install ./amdgpu-install_6.0.60000-1_all.deb sudo amdgpu-install --usecase=rocm sudo usermod -aG render,video $USER # reboot` ``` ! Cartes non officiellement supportées Si votre GPU n'est pas dans la liste officielle AMD (ex : RX 6600, 6700), utilisez HSA_OVERRIDE_GFX_VERSION=10.3.0 comme variable d'environnement. Ça force ROCm à traiter la carte comme une gfx1030. ## #5. Exposer sur le réseau local Par défaut, Ollama n'écoute que sur localhost:11434. Pour qu'un autre poste ou un Raspberry Pi puisse l'interroger : Dans l'override systemd ⧉ Copier ``` `Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_ORIGINS=http://192.168.1.*"` ``` Firewall ⧉ Copier ``` `sudo ufw allow from 192.168.1.0/24 to any port 11434` ``` ! N'exposez jamais sur Internet Ollama n'a pas d'authentification native. Si vous voulez l'exposer au-delà du LAN, mettez un reverse proxy (Caddy, nginx) avec auth basic ou JWT devant. ## #Dépannage systemctl status ollama → failed Vérifier journalctl -u ollama -n 50. Souvent : port 11434 déjà pris, ou permissions sur le dossier models. GPU non détecté nvidia-smi et rocminfo doivent répondre. Sinon : drivers. Un reboot après install est souvent nécessaire. Modèle lent, 100% CPU ollama ps ne montre pas GPU. Drivers ok, mais variable CUDA_VISIBLE_DEVICES mal réglée ? Vérifiez environnement du service. Pas assez d'espace Déplacez OLLAMA_MODELS vers un SSD plus grand. Ne pas oublier chown -R ollama:ollama sur le nouveau dossier. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 8 min ### Phi-4 en local : installer avec Ollama, VRAM, vitesse et test FR Lire →](/guide/phi4-microsoft-local-ollama) [Installation · 12 min ### Ollama avec GPU AMD (ROCm) Lire →](/guide/ollama-gpu-amd-rocm) [Premiers pas · 9 min ### Choisir sa quantification Lire →](/guide/choisir-quantification-q4-q5-q8) [Installation · 9 min ### LM Studio Linux : installer sur Ubuntu, Debian, Arch, Fedora (2026) Lire →](/guide/lm-studio-linux-installation-guide) --- ## Installer Ollama en 5 minutes (Windows, macOS, Linux) | QuelLLM.fr URL: https://quelllm.fr/guide/installer-ollama published: 2026-09-11 > Comment installer Ollama en 5 minutes sur Windows, macOS et Linux : prérequis RAM/GPU, commandes essentielles et premier modèle local à lancer dans la foulée. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Installer Ollama en 5 minutes (Windows, macOS, Linux) Débutant 6 min Ollama # Installer Ollama en 5 minutes (Windows, macOS,Linux) Installer Ollama prend environ 5 minutes, quel que soit votre système : voici la méthode pour Windows, macOS et Linux, plus l'essentiel pour lancer votre premier modèle. Si vous voulez le détail complet pour votre OS (captures, dépannage approfondi), les guides dédiés sont juste en dessous. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-24 · Testé sur Windows 11 [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-ollama) ## #Prérequis : RAM, GPU, quoi préparer Ollama tourne sur à peu près n'importe quelle machine récente. Le critère qui compte vraiment est la mémoire disponible (RAM, ou VRAM si vous avez une carte graphique dédiée) : c'est elle qui détermine la taille des modèles que vous pourrez faire tourner confortablement. RAM 8 Go permettent de démarrer avec des petits modèles (3B à 7B). 16 Go sont plus confortables pour un usage quotidien. GPU Une carte NVIDIA, AMD récente ou un Mac Apple Silicon accélère fortement les réponses. Ce n'est pas obligatoire : Ollama fonctionne aussi sur processeur seul, simplement plus lentement. Espace disque Chaque modèle occupe plusieurs gigaoctets selon sa taille et sa quantization. Prévoyez de la marge si vous comptez en tester plusieurs. Système Windows 10/11, macOS (Apple Silicon recommandé) ou Linux (la plupart des distributions récentes conviennent). → Pas de GPU ? Ça marche quand même Sur un ordinateur sans carte graphique dédiée, les petits modèles (3B) restent utilisables pour discuter, résumer ou rédiger. On commence petit, on monte en puissance plus tard si besoin. ## #Installer sur Windows ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-ollama) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-ollama-bundle) → Sur Windows, l'installation passe par un installateur classique téléchargé depuis le site officiel. 1. Téléchargez Rendez-vous sur ollama.com et récupérez l'installateur Windows (fichier .exe). 2. Lancez-le Double-clic sur le fichier téléchargé. L'installation est silencieuse, sans étape à configurer. 3. Vérifiez Une icône Ollama apparaît près de l'horloge : le service tourne en arrière-plan. Ouvrez un terminal (PowerShell) et tapez ollama --version pour confirmer. 4. GPU NVIDIA Si vous avez une carte NVIDIA récente avec des pilotes à jour, Ollama la détecte automatiquement, sans manipulation supplémentaire. Pour le détail pas à pas avec captures d'écran et le dépannage spécifique à Windows (SmartScreen, pare-feu d'entreprise, PATH), direction le guide dédié Windows listé en bas de page. ## #Installer sur macOS Sur Mac, deux méthodes cohabitent : l'application officielle (fichier .dmg) ou Homebrew si vous préférez le terminal. Via le site officiel Téléchargez le fichier .dmg sur ollama.com, ouvrez-le puis glissez l'application Ollama dans le dossier Applications. Lancez-la une première fois pour démarrer le service. Via Homebrew (optionnel) Si vous avez déjà Homebrew installé, la commande brew install ollama fait la même chose en une ligne, directement dans le terminal. Apple Silicon Sur les puces M1 à M4, Ollama exploite automatiquement Metal et la mémoire unifiée : pas de configuration GPU à faire, les performances sont bonnes dès le départ. Le guide macOS dédié détaille les deux méthodes d'installation et les spécificités Apple Silicon. ## #Installer sur Linux Sur Linux, l'installation officielle tient en une seule commande : un script shell qui détecte votre distribution et installe le binaire ainsi qu'un service systemd. Installation officielle ⧉ Copier ``` `curl -fsSL https://ollama.com/install.sh | sh` ``` Le script configure aussi le support GPU si un pilote NVIDIA ou ROCm (AMD) compatible est déjà présent sur la machine. Une fois l'installation terminée, Ollama tourne comme service systemd en arrière-plan et démarre automatiquement au boot. Le guide Linux dédié détaille la gestion du service systemd et la configuration GPU NVIDIA/AMD. ## #Lancer son premier modèle Une fois Ollama installé, une seule commande suffit pour télécharger et lancer un modèle. La première exécution télécharge les fichiers (cela peut prendre quelques minutes selon votre connexion), les suivantes sont quasi instantanées. Premier lancement ⧉ Copier ``` `ollama run qwen3.5:4b` ``` Quel modèle choisir au départ ? Tout dépend de votre RAM. Avec une machine modeste, un petit modèle généraliste (3-4B) reste fluide et déjà très utile pour discuter ou résumer. Avec plus de mémoire disponible, vous pouvez viser un modèle de milieu de gamme, plus capable en raisonnement et en code. Dans le doute, commencez petit : vous pourrez toujours télécharger un modèle plus gros ensuite. → Quitter la conversation Tapez /bye pour sortir du prompt de discussion. Le modèle reste en mémoire quelques minutes, ce qui rend les relances suivantes immédiates. ## #Commandes de base ollama list Affiche tous les modèles déjà téléchargés sur votre machine. ollama pull Télécharge un modèle sans le lancer immédiatement, utile pour préparer plusieurs modèles à l'avance. ollama rm Supprime un modèle téléchargé pour libérer de l'espace disque. ollama serve Démarre manuellement le service Ollama si celui-ci ne tourne pas déjà en arrière-plan (utile sur Linux si le service systemd n'est pas actif). ## #Dépannage express GPU non détecté Vérifiez que vos pilotes (NVIDIA, AMD ou Metal sur Mac) sont à jour. Sur Windows et Linux, ollama ps affiche si le modèle chargé tourne sur GPU ou sur CPU. Port 11434 déjà occupé C'est le port par défaut utilisé par le service Ollama. S'il est pris par un autre programme, arrêtez ce dernier ou relancez Ollama après avoir libéré le port. Commande introuvable après installation Fermez et rouvrez votre terminal : le PATH vient d'être modifié par l'installateur et n'est pas encore rechargé dans la session en cours. Questions fréquentes sur l'installation d'Ollama Ollama est-il gratuit ? + Oui, Ollama est un outil open source et gratuit, tout comme la grande majorité des modèles qu'il permet de faire tourner (Llama, Mistral, Qwen, Gemma). Vous ne payez que l'électricité consommée par votre machine. Faut-il un GPU pour Ollama ? + Non, ce n'est pas obligatoire. Ollama fonctionne sur processeur seul, en particulier pour les petits modèles. Un GPU (NVIDIA, AMD récent ou Apple Silicon) accélère nettement les réponses, mais reste optionnel pour débuter. Quel modèle installer en premier ? + Un modèle généraliste de petite taille est le choix le plus sûr pour tester rapidement, quelle que soit votre machine. Vous pourrez ensuite télécharger un modèle plus grand si votre RAM ou votre VRAM le permet. Ollama fonctionne-t-il hors ligne ? + Oui, une fois le modèle téléchargé. La connexion internet ne sert qu'au moment du téléchargement initial ; toutes les conversations suivantes se déroulent entièrement en local, sans échange de données. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie —… --- ## Ollama + GPU AMD (ROCm) : configurer une Radeon RX 6000/7000/9000 | QuelLLM.fr URL: https://quelllm.fr/guide/ollama-gpu-amd-rocm published: 2026-09-11 > Configurer ROCm pour accélérer Ollama sur Radeon RX 6000/7000. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à… [Accueil](/) / [Guides](/guides) / Installation / Ollama / Ollama + GPU AMD (ROCm) : configurer une Radeon RX 6000/7000/9000 Intermédiaire 12 min Ollama # Ollama + GPU AMD (ROCm) : configurer une Radeon RX6000/7000/9000 AMD a longtemps été en retard sur CUDA, mais ROCm 6 a rattrapé assez de chemin pour que Radeon RX 6000, 7000 et 9000 soient pleinement utilisables pour l'inférence LLM. Ce guide couvre l'installation propre, la configuration Ollama, et l'override qui permet de faire tourner des cartes non officiellement listées. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ollama-gpu-amd-rocm) ## #Pourquoi ROCm Pour utiliser le GPU AMD, Ollama (qui s'appuie sur llama.cpp) doit passer par ROCm — l'équivalent AMD de CUDA. Sans ROCm, la carte est invisible côté inférence et tout tourne sur CPU. i Alternative : Vulkan Si ROCm refuse de coopérer, llama.cpp compilé avec Vulkan fonctionne aussi sur AMD (et Intel Arc, d'ailleurs). Un peu plus lent mais plus simple. Voir le guide llama.cpp avec Vulkan. ## #Cartes officiellement compatibles ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ollama-gpu-amd-rocm) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ollama-gpu-amd-rocm-bundle) → RX 7900 XTX / XT / GRE gfx1100. Support officiel. Environ 80 % des perfs d'une RTX 4080. RX 7800 / 7700 XT gfx1101. Support officiel depuis ROCm 6.1. RX 6900 / 6800 / 6700 XT gfx1030/1031. Support officiel pour les grandes cartes, override pour les petites. Instinct MI200 / MI300 Cartes data-center. Support natif complet. ! RX 6600, 6500, 5700 Pas officiellement supportées. Tout est possible avec la variable HSA_OVERRIDE_GFX_VERSION (voir plus bas), mais c'est à vos risques. ## #1. Installer ROCm Les deux distributions les mieux supportées sont Ubuntu 22.04/24.04 et RHEL/Fedora. Les versions Debian, Arch et consorts demandent des bricolages supplémentaires. Ubuntu 24.04 ⧉ Copier ``` `# Dépôt officiel wget https://repo.radeon.com/amdgpu-install/6.1/ubuntu/noble/amdgpu-install_6.1.60100-1_all.deb sudo apt install ./amdgpu-install_6.1.60100-1_all.deb # ROCm + drivers GPU sudo amdgpu-install --usecase=rocm,graphics # Droits utilisateur sudo usermod -aG render,video $USER # Reboot obligatoire sudo reboot` ``` Vérification post-reboot ⧉ Copier ``` `rocminfo | grep gfx # Doit afficher votre architecture, ex : gfx1100 rocm-smi # Résumé VRAM, température, conso` ``` ## #2. Ollama et ROCm Ollama 0.3+ détecte ROCm automatiquement. Si vous avez installé Ollama AVANT ROCm, réinstallez-le — le script détecte alors le GPU AMD et installe les bonnes libs. Réinstaller après ROCm ⧉ Copier ``` `curl -fsSL https://ollama.com/install.sh | sh systemctl restart ollama` ``` Tester ⧉ Copier ``` `ollama run qwen3.5:9b "Test GPU" # Puis dans un autre terminal : rocm-smi --showuse # La ligne GPU[0] doit bouger` ``` ## #3. Forcer une carte non-supportée Si rocminfo ne liste pas votre GPU, ou si Ollama continue d'utiliser le CPU, la variable HSA_OVERRIDE_GFX_VERSION force ROCm à faire semblant. RX 6600 / 6700 HSA_OVERRIDE_GFX_VERSION=10.3.0 RX 5700 XT HSA_OVERRIDE_GFX_VERSION=10.1.0 (support fragile) RX 6800 / 6900 Supportées nativement, pas besoin d'override. Dans l'override systemd Ollama ⧉ Copier ``` `sudo systemctl edit ollama # Ajouter : [Service] Environment="HSA_OVERRIDE_GFX_VERSION=10.3.0" sudo systemctl daemon-reload sudo systemctl restart ollama` ``` ## #4. Performance attendue Sur Qwen 3.5 9B Q4_K_M (6,6 Go, le choix 8 Go de référence en 2026), voici les ordres de grandeur en tokens/seconde à l'inférence : RX 7900 XTX (24 Go) ~90 tok/s. Comparable à une RTX 4080. RX 7800 XT (16 Go) ~62 tok/s. Entre RTX 4070 et 4070 Ti. RX 6900 XT (16 Go) ~52 tok/s. Équivalent RTX 3080 10 Go. RX 6700 XT (12 Go, override) ~33 tok/s. Entre RTX 3060 et 3060 Ti. → VRAM est reine Sur AMD comme sur NVIDIA, c'est la VRAM qui ouvre la porte aux gros modèles. Une RX 7900 XTX 24 Go fait tourner Qwen 3.6 35B-A3B (23 Go en Q4) qu'une RTX 4070 12 Go ne peut pas charger, même si la 4070 est plus rapide en pure compute. ## #Dépannage rocminfo est vide Drivers pas installés ou utilisateur pas dans le groupe render. Vérifiez groups $USER. Ollama utilise le CPU malgré ROCm Souvent une incompatibilité d'archi. Essayez l'HSA_OVERRIDE correspondant à la génération au-dessus. Crash sur gros modèle (OOM) rocm-smi pour voir la VRAM consommée. Si vous débordez, réduisez num_ctx ou passez en Q3_K_M. Version ROCm incompatible Ollama Ollama packagé pour ROCm 6.x. ROCm 5 ne marche pas. Mettez à jour. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Outils · 11 min ### KoboldCpp : installer, régler (GGUF, ROCm, API) — et vs Ollama Lire →](/guide/koboldcpp-guide-complet) [Installation · 4 min ### Installer Ollama sur Linux Lire →](/guide/installer-ollama-linux) [Installation · 12 min ### llama.cpp avec Vulkan Lire →](/guide/compiler-llama-cpp-vulkan) [Matériel · 12 min ### Choisir son GPU Lire →](/guide/choisir-gpu-llm-local) --- ## Installer DeepSeek R1 avec Ollama | QuelLLM.fr URL: https://quelllm.fr/guide/installer-deepseek-r1-ollama published: 2026-09-11 > Tutoriel complet pour faire tourner DeepSeek R1 (versions distillées 7B/14B/32B) en local avec Ollama. Modèle de raisonnement avec chaîne de pensée. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Installer DeepSeek R1 avec Ollama Débutant 8 min Ollama # Installer DeepSeek R1 avecOllama DeepSeek R1 est un modèle de raisonnement à chaîne de pensée publié sous licence MIT par DeepSeek. Le modèle complet pèse 671 milliards de paramètres et reste hors de portée d'une machine personnelle, mais les versions distillées (1.5B à 70B) tiennent confortablement sur du matériel grand public. Ce tutoriel montre comment installer DeepSeek R1 avec Ollama, choisir la bonne taille, et tirer parti du mode raisonnement. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-deepseek-r1-ollama) ## #Pourquoi DeepSeek R1 ? R1 n'est pas un LLM "classique" : avant de répondre, il génère une chaîne de raisonnement visible, encadrée par des balises .... C'est cette phase qui lui permet de résoudre des problèmes de maths, de logique ou de code que les modèles à génération directe ratent souvent. Sur AIME 2024 et MATH-500, les distillats 14B et 32B battent largement Llama 3.1 70B Instruct, qui pèse pourtant 2 à 5 fois plus. L'autre intérêt : la licence MIT, sans restriction d'usage commercial ni géographique. Vous pouvez intégrer R1 dans un produit, un agent, un outil interne, sans demander la permission à personne. C'est rare pour un modèle de raisonnement à ce niveau. i Distillation, en deux mots Le modèle complet R1 (671B MoE) a généré des millions d'exemples de raisonnement, qui ont ensuite servi à fine-tuner des modèles plus petits (Qwen 7B/14B/32B et Llama 8B/70B). Les distillats ne sont donc pas R1 lui-même, mais des Qwen/Llama qui ont appris à raisonner comme R1. ## #Les versions distillées disponibles ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-deepseek-r1-ollam) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-deepseek-r1-ollam-bundle) → Ollama distribue sept tailles sous le même nom deepseek-r1. Le tag par défaut pointe sur la 7B distillée (Qwen 7B base). deepseek-r1:1.5b Base Qwen 2.5 Math 1.5B. Léger, parfait pour tester sur un laptop sans GPU. Qualité limitée sur les problèmes complexes. deepseek-r1:7b Base Qwen 2.5 Math 7B. Tag par défaut. Bon compromis pour 8 Go de VRAM. Excellente entrée en matière. deepseek-r1:8b Base Llama 3.1 8B. Légèrement plus loquace que la 7B, meilleure en français. deepseek-r1:14b Base Qwen 2.5 14B. Saut de qualité notable sur les maths. Sweet spot pour 12 Go de VRAM. deepseek-r1:32b Base Qwen 2.5 32B. Niveau o1-mini sur la plupart des benchmarks de raisonnement. Demande 24 Go de VRAM en Q4. deepseek-r1:70b Base Llama 3.3 70B. Le plus capable des distillats. RTX 5090 32 Go ou Mac Studio 64 Go+. deepseek-r1:671b Le modèle complet (MoE 671B, 37B actifs). Hors machine perso, mais possible sur un Mac Studio Ultra 512 Go. ## #Prérequis et VRAM par taille Avant d'installer DeepSeek R1 avec Ollama, vérifiez que vous avez Ollama installé (le daemon écoute par défaut sur http://localhost:11434) et que votre GPU a assez de mémoire pour la taille visée. Voici les besoins en VRAM pour la quantization Q4_K_M, qui est celle qu'Ollama télécharge par défaut. 1.5B Q4 ~1,1 Go VRAM. Tourne sur n'importe quel GPU ou même en CPU pur (15-25 tok/s). 7B Q4 ~4,7 Go VRAM. RTX 3050 8 Go, 4060 8 Go, Mac M1/M2 16 Go. 8B Q4 ~5,2 Go VRAM. Même cible que la 7B, marge plus serrée sur 6 Go. 14B Q4 ~9 Go VRAM. RTX 3060 12 Go, 4070 12 Go, M2 Pro 16 Go. 32B Q4 ~19 Go VRAM. RTX 3090/4090 24 Go, M3 Max 36 Go. 70B Q4 ~40 Go VRAM. RTX 5090 32 Go avec offload, Mac Studio Ultra 64 Go+. → Pas sûr de votre VRAM ? Sur Windows, ouvrez le Gestionnaire des tâches, onglet Performance > GPU. Sur Linux : nvidia-smi pour NVIDIA, rocm-smi pour AMD. Sur Mac : la mémoire est unifiée, comptez environ 75 % de la RAM totale comme VRAM utilisable pour le LLM. ## #1. Installer le modèle Une seule commande suffit. Ollama télécharge les poids depuis son registre officiel et charge le modèle en mémoire à la première utilisation. Installer la 7B par défaut ⧉ Copier ``` `ollama run deepseek-r1` ``` Pour une taille précise, ajoutez le tag : Choisir explicitement une taille ⧉ Copier ``` `# Version la plus légère (1.5B) ollama run deepseek-r1:1.5b # Sweet spot 12 Go VRAM ollama run deepseek-r1:14b # Pour RTX 3090/4090 ollama run deepseek-r1:32b` ``` Le premier lancement télécharge le modèle (de 1 Go pour la 1.5B à 40 Go pour la 70B). Les lancements suivants sont instantanés tant que le modèle reste dans le cache d'Ollama. ! Pas de :cloud, jamais Si vous voyez deepseek-r1:cloud quelque part, ignorez-le : c'est un tag qui route vers les serveurs Ollama Cloud et facture à l'usage. Pour rester en self-hosted strict, n'utilisez que les tags numérotés (1.5b, 7b, 14b, 32b, 70b). ## #2. Choisir sa taille Le choix de taille dépend de trois variables : la VRAM, le type de tâches, et votre tolérance à l'attente. R1 produit en moyenne 500 à 2000 tokens de raisonnement avant la réponse finale — c'est donc 3 à 10 fois plus de tokens qu'un modèle de chat classique à génération directe. La vitesse compte vraiment. Tester R1 sans GPU sérieux 1.5B ou 7B. Latence chat utilisable même en CPU. Maths de niveau lycée / Python simple 7B ou 8B. Suffisant 80 % du temps, déçoit sur l'algèbre avancée. Maths sérieuses, logique, raisonnement long 14B minimum. Saut net entre 8B et 14B sur AIME et MATH-500. Niveau o1-mini, débogage complexe, démonstrations 32B. C'est la cible idéale si vous avez 24 Go de VRAM. Le maximum local possible 70B Q4 sur RTX 5090 avec offload ou Mac Studio 64 Go+. → Règle simple Commencez par la 14B si vous avez 12 Go de VRAM. C'est le palier où R1 devient vraiment intéressant. La 7B sert surtout à se faire la main. ## #3. Premier prompt de raisonnement R1 brille sur les problèmes qui demandent plusieurs étapes. Testons-le sur un classique d'AIME, abordable par la 14B : Exemple maths ⧉ Copier ``` `>>> Un train part de Lyon à 8h à 90 km/h vers Paris. ... Un autre part de Paris à 9h à 110 km/h vers Lyon. ... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ? À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h. Temps avant croisement : 370 / 200 = 1,85 h = 1h51min. Donc croisement à 9h + 1h51 = 10h51. Les deux trains se croisent à 10h51.` ``` Notez bien la structure : tout ce qui est entre et est la chaîne de pensée du modèle. Vous pouvez l'afficher à l'utilisateur final, la masquer, ou la logger pour debug. C'est un excellent levier d'explicabilité dans une app. i Ne supprimez pas le Tentation classique : ajouter un system prompt qui dit "ne génère pas de chaîne de pensée". Mauvaise idée : la qualité s'effondre. Le raisonnement EST le modèle. Masquez le bloc côté UI plutôt que de le supprimer côté génération. ## #4. Q4 vs Q8 : choisir la quantization Par défaut, Ollama télécharge la Q4_K_M (compromis qualité/mémoire recommandé). Pour les modèles de raisonnement, certains préfèrent monter en Q8_0 — la dégradation de qualité sur la chaîne de pensée se ressent davantage que sur du chat classique. Tags de quantization Ollama ⧉ Copier ``` `# Q4_K_M (défaut) — recommandé pour 80 % des cas ollama pull deepseek-r1:14b # Q8_0 — qualité maximale, mémoire doublée ollama pull deepseek-r1:14b-q8_0 # Liste complète des tags disponibles ollama show deepseek-r1:14b --modelfile` ``` Q4_K_M Compromis par défaut. -2 à -4 % qualité vs FP16 sur les benchmarks de maths. C'est ce qu'il faut prendre en première intention. Q5_K_M +1 % qualité vs Q4, +25 % mémoire. Intéressant si vo… --- ## Ollama Cloud : prix, limites, et l'alternative 100 % locale (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/ollama-cloud-explication-self-host published: 2026-09-11 > Ollama Cloud : gratuit puis 20 $/mois en Pro, limites d'usage, et ce que ça change face à Ollama en local. Quand payer, quand rester 100 % local. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Ollama Cloud : prix, limites, et l'alternative 100 % locale (2026) Débutant 8 min Ollama # Ollama Cloud : prix, limites, et l'alternative 100 % locale(2026) Ollama Cloud propose une chose simple : exécuter sur les serveurs d'Ollama des modèles trop gros pour votre machine — 120B, 480B, 671B paramètres — avec la même CLI que la version locale. C'est pratique. Mais cela change deux choses fondamentales : vos prompts quittent votre poste, et vous payez à l'usage. Ce guide explique ce que c'est exactement, ce que ça coûte, et pourquoi pour la plupart des cas le self-host reste préférable. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-09-05 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ollama-cloud-explication-self-host) i En bref Ollama Cloud fait tourner sur les serveurs d'Ollama des modèles trop gros pour votre machine (120B, 480B, 671B), avec la même CLI qu'en local. · L'offre se situe entre un forfait mensuel à quota horaire et une facturation à la durée d'inférence pour les gros usages — vérifiez les tarifs sur ollama.com/cloud, ils évoluent. · Contrairement au local, vos prompts quittent votre machine et transitent par des serveurs majoritairement basés aux États-Unis. · Pour un usage récurrent ou des données sensibles, le self-host reste largement préférable. ## #Ce qu'est Ollama Cloud Depuis 2025, Ollama propose une offre payante baptisée Ollama Cloud qui permet d'appeler des modèles hébergés sur leur infrastructure GPU, en gardant exactement les mêmes commandes que pour un modèle local. La promesse : faire tourner des modèles open-weight massifs (centaines de milliards de paramètres) sans avoir besoin d'un Mac Studio Ultra ou d'un cluster H100. Concrètement, vous installez Ollama comme d'habitude, vous vous authentifiez, et vous tirez un modèle marqué "cloud" (par exemple gpt-oss:120b-cloud). L'inférence ne se fait plus sur votre GPU, mais sur les serveurs d'Ollama — votre machine n'envoie que les tokens du prompt et reçoit les tokens de réponse. Exemple d'appel cloud (syntaxe générale) ⧉ Copier ``` `# Authentification (une seule fois) ollama signin # Lancer un modèle hébergé ollama run gpt-oss:120b-cloud` ``` i Ce n'est pas du "local cloud" Ollama Cloud n'est pas un mode hybride qui exécute une partie du modèle chez vous. C'est de l'inférence distante pure : vos prompts partent sur Internet, comme avec l'API OpenAI ou Anthropic. La seule chose "locale" est la CLI. ## #Quels modèles tournent côté cloud ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ollama-cloud-explication-se) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ollama-cloud-explication-se-bundle) → Le catalogue cloud cible précisément ce qui passe mal en local. Il évolue, mais la logique reste la même : modèles open-weight ou ouverts, de très grande taille, ou multimodaux exigeants en VRAM. Modèles 100B+ paramètres Type gpt-oss:120b, qwen3-coder:480b, kimi-k2 — qui demandent 60 à 250 Go de VRAM en Q4, hors de portée d'un poste de travail individuel. Modèles frontière MoE DeepSeek V3/V4, Llama 4 Maverick : les versions complètes, pas les distillations 7B/32B qu'on installe en local. Modèles spécialisés lourds Coder géants, modèles de raisonnement ("thinking") long contexte, modèles vision haute résolution. Les modèles "normaux" (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4, etc.) restent recommandés en local : ils tiennent sur une RTX 3060 12 Go ou un MacBook Air, et il n'y a aucun bénéfice à les déporter. ## #Tarifs et limites Ollama Cloud se positionne entre un abonnement mensuel forfaitaire (avec quota de requêtes/heure) et un modèle de facturation à la consommation pour les usages intensifs. Les tarifs exacts évoluent — vérifiez sur ollama.com/cloud avant de vous engager — mais quelques constantes méritent d'être notées. Quotas horaires Les plans de base limitent le nombre de requêtes par heure ou par jour. Confortable pour un usage humain en chat, vite atteint pour un script qui boucle sur 10 000 documents. Facturation à la durée d'inférence Les très gros modèles sont parfois facturés au temps GPU consommé. Une requête à long contexte (32k tokens, raisonnement profond) coûte mécaniquement plus qu'un "bonjour". Pas de prix au token affiché par défaut Contrairement à OpenAI ou Anthropic, l'API ne facture pas systématiquement au token côté Ollama Cloud. Cela rend la budgétisation moins précise. Pas de SLA grand public L'offre est jeune, il n'y a pas (au moment d'écrire ces lignes) de garantie de disponibilité comparable à celles des grands clouds. ! Le piège du "presque gratuit" Un quota gratuit ou un plan d'entrée bon marché donne envie de tout faire passer par le cloud. Mais dès qu'on automatise (batch processing, agent qui boucle, RAG sur 100 000 chunks), la facture grimpe vite et la latence réseau s'ajoute à chaque appel. ## #Confidentialité : ce qui change vraiment C'est ici que la différence avec le self-host devient structurelle, pas anecdotique. Quand vous utilisez Ollama en local, vos prompts ne quittent jamais le port 11434 sur localhost — c'est vérifiable au pare-feu. En cloud, ils transitent par Internet et sont traités sur une infrastructure tierce. Vos prompts sortent du périmètre Toute donnée envoyée — extrait de contrat, code source propriétaire, dossier patient, email — quitte votre machine. Pour un cabinet d'avocats, un médecin, un service RH ou un labo R&D, c'est rédhibitoire. Politique de rétention Ollama indique ne pas entraîner ses modèles sur vos prompts. Mais la rétention pour debug, abuse-detection ou logs varie selon les plans. Lisez les CGU avant d'envoyer du sensible. RGPD et hébergement Les serveurs Ollama Cloud sont majoritairement aux États-Unis. Pour des données personnelles européennes, cela soulève des questions de transfert hors-UE que le self-host élimine d'un coup. Pas d'audit possible côté infra En local, vous pouvez tcpdump le port 11434 et prouver que rien ne sort. En cloud, vous devez faire confiance — il n'y a pas de moyen technique de vérifier ce qui est journalisé. → Le test du tcpdump Pour un Ollama self-host, lancez `sudo tcpdump -i any port 443` pendant que vous utilisez le modèle. Aucun paquet sortant ne doit apparaître. Avec Ollama Cloud, vous verrez du trafic vers les serveurs ollama.com. La preuve de la confidentialité est binaire et observable. ## #Alternatives self-host à chaque modèle cloud Pour la quasi-totalité des modèles proposés en cloud, il existe une alternative locale soit équivalente (modèle plus petit de la même famille), soit acceptable (autre modèle open-weight comparable). Voici les correspondances utiles. gpt-oss:120b-cloud → llama3.1:8b ou qwen2.5:14b en local Pour 90 % des usages conversationnels, un 8B-14B Q4 sur une RTX 3060 12 Go fait l'affaire. La différence se mesure surtout sur des tâches de raisonnement long ou de connaissance encyclopédique. qwen3-coder:480b-cloud → qwen2.5-coder:14b ou 32b Le 32B en Q4 (≈19 Go VRAM) tourne sur une RTX 4090 ou un Mac M-Max. Pour de l'autocomplétion code en IDE, c'est largement suffisant — voir le guide Continue.dev. deepseek-v3:671b-cloud → deepseek-r1:32b ou 70b distillé Les versions distillées de DeepSeek R1 reproduisent 80-90 % du raisonnement du modèle complet sur des benchmarks usuels, en local sur une 4090 ou un Mac Studio. Modèles vision géants → qwen2.5-vl:7b ou llama3.2-vision:11b Pour de l'OCR, du tagging d'images, de la description, ces deux modèles tournent sur 8-12 Go de VRAM. Voir le guide LLM multimodal vision en local. Long contexte 1M tokens → modèles 128k locaux + chunking Très peu d'usages réels nécessitent 1M de tokens d'un coup. Un bo… --- ## Maintenance Ollama : mettre à jour, supprimer des modèles, désinstaller | QuelLLM.fr URL: https://quelllm.fr/guide/maintenance-ollama-update-supprimer published: 2026-09-11 > Le guide d'entretien d'Ollama — mettre à jour proprement selon l'OS, supprimer un modèle sans casser les autres (blobs partagés), récupérer de l'espace… [Accueil](/) / [Guides](/guides) / Installation / Ollama / Maintenance Ollama : mettre à jour, supprimer des modèles, désinstaller Débutant 8 min Ollama # Maintenance Ollama : mettre à jour, supprimer des modèles,désinstaller Une installation d'Ollama vieillit vite : nouvelles versions chaque mois, modèles téléchargés puis oubliés, dizaines de gigaoctets qui s'accumulent dans un dossier qu'on ne regarde jamais. Ce guide fait le tour de l'entretien — un ollama update propre selon votre OS, la suppression d'un modèle sans casser les autres à cause des blobs partagés, le nettoyage du disque, et la désinstallation complète quand vous voulez repartir de zéro. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-09-10 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-maintenance-ollama-update-supprimer) ## #Pourquoi entretenir Ollama Ollama évolue au rythme du moteur llama.cpp qu'il embarque : chaque mise à jour apporte le support de nouveaux modèles, des gains de vitesse, des correctifs GPU et parfois des changements de format. Rester sur une vieille version, c'est se priver de modèles récents (« this model is not supported by your version of Ollama ») et traîner des bugs déjà corrigés. L'autre moitié de l'entretien, c'est le disque. Un modèle 7B en Q4_K_M pèse environ 4-5 Go, un 14B autour de 9 Go, un 32B près de 20 Go. Testez-en une dizaine sur quelques semaines et vous avez tranquillement rempli 100 Go sans vous en rendre compte. Savoir supprimer proprement et lire l'espace réellement occupé fait partie du métier. i Où vivent les modèles Par défaut, les poids sont stockés dans ~/.ollama/models sur macOS et Linux, et dans C:\Users\\.ollama\models sur Windows. Le daemon, lui, écoute toujours sur http://localhost:11434. ## #Vérifier sa version ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-maintenance-ollama-update-s) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-maintenance-ollama-update-s-bundle) → Avant toute chose, regardez où vous en êtes. La commande fonctionne à l'identique sur les trois systèmes et vous donne le numéro de version installé. Terminal ⧉ Copier ``` `ollama --version # ollama version is 0.x.y` ``` Comparez ce numéro à la dernière version publiée sur la page des releases officielles (github.com/ollama/ollama/releases). Si vous êtes en retard de plusieurs versions, la mise à jour ci-dessous prend deux minutes. ## #Mettre à jour Ollama (Windows, macOS, Linux) La mise à jour ne touche jamais vos modèles : le dossier ~/.ollama est indépendant du binaire. Vous pouvez donc mettre à jour l'application sans rien re-télécharger. La méthode dépend simplement de votre système. 1. 01 Windows L'application vérifie les mises à jour automatiquement et affiche une notification quand une nouvelle version est prête ; il suffit de cliquer pour l'installer. Pour forcer, retéléchargez l'installeur OllamaSetup.exe depuis ollama.com/download et relancez-le par-dessus : vos modèles sont conservés. 2. 02 macOS Même logique : l'app propose la mise à jour dans la barre de menus (icône Ollama → « Restart to update »). Sinon, retéléchargez le .dmg depuis ollama.com/download et remplacez l'app dans /Applications. Si vous l'avez installée via Homebrew, faites plutôt « brew upgrade ollama ». 3. 03 Linux Rejouez simplement le script d'installation officiel : il détecte l'installation existante et remplace le binaire par la dernière version, sans effacer vos modèles ni votre service systemd. Linux — mise à jour ⧉ Copier ``` `# Réexécuter le script officiel met à jour le binaire en place curl -fsSL https://ollama.com/install.sh | sh # Vérifier, puis redémarrer le service si besoin ollama --version sudo systemctl restart ollama` ``` → Après une grosse mise à jour, relancez le daemon Sur Linux, « sudo systemctl restart ollama » garantit que le nouveau binaire est bien chargé. Sur Windows et macOS, quittez complètement l'application (elle reste souvent dans la zone de notification) avant de la relancer. ## #Supprimer un modèle : ollama rm Pour faire le ménage, commencez par lister ce que vous avez réellement installé. La colonne SIZE donne la taille apparente de chaque modèle, et TAG le nom exact à passer à la suppression. Lister puis supprimer ⧉ Copier ``` `# Voir tous les modèles installés, avec leur taille ollama list # Supprimer un modèle précis (nom:tag exact) ollama rm llama3.1:8b # Supprimer plusieurs modèles d'un coup ollama rm gemma3:12b qwen2.5:7b` ``` Attention au tag : « llama3.1 » et « llama3.1:8b » peuvent désigner des entrées différentes. Copiez le nom exact affiché par ollama list pour ne pas supprimer autre chose que ce que vous visez. Un modèle en cours d'utilisation par une requête sera libéré à la fin de celle-ci. ! La taille supprimée n'est pas toujours celle affichée ollama rm retire l'étiquette du modèle, mais l'espace réellement libéré dépend des blobs qu'aucun autre modèle ne partage — c'est tout l'objet de la section suivante. ## #La réalité des blobs partagés Ollama ne stocke pas un fichier monolithique par modèle. En interne, chaque modèle est décrit par un manifeste qui référence plusieurs blobs : les poids (le gros fichier GGUF), mais aussi le template de prompt, les paramètres, la licence. Ces blobs sont identifiés par leur empreinte SHA-256 et dédupliqués : deux modèles qui partagent exactement le même fichier de poids ne le stockent qu'une seule fois. Concrètement, si vous avez tiré « llama3.1:8b » et « llama3.1:8b-instruct-q4_K_M » qui pointent vers le même blob de poids, supprimer l'un des deux ne libère rien du tout côté poids : l'autre référence encore le blob. À l'inverse, supprimer le dernier modèle qui référençait un blob le supprime enfin du disque. C'est pour ça que la place récupérée par un ollama rm est parfois bien inférieure à la taille annoncée par ollama list. Manifeste Un petit fichier JSON par modèle:tag, dans ~/.ollama/models/manifests/. C'est lui qu'ollama rm supprime en premier. Blob Un fichier de données (poids, template, params) nommé sha256-, dans ~/.ollama/models/blobs/. Partagé entre tous les modèles qui le référencent. Déduplication Un blob n'est effacé que lorsque plus aucun manifeste ne le référence. C'est une bonne chose : ça évite de dupliquer des gigaoctets identiques. i Ne supprimez jamais un blob à la main Il est tentant de faire du ménage direct dans le dossier blobs/. Ne le faites pas : vous risquez de casser un modèle encore référencé et de laisser des manifestes orphelins. Passez toujours par ollama rm, qui gère le comptage de références pour vous. ## #Retrouver et nettoyer l'espace disque Pour savoir ce qui occupe vraiment votre disque, regardez la taille du dossier de stockage plutôt que la seule sortie d'ollama list — cette dernière additionne des tailles qui peuvent partager des blobs. macOS / Linux — mesurer ⧉ Copier ``` `# Taille totale réellement occupée sur le disque du -sh ~/.ollama/models # Détail : blobs (les poids) vs manifests (les métadonnées) du -sh ~/.ollama/models/blobs ~/.ollama/models/manifests # Les plus gros blobs en premier ls -lhS ~/.ollama/models/blobs/ | head` ``` Windows PowerShell — mesurer ⧉ Copier ``` `# Taille totale du dossier de modèles Get-ChildItem "$env:USERPROFILE\.ollama\models" -Recurse | Measure-Object -Property Length -Sum | Select-Object @{n='Go';e={[math]::Round($_.Sum/1GB,2)}}` ``` La routine de nettoyage la plus efficace : lister, repérer les modèles que vous n'utilisez plus, les supprimer avec ollama rm, puis remesurer avec du -sh pour constater l'espace récupéré. Comme la déduplication joue, supprimez les variantes redondantes d'un même modèle en dernier — c'est là que la vraie place … --- ## Llama 4 Scout en local : installation et premiers tests avec Ollama | QuelLLM.fr URL: https://quelllm.fr/guide/installer-llama4-scout-ollama published: 2026-09-11 > Faire tourner Llama 4 Scout (17B-A2B MoE multimodal) en local avec Ollama. Prérequis VRAM, configuration des experts actifs, exemples vision et long contexte. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Llama 4 Scout en local : installation et premiers tests avec Ollama Intermédiaire 12 min Ollama # Llama 4 Scout en local : installation et premiers tests avecOllama Llama 4 Scout est le plus petit des trois modèles de la famille Llama 4 de Meta. C'est aussi le seul qui tient en local sur une station de travail haut de gamme — Maverick et Behemoth restent réservés au cloud ou à du serveur dédié. Ce guide montre comment installer Llama 4 Scout avec Ollama, ce qu'il faut vraiment comme VRAM (la promesse MoE est souvent mal comprise), et comment exploiter ses deux atouts différenciants : la multimodalité native et le contexte de 10M tokens. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-llama4-scout-ollama) ## #Pourquoi installer Llama 4 Scout en local avec Ollama ? Scout est le seul modèle de la gamme Llama 4 conçu pour tourner sur une seule machine. Meta l'a positionné comme le "workstation model" de la famille : multimodal nativement (texte + images), fenêtre de contexte annoncée à 10 millions de tokens, et architecture MoE (Mixture of Experts) qui n'active qu'une fraction des paramètres à chaque token. Concrètement, par rapport à un modèle dense de taille équivalente, Scout offre une meilleure latence (peu de paramètres actifs par token), une mémoire de contexte largement supérieure, et la vision incluse sans modèle séparé. Le prix à payer : un poids disque conséquent (l'ensemble des experts doit rester chargé en VRAM pour que le routing fonctionne). i MoE en deux mots Un modèle MoE comme Scout contient N "experts" (sous-réseaux spécialisés). À chaque token, un routeur en choisit k (typiquement 1 ou 2). Seuls ces k experts sont calculés. Résultat : la vitesse d'inférence est celle d'un petit modèle, mais la qualité tend vers celle du grand. Les paramètres totaux restent en VRAM — seul le calcul est partiel. ## #Scout, Maverick, Behemoth : qui fait quoi ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-llama4-scout-olla) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-llama4-scout-olla-bundle) → Scout (17B actifs) Le modèle workstation. 16 experts, ~109B paramètres totaux. Multimodal. Contexte 10M tokens. Cible : RTX 4090, M3/M4 Max/Ultra, ou setup multi-GPU 48 Go+. Maverick (17B actifs) Le modèle serveur. 128 experts, ~400B paramètres totaux. Même nombre d'actifs que Scout mais beaucoup plus de connaissance encodée. Cible : serveur 8x H100 ou cluster. Hors-jeu en local pour la plupart des configurations. Behemoth (288B actifs) Le modèle frontière. ~2T paramètres totaux. Pas exécutable en local sans datacenter. Surtout utile comme modèle "professeur" pour distiller les deux autres. → Lequel choisir ? Si vous lisez ce guide et que vous installez en local, c'est Scout. Maverick demande au minimum un serveur multi-GPU haut de gamme — à ce niveau-là, les guides DeepSeek V4 Flash ou Qwen3.7 Max sont plus pertinents. ## #VRAM réelle : ce que la fiche technique ne dit pas L'erreur classique avec les modèles MoE consiste à raisonner sur les paramètres actifs. "17B actifs = ça tient sur 12 Go en Q4" : faux. Pour que le routing fonctionne, tous les experts doivent rester en mémoire. Scout en Q4_K_M demande beaucoup plus que ce que ses 17B actifs laisseraient croire. Q4_K_M (recommandé) ≈ 65 Go de VRAM pour le modèle seul. Ajouter ~4 Go pour un contexte raisonnable (32k tokens). Total ≈ 70 Go. Q5_K_M ≈ 78 Go. Gain de qualité marginal sur la plupart des tâches face au Q4_K_M. Q8_0 ≈ 115 Go. Réservé aux benchmarks de référence. FP16 ≈ 220 Go. Cloud ou multi-serveur uniquement. ! Pas pour un GPU 24 Go Si vous avez une RTX 4090 ou une 3090 seule, Scout ne tournera pas correctement. Vous pouvez forcer l'offload CPU mais la vitesse s'effondre (< 2 tokens/sec). Pour un GPU 24 Go, regardez plutôt Qwen3-30B-A3B ou Mistral Small 24B. Pour une RTX 5090 32 Go, Qwen 3.6 35B-A3B reste plus pertinent que Scout offloaded. Les configurations qui font tourner Scout confortablement en local : Mac Studio M3 Ultra / M4 Ultra 96-192 Go La meilleure plateforme grand public pour Scout. Mémoire unifiée, pas d'offload, ~25-40 tokens/sec selon la quantification. 2x RTX 4090 / 2x 5090 48 Go ou 64 Go cumulés, suffisant pour Q4_K_M avec contexte étendu. Compter sur llama.cpp ou Ollama avec la variable OLLAMA_NUM_GPU. Workstation RTX 6000 Ada (48 Go) ou A6000 Tient Scout Q4 confortablement avec marge pour le contexte. ## #Prérequis Ollama 0.6 ou plus récent Le support de Llama 4 a été ajouté à partir d'Ollama 0.6. Vérifiez avec ollama --version, mettez à jour sinon. 70 Go d'espace disque libre Le tag Q4_K_M pèse environ 65 Go. Comptez large pour la marge cache. Bande passante mémoire élevée Sur Mac : viser ≥ 400 Go/s (M3 Max et au-dessus). Sur PC : DDR5 si offload CPU envisagé. Une connexion stable Le téléchargement initial peut durer 1 à 3 heures selon votre lien. ollama pull supporte la reprise en cas d'interruption. ## #1. Installer Llama 4 Scout avec Ollama Si Ollama n'est pas encore installé, suivez d'abord le guide adapté à votre système. Ensuite, le téléchargement de Scout se fait en une commande. Terminal — pull du modèle ⧉ Copier ``` `ollama pull llama4:scout` ``` Ce tag pointe par défaut sur la quantification Q4_K_M. Si vous voulez forcer une autre variante : Variantes disponibles ⧉ Copier ``` `ollama pull llama4:scout-q5_K_M ollama pull llama4:scout-q8_0 ollama pull llama4:scout-fp16` ``` Une fois le téléchargement terminé, listez les modèles pour confirmer le poids réel : Vérification ⧉ Copier ``` `ollama list` ``` i Patience au premier chargement Charger 65 Go en VRAM prend du temps : entre 30 secondes et 2 minutes selon le SSD. Les chargements suivants sont plus rapides grâce au cache OS. ## #2. Premier test : texte et raisonnement Lancez une session interactive pour valider le bon fonctionnement avant de toucher au reste. Session interactive ⧉ Copier ``` `ollama run llama4:scout` ``` À l'apparition du prompt >>>, vérifiez la langue et la qualité du raisonnement avec un test simple : Prompt de test ⧉ Copier ``` `>>> Explique en 4 phrases ce qu'est un modèle MoE, puis donne un avantage et un inconvénient. [Réponse attendue : explication structurée en français, distinction entre paramètres totaux et actifs, mention de la latence comme avantage et de la VRAM comme inconvénient.]` ``` Pendant que la conversation tourne, ouvrez un second terminal pour observer la charge : Surveiller la charge ⧉ Copier ``` `ollama ps` ``` La colonne SIZE doit refléter le poids effectif chargé. Sur PROCESSOR, idéalement 100% GPU. Si vous voyez un mix CPU/GPU, c'est que la VRAM ne suffit pas et qu'Ollama fait de l'offload — la vitesse en pâtira sévèrement. ## #3. Test vision en français Scout est multimodal nativement : l'image et le texte passent par le même backbone, contrairement à une approche qui colle un encodeur visuel séparé à un modèle purement textuel. Cela donne de meilleurs résultats sur les tâches qui mélangent les deux modalités (OCR contextuel, lecture de schémas, description fine). Avec l'API REST d'Ollama, on envoie l'image en base64 dans le champ images : Test vision Python ⧉ Copier ``` `import base64, requests, json with open('facture.jpg', 'rb') as f: img_b64 = base64.b64encode(f.read()).decode() response = requests.post( 'http://localhost:11434/api/generate', json={ 'model': 'llama4:scout', 'prompt': 'Décris cette image en français. Si c\'est un document, extrais les montants et la date.', 'images': [img_b64], 'stream': False, } ) print(response.json()['response'])` ``` Sur de… --- ## GLM-5 en local avec Ollama (le challenger chinois open-weights) | QuelLLM.fr URL: https://quelllm.fr/guide/installer-glm5-ollama-guide published: 2026-09-11 > GLM-5 (Zhipu AI) en local Ollama. Versions 9B et 32B, qualité raisonnement, français, code. Comparatif avec Qwen3 et DeepSeek V3.2. [Accueil](/) / [Guides](/guides) / Installation / Ollama / GLM-5 en local avec Ollama (le challenger chinois open-weights) Intermédiaire 11 min Ollama # GLM-5 en local avec Ollama (le challenger chinoisopen-weights) GLM-5 est la nouvelle famille open-weights de Zhipu AI (université de Tsinghua). Versions 9B et 32B, licence permissive, raisonnement solide, français correct et code respectable. Ce guide montre comment installer GLM-5 en local avec Ollama, mesure les performances réelles sur RTX 4070 et 4090, et le compare à Qwen3-32B et DeepSeek V3.2 sur les mêmes tâches. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-11 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-glm5-ollama-guide) ## #Pourquoi GLM-5 ? GLM-5 n'a pas la notoriété de Qwen3 ou DeepSeek, mais c'est un des modèles chinois open-weights les plus aboutis sortis ces derniers mois. Le 9B vise les configurations modestes (12 Go de VRAM suffisent), le 32B s'adresse aux RTX 4090 et Mac Studio. Sur le papier, il revendique des scores proches de GPT-4o-mini sur MMLU et HumanEval, à la même taille que Qwen3-32B. En pratique, GLM-5 brille sur trois axes : le raisonnement structuré (mode thinking similaire à celui de Qwen3), le français (sensiblement meilleur que Qwen3-9B sur des prompts complexes), et le code Python. Là où il déçoit : la fenêtre de contexte plafonne à 128k en local malgré une promesse de 1M, et la vision n'est pas intégrée (contrairement à GLM-4V). i GLM-5 vs GLM 5.1 Ce guide couvre GLM-5 (release initiale). GLM 5.1 (sortie ultérieure) corrige plusieurs régressions sur le code et améliore le suivi d'instructions. Si vous démarrez de zéro aujourd'hui, lisez aussi le guide GLM 5.1 du site avant d'arbitrer. ## #Prérequis matériel ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-glm5-ollama-guide) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-glm5-ollama-guide-bundle) → GLM-5 9B Q4_K_M ≈ 5,5 Go VRAM. RTX 3060 12 Go, RTX 4060 8 Go (offload partiel), Mac M2 16 Go unifié, toutes les RTX 4070+. GLM-5 32B Q4_K_M ≈ 19 Go VRAM. RTX 4090 24 Go confortable, RTX 3090 24 Go aussi. Sur 16 Go (4080), il faut descendre en Q3_K_M. GLM-5 32B Q5_K_M ≈ 22-23 Go VRAM. RTX 4090 tient, marge serrée. Préférez Q4_K_M si vous activez un long contexte. Ollama 0.6.0+ Le support GLM-5 a été ajouté progressivement. Une version récente est nécessaire pour le tokenizer et le template de chat. Disque Comptez 6 Go (9B Q4) à 23 Go (32B Q5). Plus si vous gardez plusieurs quantizations en parallèle. ## #1. Récupérer le modèle depuis Hugging Face Zhipu AI publie les poids officiels sur Hugging Face sous l'organisation THUDM. Deux dépôts vous intéressent : Dépôt officiel 9B ⧉ Copier ``` `https://huggingface.co/THUDM/glm-5-9b-chat` ``` Dépôt officiel 32B ⧉ Copier ``` `https://huggingface.co/THUDM/glm-5-32b-chat` ``` Ces dépôts contiennent les poids au format safetensors (FP16/BF16). Pour Ollama, il vous faut du GGUF. Deux options : télécharger un GGUF déjà converti par la communauté, ou convertir vous-même. → Raccourci : GGUF tout fait Cherchez sur Hugging Face glm-5 GGUF — bartowski, mradermacher et lmstudio-community publient des conversions Q4_K_M, Q5_K_M et Q8_0 à jour. C'est l'option pragmatique pour 95 % des cas. ## #2. GGUF et conversion si nécessaire Si aucun GGUF officiel ou communautaire ne convient (variante exotique, quantization spécifique), la conversion passe par llama.cpp. La procédure standard : Cloner llama.cpp et installer les deps ⧉ Copier ``` `git clone https://github.com/ggml-org/llama.cpp cd llama.cpp pip install -r requirements.txt` ``` Convertir HF → GGUF FP16 ⧉ Copier ``` `python convert_hf_to_gguf.py /chemin/vers/glm-5-9b-chat \ --outfile glm-5-9b-chat-f16.gguf \ --outtype f16` ``` Quantifier en Q4_K_M ⧉ Copier ``` `./build/bin/llama-quantize \ glm-5-9b-chat-f16.gguf \ glm-5-9b-chat-Q4_K_M.gguf \ Q4_K_M` ``` ! Tokenizer GLM GLM utilise un tokenizer SentencePiece dérivé. Si convert_hf_to_gguf.py râle sur des tokens spéciaux manquants, mettez llama.cpp à jour (le support GLM-5 a été ajouté dans une PR récente). Avec une version trop ancienne, la conversion réussit mais l'inférence produit du charabia. ## #3. Installer GLM-5 dans Ollama (local) Une fois le GGUF en main, Ollama l'importe via un Modelfile. Créez un fichier nommé Modelfile à côté du GGUF : Modelfile pour GLM-5 9B ⧉ Copier ``` `FROM ./glm-5-9b-chat-Q4_K_M.gguf PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 32768 PARAMETER stop "<|user|>" PARAMETER stop "<|endoftext|>" TEMPLATE """[gMASK]{{ if .System }}<|system|> {{ .System }}{{ end }}<|user|> {{ .Prompt }}<|assistant|> {{ .Response }}""" SYSTEM """Tu es un assistant utile, précis et concis. Tu réponds en français sauf demande contraire."""` ``` Puis créez le modèle dans Ollama, vérifiez qu'il s'enregistre, et lancez-le : Création et lancement ⧉ Copier ``` `ollama create glm5-9b -f Modelfile ollama list ollama run glm5-9b` ``` → Quand le support natif arrive Si Ollama publie GLM-5 dans sa registry officielle (ollama run glm5 sans Modelfile), préférez-la : le template de chat sera maintenu en amont et vous éviterez les erreurs de stop tokens. ## #4. Tester la qualité en français Le français de GLM-5 est l'un de ses points forts pour un modèle entraîné majoritairement sur du chinois et de l'anglais. Trois prompts utiles pour évaluer rapidement : 1. 01 Raisonnement structuré « Une bouteille et son bouchon coûtent 1,10 €. La bouteille coûte 1 € de plus que le bouchon. Combien coûte le bouchon ? Détaille ton raisonnement. » GLM-5 9B devrait répondre 0,05 € en montrant l'équation. 2. 02 Synthèse longue Collez un article de 2000 mots et demandez un résumé en 5 points clés en français. Le 32B garde un fil clair, le 9B raccourcit trop sur le contexte étendu. 3. 03 Code Python contextuel « Écris une fonction Python qui parse un CSV avec délimiteur ;, gère les guillemets et renvoie un générateur de dict. Pas de pandas. » GLM-5 produit du code propre et idiomatique, là où Qwen3-9B a tendance à importer csv sans gérer les guillemets correctement. i Mode thinking GLM-5 a un mode de chaîne de pensée activable via un préfixe système (consultez le model card sur HF pour le format exact). Activé, la qualité du raisonnement monte d'un cran — au prix d'environ 30-40 % de tokens en plus. ## #5. Tokens/sec mesurés sur RTX 4070 et 4090 Mesures faites avec Ollama 0.6.x, OLLAMA_FLASH_ATTENTION=1, contexte 8k, prompt de 500 tokens, génération de 300 tokens. Moyenne sur 5 runs. RTX 4070 12 Go — GLM-5 9B Q4_K_M ≈ 55-60 tokens/sec. Confortable pour du chat, le modèle reste 100 % en VRAM. RTX 4070 12 Go — GLM-5 9B Q5_K_M ≈ 48-52 tokens/sec. Léger gain qualité, perte de vitesse mesurée. RTX 4090 24 Go — GLM-5 9B Q4_K_M ≈ 110-120 tokens/sec. Largement surdimensionné pour le 9B. RTX 4090 24 Go — GLM-5 32B Q4_K_M ≈ 22-26 tokens/sec. Le cas d'usage cible : qualité 32B à un débit utilisable interactif. RTX 4090 24 Go — GLM-5 32B Q5_K_M ≈ 18-22 tokens/sec. Marge VRAM serrée si contexte > 16k. Mac M4 Pro 48 Go — GLM-5 32B Q4_K_M ≈ 12-15 tokens/sec. Acceptable pour des tâches non-streaming (synthèse, analyse). → Activez Flash Attention OLLAMA_FLASH_ATTENTION=1 dans l'environnement gagne 10-15 % sur GLM-5 32B et stabilise la VRAM en contexte long. Couplé à OLLAMA_KV_CACHE_TYPE=q8_0, vous libérez 2-3 Go supplémentaires sans dégradation visible. ## #GLM-5 vs Qwen3-32B vs DeepSeek V3.2 Sur un même prompt, sur la même machine, voici ce qu'on observe en pratique. C'est une lecture qualitative, pas un benchmark normalisé — prenez-le comme une boussole, pas comme une vérité absolue. Français général Qwen3-32B ≥ … --- ## Mistral Magistral : installer le modèle de raisonnement français en local | QuelLLM.fr URL: https://quelllm.fr/guide/mistral-magistral-installation published: 2026-09-11 > Mistral Magistral (24B et Small) en local. Chaîne de pensée FR, comparaison avec DeepSeek R1 distillé, qualité math/code, prompt template officiel. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Mistral Magistral : installer le modèle de raisonnement français en local Intermédiaire 10 min Ollama # Mistral Magistral : installer le modèle de raisonnement français enlocal Magistral est le modèle de raisonnement de Mistral AI : un modèle qui « pense à voix haute » avant de répondre, à la manière de DeepSeek R1 ou OpenAI o1, mais avec une qualité native en français qu'aucun autre modèle de raisonnement open-weight n'atteint. Ce guide montre comment installer Mistral Magistral en local via Ollama, le configurer avec le bon prompt template, et le comparer honnêtement à DeepSeek R1 distillé. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-mistral-magistral-installation) ## #Pourquoi Magistral plutôt qu'un autre modèle de raisonnement ? Les modèles de raisonnement (reasoning models) génèrent une chaîne de pensée explicite avant la réponse finale. Sur des problèmes complexes — maths, logique, code délicat, analyse juridique — ils gagnent 10 à 30 points sur les benchmarks par rapport à un modèle généraliste de même taille. Le coût : ils sont plus lents et bavards. Jusqu'à Magistral, les options open-weights étaient surtout chinoises : DeepSeek R1 et ses distillations, Qwen3 en mode thinking, GLM. Toutes raisonnent parfaitement en anglais et en chinois, mais leur chaîne de pensée bascule régulièrement en chinois même quand le prompt est en français. Magistral est entraîné spécifiquement pour garder la trace de raisonnement dans la langue du prompt. Raisonnement multilingue natif La chaîne de pensée reste en français quand vous écrivez en français. Pas de bascule sauvage vers le chinois ou l'anglais. Apache 2.0 sur la version Small Usage commercial autorisé, fine-tuning libre, redistribution permise. Aucune zone grise comme avec certaines licences "open" restrictives. Base Mistral Small 3.1 Bonne qualité d'écriture FR héritée de la base, ce qui se voit sur la rédaction de réponses juridiques ou administratives. Contexte 40k tokens Suffisant pour un long énoncé de problème, plusieurs articles de code, ou un contrat de quelques dizaines de pages. i Raisonnement = tokens supplémentaires Comptez 500 à 3000 tokens de "thinking" avant chaque réponse finale. Sur GPU modeste, prévoyez de la patience : une question complexe peut prendre 30 à 60 secondes de génération continue avant la première ligne utile. ## #Magistral Small vs Magistral Medium ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-mistral-magistral-installat) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-mistral-magistral-installat-bundle) → Mistral AI publie Magistral en deux versions, et la confusion est fréquente. Pour installer mistral magistral en local, seule la version Small est exploitable — la Medium n'est disponible que via l'API. Magistral Small (24B) Open-weights Apache 2.0. C'est CE modèle qu'on installe en local. 24 milliards de paramètres, dérivé de Mistral Small 3.1. Magistral Medium Propriétaire, accessible uniquement via l'API Mistral ou Le Chat. Performances supérieures mais pas auto-hébergeable. Hors-sujet pour ce guide. → Petite astuce de nommage Sur Ollama Hub, le modèle s'appelle simplement `magistral`. Pas besoin de préciser "small" : la version Medium n'est pas distribuée en local de toute façon. ## #Prérequis matériel Magistral Small fait 24B paramètres. En quantization Q4_K_M (le standard Ollama), comptez environ 14 Go de VRAM pour charger le modèle, plus 1 à 3 Go pour le contexte selon la longueur. Minimum confortable RTX 4080 16 Go, RTX 4090 24 Go, RTX 3090 24 Go, ou Mac Apple Silicon avec 24 Go de mémoire unifiée. Marginal mais jouable RTX 4070 Ti Super 16 Go (Q4 tient pile, contexte court obligatoire) ou Mac M-series 16 Go avec offload partiel. Insuffisant Tout GPU 12 Go ou moins. Le modèle déborde sur la RAM CPU et tombe à 2-4 tokens/sec, inutilisable pour un modèle qui doit en produire des milliers avant de répondre. Ollama et drivers Ollama ≥ 0.5.x, drivers NVIDIA récents (CUDA 12), ou Metal sur Mac. Vérifiez avec `ollama --version`. ! Pas de GPU 24 Go ? Reconsidérez Magistral n'est pas un modèle à essayer sans GPU musclé. Sur 12 Go ou moins, vous attendrez plusieurs minutes par réponse. Tournez-vous plutôt vers une distillation 7B-14B de DeepSeek R1 — moins bonne en FR, mais utilisable sur du matériel modeste. ## #1. Installation via Ollama Magistral Small est publié sur Ollama Hub depuis la sortie officielle de Mistral. L'installation tient en une commande. 1. 01 Vérifiez qu'Ollama tourne Sur Windows/macOS, l'application doit être lancée (icône dans la barre des tâches). Sur Linux, `systemctl status ollama` confirme le service actif. 2. 02 Télécharger le modèle La quantization par défaut servie par Ollama est Q4_K_M. C'est le bon compromis pour 16-24 Go de VRAM. 3. 03 Premier lancement Ollama télécharge ~14 Go au premier `pull`. Le téléchargement initial peut prendre 10 à 30 minutes selon votre connexion. 4. 04 Test de chargement Lancez `ollama run magistral` puis une question courte. Si le modèle répond après 5-10 secondes de "warmup", tout va bien. Terminal ⧉ Copier ``` `ollama pull magistral ollama run magistral` ``` Pour vérifier que le modèle utilise bien le GPU et non la RAM CPU, une commande de contrôle : Statut runtime ⧉ Copier ``` `ollama ps` ``` Dans la colonne PROCESSOR, vous devez voir `100% GPU`. Si vous voyez `45% CPU / 55% GPU`, votre VRAM est insuffisante : Ollama a fallback partiellement sur la RAM. Le modèle marchera, mais à 1-3 tokens/sec. ## #2. Le prompt template officiel Magistral utilise un format de prompt spécifique pour activer correctement le raisonnement. Ollama embarque déjà ce template dans le Modelfile officiel, mais il vaut mieux le comprendre pour ne pas le sabouler involontairement avec un system prompt mal placé. La structure attendue, simplifiée : Format brut (interne au modèle) ⧉ Copier ``` `[SYSTEM_PROMPT]Vous êtes un assistant qui raisonne soigneusement avant de répondre.[/SYSTEM_PROMPT][INST]Question utilisateur[/INST] Chaîne de raisonnement interne... Réponse finale` ``` Concrètement, vous n'écrivez jamais ces balises à la main : Ollama les insère automatiquement. Ce qu'il faut savoir : le modèle attend que vous lui demandiez de raisonner. Un system prompt court et clair améliore nettement la qualité. Configurer le system prompt ⧉ Copier ``` `ollama run magistral >>> /set system "Tu es un assistant rigoureux. Avant chaque réponse, analyse le problème étape par étape en français. Réponds de manière concise après ton raisonnement."` ``` → Inutile de demander "réfléchis bien" Contrairement à un modèle généraliste, Magistral raisonne par défaut. Inutile d'écrire "prends ton temps" ou "pense étape par étape" : c'est déjà son mode normal. En revanche, lui demander explicitement de raisonner en français dans le system prompt aide à verrouiller la langue. ## #3. Premiers tests pratiques en français Voici trois prompts pour évaluer rapidement Magistral sur des tâches typiques. Notez que les réponses arrivent en deux temps : d'abord la chaîne de pensée (`...`), puis la réponse finale. Test 1 — Problème logique ⧉ Copier ``` `>>> Trois personnes se partagent 17 chevaux selon les proportions 1/2, 1/3, 1/9. Comment faire sans couper aucun cheval ?` ``` Magistral va dérouler le raisonnement classique du chameau emprunté. Comptez 1500 à 2500 tokens de thinking avant la réponse finale claire et numérotée. Test 2 — Code Python ⧉ Copier ``` `>>> Écris une fonction Python qui trouve le plus long sous-tableau dont la somme vaut zéro. Compl… --- ## Phi-4 en local : installer avec Ollama, VRAM, vitesse et test FR | QuelLLM.fr URL: https://quelllm.fr/guide/phi4-microsoft-local-ollama published: 2026-09-11 > Phi-4 (14B) de Microsoft en local avec Ollama : VRAM nécessaire, vitesse réelle, qualité en français et cas d'usage. Installation en deux commandes. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Phi-4 en local : installer avec Ollama, VRAM, vitesse et test FR Débutant 8 min Ollama # Phi-4 en local : installer avec Ollama, VRAM, vitesse et testFR Phi-4 est le petit modèle de Microsoft qui a fait beaucoup de bruit fin 2024 : 14 milliards de paramètres seulement, et pourtant des scores en maths et en code qui titillent des modèles trois fois plus gros. Ce guide montre comment installer Phi-4 Ollama en local, ce qu'il vaut vraiment dans la pratique, et où il déçoit — notamment en français. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-phi4-microsoft-local-ollama) i En bref Phi-4 est un modèle Microsoft de 14 milliards de paramètres, fort en maths et en code (GPQA, MATH, HumanEval), sous licence MIT. · Il tient en environ 9 Go de VRAM en Q4_K_M, accessible dès une RTX 3060 ou RTX 4070 12 Go, voire en CPU pur (16 Go de RAM, environ 5 tok/s). · L'installation tient en une commande : ollama pull phi4. · Sa faiblesse : le français, avec accords fautifs et basculements en anglais — préférez Mistral Small ou Qwen 3.5 9B pour de la rédaction française. ## #Pourquoi Phi-4 ? Phi-4 est la suite logique de la famille Phi de Microsoft Research : des modèles de petite taille, entraînés majoritairement sur des données synthétiques très soignées, pensés pour rivaliser avec des modèles bien plus gros sur les tâches de raisonnement. La version 4 sortie fin 2024 pousse cette approche à 14B de paramètres et obtient des scores remarquables sur GPQA, MATH et HumanEval — souvent au-dessus de Llama 3.3 70B sur ces benchmarks spécifiques. Concrètement, c'est un modèle qui rentre dans 9 Go de VRAM en Q4_K_M, donc accessible à un GPU 12 Go d'entrée de gamme comme une RTX 3060 ou une RTX 4070. Et il s'en tire honorablement même en CPU pur si vous avez 16 Go de RAM. C'est cet équilibre taille/qualité qui en fait un excellent candidat pour l'auto-hébergement modeste. i En deux mots Phi-4 = 14B, fort en maths et en code, faible en culture générale et en français, licence MIT. Idéal si vous voulez un "petit costaud" pour des tâches techniques sur un GPU 12 Go. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-phi4-microsoft-local-ollama) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-phi4-microsoft-local-ollama-bundle) → Ollama installé Windows, macOS ou Linux. Si ce n'est pas encore fait, le guide d'installation Ollama prend 3 minutes. VRAM pour la quantization Q4_K_M ≈ 9 Go. Une RTX 3060 12 Go, RTX 4070 12 Go ou un Mac avec 16 Go de mémoire unifiée passent sans souci. RAM CPU si pas de GPU 16 Go minimum pour Q4. Comptez 4 à 8 tokens/sec sur un Ryzen 5 ou Core i5 récent — utilisable pour des tests, pas pour du chat fluide. 10 Go d'espace disque Le modèle Q4_K_M pèse environ 9 Go. Prévoyez plus si vous voulez aussi tester Phi-4-Mini en parallèle. → Cas CPU-only Phi-4 est l'un des rares 14B vraiment utilisables sans GPU. Sur un Ryzen 7 5800X ou un Intel i7-12700, on tourne autour de 5 tok/sec en Q4 — lent mais OK pour une question à la fois. Pour un usage interactif, visez quand même un GPU. ## #1. Installer Ollama Si Ollama est déjà en place, sautez directement à la section suivante. Sinon, voici l'installation en une commande sur Linux et macOS. Linux / macOS ⧉ Copier ``` `curl -fsSL https://ollama.com/install.sh | sh` ``` Sur Windows, téléchargez l'installateur depuis le site officiel. Lien officiel Windows ⧉ Copier ``` `https://ollama.com/download/windows` ``` Une fois installé, le daemon Ollama écoute sur le port 11434. Vérification ⧉ Copier ``` `ollama --version curl http://localhost:11434/api/tags` ``` ## #2. Récupérer Phi-4 Phi-4 est disponible dans le catalogue officiel Ollama. Le tag par défaut récupère la quantization Q4_K_M, qui est le compromis recommandé. Terminal ⧉ Copier ``` `ollama pull phi4` ``` Le téléchargement fait environ 9 Go. Pour explicitement viser une autre quantization, précisez le tag. Variantes ⧉ Copier ``` `ollama pull phi4:14b-q4_K_M # ≈ 9 Go (défaut) ollama pull phi4:14b-q5_K_M # ≈ 10 Go ollama pull phi4:14b-q8_0 # ≈ 15 Go ollama pull phi4:14b-fp16 # ≈ 29 Go (sans quantization)` ``` → Quelle quantization choisir Pour Phi-4, Q4_K_M reste le meilleur compromis sur du matériel grand public. La différence avec Q5_K_M est marginale en pratique sur ce modèle, et Q8_0 demande 15 Go de VRAM pour un gain qualitatif difficile à percevoir hors benchmarks. ## #3. Premiers tests : maths, code, raisonnement Démarrez une session interactive pour vérifier que le modèle tourne et tester ses points forts. Session ⧉ Copier ``` `ollama run phi4` ``` Vous devriez voir un prompt `>>>`. C'est là que Phi-4 brille : les exercices logiques et techniques. Quelques prompts révélateurs : Test maths ⧉ Copier ``` `>>> Une boutique vend des stylos à 0,80 € pièce. Si vous en achetez 12 ou plus, le prix tombe à 0,65 € pièce. À partir de combien de stylos est-il plus économique de commander une boîte de 12 ?` ``` Phi-4 va dérouler le raisonnement étape par étape et arriver au résultat. Pour du code, il gère sans broncher Python et JavaScript standards. Test code ⧉ Copier ``` `>>> Écris une fonction Python qui prend une liste d'entiers et renvoie le sous-tableau contigu de somme maximale (algorithme de Kadane). Avec docstring et 3 cas de test.` ``` i Vitesse attendue Sur RTX 4070 (12 Go) en Q4_K_M, comptez 45–60 tok/sec. Sur RTX 3060 (12 Go), 25–35 tok/sec. Sur Mac M2 24 Go, 20–30 tok/sec. Sur CPU Ryzen 5 5600X, 4–6 tok/sec. ## #4. Qualité française : les vraies faiblesses C'est ici que Phi-4 montre ses limites. Le modèle a été entraîné majoritairement sur de l'anglais (et beaucoup de données synthétiques générées en anglais). Le français est présent dans le corpus mais clairement secondaire. Grammaire et accords Bons sur des phrases simples, mais accords fautifs, anglicismes et tournures lourdes dès qu'on demande de la rédaction longue. Vocabulaire technique FR Tendance à utiliser les termes anglais ("endpoint", "deployment", "thread") même quand un équivalent français usuel existe. Compréhension Comprend très bien un prompt en français. Le souci est la production. Code commenté en FR Les commentaires de code basculent fréquemment en anglais en cours de génération. Donnez la consigne explicitement, ça aide mais ne résout pas tout. Culture FR Faible. Connaissance superficielle de la jurisprudence, de l'histoire ou des institutions françaises. Tout sauf un modèle pour rédiger une note juridique en FR. ! Le verdict francophone Pour de la rédaction française correcte, préférez Mistral Small 24B (généraliste, bon en français) ou, sur une machine plus modeste, Qwen 3.5 9B — nettement plus à l'aise en français que Phi-4. Phi-4 reste excellent pour des tâches où la sortie est du code ou du raisonnement structuré — et où la langue d'interaction compte peu. Astuce qui aide un peu : un system prompt strict force le modèle à rester en français, au prix de réponses parfois plus courtes. System prompt FR ⧉ Copier ``` `>>> /set system "Tu réponds exclusivement en français, sans jamais basculer en anglais. Les commentaires de code, les noms de variables explicatifs et les titres restent en français."` ``` ## #5. Phi-4-Mini : la version 3.8B Microsoft a publié en parallèle Phi-4-Mini, une variante 3.8B qui vise les configurations très contraintes : laptop sans GPU dédié, Raspberry Pi 5, edge devices. Avec 2,5 Go en Q4, elle tourne sur n'importe quelle machine moderne. Installation ⧉ Copier ``` `ollama pull phi4-mini` ``` VRAM/RAM nécessaire ≈ 2,5 Go en Q4_K_M. Passe sur un MacBook Air M1 8 Go ou un PC avec un GPU 4… --- ## Gemma 3 (Google) en local : guide complet 2026 | QuelLLM.fr URL: https://quelllm.fr/guide/gemma3-google-installation-locale published: 2026-09-11 > Gemma 3 (1B / 4B / 12B / 27B) en local avec Ollama. Spécificités licence Google, contexte 128k, vision intégrée, benchmarks FR, multilingue. [Accueil](/) / [Guides](/guides) / Installation / Ollama / Gemma 3 (Google) en local : guide complet 2026 Débutant 9 min Ollama # Gemma 3 (Google) en local : guide complet2026 Gemma 3 est la famille de modèles open-weight de Google sortie en mars 2025. Quatre tailles (1B, 4B, 12B, 27B), vision intégrée à partir de 4B, contexte 128k, et un support multilingue solide qui inclut un français correct. Ce guide couvre l'installation Gemma 3 Ollama en local pas à pas, la licence Google à connaître, et où le modèle brille vraiment. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-gemma3-google-installation-locale) ## #Pourquoi Gemma 3 ? Gemma 3 est la troisième itération des modèles open-weight de Google DeepMind, dérivés de la même recherche que Gemini. La famille couvre quatre tailles très distinctes — de 1B à 27B — ce qui permet de viser exactement le palier de matériel que vous avez sous la main, du laptop sans GPU au workstation 24 Go. Trois choses font sortir Gemma 3 du lot des modèles de cette catégorie : un contexte 128k de série (32k seulement pour la 1B), une vision multimodale intégrée dès la 4B sans avoir à charger un modèle séparé, et un travail explicite sur le multilingue (la doc Google revendique 140+ langues couvertes pour les tailles 4B et au-dessus). i En deux mots Gemma 3 = la famille "polyvalente" de Google. Pas la plus forte sur un benchmark en particulier, mais l'une des plus complètes : 4 tailles, vision, contexte long, multilingue. Idéale comme modèle par défaut sur une machine donnée. ## #Les 4 tailles Gemma 3 ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-gemma3-google-installation-) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-gemma3-google-installation--bundle) → Choisir la bonne taille est la décision la plus importante. Voici le mapping usage / matériel : gemma3:1b Texte uniquement, contexte 32k. Pour CPU pur, Raspberry Pi 5, ou un Mac M1 8 Go. Qualité limitée mais réponses instantanées. Bon pour de la classification, de la reformulation courte. gemma3:4b Multimodal (texte + image), contexte 128k. Le palier "laptop" : tient confortablement sur 6 Go de VRAM ou un Mac M2/M3 16 Go. Qualité raisonnable pour des tâches généralistes. gemma3:12b Multimodal, contexte 128k. Le palier "PC mid-range" : RTX 3060 12 Go, 4070, M3 Pro 18 Go. Niveau qualitatif vraiment utilisable au quotidien. gemma3:27b Multimodal, contexte 128k. Le palier "workstation" : RTX 3090/4090, M3 Max. Le meilleur Gemma 3, comparable à des modèles de catégorie supérieure sur beaucoup de tâches. → Si vous hésitez Commencez par la 4B. C'est le plus petit modèle qui inclut la vision et le contexte 128k, et il tourne pratiquement partout. Vous monterez en 12B ou 27B une fois que vous saurez si la qualité vous suffit. ## #Prérequis VRAM (quantization Q4_K_M) gemma3:1b ≈ 1 Go de VRAM ou de RAM. Tourne sur n'importe quelle machine, y compris un Raspberry Pi 5. gemma3:4b ≈ 3 Go de VRAM. RTX 3050 6 Go, GTX 1660 6 Go, MacBook Air M2 8 Go suffisent. gemma3:12b ≈ 8 Go de VRAM. RTX 3060 12 Go, RTX 4070 12 Go, Mac M3 Pro 18 Go unifiés. gemma3:27b ≈ 17 Go de VRAM en Q4. RTX 3090/4090 24 Go ou Mac M3/M4 Max 36 Go+. En Q3 (qualité dégradée) ça passe sur 16 Go. Ajoutez environ 1 à 4 Go pour le cache KV selon la longueur de contexte que vous utilisez réellement. Charger le contexte 128k complet d'un 27B demande plus que la VRAM brute du modèle. ## #1. Installation Gemma 3 Ollama en local Si Ollama n'est pas encore installé, suivez d'abord le guide d'installation Ollama pour votre OS. Une fois Ollama en route, le téléchargement de Gemma 3 tient en une commande. Terminal ⧉ Copier ``` `ollama run gemma3:4b` ``` Ollama télécharge le modèle (environ 3,3 Go pour la 4B en Q4), puis le lance directement en mode interactif. Quand le prompt >>> apparaît, vous pouvez tester. Pull sans lancer ⧉ Copier ``` `ollama pull gemma3:1b ollama pull gemma3:4b ollama pull gemma3:12b ollama pull gemma3:27b` ``` Le daemon Ollama écoute sur http://localhost:11434 — vous pouvez brancher dessus Open WebUI, LM Studio en client, Continue.dev, ou n'importe quel client compatible OpenAI. → Choisir la bonne quantization Le tag par défaut (ex: gemma3:12b) pointe sur Q4_K_M, le meilleur compromis qualité/mémoire pour la plupart des usages. Pour plus de qualité au prix de plus de VRAM, utilisez gemma3:12b-it-q5_K_M ou q8_0. ## #2. Multilingue et qualité française Le travail de Google sur le multilingue reste un vrai point fort de Gemma 3 face aux petits modèles anglocentrés. Le français est bien représenté dans le corpus d'entraînement — vous ne verrez quasiment jamais le modèle basculer en anglais en cours de réponse, ce qui reste un défaut récurrent de modèles plus petits. Les générations 2026 (Qwen 3.5, Granite 4.2) ont bien rattrapé le français, mais Gemma 3 tient toujours la comparaison sur ce terrain. Gemma 3 4B FR correct pour des tâches simples (résumé, reformulation, classification). Pour de la rédaction longue, les tournures restent parfois maladroites. Gemma 3 12B Niveau "assistant FR utilisable". Bonne maîtrise de la grammaire, vocabulaire varié, peu d'anglicismes parasites. Comparable à Qwen 3.5 9B sur ce critère. Gemma 3 27B Très bon FR. Au niveau de Mistral Small 24B pour la rédaction, légèrement en dessous sur le raisonnement formel mais souvent meilleur sur la nuance et le style. Test rapide en FR ⧉ Copier ``` `>>> Résume en 3 points clés les enjeux de la souveraineté numérique européenne. 1. **Dépendance technologique** : 80% du cloud européen repose sur trois acteurs américains... 2. **Conformité réglementaire** : le RGPD et l'AI Act créent un cadre que les fournisseurs hors-UE... 3. **Capacité industrielle** : la course aux semi-conducteurs et aux modèles d'IA...` ``` ## #3. Vision multimodale intégrée À partir de la 4B, Gemma 3 accepte des images en entrée — pas besoin de charger un modèle de vision séparé. Le même binaire fait texte et vision, avec un encodeur SigLIP intégré. Pratique pour de l'OCR, de la description d'image, ou de l'analyse de capture d'écran. CLI Ollama avec image ⧉ Copier ``` `ollama run gemma3:12b >>> Décris cette capture d'écran et identifie les éléments d'interface : /chemin/vers/screenshot.png` ``` En API Python, on passe l'image au format base64 ou via un chemin local : API Python Ollama ⧉ Copier ``` `import ollama response = ollama.chat( model='gemma3:12b', messages=[{ 'role': 'user', 'content': 'Extrais le texte visible sur cette facture.', 'images': ['/chemin/vers/facture.jpg'], }] ) print(response['message']['content'])` ``` i Qualité vision réaliste Gemma 3 vision est correct sur de la description générale, de l'OCR de documents propres, et de la lecture d'interfaces. Pour de l'OCR sur photos floues ou manuscrites, un modèle vision plus récent et plus gros comme Qwen 3.8 27B (vision) reste meilleur. Pour du raisonnement spatial complexe (compter des objets, comprendre un schéma technique), tout reste perfectible — c'est vrai de tous les LLM open-weight. ## #4. Contexte 128k en pratique Le contexte 128k de Gemma 3 (sauf 1B limitée à 32k) est suffisant pour ingérer un livre court, un dossier de documentation complet, ou plusieurs heures de transcription. Par défaut, Ollama charge un contexte beaucoup plus court (typiquement 4k ou 8k) pour économiser la VRAM — vous devez l'étendre explicitement. Étendre le contexte en CLI ⧉ Copier ``` `ollama run gemma3:12b >>> /set parameter num_ctx 32768` ``` Ou via l'API, en passant l'option num_ctx au moment de la requête : Contexte étendu via API ⧉ Copier ``` `import ollama response = ollama.chat( model='gemma3:1… --- ## gpt-oss en local : les modèles open-weights d'OpenAI avec Ollama | QuelLLM.fr URL: https://quelllm.fr/guide/installer-gpt-oss-ollama published: 2026-09-11 > Installer gpt-oss-20b et gpt-oss-120b en local avec Ollama. VRAM nécessaire par version, quantification MXFP4, niveaux de raisonnement et ce que valent… [Accueil](/) / [Guides](/guides) / Modèles / OpenAI / gpt-oss en local : les modèles open-weights d'OpenAI avec Ollama Intermédiaire 10 min OpenAI # gpt-oss en local : les modèles open-weights d'OpenAI avecOllama OpenAI a fini par publier des poids ouverts : gpt-oss-20b et gpt-oss-120b, deux modèles à mélange d'experts sous licence Apache 2.0. Ce guide montre comment faire tourner gpt-oss avec Ollama, combien de VRAM chaque version réclame, comment fonctionne la quantification MXFP4 native et comment régler l'effort de raisonnement. On termine sur ce que valent vraiment ces open-weights face à Qwen et DeepSeek. Par Clara M. · Màj 2026-07-24 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-installer-gpt-oss-ollama) ## #Pourquoi gpt-oss change la donne Pendant des années, OpenAI a gardé ses modèles fermés. gpt-oss est le premier retour de l'entreprise à des poids réellement téléchargeables depuis GPT-2, et cette fois sous licence Apache 2.0 : usage commercial autorisé, pas de clause de partage forcé, pas de limite d'utilisateurs. Vous téléchargez les poids, ils tournent sur votre machine, et rien ne sort de votre réseau. Techniquement, gpt-oss repose sur une architecture MoE (Mixture of Experts) : le modèle contient beaucoup de paramètres au total, mais n'en active qu'une petite fraction à chaque token. Résultat : une qualité proche d'un gros modèle dense pour un coût mémoire et une vitesse d'un modèle bien plus petit. Les deux versions ciblent le raisonnement, l'appel d'outils et le suivi d'instructions, avec un contexte de 128k tokens. gpt-oss-20b ≈ 21 milliards de paramètres au total, ≈ 3,6 B actifs par token. Pensé pour une seule carte grand public de 16 Go. gpt-oss-120b ≈ 117 milliards de paramètres au total, ≈ 5,1 B actifs par token. Cible une carte data-center 80 Go ou une machine à grosse mémoire unifiée. Licence Apache 2.0 — commercial, redistribuable, fine-tunable sans restriction d'usage. Quantification MXFP4 native sur les poids des experts : le format 4 bits fait partie de la publication, pas d'une conversion tierce approximative. ## #gpt-oss ollama : 20b ou 120b ? ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-installer-gpt-oss-ollama) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-installer-gpt-oss-ollama-bundle) → Le choix se joue presque uniquement sur votre matériel. Les deux modèles partagent la même famille et la même mise en forme des réponses ; la différence de qualité existe mais reste secondaire face à la question « est-ce que ça rentre dans ma VRAM ». Voici le repère simple. 20b — le défaut raisonnable Environ 14-16 Go une fois chargé en MXFP4. Tient sur une RTX 4080 16 Go ou une RTX 4090, et sur un Mac Apple Silicon à partir de 24 Go de mémoire unifiée. C'est la version à installer en premier. 120b — quand vous avez la mémoire Environ 60-65 Go en MXFP4. Il vise un GPU 80 Go (classe H100/A100), un poste multi-GPU, ou un Mac à grosse mémoire unifiée (M3/M4 Ultra 96 Go et plus). Inutile de l'essayer sous 64 Go de mémoire disponible pour le modèle. Qualité relative Le 120b creuse l'écart sur le raisonnement multi-étapes, le code long et les tâches ambiguës. Sur du questions-réponses courant et du français, le 20b s'en sort déjà très bien. i MoE : peu de paramètres actifs, mais toute la mémoire L'architecture MoE réduit le calcul par token, pas l'empreinte mémoire : tous les experts doivent être chargés en VRAM même si un seul groupe travaille à chaque étape. C'est pourquoi le 120b réclame ~65 Go alors qu'il n'active que ~5 B de paramètres. ## #Prérequis Rien d'exotique : une installation d'Ollama à jour et assez de mémoire pour la version visée. Ollama gère le téléchargement, la quantification MXFP4 et le déchargement GPU/CPU tout seul. Ollama récent Version supportant gpt-oss et MXFP4. Mettez à jour avant de commencer — les versions trop anciennes ne connaissent pas le format. VRAM / mémoire unifiée ≥ 16 Go pour le 20b, ≥ 64 Go pour le 120b. En dessous, Ollama débordera sur la RAM CPU et la vitesse s'effondrera. Espace disque ≈ 12-14 Go pour le 20b, ≈ 60-65 Go pour le 120b. Les poids sont stockés dans le dossier des modèles Ollama. Daemon en écoute Ollama expose son API sur http://localhost:11434 par défaut — pratique pour brancher Open WebUI ou du code par-dessus. → Vous n'avez pas encore Ollama ? Suivez d'abord le guide d'installation d'Ollama pour votre OS (Windows, macOS ou Linux), puis revenez ici. Tout le reste de ce guide suppose que la commande ollama répond dans votre terminal. ## #Installer gpt-oss-20b en une commande La version 20b s'installe et se lance en une seule ligne. Ollama télécharge les poids MXFP4, les charge sur le GPU et ouvre une session de chat. Terminal ⧉ Copier ``` `# Télécharge et lance gpt-oss-20b ollama run gpt-oss:20b` ``` Au premier lancement, comptez le temps de télécharger ~13 Go. Ensuite le modèle reste en cache. Pour juste récupérer les poids sans ouvrir de session interactive, utilisez pull. Terminal ⧉ Copier ``` `# Récupérer sans lancer le chat ollama pull gpt-oss:20b # Vérifier que le modèle est présent ollama list # Voir s'il tourne bien sur le GPU ollama ps` ``` Sur ollama ps, vous voulez voir un pourcentage GPU élevé. Si la colonne affiche « 100% CPU », c'est que le modèle n'a pas tenu en VRAM et a débordé — la génération sera lente. Sur une RTX 4090, attendez-vous à un débit confortable en interactif ; sur une 4080 16 Go, le 20b tient mais sans marge pour un gros contexte. Pour piloter le modèle par API plutôt qu'en chat, l'endpoint est déjà là. Voici un appel minimal. API — génération ⧉ Copier ``` `curl http://localhost:11434/api/generate -d '{ "model": "gpt-oss:20b", "prompt": "Explique la quantification MXFP4 en trois phrases.", "stream": false }'` ``` ## #Le 120b, pour quelles machines La commande est identique, seul le tag change. Mais ne la lancez que si vous disposez réellement de la mémoire : sous 64 Go, Ollama va décharger une partie des experts sur le CPU et vous obtiendrez quelques tokens par seconde au mieux. Terminal ⧉ Copier ``` `# ~60-65 Go de mémoire nécessaires ollama pull gpt-oss:120b ollama run gpt-oss:120b` ``` 1. 01 Vérifier la mémoire disponible Sur GPU NVIDIA, nvidia-smi doit montrer une carte 80 Go (ou plusieurs cartes cumulant assez de VRAM). Sur Mac, une mémoire unifiée de 96 Go+ laisse la marge pour le modèle et le système. 2. 02 Lancer le pull Le téléchargement est conséquent (~60 Go) : prévoyez le débit et l'espace disque. Le format MXFP4 évite d'avoir à requantifier soi-même. 3. 03 Contrôler le placement Après ollama run, un ollama ps dans un autre terminal confirme le taux de GPU. Un déchargement CPU massif = mémoire insuffisante, revenez au 20b. 4. 04 Ajuster le contexte Le 120b accepte 128k tokens, mais un contexte plein consomme beaucoup de mémoire supplémentaire. Réduisez num_ctx si vous êtes juste en VRAM. ! Multi-GPU grand public : attention aux attentes Cumuler deux RTX 4090 (48 Go) ne suffit pas au 120b, et le partage inter-GPU sur PCIe ajoute de la latence. Pour ce modèle, une seule carte 80 Go ou une grosse mémoire unifiée reste bien plus fluide qu'un bricolage multi-cartes. ## #Régler l'effort de raisonnement Particularité de gpt-oss : les modèles produisent une chaîne de raisonnement avant leur réponse, et vous pouvez doser cet effort. Trois niveaux — low, medium, high — arbitrent entre vitesse et profondeur. Un effort bas répond vite pour des tâches simples ; un effort haut réfléchit plus longtemps pour du math, du code ou de la logique multi-étapes. Le réglage se passe dans le message système. Indiquez le niveau voulu, et le modèle ajuste la longueur de sa réflexion interne. API — effort haut … --- ## Nemotron 3 en local : les modèles NVIDIA avec Ollama | QuelLLM.fr URL: https://quelllm.fr/guide/nemotron-nvidia-local-ollama published: 2026-09-11 > Installer les modèles Nemotron 3 de NVIDIA en local. Variantes Nano et Super, VRAM nécessaire, points forts en raisonnement et code, et comparaison avec les… [Accueil](/) / [Guides](/guides) / Modèles / NVIDIA / Nemotron 3 en local : les modèles NVIDIA avec Ollama Intermédiaire 10 min NVIDIA # Nemotron 3 en local : les modèles NVIDIA avecOllama NVIDIA ne fabrique pas que des GPU : la marque post-entraîne aussi ses propres LLM, la famille Nemotron. Ce guide montre comment installer Nemotron 3 en local avec Ollama, quelles variantes (Nano, Super) choisir selon votre VRAM, ce que NVIDIA optimise différemment des autres — raisonnement contrôlable et usage agentique — et quand ces modèles valent le coup face aux Qwen3 équivalents. Par Clara M. · Màj 2026-07-28 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-nemotron-nvidia-local-ollama) ## #Pourquoi Nemotron plutôt qu'un autre modèle Nemotron n'est pas un modèle entraîné de zéro. NVIDIA part de bases open-weight solides (Llama, Qwen selon les versions) puis applique sa propre recette de post-entraînement : élagage (pruning) pour réduire la taille, distillation pour récupérer la qualité perdue, et un fine-tuning massif orienté raisonnement, mathématiques, code et appels d'outils. Le résultat vise un point précis : le meilleur ratio qualité/coût de calcul pour des tâches d'agent, pas la conversation généraliste. L'autre particularité, c'est que NVIDIA optimise ces modèles pour son propre matériel et ses propres pipelines d'inférence. En pratique cela se traduit par des débits solides sur GPU NVIDIA et par une famille pensée comme une gamme cohérente : une petite version pour les cartes grand public, une version moyenne pour les stations de travail, une version géante pour les serveurs. Vous choisissez selon la VRAM disponible sans changer de logique de prompt. i Nemotron, c'est du Llama/Qwen amélioré Si vous connaissez déjà Llama ou Qwen en local, Nemotron se comporte de façon familière : même format de chat, mêmes quantizations GGUF. La différence tient au post-entraînement NVIDIA, pas à une architecture exotique. ## #Nano, Super et Ultra : quelle variante ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-nemotron-nvidia-local-ollam) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-nemotron-nvidia-local-ollam-bundle) → La gamme Nemotron 3 se décline en trois tailles, chacune pour une catégorie de machine. Le nom indique la cible plus que le nombre exact de paramètres. Nano (~8-9B) La version pour cartes grand public. Tient à l'aise sur une RTX 3060 12 Go ou tout GPU à partir de 8 Go de VRAM en Q4. C'est le point d'entrée idéal pour tester Nemotron et pour les agents légers. Super (~49B) La version pour stations de travail et gros GPU. Vise la qualité d'un modèle 70B pour un coût de calcul moindre, grâce à l'élagage NVIDIA. Demande une RTX 4090 24 Go (en Q4 serré) ou mieux, une carte 32-48 Go. Ultra (~253B) La version serveur, hors de portée d'une machine grand public. Réservée aux stations multi-GPU ou au datacenter. Mentionnée ici pour situer la gamme, pas pour un usage local courant. Pour un poste local, le choix réel se joue entre Nano et Super. Nano si vous avez une carte 8-16 Go ou si la vitesse prime. Super si vous avez 24 Go ou plus et que vous cherchez la qualité maximale sur du raisonnement ou du code exigeant. ## #Prérequis et VRAM par variante Comme tout modèle en local, la VRAM est le facteur limitant. Voici les repères en quantification Q4_K_M, celle recommandée par défaut car elle offre le meilleur compromis qualité/mémoire. Comptez toujours une marge pour la fenêtre de contexte, qui consomme de la mémoire en plus des poids. Nemotron Nano (~9B) — Q4 ≈ 6-7 Go de VRAM. Confortable sur RTX 3060 12 Go, RTX 4070 12 Go, ou un Mac Apple Silicon à partir de 16 Go de mémoire unifiée. Nemotron Super (~49B) — Q4 ≈ 28-30 Go. Ne tient pas sur une seule RTX 4090 24 Go sans offload : prévoyez une carte 32 Go+, deux GPU, ou un Mac M4 Pro/Max avec 48 Go unifiés. Nemotron Super — Q5/Q8 Q5_K_M grimpe vers 35 Go, Q8_0 dépasse 50 Go. Réservé aux configurations à forte VRAM ou multi-GPU. Marge contexte Ajoutez 1 à 4 Go selon la longueur de contexte visée. Un contexte long en raisonnement génère beaucoup de tokens intermédiaires, donc gonfle l'empreinte mémoire. → Vérifier ce qui tient vraiment Après un « ollama run », lancez « ollama ps » dans un autre terminal. La colonne PROCESSOR indique « 100% GPU » si tout est en VRAM, ou un partage « GPU/CPU » si Ollama a dû déborder en RAM — auquel cas la vitesse chute fortement. C'est le signal qu'il faut descendre d'une taille ou d'un cran de quantification. Côté logiciel, le prérequis est minimal : le daemon Ollama installé, qui écoute par défaut sur http://localhost:11434. Sur GPU NVIDIA, assurez-vous que les pilotes CUDA sont à jour ; Ollama détecte le GPU automatiquement. Une interface comme Open WebUI ou LM Studio par-dessus est un confort, pas une obligation. ## #Installer Nemotron via Ollama L'installation suit exactement le flux Ollama habituel. Si le daemon tourne déjà, une seule commande télécharge et lance le modèle. 1. 01 Vérifier qu'Ollama tourne Ouvrez un terminal et lancez « ollama --version ». Si la commande répond, le daemon est prêt. Sinon, installez Ollama d'abord (voir le guide d'installation en fin d'article). 2. 02 Télécharger la variante Nano Pour tester sans risque côté VRAM, commencez par Nano. La commande télécharge les poids puis ouvre une session de chat directement dans le terminal. 3. 03 Passer à Super si votre GPU suit Une fois à l'aise, et si vous disposez d'assez de VRAM, tirez la variante Super pour gagner en qualité de raisonnement et de code. 4. 04 Lister et gérer les modèles « ollama list » affiche les modèles installés et leur taille sur disque. « ollama rm » libère l'espace d'une variante que vous n'utilisez plus. Terminal — installation Nemotron ⧉ Copier ``` `# Vérifier qu'Ollama répond ollama --version # Variante Nano (~9B) — cartes grand public ollama run nemotron-nano # Variante Super (~49B) — grosse VRAM / multi-GPU ollama run nemotron-super # Voir ce qui est installé et vérifier le placement GPU ollama list ollama ps` ``` ! Les tags évoluent La bibliothèque Ollama met régulièrement à jour les noms et les versions des modèles Nemotron. Avant de lancer une commande, vérifiez le tag exact sur ollama.com/library — le nom du modèle et son numéro de version peuvent différer de l'exemple ci-dessus selon la génération publiée. Pour appeler Nemotron depuis vos propres scripts, l'API REST d'Ollama est disponible sur le même port. Le champ « model » reprend le tag exact que vous avez tiré. Terminal — appel API ⧉ Copier ``` `curl http://localhost:11434/api/generate -d '{ "model": "nemotron-nano", "prompt": "Explique la différence entre RAG et fine-tuning en trois phrases.", "stream": false }'` ``` ## #Le mode raisonnement contrôlable La signature des modèles Nemotron, c'est un raisonnement qu'on peut activer ou couper à la demande. NVIDIA a entraîné ces modèles à produire une chaîne de pensée détaillée lorsqu'on le leur demande via le system prompt, et à répondre directement sinon. Concrètement, on bascule entre deux régimes avec une simple instruction système : « detailed thinking on » pour forcer le raisonnement étape par étape, « detailed thinking off » pour une réponse concise et rapide. Cet interrupteur est utile parce que le raisonnement a un coût. Une chaîne de pensée génère beaucoup de tokens intermédiaires : c'est précieux pour un problème de maths, de logique ou un débogage subtil, mais du gaspillage pour reformuler un e-mail. Avec Nemotron vous décidez, prompt par prompt, si vous payez ce surcoût. Terminal — activer le raisonnement ⧉ Copier ``` `# Dans une session ollama run, définir le system prompt : /set system detailed thin… --- ## Granite 4 d'IBM en local : installation et cas d'usage | QuelLLM.fr URL: https://quelllm.fr/guide/granite-4-ibm-local-ollama published: 2026-09-11 > Les modèles Granite 4 d'IBM en auto-hébergement. Architecture hybride Mamba, VRAM réduite, licence Apache 2.0 et cas d'usage entreprise où Granite se… [Accueil](/) / [Guides](/guides) / Modèles / IBM / Granite 4 d'IBM en local : installation et cas d'usage Intermédiaire 10 min IBM # Granite 4 d'IBM en local : installation et casd'usage IBM développe discrètement l'une des familles de LLM open-weight les plus intéressantes pour l'entreprise : Granite. Ce guide montre comment installer Granite 4 en local avec Ollama, explique l'architecture hybride Mamba qui divise la mémoire nécessaire, détaille la licence Apache 2.0 sans clause piège, et cible les usages — RAG, function calling, tâches métier — où Granite se démarque vraiment des modèles grand public. Par Clara M. · Màj 2026-07-30 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-granite-4-ibm-local-ollama) ## #Pourquoi Granite 4 plutôt qu'un autre modèle Granite n'est pas conçu pour gagner les classements de chatbots. IBM cible un objectif différent : des modèles fiables, économes en mémoire et juridiquement propres, faits pour être intégrés dans des applications d'entreprise. On ne choisit pas Granite pour discuter de philosophie, mais pour brancher un modèle sur une base documentaire, lui faire appeler des outils, ou l'exécuter à moindre coût sur du matériel modeste. Trois choses distinguent Granite 4 du reste de l'open-weight. D'abord une architecture hybride Mamba qui réduit fortement la mémoire consommée, surtout en long contexte. Ensuite une licence Apache 2.0 stricte, sans les restrictions d'usage qu'imposent Llama ou Gemma. Enfin un travail de traçabilité et de gouvernance — modèles signés, données d'entraînement documentées, certification ISO 42001 — que les DSI et les services juridiques savent apprécier. C'est un modèle pensé pour passer une revue de conformité, pas seulement un benchmark. i Granite vise l'intégration, pas la conversation Si vous cherchez le meilleur assistant généraliste en français, Qwen3 ou Mistral resteront souvent devant. Granite brille quand il devient un composant : moteur de RAG, orchestrateur d'outils, extracteur de données structurées dans un pipeline. ## #L'architecture hybride Mamba et son gain mémoire ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-granite-4-ibm-local-ollama) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-granite-4-ibm-local-ollama-bundle) → Le vrai argument technique de Granite 4, c'est son architecture. Un transformeur classique repose entièrement sur l'attention : à chaque nouveau token, le modèle relit tout le contexte, et il stocke un « KV cache » qui grossit linéairement avec la longueur de la conversation. Plus le contexte est long, plus la VRAM explose et plus l'inférence ralentit. C'est la limite bien connue des gros contextes en local. Mamba appartient à une autre famille : les modèles à espace d'états (state space models). Au lieu de tout relire, une couche Mamba maintient un état récurrent de taille fixe qui résume le passé. Conséquence : la mémoire ne grandit pas avec la longueur du contexte, et le débit reste stable même sur des documents très longs. Le défaut de Mamba seul, c'est un rappel moins précis des détails éloignés. Granite 4 combine les deux. La majorité des blocs sont des couches Mamba-2 (économes), entrecoupées d'une minorité de blocs d'attention (précis) — un ratio d'environ neuf couches Mamba pour une couche d'attention. On garde ainsi l'essentiel du gain mémoire tout en conservant la capacité de l'attention à retrouver un détail exact. En pratique, Granite 4 tourne dans nettement moins de RAM/VRAM qu'un transformeur de taille comparable, surtout dès que le contexte dépasse quelques milliers de tokens. → Le gain est maximal en long contexte Sur un prompt court, la différence avec un transformeur classique est modeste. Mais chargez un gros document ou une longue conversation et l'écart se creuse : là où un modèle classique sature votre carte, Granite garde une empreinte mémoire quasi plate. ## #Micro, Tiny et Small : quelle variante choisir Granite 4 se décline en plusieurs tailles, avec des suffixes qui indiquent la cible matérielle. Les versions marquées « H » utilisent l'architecture hybride ; une version non hybride est fournie pour les environnements qui ne supportent pas encore Mamba. Granite 4 Micro (~3B, dense) Le plus petit, dense et hybride. Idéal sur CPU, petite VRAM ou en edge. Tient dans ~2 Go en Q4. Parfait pour extraction, classification et RAG léger. Granite 4 Tiny-H (~7B, MoE) Mixture of experts hybride : beaucoup de paramètres totaux mais peu actifs à chaque token, donc rapide. Bon compromis qualité/vitesse sur une carte d'entrée de gamme. Granite 4 Small-H (~32B, MoE) Le haut de gamme accessible : qualité proche des gros modèles pour les tâches métier, tout en gardant l'empreinte mémoire réduite du hybride. Cible station de travail ou serveur. Variante non hybride Une version transformeur classique existe pour les runtimes qui ne gèrent pas encore Mamba. À réserver aux cas de compatibilité — on perd le gain mémoire. Pour débuter, Micro suffit à valider les cas d'usage et tourne partout. Passez à Tiny-H ou Small-H une fois que vous savez ce que vous voulez industrialiser et que vous mesurez un manque de qualité. ## #Prérequis et VRAM Le prérequis logiciel se résume à Ollama installé et à jour — le daemon écoute par défaut sur http://localhost:11434. Assurez-vous d'avoir une version récente : le support des couches Mamba de Granite 4 nécessite un Ollama assez récent, faute de quoi le modèle refusera de se charger. Micro (3B) en Q4 ≈ 2 Go de VRAM. Tourne aussi sur CPU avec 8 Go de RAM, lentement mais sûrement. Une RTX 3060 12GB est très confortable. Tiny-H (7B MoE) en Q4 ≈ 5 Go de VRAM pour les poids, mais l'activation MoE partielle rend l'inférence légère. Une carte 8–12 Go suffit largement. Small-H (32B MoE) en Q4 ≈ 19 Go de VRAM. RTX 4090 24GB ou Mac à mémoire unifiée 32–48 Go. Le hybride limite l'explosion mémoire en long contexte. Marge pour le contexte Grâce à Mamba, le KV cache pèse bien moins lourd qu'un transformeur équivalent : vous pouvez viser de grands contextes sans doubler la VRAM. i Repère quantization Q4_K_M reste le défaut recommandé (meilleur ratio qualité/taille). Montez en Q5_K_M ou Q8_0 si vous avez la marge VRAM et visez la précision maximale sur des tâches d'extraction sensibles. ## #Installer Granite 4 via Ollama L'installation suit le flux Ollama habituel. Le modèle est publié dans la bibliothèque officielle sous le nom granite4 ; les variantes se sélectionnent via des tags. Vérifiez le nom exact des tags sur ollama.com/library avant de tirer une taille précise, car ils évoluent d'une release à l'autre. 1. 01 Vérifier Ollama Confirmez que le daemon tourne et qu'il est à jour. Une version ancienne ne connaît pas les couches Mamba de Granite 4. 2. 02 Tirer le modèle Téléchargez la variante choisie avec ollama pull. Commencez par Micro pour tester rapidement sans saturer votre disque ni votre carte. 3. 03 Lancer un premier chat ollama run ouvre une session interactive. Posez une question métier — résumé d'un texte, extraction de champs — plutôt qu'une devinette généraliste. 4. 04 Brancher une interface Pointez Open WebUI ou LM Studio sur l'endpoint local pour un usage confortable, ou appelez directement l'API HTTP depuis votre application. Terminal — installer et lancer Granite 4 ⧉ Copier ``` `# Vérifier la version d'Ollama (doit être récente) ollama --version # Tirer la variante Micro (la plus légère) ollama pull granite4:micro # Lancer une session interactive ollama run granite4:micro # Vérifier ce qui tourne et la répartition GPU/CPU ollama ps` ``` Pour un usage applicatif, Ollama expose une API OpenAI-compatible sur le même port. Vous pouvez donc réutiliser tout client exista… --- ## Muse Glimmer 30B : le retour de Meta à l'open-weight, en local avec Ollama | QuelLLM.fr URL: https://quelllm.fr/guide/muse-glimmer-30b-meta-installer-ollama-guide published: 2026-09-11 > Sorti le 10 août 2026 sous Apache 2.0, Muse Glimmer 30B (multimodal, optimisé agents) tourne sur un seul GPU 24-32 Go avec le GGUF Q4_K_M officiel… [Accueil](/) / [Guides](/guides) / Modèles / Meta / Muse Glimmer 30B : le retour de Meta à l'open-weight, en local avec Ollama Intermédiaire 12 min Meta # Muse Glimmer 30B : le retour de Meta à l'open-weight, en local avecOllama Meta a surpris tout le monde le 10 août 2026 en publiant Muse Glimmer 30B sous licence Apache 2.0, après deux ans sans sortie open-weight majeure. Le modèle est multimodal, taillé pour les usages agents, et tient sur un seul GPU 24-32 Go grâce au GGUF Q4_K_M distribué officiellement. Ce guide montre comment l'installer avec Ollama dès le jour de sortie, activer le speculative decoding DFlash, et lit les benchmarks annoncés avec le recul qui s'impose. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-12 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-muse-glimmer-30b-meta-installer-ollama-guide) ## #Pourquoi Muse Glimmer 30B Muse Glimmer 30B marque le retour de Meta sur le terrain de l'open-weight. Trois choses en font un modèle intéressant à héberger soi-même : la licence Apache 2.0 (usage commercial sans clause de seuil d'utilisateurs, contrairement aux anciennes licences Llama), le multimodal natif texte + image, et une architecture pensée pour les boucles d'agents — appels d'outils fiables, sorties structurées, et un budget de raisonnement ajustable. Le vrai argument reste la taille. Avec 30 milliards de paramètres et le GGUF Q4_K_M publié par Meta, le modèle tourne sur un seul GPU grand public de 24 à 32 Go. Pas besoin de multi-GPU ni d'offload disque : on est dans la même catégorie d'accessibilité qu'un Qwen 32B, mais avec la vision en plus. Licence Apache 2.0 — usage commercial libre, redistribution et fine-tuning autorisés sans restriction de volume. Modalités Texte et image en entrée, texte en sortie. Pensé pour la lecture de captures d'écran, schémas et documents. Cible Agents et outillage : function calling, JSON strict, contexte long pour les traces d'exécution. Format officiel GGUF Q4_K_M poussé day-0 sur la bibliothèque Ollama, plus un portage MLX pour Apple Silicon. i Multimodal en local : deux fichiers Comme tous les modèles vision sous Ollama, Muse Glimmer se compose du modèle de langage plus un projecteur d'image (mmproj). Ollama gère les deux automatiquement quand vous tirez le tag officiel : vous n'avez rien à assembler à la main. ## #Prérequis et VRAM (24-32 Go) ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-muse-glimmer-30b-meta-insta) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-muse-glimmer-30b-meta-insta-bundle) → Un 30B en Q4_K_M pèse autour de 18-19 Go de poids. Mais avec Muse Glimmer, le projecteur d'image et le cache contexte poussent l'empreinte réelle plus haut — comptez 24 à 32 Go de VRAM pour un usage confortable en multimodal avec un contexte de travail correct. En texte seul et petit contexte, un GPU 24 Go suffit largement. Cible idéale RTX 4090 24 Go ou RTX 5090 32 Go côté NVIDIA — tout en VRAM, aucune bascule sur le CPU. Apple Silicon Mac M4 Pro/Max avec 32 Go de mémoire unifiée ou plus. La mémoire partagée absorbe le modèle et le cache image sans souci. Entrée de gamme Une RTX 4080 16 Go fait tourner le modèle mais déborde en VRAM : une partie des couches passe en RAM, l'inférence ralentit nettement. Logiciel Ollama ≥ 0.6 (support day-0 de l'architecture), pilotes GPU à jour (CUDA côté NVIDIA), 30 Go de disque libre. ! 16 Go, c'est juste Sur un GPU 16 Go, le multimodal fait fréquemment déborder la VRAM dès qu'on envoie une image un peu grande. Si vous êtes limité à 16 Go, restez en texte seul et réduisez le contexte, ou visez plutôt un modèle 14B. ## #Installation Ollama pas-à-pas Si Ollama n'est pas déjà installé, la procédure prend deux minutes. Le daemon écoute par défaut sur http://localhost:11434, et c'est lui qui télécharge et sert le modèle. 1. 01 Installer Ollama Sur Linux, une seule commande. Sur macOS et Windows, téléchargez l'application depuis ollama.com. Vérifiez ensuite que le daemon tourne avec `ollama --version`. 2. 02 Tirer Muse Glimmer 30B Le tag officiel pointe sur le GGUF Q4_K_M. Le téléchargement fait environ 18-19 Go : prévoyez la bande passante et l'espace disque. 3. 03 Premier échange Lancez le modèle en interactif. Au premier démarrage, Ollama charge les poids en VRAM (quelques secondes selon le GPU), puis vous obtenez une invite. 4. 04 Exposer l'API Une fois le modèle tiré, l'endpoint OpenAI-compatible est déjà disponible sur le port 11434. Aucune configuration supplémentaire pour brancher une app ou Open WebUI dessus. Terminal — installer Ollama (Linux) ⧉ Copier ``` `curl -fsSL https://ollama.com/install.sh | sh ollama --version` ``` Terminal — tirer et lancer le modèle ⧉ Copier ``` `# Télécharge le GGUF Q4_K_M officiel (~18-19 Go) ollama pull muse-glimmer:30b # Chat interactif ollama run muse-glimmer:30b` ``` Pour un usage programmatique, l'API REST répond en JSON. Voici un appel minimal en texte seul : Terminal — appel API ⧉ Copier ``` `curl http://localhost:11434/api/chat -d '{ "model": "muse-glimmer:30b", "messages": [ { "role": "user", "content": "Résume en trois points ce que change la licence Apache 2.0 pour un projet commercial." } ], "stream": false }'` ``` → Une interface graphique en prime Si vous préférez une expérience type ChatGPT plutôt que le terminal, branchez Open WebUI sur le même daemon Ollama. Vous y glissez vos images directement dans le chat, ce qui est plus pratique pour tester le multimodal. ## #Utiliser le multimodal L'intérêt de Muse Glimmer, c'est de raisonner sur des images : lire une capture d'écran d'erreur, extraire un tableau d'un scan, décrire un schéma d'architecture. En CLI, il suffit de glisser le chemin de l'image dans le prompt. Terminal — question sur une image ⧉ Copier ``` `ollama run muse-glimmer:30b >>> Décris cette capture et liste les erreurs visibles: ./capture-console.png` ``` Via l'API, on passe l'image encodée en base64 dans le champ `images` du message. C'est le format standard des modèles vision d'Ollama, donc tout client existant fonctionne sans adaptation. Python — vision via l'API ⧉ Copier ``` `import base64, requests with open("schema.png", "rb") as f: img = base64.b64encode(f.read()).decode() resp = requests.post("http://localhost:11434/api/chat", json={ "model": "muse-glimmer:30b", "messages": [{ "role": "user", "content": "Quels composants communiquent avec la base de données ?", "images": [img], }], "stream": False, }) print(resp.json()["message"]["content"])` ``` Pour les usages agents, Muse Glimmer accepte les définitions d'outils au format OpenAI. Vous décrivez vos fonctions dans le champ `tools`, le modèle renvoie un appel structuré que votre code exécute avant de renvoyer le résultat. C'est là que le modèle a été le plus travaillé : peu d'hallucinations d'arguments, JSON valide de manière fiable. ## #Speculative decoding DFlash Meta livre Muse Glimmer avec DFlash, sa méthode de speculative decoding : un petit modèle « brouillon » propose plusieurs tokens d'avance, que le modèle principal valide en un seul passage. Quand les propositions sont bonnes — ce qui est fréquent sur du code et du texte structuré — on génère plusieurs tokens par étape au lieu d'un, d'où un gain de débit sans perte de qualité, la sortie restant identique à un décodage classique. Le principe Un modèle brouillon léger devine la suite, le modèle 30B vérifie en lot et accepte les tokens corrects. Le gain Débit en hausse sur les contenus prévisibles (code, JSON, traces d'agent) ; nul à négatif sur du texte très créatif où les devinettes ratent. Le coût Le modèle brouillon occupe un peu de VRAM en plus — une raison de viser 32 Go si vous voulez DFlash actif… --- ## Qwen 3.8 open weights : chronologie et sortie du 14 août 2026 | QuelLLM.fr URL: https://quelllm.fr/guide/qwen-3-8-open-weights-date-sortie-local published: 2026-09-11 > Chronologie vérifiée de Qwen 3.8 : annonce au WAIC, lancement du Max en API le 3 août 2026, puis publication des poids Qwen3.8-27B le 14 août sous Apache… [Accueil](/) / [Guides](/guides) / Modèles / Actualités / Qwen 3.8 open weights : chronologie et sortie du 14 août 2026 Débutant 8 min Actualités # Qwen 3.8 open weights : chronologie et sortie du 14 août2026 Les poids ouverts de Qwen 3.8 sont sortis : Alibaba a publié Qwen3.8-27B sur Hugging Face le 14 août 2026, sous licence Apache 2.0, avec un tag Ollama officiel dans la foulée. Ce guide retrace la chronologie complète — de l'annonce au WAIC fin juillet au lancement du Qwen 3.8-Max en API le 3 août, puis au drop des poids — et explique la confusion persistante entre le Max, propriétaire et hors de portée du local, et le 27B dense que vous pouvez installer chez vous. Pour l'installation pas à pas, voyez notre guide dédié à Qwen 3.8 27B en local. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-18 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-qwen-3-8-open-weights-date-sortie-local) ## #Le point en une minute Si vous êtes venu chercher un tag Ollama pour Qwen 3.8, il existe depuis le 14 août 2026 : « ollama run qwen3.8:27b ». Ce qu'il faut comprendre avant d'aller plus loin, c'est que la génération 3.8 recouvre deux modèles très différents — un modèle propriétaire géant servi par API, et un modèle dense de 27 milliards de paramètres que vous pouvez télécharger. Qwen 3.8-Max Modèle phare d'Alibaba, MoE d'environ 2 400 milliards de paramètres, contexte 1M. Disponible via l'API Alibaba Cloud depuis le 3 août 2026. Propriétaire, non téléchargeable — ce n'est pas un modèle local. Qwen3.8-27B (open weights) Version dense multimodale publiée le 14 août 2026 sur Hugging Face sous licence Apache 2.0. 262 144 tokens de contexte natif, 18 Go en Q4_K_M, tag Ollama officiel qwen3.8:27b. Ce que vous pouvez faire aujourd'hui Installer directement le 27B sur une carte 24 Go ou un Mac 32 Go. Notre guide d'installation détaille la commande, les quantifications et les réglages. i Guide mis à jour le 18 août 2026 Cet état des lieux a été réécrit après la publication effective des poids. L'écosystème Qwen bouge vite : la page officielle huggingface.co/Qwen et la bibliothèque Ollama restent les seules sources qui font foi sur la disponibilité d'un modèle. ## #Chronologie vérifiée : de WAIC à l'API ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-qwen-3-8-open-weights-date-) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-qwen-3-8-open-weights-date--bundle) → Une bonne partie de la confusion autour de Qwen 3.8 vient d'un télescopage entre une démo de conférence et une sortie produit. Voici la séquence, remise dans l'ordre. 1. 01 Fin juillet 2026 — WAIC (Shanghai) Alibaba présente la génération Qwen 3.8 à la World Artificial Intelligence Conference. C'est là qu'apparaissent les premiers chiffres (contexte 1M, architecture MoE massive) et qu'est évoquée l'intention de publier une variante open-weight. À ce stade, rien n'est téléchargeable : ce sont des annonces. 2. 02 3 août 2026 — Lancement de Qwen 3.8-Max en API Le modèle propriétaire devient accessible via l'API Alibaba Cloud (DashScope) et l'application Qwen. C'est une sortie réelle, mais cloud uniquement. Les benchmarks communiqués datent de ce moment. 3. 03 3 au 13 août 2026 — Attente des poids La communauté attend le Qwen3.8-27B open-weight évoqué au WAIC. Les dépôts habituels (huggingface.co/Qwen, ModelScope) ne reçoivent aucun poids de la génération 3.8 sur cette période, ce qui alimente le doute sur la tenue de l'annonce. 4. 04 14 août 2026 — Publication des poids Qwen3.8-27B Alibaba publie le dépôt Qwen/Qwen3.8-27B sur Hugging Face sous licence Apache 2.0 : modèle dense de 27 milliards de paramètres, vision-langage natif, 262 144 tokens de contexte. La bibliothèque Ollama référence le tag officiel le jour même, avec douze variantes (Q4_K_M, Q8, BF16, builds MLX pour Apple Silicon). Onze jours séparent donc le lancement du Max en API du drop des poids ouverts. i Pourquoi ce décalage est normal Chez Alibaba comme chez d'autres, le modèle « Max » propriétaire sort d'abord en API pour monétiser et cadrer l'usage. Les variantes open-weight, plus petites et denses, arrivent souvent quelques semaines plus tard, une fois la version phare stabilisée. Un délai entre l'annonce WAIC et le drop des poids n'a rien d'anormal. ## #Ce qui est réellement sorti : Qwen 3.8-Max Qwen 3.8-Max est le seul modèle de cette génération réellement disponible aujourd'hui, et il faut être clair : ce n'est pas un modèle que vous ferez tourner chez vous. Sa taille l'exclut du self-hosting grand public, et de toute façon ses poids ne sont pas publiés. Architecture Mixture-of-Experts d'environ 2,4 trillions de paramètres au total, avec une fraction active par token. Impossible à charger sur du matériel grand public, même très haut de gamme. Contexte Fenêtre annoncée à 1 million de tokens, orientée documents longs et bases de code entières. Disponibilité API Alibaba Cloud (DashScope) et application Qwen. Facturation à l'usage, pas de téléchargement de poids. Positionnement Concurrent direct des modèles propriétaires frontières. À comparer avec du cloud, pas avec du local. ! « En local » ne s'applique pas au Max Si un tutoriel prétend installer Qwen 3.8-Max sur un PC avec Ollama, méfiance : un MoE de plusieurs trillions de paramètres ne tient sur aucune machine grand public, et ses poids ne sont pas distribués. Ce qui sera installable en local, c'est la variante dense 27B — quand elle sortira. ## #Open weights : ce qui est promis vs ce qui est livré Le tri est désormais simple : ce qui avait été annoncé au WAIC a bien été livré, avec onze jours de décalage sur le modèle API. Voici le bilan factuel. Promis Un Qwen3.8-27B dense, open-weight, sous licence permissive, pensé pour tenir sur un GPU 24 Go en quantifié. Livré Exactement cela, le 14 août 2026 : poids safetensors sur Hugging Face, licence Apache 2.0, GGUF et builds MLX distribués via Ollama, 18 Go en Q4_K_M — donc bien dans la cible des 24 Go. En prime La vision native (images et vidéos) et un contexte de 262 144 tokens extensible à 1M via YaRN, ce qui n'était pas garanti par les annonces initiales. → Le réflexe anti-hype reste valable Avant de croire qu'un modèle est disponible en local, un test simple : le poids est-il téléchargeable maintenant, avec une commande, sans liste d'attente ? Entre le 3 et le 13 août 2026, Qwen 3.8 échouait à ce test alors que des dizaines d'articles le présentaient déjà comme installable. Depuis le 14 août, il le passe. ## #Le drop du 14 août sur Hugging Face Le meilleur juge de disponibilité reste le dépôt officiel. Voici comment vérifier vous-même, aujourd'hui comme pour la prochaine génération — y compris contre cet article, qui vieillira à son tour. Vérifier via le CLI Hugging Face ⧉ Copier ``` `pip install -U "huggingface_hub[cli]" # Lister les dépôts de l'organisation Qwen contenant "3.8" huggingface-cli repo list Qwen --limit 200 | grep -i "3.8" # Depuis le 14/08/2026, la commande renvoie bien Qwen/Qwen3.8-27B` ``` Le dépôt officiel est Qwen/Qwen3.8-27B. Sa carte de modèle annonce 27 milliards de paramètres, 64 couches, une attention hybride, la vision native et la licence Apache 2.0. Côté Ollama, douze variantes sont publiées, du Q4_K_M de 18 Go au BF16 de 56 Go. Vérifier côté Ollama ⧉ Copier ``` `# Depuis le 14 août 2026, le tag officiel existe : ollama pull qwen3.8:27b # 18 Go (Q4_K_M) # Variante Apple Silicon (Metal) ollama pull qwen3.8:27b-mlx` ``` ## #Faut-il quitter Qwen 3.6 ? Si vous tournez déjà sur Qwen 3.6-27B, la question n'est plus « quoi installer en attendant » mais « la mise à jour vaut-elle le téléchargement ». Réponse courte : oui, à empreinte mémoire équivalente — mais gardez… --- ## Qwythos 9B : le petit modèle de raisonnement entraîné sur Claude, testé en local | QuelLLM.fr URL: https://quelllm.fr/guide/qwythos-9b-test-ollama-modele-raisonnement published: 2026-09-11 > Qwythos-9B (Empero AI, juin 2026) : base Qwen3.5-9B, Apache 2.0, contexte 1M, entraîné sur des traces de raisonnement Claude Mythos — d'où le nom. GGUF sur… [Accueil](/) / [Guides](/guides) / Modèles / Communauté / Qwythos 9B : le petit modèle de raisonnement entraîné sur Claude, testé en local Intermédiaire 10 min Communauté # Qwythos 9B : le petit modèle de raisonnement entraîné sur Claude, testé enlocal Qwythos-9B est un modèle communautaire publié par Empero AI en juin 2026 : une base Qwen3.5-9B sous licence Apache 2.0, contexte 1M, fine-tunée sur des traces de raisonnement générées par Claude — d'où le mot-valise « Qwythos » (Qwen + Mythos). Il n'y a pas de page marketing léchée derrière : juste des poids GGUF sur Hugging Face et des tags Ollama poussés par la communauté. Ce guide fait le tri sur son origine, montre comment l'installer proprement, et le confronte en test réel à sa base Qwen3.5-9B sur une RTX 5070 Ti. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-21 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-qwythos-9b-test-ollama-modele-raisonnement) ## #Qwythos, c'est quoi au juste Qwythos-9B n'est pas un modèle « from scratch ». C'est un fine-tune : quelqu'un a pris une base ouverte solide — Qwen3.5-9B d'Alibaba — et l'a ré-entraînée sur un corpus spécifique de traces de raisonnement. Ces traces (des chaînes de pensée détaillées, question → réflexion étape par étape → réponse) proviendraient de sorties de Claude, la famille de modèles d'Anthropic, sur un jeu de problèmes de logique, de maths et de code. Le nom « Qwythos » condense l'idée : la lettre initiale de Qwen, et « Mythos », nom informel donné au style de raisonnement de Claude par la communauté qui a assemblé le dataset. L'intérêt du projet tient en une phrase : distiller un style de raisonnement verbeux et structuré dans un modèle assez petit pour tourner sur un GPU grand public. Un 9B se loge dans 6 Go de VRAM en Q4, là où les gros modèles de raisonnement demandent des dizaines de Go. Si le transfert de « manière de réfléchir » fonctionne, on obtient un raisonneur de poche. C'est exactement ce qu'on va vérifier. i Modèle communautaire, pas produit officiel Qwythos n'est ni un modèle Alibaba ni un modèle Anthropic. C'est un fine-tune communautaire distribué par Empero AI. Aucune des deux entreprises d'origine ne le maintient ni ne le cautionne. Traitez-le comme un projet open source : les poids sont là, la qualité est à vérifier, le support tient à la bonne volonté de ses auteurs. ## #Origine de Qwythos : les deux sources à connaître ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-qwythos-9b-test-ollama-mode) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-qwythos-9b-test-ollama-mode-bundle) → Avant d'installer quoi que ce soit, il faut comprendre d'où viennent réellement les poids. Pour un modèle communautaire, la provenance n'est pas un détail : elle conditionne la confiance que vous pouvez accorder au fichier que vous téléchargez. Qwythos se trouve à deux endroits, et les deux ne se valent pas. Source 1 — Hugging Face (dépôt d'origine) Empero AI publie les poids sur Hugging Face, à la fois en format transformers (safetensors) et en GGUF quantifié. C'est la source de vérité : carte de modèle, licence Apache 2.0 affichée, mention de la base Qwen3.5-9B et du dataset de traces de raisonnement. Partez toujours de là pour vérifier le hash et lire la carte. Source 2 — Tags Ollama communautaires Sur le registre Ollama, Qwythos apparaît sous des espaces de noms d'utilisateurs (du type nom-utilisateur/qwythos), pas dans la bibliothèque officielle. Ces tags sont pratiques — une seule commande pour installer — mais ils sont ré-empaquetés par des tiers depuis les GGUF Hugging Face. Vérifiez qui publie le tag avant de lui faire confiance. ! Un tag Ollama n'est pas signé N'importe qui peut pousser un modèle sur le registre Ollama sous son propre nom. Un tag « qwythos » ne garantit pas que le GGUF derrière correspond aux poids officiels d'Empero AI. Pour un usage sérieux, préférez télécharger le GGUF depuis Hugging Face et l'importer vous-même via un Modelfile (voir plus bas), plutôt que de tirer un tag communautaire à l'aveugle. Base Qwen3.5-9B (Alibaba), licence Apache 2.0 Type Fine-tune de raisonnement, chaîne de pensée explicite Éditeur Empero AI (communautaire), publication juin 2026 Licence Apache 2.0 — usage commercial autorisé, héritée de la base Contexte 1M de tokens annoncé (hérité de Qwen3.5), à tempérer selon la VRAM réelle Formats safetensors + GGUF (Q4_K_M, Q5_K_M, Q8_0) sur Hugging Face ## #Prérequis matériel Un modèle de 9 milliards de paramètres est confortable pour du matériel récent. En quantification Q4_K_M — le compromis qualité/mémoire recommandé — Qwythos-9B occupe environ 6 Go de VRAM une fois chargé, auxquels s'ajoute le cache de contexte (KV cache) qui grossit avec la longueur des prompts. Notre banc de test tourne sur une RTX 5070 Ti (16 Go), largement au-dessus du minimum. Q4_K_M (recommandé) ≈ 6 Go de VRAM. Tient sur une RTX 3060 12 Go, une 4070, une 5070 Ti — et même en partie sur 8 Go avec un contexte modeste. Q5_K_M ≈ 7 Go. Léger gain de qualité, à privilégier si vous avez 12 Go ou plus. Q8_0 ≈ 10 Go. Quasi sans perte face au FP16, pertinent sur 16 Go et au-delà. Contexte long Le 1M annoncé est théorique. Un KV cache pour 128k tokens ajoute déjà plusieurs Go ; visez 16 Go+ de VRAM pour dépasser confortablement 32k. → Un modèle de raisonnement génère beaucoup Les modèles de raisonnement « pensent » à voix haute avant de répondre : ils produisent parfois plusieurs centaines de tokens de réflexion pour une réponse d'une ligne. Prévoyez de la marge sur le contexte de sortie (num_predict) et attendez-vous à des temps de réponse plus longs qu'un modèle classique de même taille. ## #Installer Qwythos avec Ollama Deux voies. La rapide : tirer un tag communautaire. La sûre : télécharger le GGUF officiel depuis Hugging Face et l'importer via un Modelfile. Je détaille les deux ; pour un poste de travail sérieux, la seconde est préférable car vous savez exactement quel fichier vous exécutez. 1. 01 Vérifier qu'Ollama tourne Ollama expose son daemon sur http://localhost:11434. Un simple appel confirme qu'il répond avant d'aller plus loin. Si vous ne l'avez pas encore installé, reportez-vous au guide d'installation Ollama. 2. 02 Voie rapide — tag communautaire Repérez le tag sur ollama.com (espace de noms utilisateur), puis lancez ollama run. Notez le nom exact du publieur : c'est votre seule garantie de provenance. 3. 03 Voie sûre — GGUF depuis Hugging Face Téléchargez le fichier .gguf en Q4_K_M depuis le dépôt Empero AI, vérifiez son empreinte SHA256 contre celle affichée sur la carte du modèle, puis créez un Modelfile qui pointe dessus. 4. 04 Créer le modèle local Un ollama create construit un modèle nommé à partir de votre Modelfile. Vous obtenez un tag local que vous contrôlez de bout en bout. 5. 05 Lancer et discuter ollama run démarre la session interactive. Le premier chargement met le modèle en VRAM ; les suivants sont instantanés tant qu'il reste résident. Terminal — vérifier Ollama ⧉ Copier ``` `curl http://localhost:11434/api/version # {"version":"0.x.x"}` ``` Terminal — voie rapide (tag communautaire) ⧉ Copier ``` `# Remplacez par le nom réel du dépôt Ollama ollama run /qwythos:9b-q4_k_m` ``` Terminal — voie sûre (GGUF Hugging Face) ⧉ Copier ``` `# 1. Télécharger le GGUF officiel depuis le dépôt Empero AI huggingface-cli download EmperoAI/Qwythos-9B-GGUF \ qwythos-9b-Q4_K_M.gguf --local-dir ./qwythos # 2. Vérifier l'empreinte contre celle de la carte du modèle sha256sum ./qwythos/qwythos-9b-Q4_K_M.gguf` ``` Modelfile — qwythos.Modelfile ⧉ Copier ``` `FROM ./qwythos/qwythos-9b-Q4_K_M.gguf PARAMETER temperature 0.6 PARAMETER top_p 0.9… --- ## LM Studio pour débutants : premier chat local en 10 minutes | QuelLLM.fr URL: https://quelllm.fr/guide/demarrer-avec-lm-studio published: 2026-09-11 > Votre premier LLM local avec LM Studio : installer, télécharger un modèle et discuter en 10 minutes. Zéro ligne de commande, idéal débutants. [Accueil](/) / [Guides](/guides) / Installation / LM Studio / LM Studio pour débutants : premier chat local en 10 minutes Débutant 5 min LM Studio # LM Studio pour débutants : premier chat local en 10minutes LM Studio est la solution la plus proche de ChatGPT pour l'IA locale : une application graphique, un store intégré pour chercher et télécharger des modèles, un chat qui ressemble à ce que vous connaissez. Zéro ligne de commande. Parfait pour démarrer sans terminal. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-demarrer-avec-lm-studio) ## #Qu'est-ce que LM Studio ? Une application desktop (Windows, macOS, Linux) qui empaquette quatre choses en une seule interface : un navigateur de modèles connecté à Hugging Face, un gestionnaire de téléchargements, un moteur d'inférence (llama.cpp sous le capot), et un chat. L'outil est gratuit pour un usage personnel. Pour un usage commercial en entreprise, une licence est requise depuis la version 0.3. i LM Studio vs Ollama Ollama est CLI-first, optimisé pour scripts et API. LM Studio est GUI-first, optimisé pour explorer. Les deux sont légitimes — beaucoup d'utilisateurs avancés ont les deux installés. ## #1. Installation ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-demarrer-avec-lm-studio) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-demarrer-avec-lm-studio-bundle) → Site officiel ⧉ Copier ``` `https://lmstudio.ai` ``` 1. 01 Choisissez votre plateforme Windows .exe, macOS .dmg (Apple Silicon ou Intel), Linux .AppImage. Les binaires font entre 400 et 600 Mo — normal, llama.cpp et ses dépendances sont dedans. 2. 02 Lancez l'installateur Sur Windows, l'install se fait dans %LOCALAPPDATA% (pas de droits admin requis). Sur Mac, glissez vers Applications. Sur Linux, rendez le AppImage exécutable : chmod +x LM_Studio_*.AppImage. 3. 03 Premier lancement LM Studio vous demande quel niveau d'interface afficher (Power user ou Developer). Power user suffit amplement pour débuter — vous pourrez basculer plus tard. ## #2. Tour du propriétaire La sidebar de gauche contient les 5 vues essentielles : 💬 Chat L'interface de conversation principale. Ressemble à ChatGPT. 🔍 Discover Le "store" de modèles. Recherche en direct sur Hugging Face, téléchargement en un clic. 📁 My Models Tous les modèles que vous avez téléchargés, avec leur taille et leurs quantizations. 💻 Developer Le mode serveur local OpenAI-compatible (voir plus bas). ⚙️ Settings Paramètres globaux : dossier de modèles, thème, intégrations. ## #3. Télécharger votre premier modèle Cliquez sur 🔍 Discover. La barre de recherche cherche directement sur Hugging Face. Pour un premier essai en 2026, tapez Qwen 3.5 9B — le meilleur choix pour 8 Go de VRAM (256k de contexte, vision, licence Apache 2.0). 1. 01 Regardez les tags de compatibilité À droite de chaque résultat, LM Studio indique Full GPU Offload possible, Partial GPU Offload, ou Likely too large. C'est basé sur votre matériel détecté — il suffit de choisir un vert. 2. 02 Choisissez la bonne quantization Pour un 9B comme Qwen 3.5 9B sur 8 Go de VRAM : Q4_K_M est le sweet spot. Pour 12 Go+ : Q5_K_M ou Q6_K (voire le Q8_0 du 9B). Pour 16 Go+ : Q8_0 pour le maximum de qualité. 3. 03 Cliquez Download Entre 4 et 8 Go selon la quantization. LM Studio affiche la progression en direct. → Le tag "GGUF" LM Studio ne sait lire que le format GGUF (successeur de GGML). Si un modèle apparaît sans variante GGUF, il faut le convertir soi-même ou l'éviter. ## #4. Première conversation 1. 01 Retournez à l'onglet Chat En haut, cliquez sur le sélecteur "Select a model to load" et choisissez le modèle que vous venez de télécharger. 2. 02 Ajustez le GPU offload LM Studio propose un slider : 0 = tout en CPU (lent mais marche toujours), max = tout en GPU (rapide mais crash si VRAM insuffisante). Mettez le curseur au maximum proposé par défaut. 3. 03 Cliquez Load model Le chargement prend 5 à 30 secondes selon la taille du modèle et la vitesse de votre disque. 4. 04 Tapez votre question Dans le champ en bas. Entrée pour envoyer. Le modèle répond en streaming, token par token. ## #5. Régler la qualité des réponses Panneau de droite pendant une conversation. Trois réglages suffisent à changer 90 % du comportement : Temperature 0.2 = factuel, déterministe. 0.7 = équilibré (défaut). 1.2 = créatif, parfois erratique. Remonte si le modèle est trop répétitif. Context Length Combien de tokens le modèle "voit" en arrière. 4096 par défaut. Augmentez à 8192 ou 16384 pour de longs documents — attention, ça consomme de la VRAM. System Prompt Le message invisible qui donne le rôle et les règles. Ex : "Tu es un assistant juridique français. Réponds en citant toujours l'article de loi applicable." ! Les presets trompeurs LM Studio embarque plusieurs "presets" (Creative, Balanced, Precise). Ils modifient plusieurs réglages d'un coup. Pratique, mais lisez ce que chacun change avant de les appliquer en aveugle. ## #6. Mode serveur local (API) LM Studio expose un serveur HTTP compatible avec l'API OpenAI. N'importe quel outil qui sait parler à ChatGPT peut donc tourner en local. 1. 01 Onglet Developer Sélectionnez un modèle et cliquez Start Server (par défaut sur le port 1234). 2. 02 Testez avec curl Depuis un terminal, un simple GET vérifie que le serveur répond. Vérification ⧉ Copier ``` `curl http://localhost:1234/v1/models` ``` Chat minimal ⧉ Copier ``` `curl http://localhost:1234/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "local-model", "messages": [{"role":"user","content":"Bonjour"}] }'` ``` Dans vos scripts Python, il suffit de changer base_url vers http://localhost:1234/v1 et n'importe quelle clé API fictive. Tout ce qui marche avec OpenAI marche. ## #Limites à connaître Pas totalement open source L'app elle-même est propriétaire, seul le moteur llama.cpp derrière est open source. Pour du 100 % libre, préférez Jan ou Ollama. Mises à jour automatiques LM Studio se met à jour tout seul. Pratique mais inattendu en environnement pro contrôlé. Licence commerciale payante Pour un usage entreprise, lire les conditions. L'usage personnel et éducatif reste gratuit. Pas de scripting natif Contrairement à Ollama, il n'y a pas de CLI. Les automatisations passent uniquement par le serveur API. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Premiers pas · 11 min ### Ollama vs LM Studio : lequel choisir en 2026 ? Lire →](/guide/ollama-vs-lm-studio) [Outils · 12 min ### LM Studio Bionic : l'agent local, installation et test (2026) Lire →](/guide/lm-studio-bionic-agent-local-guide) [Premiers pas · 9 min ### Meilleure IA locale gratuite : top 2026, même sans GPU Lire →](/guide/ia-locale-gratuite) [Premiers pas · 9 min ### Comprendre les quantizations Lire →](/guide/choisir-quantification-q4-q5-q8) --- ## Transformer LM Studio en serveur API OpenAI (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/lm-studio-serveur-api published: 2026-09-11 > Transformez LM Studio en serveur API compatible OpenAI : configuration pas à pas, endpoints, accès depuis vos apps et le reste de votre réseau local. [Accueil](/) / [Guides](/guides) / Installation / LM Studio / Transformer LM Studio en serveur API OpenAI (2026) Intermédiaire 8 min LM Studio # Transformer LM Studio en serveur API OpenAI(2026) LM Studio n'est pas qu'un chat graphique. Son onglet Developer expose une API OpenAI-compatible qui permet de brancher n'importe quel outil — Continue.dev, LangChain, vos scripts internes — sur un modèle local. Ce guide montre comment transformer votre poste LM Studio en serveur LLM privé pour l'équipe. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-lm-studio-serveur-api) ## #Objectif de ce guide À la fin, vous aurez un endpoint http://localhost:1234/v1 (ou accessible depuis votre LAN) qui parle le protocole OpenAI. N'importe quel SDK (openai-python, LangChain, llamaindex, Continue) pourra taper dessus sans une ligne de code changée. ## #1. Activer le serveur ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-lm-studio-serveur-api) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-lm-studio-serveur-api-bundle) → 1. 01 Ouvrez l'onglet Developer Icône en forme de terminal dans la sidebar gauche. Si elle n'apparaît pas, basculez l'interface en mode Developer via Settings → UI Mode. 2. 02 Sélectionnez un modèle Menu déroulant en haut. Le modèle doit être déjà téléchargé (voir onglet My Models). 3. 03 Ajustez les réglages Context Length, GPU offload, Flash Attention si disponible. Réglages par défaut OK pour démarrer. 4. 04 Cliquez Start Server Le serveur écoute sur localhost:1234 par défaut. Le port est configurable juste à côté. → Logs en direct Dans la même vue, un onglet Server Logs montre chaque requête entrante. Très utile pour debugger une intégration. ## #2. Tester avec curl Liste des modèles ⧉ Copier ``` `curl http://localhost:1234/v1/models` ``` Complétion chat ⧉ Copier ``` `curl http://localhost:1234/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model": "local-model", "messages": [ {"role":"system","content":"Tu es concis."}, {"role":"user","content":"Capitale du Portugal ?"} ], "temperature": 0.2 }'` ``` Vous devriez recevoir un JSON standard OpenAI : choices[0].message.content contient la réponse. ## #3. Appeler depuis Python Via le SDK openai ⧉ Copier ``` `from openai import OpenAI client = OpenAI( base_url="http://localhost:1234/v1", api_key="lm-studio", # n'importe quelle chaîne ) resp = client.chat.completions.create( model="local-model", messages=[ {"role": "system", "content": "Réponds en 1 phrase."}, {"role": "user", "content": "Qu'est-ce qu'un LLM ?"}, ], temperature=0.3, stream=True, ) for chunk in resp: delta = chunk.choices[0].delta.content or "" print(delta, end="", flush=True)` ``` i Streaming gratuit stream=True fonctionne exactement comme chez OpenAI. Aucun changement côté client pour afficher les tokens en direct. ## #4. Plusieurs modèles en parallèle LM Studio 0.3+ peut charger plusieurs modèles simultanément. Chacun répond via son propre nom (qu'on sélectionne via le champ model de la requête). Requête multi-modèle ⧉ Copier ``` `curl http://localhost:1234/v1/chat/completions \ -d '{"model":"qwen3.5-9b","messages":[...]}' curl http://localhost:1234/v1/chat/completions \ -d '{"model":"granite-4.2-8b","messages":[...]}'` ``` ! Attention à la VRAM Deux modèles de 8-9B (Qwen 3.5 9B ~6,6 Go + Granite 4.2 8B ~5,3 Go) chargés simultanément consomment ~12 Go de VRAM. Surveillez via l'onglet Hardware de LM Studio. ## #5. Exposer sur le réseau Dans les settings du serveur, le champ Host accepte 0.0.0.0 pour écouter sur toutes les interfaces réseau. Depuis un autre poste du LAN : Client distant ⧉ Copier ``` `curl http://192.168.1.42:1234/v1/models` ``` ! Zéro auth native LM Studio n'a pas d'authentification. Tout qui atteint le port peut utiliser votre modèle. Mettez Caddy ou Nginx avec basic auth devant, ou restreignez au LAN via firewall. ## #6. Performance et tuning GPU offload max Slider à fond à droite tant que la VRAM suit. Un modèle 8-9B Q4 (Qwen 3.5 9B, Granite 4.2 8B) doit tenir entier en VRAM. Flash Attention Activez si disponible (coche dans les réglages du modèle). +15 à 30 % de throughput, moins de VRAM consommée par le contexte. Context Length Mettre la valeur dont vous avez besoin, pas plus. Un contexte 32k coûte beaucoup plus de VRAM qu'un 8k. n_batch Visible en mode Developer. 512 par défaut. 1024 accélère les longs prompts. Au-delà, gains marginaux. ## #Limites et alternatives Pas de cluster LM Studio tourne sur un poste. Pour répartir la charge sur plusieurs machines, vLLM ou un load balancer devant plusieurs instances. Pas de queue Si 10 requêtes arrivent en même temps, elles sont traitées en séquence. Pour du throughput, vLLM est 5-10x plus rapide en batching. Licence commerciale Usage entreprise = licence payante. Ollama ou vLLM restent gratuits. Mises à jour auto Peuvent casser un workflow en prod. En environnement contrôlé, désactivez-les via Settings. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 9 min ### LM Studio Linux : installer sur Ubuntu, Debian, Arch, Fedora (2026) Lire →](/guide/lm-studio-linux-installation-guide) [Installation · 20 min ### Déployer vLLM en production Lire →](/guide/deployer-vllm-production) [Outils · 9 min ### MTP LM Studio : activer la Multi-Token Prediction et mesurer le gain Lire →](/guide/lm-studio-mtp-multi-token-prediction) [Comparatif · 8 min ### Ollama vs LM Studio vs Jan Lire →](/guide/ollama-vs-lmstudio-vs-jan) --- ## LM Studio Linux : installer sur Ubuntu, Debian, Arch, Fedora (2026) | QuelLLM.fr URL: https://quelllm.fr/guide/lm-studio-linux-installation-guide published: 2026-09-11 > Installer LM Studio sur Linux (AppImage), charger un modèle GGUF, lancer le serveur local OpenAI-compatible, et brancher une app dessus. Spécificités Linux… [Accueil](/) / [Guides](/guides) / Installation / Interfaces / LM Studio Linux : installer sur Ubuntu, Debian, Arch, Fedora (2026) Débutant 9 min Interfaces # LM Studio Linux : installer sur Ubuntu, Debian, Arch, Fedora(2026) LM Studio sur Linux, c'est une AppImage de ~600 Mo qui empaquette une interface graphique, un store de modèles connecté à Hugging Face, un moteur d'inférence llama.cpp et un serveur OpenAI-compatible. Pas d'installation système, pas de daemon, pas de dépôt à ajouter — un fichier exécutable, et c'est tout. Ce guide couvre l'installation, le téléchargement d'un GGUF, le démarrage du serveur local et les pièges propres à Linux (permissions, FUSE, GPU). Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Ubuntu 24.04 [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-lm-studio-linux-installation-guide) i En bref LM Studio sur Linux est une AppImage d'environ 600 Mo : pas d'installation système, pas de daemon, un seul fichier exécutable. · Trois étapes suffisent : télécharger le fichier, le rendre exécutable (chmod +x), puis le lancer. · Prérequis : une distribution récente avec glibc 2.35+, et le paquet libfuse2 sur Ubuntu 22.04 et plus. · L'AppImage détecte automatiquement le GPU (CUDA, ROCm ou Vulkan selon votre carte) pour accélérer l'inférence. ## #Pourquoi LM Studio sur Linux Sur Linux, le réflexe pour un LLM local est Ollama : daemon systemd, CLI propre, écoute par défaut sur localhost:11434. C'est excellent pour le serveur. LM Studio attaque un autre angle — celui du poste de travail graphique. Une interface complète sans terminal Chat, navigateur de modèles Hugging Face, gestionnaire de téléchargements, réglages de sampling : tout en GUI. Utile si vous voulez tester rapidement plusieurs modèles avant de passer en prod. Un serveur OpenAI-compatible en un clic L'onglet Developer expose un endpoint http://localhost:1234/v1 qui parle le protocole OpenAI. N'importe quel SDK (openai-python, LangChain, Continue.dev) tape dessus sans changer une ligne. Zéro installation système L'AppImage tourne en espace utilisateur. Pas de sudo, pas de paquet à installer, pas de dépôt tiers. Pour les machines verrouillées par la DSI ou les distributions atypiques, c'est précieux. Format GGUF natif LM Studio lit uniquement le GGUF (le format de llama.cpp). C'est le même format que celui utilisé par Ollama sous le capot, donc 100 % des modèles populaires sont disponibles. i LM Studio et Ollama coexistent très bien Rien n'empêche d'avoir les deux. Ollama en daemon pour vos scripts et vos intégrations, LM Studio pour le chat interactif et la découverte de nouveaux modèles. Ils n'utilisent pas les mêmes ports (11434 vs 1234) et ne se gênent pas. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-lm-studio-linux-installatio) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-lm-studio-linux-installatio-bundle) → Distribution Linux récente Ubuntu 22.04+, Fedora 38+, Debian 12+, Arch ou dérivés. LM Studio est testé sur les principales distros, mais l'AppImage est portable et fonctionne ailleurs (openSUSE, Linux Mint, Pop!_OS). glibc 2.35+ L'AppImage embarque ses dépendances graphiques mais pas la glibc. Si vous êtes sur une distribution très ancienne (CentOS 7, Debian 10), ça ne tournera pas. FUSE Les AppImage utilisent FUSE pour se monter en lecture. La plupart des distros l'installent par défaut. Sur Ubuntu 22.04+, vous aurez besoin du paquet libfuse2 explicitement. 8 Go de RAM minimum Pour faire tourner un modèle 7B en Q4. 16 Go pour être confortable, 32 Go+ pour les 14B ou pour garder votre IDE ouvert à côté. GPU (optionnel mais conseillé) NVIDIA avec drivers récents (CUDA 12+), AMD avec ROCm 6.x, ou Intel Arc via Vulkan. Sans GPU, ça tourne en CPU — fonctionnel pour des 3B, lent pour des 7B. ! Ubuntu 22.04 et FUSE Ubuntu 22.04 a abandonné libfuse2 par défaut, ce qui casse beaucoup d'AppImage avec un message obscur du type "dlopen(): error loading libfuse.so.2". Installez le paquet avec sudo apt install libfuse2 avant de lancer LM Studio. ## #1. Récupérer l'AppImage Le site officiel détecte automatiquement votre OS et propose la bonne version. Vérifiez que vous téléchargez bien depuis lmstudio.ai — il existe des miroirs douteux. Site officiel ⧉ Copier ``` `https://lmstudio.ai` ``` 1. 01 Téléchargez le fichier .AppImage Le binaire fait entre 500 et 700 Mo. Il embarque llama.cpp, l'UI Electron et tout le runtime. Rangez-le dans ~/Applications/ ou ~/.local/bin/ par convention — n'importe où en réalité, l'AppImage est self-contained. 2. 02 Rendez-le exécutable Avec la commande chmod +x. Sans ça, le fichier est juste une archive inerte. 3. 03 Lancez-le Double-clic depuis votre file manager, ou en ligne de commande. Au premier lancement, LM Studio extrait son contenu dans ~/.cache/AppImage/ — c'est normal, et ça ne se reproduit qu'à chaque mise à jour. Installation rapide en CLI ⧉ Copier ``` `mkdir -p ~/Applications cd ~/Applications # Remplacez le nom par celui du fichier téléchargé chmod +x LM_Studio-*.AppImage ./LM_Studio-*.AppImage` ``` → Intégrer LM Studio au menu d'applications Installez appimaged ou AppImageLauncher : ces outils détectent automatiquement les AppImage dans ~/Applications/ et créent les entrées .desktop pour les voir dans votre menu, comme une appli native. AppImageLauncher gère même les mises à jour. ## #2. Premier lancement Au premier démarrage, LM Studio demande de choisir un niveau d'interface : User (chat seulement), Power User (chat + réglages), Developer (tout, y compris le serveur). Power User suffit pour explorer ; vous pourrez passer en Developer pour le serveur local plus tard, depuis Settings → UI Mode. La sidebar de gauche organise les vues : Chat L'interface principale, type ChatGPT. C'est ce que vous utiliserez 90 % du temps. Discover Le store de modèles. Recherche en direct sur Hugging Face, avec un indicateur de compatibilité matérielle (Full GPU Offload / Partial / Likely too large) basé sur votre VRAM détectée. My Models Tous vos modèles téléchargés, avec leur taille et leurs quantizations. Utile pour faire le ménage. Developer Le serveur local OpenAI-compatible. Visible uniquement en mode Power User ou Developer. ## #3. Télécharger un modèle GGUF LM Studio ne lit que le format GGUF (le format binaire de llama.cpp, successeur de GGML). Si un modèle existe sur Hugging Face mais pas en GGUF, vous ne pourrez pas le charger directement. La grande majorité des modèles populaires (Qwen 3.5, Gemma 4, Mistral, Granite 4.2, DeepSeek, gpt-oss) ont des versions GGUF maintenues par la communauté. 1. 01 Ouvrez Discover et cherchez un modèle Pour un premier essai, tapez Qwen 3.5 9B ou Granite 4.2 8B — les valeurs sûres 2026 de la tranche 6-8 Go de VRAM. LM Studio liste les variantes GGUF disponibles, généralement publiées par bartowski, unsloth ou lmstudio-community. 2. 02 Lisez les tags de compatibilité À droite de chaque variante, un indicateur vert/orange/rouge : Full GPU Offload signifie que le modèle tient entier dans votre VRAM. Partial = une partie ira en RAM (plus lent). Likely too large = oubliez. 3. 03 Choisissez la quantization Q4_K_M est le sweet spot pour la majorité des cas (faible perte de qualité, ~50 % de la taille FP16). Q5_K_M si vous avez 30-40 % de VRAM en plus. Q8_0 pour la qualité maximale si vous avez largement de la place. FP16 seulement pour le fine-tuning ou la comparaison. 4. 04 Cliquez Download Entre 4 et 8 Go pour un 7B selon la quantization. Le téléchargement se fait en arrière-plan, vous pouvez en lancer plusieurs en parallèle. → Où sont stockés les modèles Par défaut, LM Studio place les modèles dans ~/.cache/lm-studio/models/. Sur Linux, ce dossier peut gr… --- ## Compiler llama.cpp avec CUDA | QuelLLM.fr URL: https://quelllm.fr/guide/compiler-llama-cpp-cuda published: 2026-09-11 > Build from source pour le maximum de tokens/sec sur NVIDIA. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / llama.cpp / Compiler llama.cpp avec CUDA Avancé 15 min llama.cpp # Compiler llama.cpp avecCUDA Ollama et LM Studio encapsulent llama.cpp — mais en restent souvent 1 ou 2 versions en retard, avec des flags conservateurs. Compiler llama.cpp soi-même, c'est récupérer 20 à 40 % de vitesse sur un RTX récent et avoir accès aux features qui viennent juste de sortir. Ce guide couvre Windows, Linux et le build CUDA. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-03-05 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-compiler-llama-cpp-cuda) ## #Pourquoi compiler soi-même Features en avant-première Nouvelles quantizations (IQ4_NL, Q2_K_S), nouveaux modèles (Mamba, DeepSeek), flags expérimentaux. Perfs optimales Build optimisé pour votre CPU spécifique (AVX-512, AMX) et votre génération CUDA (sm_89 pour RTX 40, sm_90 pour RTX 50). Outils bas niveau llama-bench pour benchmarker, llama-cli pour scripter, llama-server pour un endpoint nu (sans UI ni dépendances). i Qui devrait compiler ? Si vous êtes dev, curieux de perfs, ou si vous travaillez sur du Mamba/Jamba non pris en charge par Ollama : oui. Sinon, Ollama fait 95 % du boulot sans compilation. ## #Prérequis CUDA Toolkit 12.x Téléchargeable sur developer.nvidia.com. Pas confondre avec les drivers — le Toolkit inclut nvcc, le compilateur. CMake 3.21+ apt install cmake sur Linux, via chocolatey sur Windows. Compilateur C++ gcc 11+ sur Linux, MSVC 2022 Build Tools sur Windows. Git Pour cloner et mettre à jour. ## #1. Cloner le repo Terminal ⧉ Copier ``` `git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp` ``` ## #2. Build avec CUDA Linux / macOS ⧉ Copier ``` `cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j $(nproc)` ``` Windows (PowerShell) ⧉ Copier ``` `cmake -B build -DGGML_CUDA=ON -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j` ``` La compilation prend 3 à 10 minutes selon votre CPU. Les binaires atterrissent dans build/bin/ (Linux) ou build/bin/Release/ (Windows). ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-compiler-llama-cpp-cuda) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-compiler-llama-cpp-cuda-bundle) → → Build optimisé pour votre GPU Ajoutez -DCMAKE_CUDA_ARCHITECTURES=89 pour cibler uniquement RTX 40 (ou 90 pour RTX 50). Le binaire est plus petit et le build plus rapide. ## #3. Tester Téléchargement d'un GGUF ⧉ Copier ``` `# Via Hugging Face CLI pip install huggingface_hub huggingface-cli download \ TheBloke/Mistral-7B-Instruct-v0.2-GGUF \ mistral-7b-instruct-v0.2.Q4_K_M.gguf \ --local-dir ./models` ``` Inférence ⧉ Copier ``` `./build/bin/llama-cli \ -m ./models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \ -p "Explique ce qu'est un LLM en 3 phrases." \ -n 256 \ -ngl 99 # nombre de couches sur GPU` ``` Serveur HTTP compatible OpenAI ⧉ Copier ``` `./build/bin/llama-server \ -m ./models/mistral-7b-instruct-v0.2.Q4_K_M.gguf \ --port 8080 \ -ngl 99 \ -c 8192` ``` ## #4. Flags d'optimisation -ngl N Nombre de couches chargées sur GPU. Mettez 99 (ou plus) pour tout mettre si la VRAM suit. -fa Flash Attention. +20-30 % de vitesse, VRAM contexte réduite. Activez toujours si votre GPU est Ampere+ (RTX 30xx et +). -c N Context length. Ne mettez pas plus que nécessaire : le KV cache mange la VRAM. -b N / -ub N Batch size et micro-batch. 512/512 par défaut. 1024/512 pour accélérer le prompt processing. --no-mmap Désactive le mmap. À tester si le chargement initial est lent sur certains SSD. ## #5. Se tenir à jour Update ⧉ Copier ``` `cd llama.cpp git pull cmake --build build --config Release -j` ``` llama.cpp sort plusieurs commits par jour. Un git pull hebdomadaire est un bon rythme. En cas de régression, utilisez git checkout sur un tag précis (ex : b4400). ## #Dépannage nvcc not found Le CUDA Toolkit n'est pas dans le PATH. Sur Linux : export PATH=/usr/local/cuda/bin:$PATH. Mismatch de version CUDA Drivers NVIDIA plus vieux que le Toolkit. Mettez à jour les drivers (version supérieure ou égale requise pour chaque Toolkit). Link error avec cuBLAS Mauvais LD_LIBRARY_PATH. Ajoutez /usr/local/cuda/lib64. Build échoue sur MSVC Ouvrez un 'x64 Native Tools Command Prompt for VS 2022', pas PowerShell. Certains outils cmake ne trouvent pas cl.exe sinon. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Avancé · 12 min ### Flash Attention (2) : l'activer dans llama.cpp, Ollama, vLLM — gain réel Lire →](/guide/flash-attention-2-llm-local-activation) [Installation · 10 min ### llama.cpp avec Metal Lire →](/guide/compiler-llama-cpp-metal) [Installation · 12 min ### llama.cpp avec Vulkan Lire →](/guide/compiler-llama-cpp-vulkan) [Comparatif · 12 min ### llama.cpp vs vLLM vs Exllama Lire →](/guide/comparer-backends-inference) --- ## Compiler llama.cpp avec Metal | QuelLLM.fr URL: https://quelllm.fr/guide/compiler-llama-cpp-metal published: 2026-09-11 > Exploiter le GPU Apple Silicon avec Metal Performance Shaders. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à… [Accueil](/) / [Guides](/guides) / Installation / llama.cpp / Compiler llama.cpp avec Metal Avancé 10 min llama.cpp # Compiler llama.cpp avecMetal Sur Mac Apple Silicon, Metal est l'API GPU native — l'équivalent de CUDA pour le monde Apple. Compiler llama.cpp avec Metal donne accès aux dernières optimisations (KV cache quantifié, Flash Attention Metal) qu'Ollama met parfois 3-4 semaines à intégrer. Ce guide est court parce que sur Mac, c'est quasi immédiat. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur macOS 14+ [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-compiler-llama-cpp-metal) ## #Metal : spécifique Apple Sur macOS, le GPU n'est pas exposé via CUDA ou Vulkan (enfin, Vulkan arrive via MoltenVK mais c'est une couche de traduction). Le chemin direct, c'est Metal. llama.cpp a un backend Metal mature depuis 2023, qui exploite le GPU de la puce M ET la mémoire unifiée. → Vous avez déjà tout macOS inclut Clang, Metal et les headers. Pas de "Toolkit" à installer comme pour CUDA. Le build est trivial. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-compiler-llama-cpp-metal) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-compiler-llama-cpp-metal-bundle) → Mac Apple Silicon M1, M2, M3, M4. Les Intel ne sont pas concernés par ce guide (Metal ne sert à rien sur Intel pour les LLM). macOS 13+ Sonoma (14) ou Sequoia (15) recommandés pour les optimisations récentes. Xcode Command Line Tools xcode-select --install. 2 Go environ. Homebrew (optionnel) Pour installer cmake facilement. Installer ce qui manque ⧉ Copier ``` `xcode-select --install brew install cmake git` ``` ## #1. Build Terminal ⧉ Copier ``` `git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp # Metal est activé par défaut sur macOS Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j $(sysctl -n hw.ncpu)` ``` Le build prend 2 à 5 minutes. Les binaires apparaissent dans build/bin/. i Métal vs MPS MPS (Metal Performance Shaders) est l'abstraction utilisée par PyTorch. llama.cpp parle Metal directement. C'est pourquoi llama.cpp est plus rapide que llama-cpp-python + PyTorch sur Mac. ## #2. Tester Charger et tester ⧉ Copier ``` `./build/bin/llama-cli \ -m ~/.ollama/models/manifests/... (ou un .gguf téléchargé) \ -p "Bonjour" -n 128 -ngl 99` ``` Le flag -ngl 99 demande de charger toutes les couches sur GPU. Sur Mac Apple Silicon, c'est gratuit — il n'y a pas de transfert CPU↔GPU à faire, la RAM est unifiée. ## #3. Gérer la mémoire unifiée macOS applique une limite par défaut sur la mémoire allouable au GPU : environ 67 % de la RAM totale. Pour les modèles qui dépassent : Relever la limite ⧉ Copier ``` `# Remplacez 57344 par la valeur en MB souhaitée # (ex : 57344 = 56 Go, pour un MBP 64 Go) sudo sysctl iogpu.wired_limit_mb=57344 # Revenir au défaut : sudo sysctl iogpu.wired_limit_mb=0` ``` ! Non persistant Cette valeur est remise à zéro à chaque reboot. Ajoutez la commande dans /etc/sysctl.conf pour la rendre permanente. ## #4. Flags qui comptent -fa Flash Attention. Activez toujours. Meilleure perf, moins de mémoire contexte. -ngl 99 Toutes les couches sur GPU. Sur Mac, rien à y perdre. -ctk q8_0 -ctv q8_0 KV cache quantifié en Q8. -50 % de VRAM pour le contexte, impact négligeable sur la qualité. -t 4 Nombre de threads CPU pour le prompt processing. 4 est optimal sur M-series (les P-cores). ## #5. Performance par puce (Qwen 3.5 9B Q4_K_M — ordres de grandeur) M1 / M2 8 Go ~18 tok/s. OK pour tester, limite pour un usage quotidien (le poids Q4 ~6,6 Go remplit presque les 8 Go). M1 / M2 16 Go ~24-28 tok/s. Usage confortable en 9B. M1 Pro / M2 Pro ~38 tok/s. Sweet spot pour dev portable. M3 Max / M4 Max 64 Go ~75 tok/s en Qwen 3.5 9B, ~40 tok/s en Qwen 3.6 35B-A3B. Quasiment une workstation. M3 Ultra / M4 Ultra ~100 tok/s en Qwen 3.5 9B. Peut tourner Qwen 3.6 35B-A3B en Q8 confortablement. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Matériel · 11 min ### Tirer le max d'un Mac Silicon Lire →](/guide/optimiser-mac-silicon-llm) [Installation · 15 min ### llama.cpp avec CUDA Lire →](/guide/compiler-llama-cpp-cuda) [Comparatif · 12 min ### llama.cpp vs vLLM Lire →](/guide/comparer-backends-inference) --- ## llama.cpp avec Vulkan (GPU universel) | QuelLLM.fr URL: https://quelllm.fr/guide/compiler-llama-cpp-vulkan published: 2026-09-11 > Solution vendor-agnostic, fonctionne AMD, Intel, NVIDIA. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / llama.cpp / llama.cpp avec Vulkan (GPU universel) Avancé 12 min llama.cpp # llama.cpp avec Vulkan (GPUuniversel) Vulkan est l'API graphique cross-vendor : elle fonctionne sur NVIDIA, AMD, Intel Arc, même les iGPU. Compiler llama.cpp avec le backend Vulkan permet d'ignorer complètement les galères de CUDA/ROCm et d'avoir une solution qui marche partout. En échange, 10 à 20 % de perf en moins qu'un backend natif — souvent un bon arbitrage pour les setups hétérogènes. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-compiler-llama-cpp-vulkan) ## #Pourquoi Vulkan Vendor-agnostic Le même binaire tourne sur GeForce, Radeon, Arc, Iris. Pratique pour distribuer un outil ou tester un modèle avant d'acheter une carte. Installation simple Les drivers Vulkan sont inclus dans les drivers graphiques standards. Pas de Toolkit de plusieurs Go à installer. Cartes anciennes Une GTX 1060 6 Go ou une RX 580 fonctionne via Vulkan, là où CUDA est abandonné et ROCm ne supporte pas. Intel Arc Les Arc A580/A750/A770 sont correctement supportées via Vulkan, là où oneAPI est plus bancal. ## #GPU compatibles NVIDIA Toute carte Maxwell+ (GTX 900 et plus récent). Vulkan est supporté dans tous les drivers NVIDIA récents. AMD Polaris (RX 400/500), Vega, Navi (RX 5000/6000/7000/9000). Mesa sur Linux, drivers officiels sur Windows. Intel Arc Alchemist (A380-A770) et Battlemage. Excellent rapport perf/prix pour l'IA locale. iGPU Intel Xe (Tiger Lake+), Xe2 (Lunar Lake, Arrow Lake). Utile pour les petits modèles sur laptop sans GPU dédié. ## #Prérequis Ubuntu / Debian ⧉ Copier ``` `sudo apt update sudo apt install libvulkan-dev vulkan-tools glslang-tools \ cmake build-essential git` ``` Fedora ⧉ Copier ``` `sudo dnf install vulkan-headers vulkan-tools \ glslang-devel cmake gcc-c++ git` ``` Windows ⧉ Copier ``` `# Installer le SDK Vulkan LunarG (fournit les headers et shaderc) winget install KhronosGroup.VulkanSDK` ``` Vérifier que Vulkan voit le GPU ⧉ Copier ``` `vulkaninfo | grep -i "deviceName" # Doit afficher votre GPU` ``` ## #1. Build Terminal ⧉ Copier ``` `git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release cmake --build build --config Release -j` ``` Les shaders Vulkan sont compilés pendant le build. Compte 3-8 minutes selon le CPU. ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-compiler-llama-cpp-vulkan) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-compiler-llama-cpp-vulkan-bundle) → ## #2. Tester Lancer ⧉ Copier ``` `./build/bin/llama-cli \ -m ./models/qwen3.5-9b-q4_k_m.gguf \ -p "Bonjour" -n 128 -ngl 99` ``` Au démarrage, llama.cpp affiche le GPU détecté via Vulkan : ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770. Si vous avez plusieurs GPU, -mg N (main GPU index) pour choisir. ## #3. Performance vs CUDA / ROCm Tokens/seconde sur Qwen 3.5 9B Q4_K_M, Flash Attention activé (ordres de grandeur) : RTX 4070 — CUDA natif ~82 tok/s (référence). RTX 4070 — Vulkan ~70 tok/s (-15 %). RX 7800 XT — ROCm ~56 tok/s. RX 7800 XT — Vulkan ~48 tok/s (-15 %). Parfois le plus rapide quand ROCm bloque. Arc A770 16 Go — Vulkan ~43 tok/s. Meilleur rapport qualité/prix. iGPU Intel Xe (Lunar Lake) ~8-13 tok/s. Utilisable pour un 2-3B, à la peine sur un 9B. ## #Quand choisir Vulkan Vous avez une carte Intel Arc Vulkan > oneAPI en 2026. Perf stable, pas d'install exotique. ROCm refuse de coopérer Carte AMD non officiellement supportée, override qui plante : Vulkan est le plan B qui marche. Setup multi-vendor Une machine avec GeForce + Intel Arc, un laptop Thunderbolt+eGPU variable. Vulkan tolère tout. Distribution d'un outil Vous codez une app qui doit tourner sur des machines inconnues : le binaire Vulkan est le plus compatible. i Pas pour Mac Sur macOS, Vulkan passe par MoltenVK (couche de traduction vers Metal). Utilisez le backend Metal natif de llama.cpp à la place — c'est plus rapide. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 15 min ### llama.cpp avec CUDA Lire →](/guide/compiler-llama-cpp-cuda) [Installation · 12 min ### Ollama avec GPU AMD Lire →](/guide/ollama-gpu-amd-rocm) [Comparatif · 12 min ### llama.cpp vs vLLM Lire →](/guide/comparer-backends-inference) --- ## Kimi K2 en local : 1 trillion de paramètres MoE chez soi | QuelLLM.fr URL: https://quelllm.fr/guide/kimi-k2-local-llama-cpp published: 2026-09-11 > Faire tourner Kimi K2 (Moonshot, MoE 1T paramètres / 32B actifs) en local. Setup llama.cpp, quantization GGUF agressive, offload disque, benchmark long… [Accueil](/) / [Guides](/guides) / Installation / llama.cpp / Kimi K2 en local : 1 trillion de paramètres MoE chez soi Avancé 18 min llama.cpp # Kimi K2 en local : 1 trillion de paramètres MoE chezsoi Faire tourner Kimi K2 local llama.cpp, c'est exécuter un modèle MoE d'un trillion de paramètres sur une station de travail personnelle. Le tour de force tient à deux choses : seulement 32B paramètres sont actifs par token (le reste dort), et llama.cpp sait laisser les poids inactifs sur SSD via mmap. Ce guide détaille la configuration matérielle, la quantization Q2_K_S, l'offload disque et les chiffres réels qu'on peut espérer. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-06-05 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-kimi-k2-local-llama-cpp) ## #Pourquoi viser Kimi K2 en local Kimi K2 est le modèle phare de Moonshot AI, publié en poids ouverts (Modified MIT) avec une architecture MoE (Mixture of Experts) à 1 trillion de paramètres totaux et environ 32B actifs par token. Sur les benchmarks de raisonnement et de code, il joue dans la cour des modèles frontière fermés, et son long contexte (128k tokens annoncés) en fait un candidat sérieux pour de l'analyse documentaire massive. Faire tourner un modèle de cette taille en local relevait, il y a 18 mois, du fantasme. Trois évolutions ont changé la donne : la généralisation de DDR5 grande capacité (192-384 Go pour quelques centaines d'euros), les SSD NVMe Gen 4 capables de débiter 7 Go/s en lecture séquentielle, et le travail de l'équipe llama.cpp sur les quantizations très agressives type Q2_K_S et IQ1_M. i Pas du temps réel, mais utilisable Soyons clairs : à 2-6 tokens/sec, Kimi K2 en local n'est pas un chatbot interactif. C'est un modèle qu'on interroge en batch, qu'on laisse mâcher un long contexte, et qu'on utilise quand la qualité de réponse compte plus que la latence. ## #Comprendre le MoE 1T / 32B actifs ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-kimi-k2-local-llama-cpp) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-kimi-k2-local-llama-cpp-bundle) → L'architecture MoE remplace les blocs FFN denses par une couche d'experts (souvent 256+) parmi lesquels un routeur en sélectionne 8 à 12 par token. Côté calcul, on ne traite que les paramètres des experts élus — d'où les ~32B « actifs ». Côté mémoire en revanche, tous les experts doivent être adressables, sinon le routeur perd l'accès à 95 % du modèle. Paramètres totaux ≈ 1 000 milliards (1T). C'est ce qui dort en RAM ou sur disque. Paramètres actifs par token ≈ 32 milliards. C'est ce qui détermine le calcul et la vitesse. Experts par couche Plusieurs centaines, dont un nombre fixe est routé par token (top-k routing). Couches partagées (attention) Toujours actives. Elles dominent le coût mémoire à petit contexte. Cache KV Croît linéairement avec le contexte. Sur 128k, le KV peut dépasser 30 Go même quantizé. → Pourquoi le MoE rentre là où un dense de 1T ne rentrerait jamais Un modèle dense de 1T paramètres exigerait ~2 To en FP16 et ~250 Go même en Q2. À iso-qualité, un MoE 1T / 32B actifs peut tourner sur 200-250 Go avec quantization agressive, et la majorité de cette mémoire est lue, pas écrite — d'où la viabilité du mmap sur SSD. ## #Budget mémoire à prévoir Le calcul mémoire pour un MoE 1T se décompose en trois postes distincts. Comprendre cette décomposition est crucial avant d'investir dans la RAM ou le SSD. Poids du modèle (quantizés) Q2_K_S ≈ 245 Go, Q3_K_S ≈ 320 Go, Q4_K_M ≈ 480 Go, Q8_0 ≈ 1 To. C'est le poste dominant et le plus compressible. Cache KV (contexte) Compter ~0,25 Mo par token en FP16, ~0,12 Mo en Q8. Soit 32 Go pour 128k tokens en Q8. Configurable via --cache-type-k/-v. Buffers d'activation Quelques Go par GPU pour les calculs intermédiaires. Marginal mais à ne pas oublier sur des GPU 24 Go. ! RAM ≠ stockage modèle Avec mmap, llama.cpp peut adresser des poids qui ne tiennent pas en RAM : le kernel paginera depuis le SSD à la demande. Mais chaque page non résidente coûte une lecture disque pendant l'inférence — d'où l'importance d'un NVMe rapide. RAM = vitesse, SSD = capacité. ## #Prérequis matériels Trois profils de machines permettent de faire tourner Kimi K2 en local, avec des compromis très différents en vitesse. Profil A — DDR5 musclée (192-384 Go RAM) Workstation Threadripper/Xeon W ou plateforme EPYC. 256 Go DDR5 ECC, pas de GPU obligatoire. Le modèle tient entièrement en RAM en Q2_K_S. Vitesse attendue : 4-8 tok/s en CPU pur. Profil B — DDR5 + 1 GPU 24 Go 96-128 Go RAM + RTX 4090/3090. On offload les couches partagées sur GPU, les experts restent en RAM. Vitesse attendue : 6-12 tok/s, dépend du nombre d'experts qui rentrent en VRAM. Profil C — RAM modeste + SSD NVMe 64-96 Go RAM + NVMe Gen 4 (7 Go/s lecture, ≥ 1 To libre). On mmap les poids depuis le SSD. Vitesse attendue : 1-3 tok/s, fortement dépendante du débit SSD réel. → Le SSD est le nouveau facteur limitant Si vous comptez sur l'offload disque, vérifiez la latence aléatoire du SSD, pas seulement le débit séquentiel marketing. Un Samsung 990 Pro ou un WD SN850X fait correctement le travail. Un SSD QLC d'entrée de gamme s'effondre à 200 Mo/s en lecture aléatoire — inutilisable pour ce cas. ## #1. Compiler llama.cpp avec le bon backend Kimi K2 nécessite une version récente de llama.cpp (build récent post-décembre 2025) qui supporte son architecture MoE et les quantizations IQ. On compile depuis le repo officiel. Cloner et compiler (CUDA + mmap) ⧉ Copier ``` `git clone https://github.com/ggerganov/llama.cpp cd llama.cpp cmake -B build -DGGML_CUDA=ON -DGGML_CUDA_FA_ALL_QUANTS=ON cmake --build build --config Release -j` ``` Sur Mac Apple Silicon, remplacer GGML_CUDA par GGML_METAL. Sur AMD avec ROCm, GGML_HIP. Le flag GGML_CUDA_FA_ALL_QUANTS active Flash Attention pour toutes les quantizations — indispensable pour tenir 128k de contexte sans exploser la VRAM. i Binaires précompilés Si vous voulez éviter la compilation, les releases GitHub fournissent des binaires pour Linux/Windows/macOS. Vérifiez que la version supporte bien l'architecture deepseek2 ou kimi selon le repackaging GGUF utilisé. ## #2. Choisir la quantization GGUF Pour un modèle de cette taille, oubliez Q4_K_M et au-dessus à moins d'avoir 512 Go de RAM. La quantization extrême — Q2_K_S, IQ2_XXS, voire IQ1_M — est ce qui rend le local viable, au prix d'une perte de qualité mesurable mais souvent acceptable sur un MoE. Q2_K_S (~245 Go) Le sweet spot. ~5 % de dégradation sur les benchmarks de code, ~3 % en raisonnement. Recommandé si vous avez 256 Go de RAM ou un SSD rapide. IQ2_XXS (~210 Go) Encore plus agressif via importance matrix. Tient sur 192 Go RAM avec un peu d'offload. Qualité un cran en dessous. IQ1_M (~155 Go) Quantization 1-bit hybride. Pour les configs très contraintes. Dégradation visible mais le modèle reste cohérent. Q3_K_S (~320 Go) Qualité quasi-Q4 mais demande 384 Go RAM. Pour les workstations EPYC bien équipées. Télécharger un GGUF Q2_K_S depuis Hugging Face ⧉ Copier ``` `pip install -U "huggingface_hub[cli]" huggingface-cli download \ unsloth/Kimi-K2-Instruct-GGUF \ --include "*Q2_K_S*" \ --local-dir ./models/kimi-k2-q2ks` ``` Les GGUF de cette taille sont split en plusieurs fichiers (split-00001-of-00007.gguf etc). llama.cpp détecte automatiquement les splits si vous pointez vers le premier fichier. ! Hash et provenance Téléchargez vos GGUF depuis un repository de confiance (unsloth, bartowski, mradermacher sont les plus suivis). Vérifiez les sommes SHA fournies. Un GGUF mal quantizé ou corrompu sortira du texte cohérent au premier prompt puis dérapera — diagnostic pénible. ## #3. Lancer Kimi K2 avec mmap et offload… --- ## DeepSeek V3.2 en local : MoE 671B accessible aux mortels | QuelLLM.fr URL: https://quelllm.fr/guide/deepseek-v32-installation-locale published: 2026-09-11 > DeepSeek V3.2 (MoE 671B / 37B actifs) en local llama.cpp. Quantization, offload RAM/SSD, RTX 5090 + 192 Go DDR5 minimum, benchmarks réels FR/code. [Accueil](/) / [Guides](/guides) / Installation / llama.cpp / DeepSeek V3.2 en local : MoE 671B accessible aux mortels Avancé 20 min llama.cpp # DeepSeek V3.2 en local : MoE 671B accessible auxmortels Faire une deepseek v3.2 local installation, c'est encaisser une réalité : 671 milliards de paramètres totaux, 37 milliards actifs par token, et un nouveau mécanisme de sparse attention qui change la donne sur les longs contextes. Ce guide donne les prérequis hardware vrais (pas marketing), explique la quantization Q2_K_XL d'ik_llama, montre le tour de force de l'offload sélectif via --override-tensor, et finit par les tokens/sec mesurés sur une workstation home en 2026. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-deepseek-v32-installation-locale) ## #Pourquoi installer DeepSeek V3.2 en local DeepSeek V3.2 est la mise à jour intermédiaire publiée par DeepSeek AI fin 2025, sous licence MIT, qui introduit deux changements significatifs par rapport à V3 : DeepSeek Sparse Attention (DSA), un mécanisme d'attention parcimonieuse qui rend le coût mémoire du long contexte sub-quadratique, et un raffinement de l'entraînement multi-token prediction. Sur le papier, on garde la qualité de V3 et on gagne en efficacité sur 128k+ tokens. L'installer en local répond à trois besoins concrets : confidentialité totale (aucun document n'est envoyé chez DeepSeek), reproductibilité (les poids ne disparaissent pas du jour au lendemain), et expérimentation libre (pas de rate limits, pas de filtre de modération imposé). i Soyons honnêtes sur la cible Un déploiement DeepSeek V3.2 local n'est pas un remplacement temps réel de ChatGPT. On vise plutôt un débit utile (5–15 tok/s) sur une workstation home musclée, pour du batch raisonnement, de la synthèse de documents longs, ou du code complexe où la qualité prime sur la latence. ## #MoE 671B / 37B actifs + DeepSeek Sparse Attention ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-deepseek-v32-installation-l) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-deepseek-v32-installation-l-bundle) → DeepSeek V3.2 garde l'architecture MoE de V3 : un routeur sélectionne 8 experts sur 256 par couche, ce qui ne fait travailler que ~37 milliards de paramètres pour chaque token généré. Les 634 milliards restants dorment, mais doivent rester adressables, sinon le routeur perd l'accès aux experts qu'il n'a pas chargés. Paramètres totaux ≈ 671 milliards (peu importe le bit-rate, c'est cette masse qui doit être logée quelque part : RAM, VRAM, ou SSD via mmap). Paramètres actifs par token ≈ 37 milliards. Ce chiffre dicte la vitesse théorique : un MoE 671B s'inflige le coût compute d'un dense 37B. Experts par couche 256 experts MoE + 1 expert partagé, top-8 routing. Plus on a de RAM, plus de couches d'experts restent résidentes et plus la génération est stable. Attention Multi-Head Latent Attention (MLA) héritée de V3, désormais combinée à DeepSeek Sparse Attention (DSA) sur les contextes > 32k tokens. Contexte 128k tokens annoncés, exploitables en pratique grâce à DSA — le cache KV n'explose plus linéairement comme sur un modèle dense classique de type Qwen 3.5 ou Gemma 4. → Ce que DSA change vraiment DeepSeek Sparse Attention sélectionne pour chaque token un sous-ensemble de positions à attendre, au lieu de balayer tout le contexte. À 128k, ça divise la consommation mémoire du cache KV par 3 à 5 selon le réglage, et accélère le prefill d'autant. C'est le seul argument technique qui justifie de viser V3.2 plutôt que V3 si vous voulez exploiter les long contextes. ## #Prérequis matériels honnêtes Aucune config grand public n'avale DeepSeek V3.2 sans contorsions. Voici les trois profils réalistes en 2026, classés par compromis vitesse/budget. Profil A — DDR5 musclée (192–384 Go) Workstation Threadripper 7960X / Xeon W ou EPYC 9354P, 256 Go DDR5 ECC (8 canaux), pas de GPU obligatoire. Q2_K_XL tient intégralement en RAM. Vitesse : 5–9 tok/s en CPU pur. Profil B — RTX 5090 + 192 Go DDR5 (recommandé) Le sweet spot 2026 : RTX 5090 (32 Go GDDR7, bande passante 1792 Go/s) + 192 Go DDR5 sur une plateforme grand public récente. On garde les couches d'attention et l'expert partagé sur GPU, le reste en RAM. Vitesse : 10–15 tok/s en génération. Profil C — RAM modeste + SSD NVMe Gen 4/5 96–128 Go DDR5 + SSD NVMe 7 Go/s minimum, ≥ 1 To libre. On mmap les experts depuis le SSD. Vitesse : 1,5–3 tok/s — utilisable en batch nocturne, pas en interactif. ! 192 Go DDR5, le minimum vital En dessous de 192 Go de RAM, la quantization Q2_K_XL (~220 Go pour V3.2) ne tient pas en mémoire physique et vous paginez en permanence depuis le SSD. Même avec un NVMe Gen 5 rapide, vous tomberez sous 2 tok/s. Si le budget RAM est contraint, descendez en IQ1_S plutôt que de saturer le SSD. ## #1. Choisir la quantization pour V3.2 L'écosystème GGUF pour DeepSeek V3.2 est porté par deux acteurs principaux : Unsloth (qui publie les variantes UD = « Unsloth Dynamic » dont la fameuse Q2_K_XL) et bartowski. Les UD utilisent une matrice d'importance pour préserver les couches sensibles (attention, expert partagé) à une précision plus haute que le reste — vraie différence pratique sur la qualité finale. IQ1_S (~150 Go) Quantification 1-bit dynamique. Tient sur 192 Go RAM avec marge. Qualité dégradée mais utilisable pour du chat généraliste. À éviter pour le code. Q2_K_XL (~220 Go) La référence ik_llama / Unsloth Dynamic. Conserve les couches critiques en Q4-Q5 et écrase les experts en Q2. ~95 % de la qualité Q4 sur les benchmarks de raisonnement. Tient sur 256 Go RAM ou 192 Go + un peu d'offload SSD. Q3_K_S (~290 Go) Pour les workstations 384 Go. Qualité quasi-Q4 sur les long contextes. Recommandé si vous comptez exploiter les 128k tokens sérieusement. Q4_K_M (~400 Go) Plein pot. Réservé aux serveurs EPYC bi-socket avec 512 Go+ DDR5. Au-delà, le retour sur qualité devient marginal pour un usage local. → Pourquoi Q2_K_XL et pas Q2_K_S Sur un MoE 671B, la sensibilité à la quantization est très hétérogène : les couches d'attention et les routeurs supportent mal Q2, les experts FFN encaissent bien. Q2_K_XL respecte cette répartition (mixed precision) là où Q2_K_S applique le même bit-rate partout. Pour ~5 % de mémoire en plus, on gagne ~10 % de qualité sur les tâches de code. ## #2. Compiler ik_llama.cpp (le fork qui gère V3.2) Au moment d'écrire ces lignes, la branche principale de ggerganov/llama.cpp gère DeepSeek V3.2 mais sans optimisations spécifiques au routing MoE de DeepSeek. Le fork ik_llama.cpp (Iwan Kawrakow) embarque des kernels CUDA accélérés pour les expert tensors et la prise en charge dynamique de DSA — gain de 30 à 50 % de débit sur V3.2 selon la config. Cloner et compiler ik_llama.cpp (CUDA + Flash Attention) ⧉ Copier ``` `git clone https://github.com/ikawrakow/ik_llama.cpp cd ik_llama.cpp cmake -B build \ -DGGML_CUDA=ON \ -DGGML_CUDA_FA_ALL_QUANTS=ON \ -DGGML_CUDA_F16=ON cmake --build build --config Release -j $(nproc)` ``` Sur Mac Apple Silicon, remplacer GGML_CUDA par GGML_METAL. Sur AMD, GGML_HIP avec ROCm 6.3+. Comptez 10 à 15 minutes de build sur une machine récente — c'est du C++ avec génération CUDA, ne lancez pas ça sur un laptop sans alim secteur. i Pourquoi ik_llama plutôt qu'un binaire pré-built Les releases Linux/Windows d'ik_llama.cpp existent, mais les kernels CUDA générés à la compilation sont sensibles au compute capability de votre GPU (sm_120 pour RTX 5090, sm_89 pour RTX 4090, etc.). Un binaire générique tombe en fallback générique et perd 20–30 % de débit. Sur ce volume, ça vaut le quart d'heure de compilation. ## #3. Télécharger les GGUF V3.2 Les … --- ## Déployer vLLM en production | QuelLLM.fr URL: https://quelllm.fr/guide/deployer-vllm-production published: 2026-09-11 > Serveur OpenAI-compatible performant pour votre équipe. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / vLLM / Déployer vLLM en production Avancé 20 min vLLM # Déployer vLLM enproduction vLLM est le moteur d'inférence de référence pour servir des LLM à l'échelle d'une équipe ou d'une entreprise. Là où Ollama excelle en usage personnel, vLLM bat tout le monde dès que plusieurs utilisateurs tapent en parallèle : le PagedAttention rend le batching 5 à 10x plus efficace. Ce guide installe, configure et expose un endpoint OpenAI-compatible prêt pour la prod. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-deployer-vllm-production) ## #Qu'est-ce que vLLM ? Un serveur d'inférence open source développé à Berkeley, optimisé pour servir des LLM à haut débit. Il gère le batching continu (continuous batching), la gestion de la mémoire par pages (PagedAttention), et expose une API OpenAI-compatible. Il est écrit en Python + CUDA, et ne supporte que les GPU NVIDIA (et AMD via ROCm, récent). i Conçu pour le throughput Une requête seule sur Ollama et vLLM donnent des perfs similaires. 20 requêtes simultanées : vLLM peut en traiter 15 en parallèle via le batching continu, quand Ollama les met en file. ## #Quand choisir vLLM plutôt qu'Ollama ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-deployer-vllm-production) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-deployer-vllm-production-bundle) → Plus de 3 utilisateurs simultanés Le throughput écrase Ollama dès que les requêtes se chevauchent. Modèle identique servi à tous vLLM charge un modèle et le sert à N requêtes. Pas idéal pour switcher entre 5 modèles à la demande. Besoin de métriques Prometheus Métriques natives : latence, TTFT, requêtes/s, VRAM used. Environnement Kubernetes Image Docker officielle, helm charts communautaires, observabilité de série. ## #1. Installation Via pip ⧉ Copier ``` `# Python 3.10-3.12 recommandé python3 -m venv venv source venv/bin/activate pip install --upgrade pip pip install vllm` ``` → Privilégiez Docker en prod vLLM a des dépendances CUDA complexes. L'image officielle vllm/vllm-openai élimine les problèmes de compatibilité entre versions. ## #2. Lancer le serveur CLI ⧉ Copier ``` `python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.5-9B-Instruct \ --host 0.0.0.0 \ --port 8000 \ --dtype auto \ --gpu-memory-utilization 0.90 \ --max-model-len 8192` ``` Au premier lancement, vLLM télécharge les poids depuis Hugging Face (~18 Go pour un 9B non-quantifié en FP16). Prévoyez du disque. Vérifier ⧉ Copier ``` `curl http://localhost:8000/v1/models curl http://localhost:8000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "model":"Qwen/Qwen3.5-9B-Instruct", "messages":[{"role":"user","content":"Hi"}] }'` ``` ## #3. Via Docker / systemd Docker (GPU NVIDIA) ⧉ Copier ``` `docker run --runtime nvidia --gpus all \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -p 8000:8000 \ --ipc=host \ -e HUGGING_FACE_HUB_TOKEN=$HF_TOKEN \ vllm/vllm-openai:latest \ --model Qwen/Qwen3.5-9B-Instruct` ``` /etc/systemd/system/vllm.service ⧉ Copier ``` `[Unit] Description=vLLM OpenAI API After=network.target [Service] Type=simple User=vllm ExecStart=/opt/vllm/bin/python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.5-9B-Instruct \ --port 8000 Restart=always [Install] WantedBy=multi-user.target` ``` ## #4. Paramètres clés --quantization awq / gptq Charge un modèle quantifié. -4x VRAM, perte qualité minimale. Cherchez les repos AWQ/GPTQ officiels sur le Hub Hugging Face. --gpu-memory-utilization 0.90 Pourcentage de VRAM réservé. 0.95 en prod, 0.85 en dev pour garder de la marge. --max-model-len 8192 Contexte maximum. Plus c'est haut, plus de VRAM consommée pour le KV cache. --tensor-parallel-size 2 Répartit le modèle sur 2 GPU. Indispensable pour un 70B. --enable-prefix-caching Cache les préfixes identiques (ex : system prompt commun). +30 % de throughput sur des workloads répétitifs. ## #5. Benchmarker Script officiel ⧉ Copier ``` `python benchmarks/benchmark_serving.py \ --backend openai \ --base-url http://localhost:8000 \ --dataset-name sharegpt \ --num-prompts 500 \ --request-rate 10` ``` Mesurez : TTFT (time to first token), tokens/s par requête, tokens/s agrégés. Sur une RTX 4090 + Qwen 3.5 9B AWQ, attendez 2000+ tokens/s agrégés avec 20 req/s. ## #Sécurité et exposition Pas d'auth native vLLM écoute sans authentification. Mettez une clé API via --api-key, ou mieux, un reverse proxy (Caddy, Traefik) avec JWT. Jamais directement sur Internet Derrière un VPN ou un WAF. Les LLM servis ouvertement sont scannés et abusés en quelques heures. Rate limiting À mettre côté proxy. vLLM ne limite pas par utilisateur nativement. Logs Toujours logguer qui a prompté quoi. Utile pour debug et audit. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Avancé · 12 min ### Flash Attention (2) : l'activer dans llama.cpp, Ollama, vLLM — gain réel Lire →](/guide/flash-attention-2-llm-local-activation) [Comparatif · 12 min ### llama.cpp vs vLLM Lire →](/guide/comparer-backends-inference) [Matériel · 22 min ### Multi-GPU avec llama.cpp Lire →](/guide/setup-multi-gpu-llama) [Installation · 8 min ### LM Studio en API serveur Lire →](/guide/lm-studio-serveur-api) --- ## Text Generation WebUI (oobabooga) | QuelLLM.fr URL: https://quelllm.fr/guide/text-generation-webui published: 2026-09-11 > Interface complète avec extensions et fine-tune intégré. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / Autres outils / Text Generation WebUI (oobabooga) Intermédiaire 10 min Autres outils # Text Generation WebUI(oobabooga) Text Generation WebUI (surnommée oobabooga) est la couteau-suisse de l'IA locale : elle supporte tous les formats (GGUF, AWQ, GPTQ, Transformers), tous les backends (llama.cpp, ExLlamaV2, vLLM), tous les usages (chat, complétion, notebook, RAG, fine-tune). En échange, c'est plus complexe à prendre en main qu'Ollama. Pour qui veut tout tester, c'est le bon outil. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-02-08 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-text-generation-webui) ## #L'interface polyvalente Développée par l'utilisateur GitHub oobabooga, la WebUI est devenue le standard de facto pour les power users qui veulent essayer des modèles différents, des backends différents, et des quantizations différentes sans réinstaller 5 outils. i Réputation Très utilisé dans les communautés r/LocalLLaMA et HuggingFace. Quand quelqu'un parle de "la WebUI" sans préciser, c'est celle-ci dans 9 cas sur 10. ## #1. Installation ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-text-generation-webui) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-text-generation-webui-bundle) → Linux / macOS ⧉ Copier ``` `git clone https://github.com/oobabooga/text-generation-webui.git cd text-generation-webui ./start_linux.sh # ou start_macos.sh` ``` Windows ⧉ Copier ``` `# Télécharger le zip du repo # Exécuter start_windows.bat` ``` Le script d'installation demande votre GPU (NVIDIA/AMD/Intel/CPU) et installe les bonnes dépendances automatiquement. Compte 10-15 minutes la première fois (beaucoup de libs Python). → Portabilité Tout s'installe dans un installer_files/ local au dossier. Pour désinstaller, supprimez le dossier. Aucune trace ailleurs sur le système. ## #2. Télécharger un modèle Accédez à l'interface sur http://localhost:7860. Onglet Model → Download. Collez un nom de repo Hugging Face : Formats supportés ⧉ Copier ``` `# GGUF (recommandé, compatible llama.cpp) : bartowski/Mistral-7B-Instruct-v0.3-GGUF # AWQ (compatible ExLlamaV2, plus rapide sur RTX) : solidrust/Mistral-7B-Instruct-v0.3-AWQ # Transformers (FP16, VRAM intensif) : mistralai/Mistral-7B-Instruct-v0.3` ``` ## #3. Choisir un backend llama.cpp Pour du GGUF. Le plus compatible, CPU + GPU. Le défaut sûr. ExLlamaV2 Pour AWQ/EXL2. Très rapide sur RTX 30/40/50. Pas de support CPU. Transformers Pour FP16/BF16 sans quantization. Lent mais polyvalent, sert au fine-tune. vLLM (via adapter) Batching continu. Overkill pour un user solo. ## #4. Chat, notebook, instruct Mode Chat Interface conversationnelle classique. Personnages, historique, instruction templates. Équivalent LM Studio. Mode Notebook Éditeur de texte libre. Vous tapez, le modèle continue. Parfait pour créatif, prompt engineering. Mode Instruct Pour les modèles fine-tunés instruction. Template Alpaca, ChatML, Mistral auto-détecté. ## #5. Extensions utiles superboogav2 RAG intégré. Chargez des docs, posez des questions, contexte injecté automatiquement. sd_api_pictures Intégration Stable Diffusion. Le modèle peut "demander" une image. openai Expose une API OpenAI-compatible. Utile pour brancher Continue, LangChain. whisper_stt Saisie vocale via Whisper. Tout local. silero_tts Sortie vocale. Idéal pour un setup mains libres. ## #6. Mode API Lancer avec API exposée ⧉ Copier ``` `./start_linux.sh --api --listen` ``` Tester l'endpoint OpenAI-compatible ⧉ Copier ``` `curl http://localhost:5000/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{ "messages":[{"role":"user","content":"Hello"}], "max_tokens":100 }'` ``` ## #WebUI vs Ollama, LM Studio Plus flexible WebUI supporte tous les backends et formats, les deux autres se concentrent sur GGUF. Plus complexe Plus d'options = plus de manière de se tromper. Les débutants préfèrent LM Studio. Orientée exploration Idéale pour comparer 10 modèles rapidement. Moins fluide pour un usage quotidien. Fine-tuning intégré Le seul des trois qui permet de lancer un LoRA en quelques clics. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Comparatif · 8 min ### Ollama vs LM Studio vs Jan Lire →](/guide/ollama-vs-lmstudio-vs-jan) [Comparatif · 10 min ### Comparer les frontends Lire →](/guide/comparer-frontends-chat) [Installation · 20 min ### Déployer vLLM en prod Lire →](/guide/deployer-vllm-production) --- ## Jan : l'alternative open source à ChatGPT | QuelLLM.fr URL: https://quelllm.fr/guide/jan-app-desktop published: 2026-09-11 > App desktop élégante, 100% offline, multi-modèles. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / Autres outils / Jan : l'alternative open source à ChatGPT Débutant 4 min Autres outils # Jan : l'alternative open source àChatGPT Jan est probablement l'app de chat local la plus élégante qui existe : 100 % open source (AGPL), une UI proche de ChatGPT, et la possibilité de basculer entre modèles locaux et cloud (OpenAI, Claude, Groq) dans la même conversation. Zéro télémétrie par défaut. Ce guide vous l'installe et vous montre ce qui la rend différente de LM Studio. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-jan-app-desktop) ## #Jan en deux mots Jan (prononcé "djane") est développée par une petite équipe vietnamienne sous licence AGPLv3. Elle embarque son propre moteur d'inférence (Cortex.cpp, fork de llama.cpp) et accepte aussi des modèles distants via API. L'app est disponible pour Windows, macOS (Apple Silicon + Intel) et Linux. i Vraiment open source Contrairement à LM Studio (app propriétaire qui embarque du libre), Jan est 100 % libre, y compris l'app elle-même. Audit possible, fork possible, redistribution possible. ## #1. Installation ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-jan-app-desktop) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-jan-app-desktop-bundle) → Site officiel ⧉ Copier ``` `https://jan.ai` ``` 1. 01 Choisissez votre plateforme Windows .exe, macOS .dmg (build Apple Silicon ou Intel séparés), Linux .AppImage ou .deb. 2. 02 Premier lancement Jan ne demande aucun compte. L'app s'ouvre sur l'écran de chat, pas de modèle chargé. 3. 03 Onboarding Hub L'onglet Hub (icône en forme de sac) propose une sélection curée de modèles testés avec votre matériel. ## #2. Télécharger un modèle Dans l'onglet Hub, chaque carte affiche la taille, la RAM minimum conseillée, et un bouton Download. Jan auto-détecte votre matériel et grise les modèles qui ne rentreront pas. → Recommandé pour débuter Qwen 3.5 2B. 1,9 Go à télécharger, tourne sur n'importe quel ordi récent (même sans carte graphique), 256k de contexte et licence Apache 2.0. Qualité surprenante pour sa taille. ## #3. Premier chat 1. 01 Retournez à l'onglet Thread Icône bulle en haut à gauche. Créez un nouveau thread. 2. 02 Sélectionnez le modèle Menu déroulant en haut. Tous vos modèles téléchargés apparaissent. Le modèle se charge en 2-5 secondes. 3. 03 Tapez votre message Entrée pour envoyer. La réponse se streame. Les réglages (température, contexte, system prompt) sont dans le panneau de droite. ## #4. Brancher un modèle cloud Jan permet de mixer local et cloud dans la même interface. Utile pour : fallback sur un modèle plus puissant quand le local sature, comparer les sorties, ou simplement garder une seule app de chat pour tous vos backends. 1. 01 Settings → Extensions Activez l'extension correspondant au provider : OpenAI, Anthropic, Groq, Mistral AI. 2. 02 Collez votre clé API Dans les paramètres de l'extension. Elle reste stockée chiffrée localement. 3. 03 Nouveau thread avec le modèle cloud Dans le menu déroulant, les modèles cloud apparaissent avec un badge spécifique. ! Clés API = fuite potentielle Un modèle cloud voit forcément vos prompts chez le provider. Si votre besoin principal est la confidentialité, restez sur local. Le mix ne sert qu'aux cas où vous assumez le trade-off. ## #5. Mode serveur local Jan expose une API OpenAI-compatible sur localhost:1337. Dans Settings → Advanced, activez Local API Server. Tester ⧉ Copier ``` `curl http://localhost:1337/v1/models curl http://localhost:1337/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"qwen3.5-2b","messages":[{"role":"user","content":"Hi"}]}'` ``` ## #Extensions à connaître Assistants Personnages pré-définis (Jan le pirate, Jan le coach de code…). Utile pour prototyper rapidement. OpenAI / Anthropic / Groq Providers cloud. Activez-les pour mixer local et distant. Cortex Moteur d'inférence par défaut. Changeable par llama.cpp ou TensorRT si vous voulez. ## #Jan est pour vous si… Vous voulez du 100 % libre Jan est la seule app graphique de ce tier totalement AGPL. Vous mixez local et cloud Aucune autre app ne le fait aussi proprement. Vous détestez le terminal Interface complète, zéro ligne de commande. Vous êtes en entreprise Licence AGPL compatible usage interne. Pas de licence payante comme LM Studio. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 5 min ### Démarrer avec LM Studio Lire →](/guide/demarrer-avec-lm-studio) [Comparatif · 8 min ### Comparatif des outils Lire →](/guide/ollama-vs-lmstudio-vs-jan) [Installation · 5 min ### GPT4All : premiers pas Lire →](/guide/gpt4all-premiers-pas) --- ## GPT4All : premiers pas | QuelLLM.fr URL: https://quelllm.fr/guide/gpt4all-premiers-pas published: 2026-09-11 > Chat local simple pour Windows, Mac, Linux. Guide indépendant QuelLLM.fr : VRAM nécessaire, vitesse réelle et installation locale pas à pas. [Accueil](/) / [Guides](/guides) / Installation / Autres outils / GPT4All : premiers pas Débutant 5 min Autres outils # GPT4All : premierspas GPT4All est la plus ancienne des apps de chat local grand public (lancée par Nomic en 2023). Elle vise la simplicité totale : un installateur, pas de ligne de commande, des modèles testés pour tourner même sur un laptop de 4 ans. Parfaite pour offrir un LLM à un proche non-technicien. Attention : le projet est en sommeil depuis début 2025 (dernière version v3.10.0, février 2025) — l'app fonctionne toujours, mais son catalogue de modèles vieillit. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-gpt4all-premiers-pas) ## #Ce qu'est GPT4All Une app desktop développée par Nomic AI, gratuite (MIT-style pour l'app, poids des modèles variables). L'approche : simplifier au maximum. Peu d'options, peu de jargon, interface proche d'un client mail. i Positionnement Là où LM Studio cible les power users et Jan les idéalistes de l'open source, GPT4All cible les utilisateurs qui veulent juste que ça marche. C'est le "Mac" des chats locaux. ## #1. Installation ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-gpt4all-premiers-pas) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-gpt4all-premiers-pas-bundle) → Site officiel ⧉ Copier ``` `https://gpt4all.io` ``` Windows .exe ~300 Mo. Installation classique sans droits admin. macOS .dmg universel (Intel + Apple Silicon). Linux .run script. chmod +x puis lancer. → Léger sur le matériel GPT4All cible explicitement les machines modestes. Les modèles recommandés tournent sur 8 Go de RAM sans GPU dédié, là où d'autres outils demandent 16 Go et une carte graphique. ## #2. Premier modèle 1. 01 Écran d'accueil : modèles recommandés L'app propose une sélection de 6-8 modèles avec leur taille et la RAM minimum conseillée. 2. 02 Cliquez Download Un petit modèle comme Qwen 3.5 2B fait ~1,9 Go et suffit pour débuter. Pour plus de qualité sur 8 Go de RAM, Granite 4.2 8B (~5,3 Go, 128k de contexte) reste très sobre. 3. 03 Attendez le téléchargement Progress bar honnête, pause/reprise possible. Aucune inscription requise. ## #3. Chat Interface minimaliste : conversation à gauche, message en bas. Panneau de droite optionnel pour changer température et system prompt. i Pas de streaming par défaut Contrairement à LM Studio, GPT4All attend souvent que la réponse soit complète avant de l'afficher. Streaming activable dans les settings mais plus basique. ## #4. LocalDocs (RAG intégré) La killer feature de GPT4All : un RAG local sans configuration. Vous pointez une collection de dossiers, l'app indexe, et le modèle peut piocher dedans. 1. 01 Settings → LocalDocs Ajoutez une collection (ex : "Mes notes"), pointez vers un dossier. 2. 02 L'app indexe PDF, Markdown, txt, docx. Indexation en tâche de fond, progression visible. 3. 03 Dans un chat, activez la collection Le modèle cite les passages trouvés. Les sources apparaissent sous sa réponse. → 100 % local Contrairement à ChatGPT Plus qui envoie vos docs aux serveurs OpenAI, LocalDocs reste entièrement sur votre machine. Pas de téléversement, pas de stockage cloud. ## #5. Serveur local Settings → Application → Enable Local Server. Le serveur écoute sur localhost:4891 avec une API OpenAI-compatible simplifiée. Test ⧉ Copier ``` `curl http://localhost:4891/v1/chat/completions \ -H 'Content-Type: application/json' \ -d '{"model":"Qwen 3.5 4B","messages":[{"role":"user","content":"Hi"}]}'` ``` ## #Avantages et limites + Install rapide, UI propre Le cycle "télécharger → chatter" est le plus court du marché. + LocalDocs sans prise de tête Un RAG fonctionnel sans ligne de code. + Fonctionne sur petite machine Un 8 Go RAM sans GPU est supporté officiellement. – Moins de modèles Le catalogue intégré est restreint. Pas de recherche Hugging Face comme LM Studio. – Moins de réglages Pas de choix de quantization à la volée, pas de presets fins. – Performance inférieure L'optimisation GPU est moins poussée qu'Ollama ou LM Studio. 20-30 % de perfs en moins. Ce guide vous a aidé ? Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde. 👍 Utile 👎 Pas clair ✏️ Signaler une erreur Les kits QuelLLM Le guide de référence par usage [IA Locale](/kit-ia-locale?utm_source=guide-band) [Copilote Local](/copilote-local?utm_source=guide-band) [Agents Locaux](/kit-agents-locaux?utm_source=guide-band) [RAG Local](/kit-rag-local?utm_source=guide-band) [IA en Entreprise](/kit-ia-entreprise?utm_source=guide-band) [IA Sans Filtre](/kit-ia-sans-filtre?utm_source=guide-band) [Mac](/kit-mac?utm_source=guide-band) [Images IA](/kit-images-ia?utm_source=guide-band) [Tous les kits à vie — 49 €](/kits?utm_source=guide-band-bundle) Suite logique [Installation · 4 min ### Jan : l'alternative open source Lire →](/guide/jan-app-desktop) [Installation · 5 min ### Démarrer avec LM Studio Lire →](/guide/demarrer-avec-lm-studio) [Comparatif · 8 min ### Comparatif des outils Lire →](/guide/ollama-vs-lmstudio-vs-jan) --- ## Ollama avec Docker : installation et premier modèle | QuelLLM.fr URL: https://quelllm.fr/guide/ollama-docker-installation-guide published: 2026-09-11 > Faire tourner Ollama dans un conteneur Docker : image officielle, volume de persistance des modèles, accès GPU NVIDIA, port 11434. Plus simple et propre… [Accueil](/) / [Guides](/guides) / Installation / Docker / Ollama avec Docker : installation et premier modèle Débutant 9 min Docker # Ollama avec Docker : installation et premiermodèle Faire tourner Ollama Docker plutôt qu'une installation système, c'est gagner en propreté : un conteneur isolé, un volume pour les modèles, une commande pour mettre à jour, zéro service systemd à gérer. Ce guide assemble la configuration minimale qui marche du premier coup — image officielle, GPU NVIDIA via le Container Toolkit, port 11434 exposé — puis ajoute un docker-compose.yml pour ne plus jamais retaper la commande. Par [Mohamed Meguedmi](/auteur/mohamed-meguedmi) · Màj 2026-08-27 · Testé sur Windows, macOS, Linux [◆ IA Locale — Ton ChatGPT privé et gratuit, sur ta machine, en 1 h · 24 € · ou tous les kits 49 € →](/kit-ia-locale?utm_source=guide-abovefold-ollama-docker-installation-guide) ## #Pourquoi Ollama Docker L'installation native d'Ollama est simple, mais elle pose un service systemd, écrit dans ~/.ollama, et mélange ses dépendances avec le reste de votre système. Sur un poste de dev ou un serveur partagé, ce n'est pas idéal. La version Docker règle ces frictions : tout vit dans un conteneur que vous démarrez, stoppez, supprimez d'une commande. Les modèles sont stockés dans un volume nommé, donc ils survivent à la suppression du conteneur. Et vous pouvez tester plusieurs versions d'Ollama en parallèle sans conflit. i Image officielle L'image de référence est ollama/ollama sur Docker Hub. Elle est maintenue par l'équipe Ollama, signée, et publiée à chaque release. C'est elle qu'on utilise — pas une copie communautaire. ## #Prérequis ✓ Le kit IA Locale Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud. - Espace en ligne à vie - PDF + fichiers - Remboursé 30 j [Le kit IA Locale →](/kit-ia-locale?utm_source=guide-inline-ollama-docker-installation-) ou [tous les kits à vie — 49 €](/kits?utm_source=guide-inline-ollama-docker-installation--bundle) → Docker Engine 20.10+ Sur Linux, le script officiel get.docker.com fait tout. Sur Windows ou macOS, Docker Desktop. 8 Go de RAM minimum Pour un modèle d'environ 8-9B en Q4, comme Qwen 3.5 9B. 16 Go conseillés si vous comptez utiliser le poste pour autre chose en parallèle. 20 Go d'espace disque libre Le volume des modèles grossit vite. Comptez 4–5 Go pour un 7B Q4, 9 Go pour un 14B Q4, 19 Go pour un 32B Q4. GPU NVIDIA (optionnel) RTX 20/30/40/50 ou compatible CUDA. Drivers à jour côté hôte. Le NVIDIA Container Toolkit s'ajoute au-dessus. → GPU AMD ou Apple Silicon Pour AMD, l'image ollama/ollama:rocm prend le relais (variable HSA_OVERRIDE_GFX_VERSION souvent nécessaire). Sur macOS, Docker Desktop ne donne pas accès à Metal — préférez l'installation native si vous voulez exploiter le GPU Apple. ## #1. La commande docker run Le cas le plus simple : CPU uniquement, port exposé sur l'hôte, volume nommé pour les modèles. Une seule commande. Ollama Docker — version CPU ⧉ Copier ``` `docker run -d \ --name ollama \ -p 11434:11434 \ -v ollama:/root/.ollama \ --restart unless-stopped \ ollama/ollama` ``` Décortiquons chaque flag, parce qu'ils ont tous une raison d'être : -d Démarre en arrière-plan (detached). Sans ça, le terminal reste accroché au conteneur. --name ollama Nom lisible pour les commandes suivantes (docker logs ollama, docker exec, etc.). -p 11434:11434 Mappe le port du conteneur vers l'hôte. C'est le port standard d'Ollama, identique à l'install native. -v ollama:/root/.ollama Volume nommé monté sur le dossier interne où Ollama stocke ses modèles. Survit à la suppression du conteneur. --restart unless-stopped Redémarre automatiquement au reboot de la machine, sauf si vous l'avez stoppé manuellement. Vérifiez que le conteneur tourne et qu'Ollama répond : Vérification ⧉ Copier ``` `docker ps --filter name=ollama curl http://localhost:11434/api/version` ``` Vous devriez voir une réponse JSON du type {"version":"0.5.x"}. Si oui, le daemon Ollama écoute déjà sur http://localhost:11434, prêt à recevoir des requêtes. ## #2. Activer le GPU NVIDIA Sans configuration spécifique, Docker ne voit pas votre GPU. Il faut installer le NVIDIA Container Toolkit côté hôte, puis ajouter --gpus all à la commande de lancement. NVIDIA Container Toolkit (Ubuntu/Debian) ⧉ Copier ``` `curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | \ sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \ sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \ sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list sudo apt-get update sudo apt-get install -y nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtime=docker sudo systemctl restart docker` ``` Validation rapide que Docker voit bien le GPU : Test du passthrough GPU ⧉ Copier ``` `docker run --rm --gpus all nvidia/cuda:12.4.0-base-ubuntu22.04 nvidia-smi` ``` Si la sortie ressemble à votre nvidia-smi habituel, vous êtes prêt. Sinon, vérifiez que les drivers NVIDIA sont à jour côté hôte (nvidia-smi doit déjà marcher en dehors de Docker). Relancez Ollama, cette fois avec accès GPU. Supprimez d'abord l'ancien conteneur (le volume ollama est préservé, vos futurs modèles aussi). Ollama Docker — version GPU ⧉ Copier ``` `docker rm -f ollama docker run -d \ --name ollama \ --gpus all \ -p 11434:11434 \ -v ollama:/root/.ollama \ --restart unless-stopped \ ollama/ollama` ``` ! Windows : un détail WSL2 Sur Windows, Docker Desktop tourne au-dessus de WSL2. L'accès GPU nécessite WSL2 + drivers NVIDIA Windows récents (525+). Pas de NVIDIA Container Toolkit à installer manuellement — Docker Desktop s'en occupe. Vérifiez juste que "Enable GPU" est coché dans les settings de Docker Desktop. ## #3. Premier modèle Le conteneur tourne mais il est vide. Tous les modèles se téléchargent via la CLI ollama, qui s'utilise depuis l'intérieur du conteneur avec docker exec. Télécharger Qwen 3.5 9B ⧉ Copier ``` `docker exec -it ollama ollama pull qwen3.5:9b` ``` Le téléchargement fait environ 6,6 Go en Q4_K_M (la quantization par défaut, le bon compromis qualité/mémoire). Qwen 3.5 9B est le choix de référence pour 8 Go en 2026 : 256k de contexte, gestion de la vision et licence Apache 2.0. Le modèle atterrit dans le volume ollama, donc il persistera même si vous supprimez le conteneur plus tard. Test de discussion interactive depuis le conteneur : Conversation ⧉ Copier ``` `docker exec -it ollama ollama run qwen3.5:9b` ``` Au prompt >>>, tapez n'importe quelle question. Pour quitter, /bye ou Ctrl+D. Mais le vrai cas d'usage, c'est l'API HTTP. Ollama expose un endpoint OpenAI-compatible sur le port 11434 — n'importe quel client (Python, curl, votre app) parle au conteneur comme à un Ollama natif. Appel API depuis l'hôte ⧉ Copier ``` `curl http://localhost:11434/api/generate -d '{ "model": "qwen3.5:9b", "prompt": "Explique la quantization Q4 en deux phrases.", "stream": false }'` ``` Pendant la génération, vérifiez que le GPU est bien sollicité : Statut du modèle chargé ⧉ Copier ``` `docker exec ollama ollama ps` ``` Dans la colonne PROCESSOR, vous devriez voir 100% GPU. Si vous voyez CPU, votre conteneur ne voit pas le GPU — relisez la section précédente et vérifiez le flag --gpus all. ## #4. Volume persistant : où vivent vos modèles Le -v ollama:/root/.ollama de la commande de lancement crée un volume Docker nommé ollama. Tous les modèles téléchargés, leurs métadonnées, et la configuration y sont stockés. Ce volume n'est pas dans le conteneur — il vit à part. Inspecter le volume ⧉ Copier ``` `docker volume inspect ollama` ``` La sortie indique le Mountpoint, typiquement /var/lib/docker/volumes/ollama/_data sur Linux. C'est là que se trouvent vos fichiers GGUF physiquement. Vous pouvez les voir avec sudo ls sur ce chemin. → Stocker l… ---