LM Studio en 2026 : tutoriel complet (Windows, Mac, Linux)
LM Studio est une app desktop qui transforme votre machine en serveur LLM local sans toucher au terminal. La version 0.3+ ajoute le support MCP, un meilleur moteur GGUF et une expérience de téléchargement de modèles directement depuis Hugging Face. Voici un tutoriel LM Studio 2026 complet : installation sur les trois OS, premier modèle, serveur OpenAI-compatible sur le port 1234, et comparaison honnête avec Ollama et Jan.
#Pourquoi LM Studio en 2026
LM Studio occupe une niche précise : l'utilisateur qui veut une vraie app graphique, pas un daemon CLI. Vous ouvrez l'app, vous cherchez un modèle dans la barre de recherche intégrée (qui pointe sur Hugging Face), vous cliquez Download, vous chattez. Zéro fichier de config, zéro ligne de commande.
Sous le capot, LM Studio embarque llama.cpp avec support CUDA, Metal, Vulkan et ROCm, ainsi qu'un moteur MLX dédié aux Mac Apple Silicon. La 0.3 a apporté l'écran « Power User » pour exposer tous les paramètres (KV cache type, flash attention, GPU offload couche par couche), et la 0.3.x a ajouté le support natif des serveurs MCP — vous branchez votre modèle local sur des outils comme un système de fichiers ou une base de données, sans coder.
#Prérequis
- Windows
- Windows 10/11 64 bits. AVX2 requis (tout CPU depuis 2014). Support CUDA si GPU NVIDIA, Vulkan sinon.
- macOS
- macOS 13.4+ sur Apple Silicon (M1/M2/M3/M4). Les Mac Intel ne sont plus supportés depuis la 0.3.
- Linux
- AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch récent). Build ARM64 disponible pour les SBC.
- RAM
- 16 Go minimum confortable, 8 Go limite. Pour un 14B en Q4, prévoyez 12 Go libres ; pour un 32B, 24 Go.
- Disque
- Comptez 30 à 50 Go : un modèle 14B en Q4 pèse ~9 Go, et vous en téléchargerez plusieurs.
#1. Installation sur Windows, Mac et Linux
Téléchargez l'installeur correspondant à votre OS depuis le site officiel. Pas de paquet npm, pas de Homebrew — c'est une app desktop classique.
- 01WindowsLancez LM-Studio-Setup.exe. SmartScreen peut bloquer le binaire au premier lancement — cliquez sur « Informations complémentaires » puis « Exécuter quand même ». L'app s'installe dans %LOCALAPPDATA%\Programs\lm-studio.
- 02macOSOuvrez le .dmg, glissez LM Studio.app dans /Applications. Au premier lancement, Gatekeeper peut vous demander d'autoriser l'app dans Réglages → Confidentialité et sécurité. Sur Apple Silicon, le moteur MLX est activé par défaut.
- 03LinuxTéléchargez l'AppImage, rendez-la exécutable avec chmod +x LM_Studio-0.3.x.AppImage, puis lancez-la. Pour l'intégrer au menu, utilisez AppImageLauncher ou créez un .desktop manuellement.
#2. Télécharger Qwen3-Coder en GGUF
L'onglet Discover (loupe) est votre interface vers Hugging Face. Tapez le nom d'un modèle, choisissez une quantization, cliquez Download. Pour ce tuto on prend Qwen3-Coder-30B-A3B, le coding model open-weight de référence chez ceux qui ont 16 Go de VRAM ou plus.
- 01Rechercher le modèleDans Discover, tapez "qwen3-coder". LM Studio affiche les repos GGUF compatibles (généralement bartowski, unsloth, lmstudio-community). Préférez les repos lmstudio-community ou bartowski : leurs GGUF sont validés sur la version courante du moteur.
- 02Choisir la quantizationPour 24 Go de VRAM, Q4_K_M est le sweet spot (qualité ~99% du FP16, taille ~17 Go). Pour 16 Go, descendez en Q3_K_M. Pour 32 Go ou Mac Studio, Q5_K_M ou Q8_0 si vous tenez à la précision maximale.
- 03Lancer le téléchargementCliquez Download. La progression s'affiche dans l'onglet Downloads. Sur connexion fibre, comptez ~5 minutes pour un fichier de 17 Go.
- 04Charger le modèlePassez sur l'onglet Chat, ouvrez le sélecteur en haut, choisissez Qwen3-Coder. Si vous êtes en Power User, ajustez le GPU Offload (par défaut LM Studio prend la valeur max safe), le Context Length (32k confortable pour du code) et activez Flash Attention.
#3. Premier chat et vérification GPU
Avec le modèle chargé, posez une question dans Chat. LM Studio affiche en bas de chaque réponse les tokens/sec, le temps de premier token et l'usage VRAM réel. C'est plus parlant que de jouer du nvidia-smi en parallèle.
Sur une RTX 4090, Qwen3-Coder-30B-A3B en Q4 tourne autour de 90-120 tok/s grâce à son architecture MoE (3B actifs sur 30B). Sur un M4 Pro 48 Go, comptez 35-50 tok/s avec le moteur MLX. Sur RTX 3060 12 Go, le modèle 30B ne rentre pas — basculez sur Qwen2.5-Coder-14B-Q4.
#4. Serveur OpenAI-compatible sur le port 1234
C'est l'argument que beaucoup ne connaissent pas : LM Studio expose un serveur HTTP compatible avec l'API OpenAI, par défaut sur http://localhost:1234. Vous pouvez donc brancher n'importe quel client OpenAI (SDK Python, LangChain, Continue.dev, Cursor, votre app maison) sur LM Studio sans changer une ligne de logique métier, juste l'URL de base et la clé.
- 01Activer Developer ModeEn bas à gauche, changez le rôle utilisateur en "Developer". L'onglet Local Server (icône terminal) apparaît dans la barre de gauche.
- 02Lancer le serveurOnglet Local Server → choisissez le modèle à exposer dans le menu du haut → cliquez Start Server. Par défaut, le serveur écoute sur localhost:1234. Cochez "Serve on Local Network" si vous voulez l'exposer aux autres machines de votre LAN.
- 03Vérifier l'endpointLe serveur expose les routes /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (si un modèle d'embeddings est chargé). Testez d'abord la liste des modèles.
#5. Support MCP natif
Depuis la 0.3.17, LM Studio supporte le Model Context Protocol (MCP) — le standard introduit par Anthropic en 2024 pour brancher des outils externes à un LLM. Concrètement : votre modèle local peut accéder à votre système de fichiers, exécuter du SQL, appeler une API, à condition qu'un serveur MCP soit configuré.
La configuration se fait dans le fichier mcp.json, accessible depuis le menu Program → Edit mcp.json. Voici un exemple qui ajoute le serveur filesystem officiel d'Anthropic et un serveur SQLite.
Une fois enregistré, les outils MCP apparaissent dans l'icône prise (plug) du chat. Vous pouvez les activer ponctuellement. Le modèle décide ensuite quand les appeler : utile pour faire un mini-agent local sans coder, du genre « résume tous les PDF du dossier Recherche » ou « combien de lignes dans la table users ».
#LM Studio vs Ollama vs Jan
Les trois outils visent le même objectif (LLM en local sans cloud) avec des philosophies différentes.
- LM Studio
- App desktop riche, recherche HF intégrée, serveur API :1234, support MCP, MLX sur Mac. Closed source mais gratuit. Idéal si vous voulez tout en un avec une GUI sérieuse.
- Ollama
- Daemon léger + CLI, écoute sur :11434, énorme bibliothèque de modèles préconfigurés (ollama run mistral), API stable, intégrations partout (Continue, Open WebUI, n8n). Open source. Idéal si vous êtes à l'aise en terminal et que vous voulez du headless.
- Jan
- App desktop open source (AGPL), philosophie « offline-first » radicale, plus jeune et moins riche en fonctionnalités qu'LM Studio. Sympa si l'open source matters et que vous voulez du desktop.
#Dépannage
- Le modèle ne se charge pas (OOM)
- Réduisez le GPU Offload manuellement dans les Settings du chat. Si vous offload 100% sur GPU et que ça plante, descendez à 80% — quelques couches passent en RAM, c'est plus lent mais ça tourne.
- Tokens/sec très faibles
- Vérifiez que Flash Attention est activé et que KV cache type est à Q8_0 (pas FP16). En Power User, ces réglages sont dans la sidebar droite du chat.
- Le serveur API ne répond pas
- Confirmez que vous êtes en Developer Mode et que le bouton Start Server est vert. Sur Windows, le pare-feu peut bloquer le port 1234 — autorisez LM Studio dans le Pare-feu Windows Defender.
- Modèle introuvable dans la recherche
- LM Studio ne liste que les repos GGUF compatibles avec sa version de llama.cpp. Pour les modèles très récents, mettez à jour LM Studio (Help → Check for Updates) ou téléchargez le GGUF manuellement et déposez-le dans le dossier models.
- Linux : AppImage refuse de se lancer
- Installez libfuse2 (sudo apt install libfuse2 sur Ubuntu 22.04+). Sur Wayland, exportez QT_QPA_PLATFORM=xcb si l'app ne s'affiche pas correctement.
#Pour aller plus loin
Trois directions naturelles selon ce que vous voulez faire ensuite :
- Comparer plus en détail
- Le guide « LM Studio vs Ollama : lequel choisir en 2026 » fait le match feature par feature, avec une grille de décision selon votre profil.
- Brancher LM Studio sur vos PDF
- « RAG local avec LM Studio : discuter avec vos documents » explique la fonction Chat with Documents, ses limites, et quand passer à AnythingLLM.
- Accélérer encore l'inférence
- « LM Studio et le MTP (Multi-Token Prediction) » détaille comment activer le MTP sur les modèles compatibles pour gagner 30 à 80% de débit.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.