Débutant 12 minInterfaces

LM Studio en 2026 : tutoriel complet (Windows, Mac, Linux)

LM Studio est une app desktop qui transforme votre machine en serveur LLM local sans toucher au terminal. La version 0.3+ ajoute le support MCP, un meilleur moteur GGUF et une expérience de téléchargement de modèles directement depuis Hugging Face. Voici un tutoriel LM Studio 2026 complet : installation sur les trois OS, premier modèle, serveur OpenAI-compatible sur le port 1234, et comparaison honnête avec Ollama et Jan.

Par Mohamed Meguedmi·Màj 2026-06-07·Testé sur Windows 11

#Pourquoi LM Studio en 2026

LM Studio occupe une niche précise : l'utilisateur qui veut une vraie app graphique, pas un daemon CLI. Vous ouvrez l'app, vous cherchez un modèle dans la barre de recherche intégrée (qui pointe sur Hugging Face), vous cliquez Download, vous chattez. Zéro fichier de config, zéro ligne de commande.

Sous le capot, LM Studio embarque llama.cpp avec support CUDA, Metal, Vulkan et ROCm, ainsi qu'un moteur MLX dédié aux Mac Apple Silicon. La 0.3 a apporté l'écran « Power User » pour exposer tous les paramètres (KV cache type, flash attention, GPU offload couche par couche), et la 0.3.x a ajouté le support natif des serveurs MCP — vous branchez votre modèle local sur des outils comme un système de fichiers ou une base de données, sans coder.

i
Licence et usage commercial
LM Studio est gratuit pour un usage personnel. Pour un usage commercial en entreprise, le formulaire "LM Studio at Work" est désormais self-serve depuis la 0.3.5 — gratuit, mais à remplir. Aucune télémétrie modèle n'est envoyée par défaut.

#Prérequis

Windows
Windows 10/11 64 bits. AVX2 requis (tout CPU depuis 2014). Support CUDA si GPU NVIDIA, Vulkan sinon.
macOS
macOS 13.4+ sur Apple Silicon (M1/M2/M3/M4). Les Mac Intel ne sont plus supportés depuis la 0.3.
Linux
AppImage x86_64, glibc 2.35+ (Ubuntu 22.04, Fedora 36, Arch récent). Build ARM64 disponible pour les SBC.
RAM
16 Go minimum confortable, 8 Go limite. Pour un 14B en Q4, prévoyez 12 Go libres ; pour un 32B, 24 Go.
Disque
Comptez 30 à 50 Go : un modèle 14B en Q4 pèse ~9 Go, et vous en téléchargerez plusieurs.

#1. Installation sur Windows, Mac et Linux

Téléchargez l'installeur correspondant à votre OS depuis le site officiel. Pas de paquet npm, pas de Homebrew — c'est une app desktop classique.

Site officiel
https://lmstudio.ai/download
  1. 01
    Windows
    Lancez LM-Studio-Setup.exe. SmartScreen peut bloquer le binaire au premier lancement — cliquez sur « Informations complémentaires » puis « Exécuter quand même ». L'app s'installe dans %LOCALAPPDATA%\Programs\lm-studio.
  2. 02
    macOS
    Ouvrez le .dmg, glissez LM Studio.app dans /Applications. Au premier lancement, Gatekeeper peut vous demander d'autoriser l'app dans Réglages → Confidentialité et sécurité. Sur Apple Silicon, le moteur MLX est activé par défaut.
  3. 03
    Linux
    Téléchargez l'AppImage, rendez-la exécutable avec chmod +x LM_Studio-0.3.x.AppImage, puis lancez-la. Pour l'intégrer au menu, utilisez AppImageLauncher ou créez un .desktop manuellement.
Linux — premier lancement
chmod +x LM_Studio-0.3.x.AppImage
./LM_Studio-0.3.x.AppImage
Onboarding 2026
Au premier lancement, LM Studio 0.3+ vous propose un mode « User », « Power User » ou « Developer ». Le mode Power User débloque le contrôle fin (GPU layers, KV cache, flash attention) ; le mode Developer ajoute l'onglet Local Server. Commencez en Power User — vous basculerez sur Developer une fois l'API serveur utile.

#2. Télécharger Qwen3-Coder en GGUF

L'onglet Discover (loupe) est votre interface vers Hugging Face. Tapez le nom d'un modèle, choisissez une quantization, cliquez Download. Pour ce tuto on prend Qwen3-Coder-30B-A3B, le coding model open-weight de référence chez ceux qui ont 16 Go de VRAM ou plus.

  1. 01
    Rechercher le modèle
    Dans Discover, tapez "qwen3-coder". LM Studio affiche les repos GGUF compatibles (généralement bartowski, unsloth, lmstudio-community). Préférez les repos lmstudio-community ou bartowski : leurs GGUF sont validés sur la version courante du moteur.
  2. 02
    Choisir la quantization
    Pour 24 Go de VRAM, Q4_K_M est le sweet spot (qualité ~99% du FP16, taille ~17 Go). Pour 16 Go, descendez en Q3_K_M. Pour 32 Go ou Mac Studio, Q5_K_M ou Q8_0 si vous tenez à la précision maximale.
  3. 03
    Lancer le téléchargement
    Cliquez Download. La progression s'affiche dans l'onglet Downloads. Sur connexion fibre, comptez ~5 minutes pour un fichier de 17 Go.
  4. 04
    Charger le modèle
    Passez sur l'onglet Chat, ouvrez le sélecteur en haut, choisissez Qwen3-Coder. Si vous êtes en Power User, ajustez le GPU Offload (par défaut LM Studio prend la valeur max safe), le Context Length (32k confortable pour du code) et activez Flash Attention.
VRAM par taille (Q4_K_M)
Repères rapides : 3B ≈ 2 Go · 7B ≈ 5 Go · 14B ≈ 9 Go · 32B ≈ 19 Go · 70B ≈ 40 Go. Si LM Studio refuse de charger le modèle entièrement sur GPU, il bascule en offload partiel CPU — c'est jouable mais 5 à 10× plus lent.

#3. Premier chat et vérification GPU

Avec le modèle chargé, posez une question dans Chat. LM Studio affiche en bas de chaque réponse les tokens/sec, le temps de premier token et l'usage VRAM réel. C'est plus parlant que de jouer du nvidia-smi en parallèle.

Test rapide
# Dans le chat LM Studio :
Écris une fonction Python qui parse un CSV streaming
sans charger tout le fichier en mémoire.

Sur une RTX 4090, Qwen3-Coder-30B-A3B en Q4 tourne autour de 90-120 tok/s grâce à son architecture MoE (3B actifs sur 30B). Sur un M4 Pro 48 Go, comptez 35-50 tok/s avec le moteur MLX. Sur RTX 3060 12 Go, le modèle 30B ne rentre pas — basculez sur Qwen2.5-Coder-14B-Q4.

i
Mode "Just Show Me The Answer"
Par défaut, les modèles de reasoning comme DeepSeek R1 ou Qwen3-Thinking affichent leur chaîne de pensée dans une zone repliable. Dans les Settings d'un chat, vous pouvez désactiver l'affichage du thinking pour ne voir que la réponse finale.

#4. Serveur OpenAI-compatible sur le port 1234

C'est l'argument que beaucoup ne connaissent pas : LM Studio expose un serveur HTTP compatible avec l'API OpenAI, par défaut sur http://localhost:1234. Vous pouvez donc brancher n'importe quel client OpenAI (SDK Python, LangChain, Continue.dev, Cursor, votre app maison) sur LM Studio sans changer une ligne de logique métier, juste l'URL de base et la clé.

  1. 01
    Activer Developer Mode
    En bas à gauche, changez le rôle utilisateur en "Developer". L'onglet Local Server (icône terminal) apparaît dans la barre de gauche.
  2. 02
    Lancer le serveur
    Onglet Local Server → choisissez le modèle à exposer dans le menu du haut → cliquez Start Server. Par défaut, le serveur écoute sur localhost:1234. Cochez "Serve on Local Network" si vous voulez l'exposer aux autres machines de votre LAN.
  3. 03
    Vérifier l'endpoint
    Le serveur expose les routes /v1/models, /v1/chat/completions, /v1/completions, /v1/embeddings (si un modèle d'embeddings est chargé). Testez d'abord la liste des modèles.
Test de l'API
curl http://localhost:1234/v1/models

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-coder-30b-a3b",
    "messages": [{"role": "user", "content": "Bonjour"}],
    "stream": false
  }'
Client Python officiel
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio",  # ignorée, n'importe quelle chaîne
)

resp = client.chat.completions.create(
    model="qwen3-coder-30b-a3b",
    messages=[{"role": "user", "content": "Refactore ce code en idiomatic Rust : ..."}],
)
print(resp.choices[0].message.content)
JIT model loading
Activez « Just-in-Time Model Loading » dans les paramètres du serveur. LM Studio charge alors automatiquement le modèle demandé par la requête API — pratique si vous jonglez entre plusieurs modèles depuis différents clients.

#5. Support MCP natif

Depuis la 0.3.17, LM Studio supporte le Model Context Protocol (MCP) — le standard introduit par Anthropic en 2024 pour brancher des outils externes à un LLM. Concrètement : votre modèle local peut accéder à votre système de fichiers, exécuter du SQL, appeler une API, à condition qu'un serveur MCP soit configuré.

La configuration se fait dans le fichier mcp.json, accessible depuis le menu Program → Edit mcp.json. Voici un exemple qui ajoute le serveur filesystem officiel d'Anthropic et un serveur SQLite.

mcp.json
{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": [
        "-y",
        "@modelcontextprotocol/server-filesystem",
        "/home/user/Documents"
      ]
    },
    "sqlite": {
      "command": "uvx",
      "args": ["mcp-server-sqlite", "--db-path", "/home/user/data.db"]
    }
  }
}

Une fois enregistré, les outils MCP apparaissent dans l'icône prise (plug) du chat. Vous pouvez les activer ponctuellement. Le modèle décide ensuite quand les appeler : utile pour faire un mini-agent local sans coder, du genre « résume tous les PDF du dossier Recherche » ou « combien de lignes dans la table users ».

!
Quel modèle pour le tool use
Tous les modèles ne sont pas bons en tool calling. Qwen3-Coder, Llama 3.3 70B, Mistral Small 3, et les modèles entraînés explicitement pour function calling marchent bien. Les petits modèles (< 7B) hallucinent souvent les noms d'outils — testez avant de déployer.

#LM Studio vs Ollama vs Jan

Les trois outils visent le même objectif (LLM en local sans cloud) avec des philosophies différentes.

LM Studio
App desktop riche, recherche HF intégrée, serveur API :1234, support MCP, MLX sur Mac. Closed source mais gratuit. Idéal si vous voulez tout en un avec une GUI sérieuse.
Ollama
Daemon léger + CLI, écoute sur :11434, énorme bibliothèque de modèles préconfigurés (ollama run mistral), API stable, intégrations partout (Continue, Open WebUI, n8n). Open source. Idéal si vous êtes à l'aise en terminal et que vous voulez du headless.
Jan
App desktop open source (AGPL), philosophie « offline-first » radicale, plus jeune et moins riche en fonctionnalités qu'LM Studio. Sympa si l'open source matters et que vous voulez du desktop.
Combo gagnant
Beaucoup d'utilisateurs avancés font tourner Ollama comme daemon serveur (24/7, sans GUI) et utilisent LM Studio comme client/explorateur pour tester de nouveaux modèles avant de les pousser dans Ollama. Les deux peuvent cohabiter — ils n'écoutent pas le même port.

#Dépannage

Le modèle ne se charge pas (OOM)
Réduisez le GPU Offload manuellement dans les Settings du chat. Si vous offload 100% sur GPU et que ça plante, descendez à 80% — quelques couches passent en RAM, c'est plus lent mais ça tourne.
Tokens/sec très faibles
Vérifiez que Flash Attention est activé et que KV cache type est à Q8_0 (pas FP16). En Power User, ces réglages sont dans la sidebar droite du chat.
Le serveur API ne répond pas
Confirmez que vous êtes en Developer Mode et que le bouton Start Server est vert. Sur Windows, le pare-feu peut bloquer le port 1234 — autorisez LM Studio dans le Pare-feu Windows Defender.
Modèle introuvable dans la recherche
LM Studio ne liste que les repos GGUF compatibles avec sa version de llama.cpp. Pour les modèles très récents, mettez à jour LM Studio (Help → Check for Updates) ou téléchargez le GGUF manuellement et déposez-le dans le dossier models.
Linux : AppImage refuse de se lancer
Installez libfuse2 (sudo apt install libfuse2 sur Ubuntu 22.04+). Sur Wayland, exportez QT_QPA_PLATFORM=xcb si l'app ne s'affiche pas correctement.

#Pour aller plus loin

Trois directions naturelles selon ce que vous voulez faire ensuite :

Comparer plus en détail
Le guide « LM Studio vs Ollama : lequel choisir en 2026 » fait le match feature par feature, avec une grille de décision selon votre profil.
Brancher LM Studio sur vos PDF
« RAG local avec LM Studio : discuter avec vos documents » explique la fonction Chat with Documents, ses limites, et quand passer à AnythingLLM.
Accélérer encore l'inférence
« LM Studio et le MTP (Multi-Token Prediction) » détaille comment activer le MTP sur les modèles compatibles pour gagner 30 à 80% de débit.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.