Installer un LLM en local : le guide pas à pas (2026)
Installer un LLM en local demande trois choses : une machine avec assez de RAM ou de VRAM pour la taille de modèle visée, un outil pour le faire tourner — LM Studio sans terminal, Ollama en ligne de commande, ou llama.cpp pour les experts — et un premier modèle quantifié adapté à ce matériel. Comptez de 10 à 15 minutes pour un premier chat local fonctionnel sur une machine récente, et plus aucune connexion internet nécessaire une fois le modèle téléchargé.
Vous voulez faire tourner une IA directement sur votre PC ou Mac, mais tous les noms d'outils et de modèles se ressemblent et vous ne savez pas par où commencer ? Ce guide est la vue d'ensemble qui manque avant de choisir : vérifier que votre machine peut suivre, comparer les trois méthodes d'installation, repérer votre premier modèle, et éviter les erreurs qui gâchent le premier essai. Chaque étape renvoie vers un guide dédié plus détaillé si vous voulez aller plus loin sur un point précis.
#Vérifier sa machine : RAM, VRAM et taille de modèle
Avant de choisir un outil, la question qui compte vraiment est : combien de mémoire votre machine peut-elle consacrer à un modèle ? Un modèle « 7B » ou « 32B » désigne son nombre de paramètres, mais c'est sa version quantifiée — compressée pour tenir en mémoire, au prix d'une petite perte de précision — qui détermine l'espace réellement nécessaire. La quantification Q4 (souvent notée Q4_K_M) est le compromis standard pour démarrer : elle réduit fortement la mémoire nécessaire par rapport au poids natif du modèle, pour une perte de qualité généralement peu perceptible à l'usage.
- 8 Go de RAM, pas de GPU dédié
- des modèles légers autour de 3-4B en Q4 : usage basique, réponses plus lentes mais fonctionnelles.
- 16 Go de RAM (CPU) ou 8 Go de VRAM (GPU)
- le point d'entrée le plus confortable, avec des modèles 7-8B en Q4 — le format le plus courant pour un premier vrai usage.
- 12 Go de VRAM
- de la marge pour monter jusqu'à un modèle 14B sans souci particulier.
- 24 Go de VRAM (ou 32-48 Go de mémoire unifiée sur Mac)
- un modèle 32B en quantification Q4 tourne confortablement.
- 64 Go et plus de RAM ou de mémoire unifiée
- les modèles autour de 70B deviennent jouables, avec un déchargement partiel entre CPU et GPU et un débit nettement plus lent.
#Choisir sa méthode : LM Studio, Ollama ou llama.cpp
Trois grandes voies permettent de faire tourner un LLM en local. Elles ne s'excluent pas entre elles, mais partent de philosophies différentes — le choix se fait surtout sur votre niveau de confort avec un terminal et sur ce que vous comptez faire du modèle une fois installé.
- LM Studio — zéro terminal
- application de bureau avec interface graphique complète, recherche de modèles intégrée, réglages GPU visuels. Le choix le plus direct pour un premier contact, disponible sur Windows, macOS (Apple Silicon) et Linux.
- Ollama — terminal et API
- installation en une commande, bibliothèque de modèles pilotée en ligne de commande, serveur API local compatible OpenAI actif par défaut. Le choix naturel si vous comptez scripter, automatiser ou brancher un outil tiers.
- llama.cpp — pour les experts
- le moteur d'inférence que beaucoup d'autres outils utilisent en coulisses, dont LM Studio. Compilation depuis les sources, contrôle fin de chaque paramètre, aucune interface — réservé à qui veut comprendre ou optimiser chaque détail.
En résumé : vous ne voulez ouvrir aucun terminal → LM Studio. Vous voulez appeler votre modèle depuis un script, une automatisation ou une application → Ollama. Vous voulez comprendre ou ajuster chaque paramètre de compilation, ou faire tourner le modèle sur un matériel inhabituel → llama.cpp.
#Installation express, étape par étape
Voici l'installation condensée pour chacune des trois voies. L'idée ici est d'avoir la vue d'ensemble pour démarrer en quelques minutes ; un guide dédié existe pour chaque outil si vous voulez le détail complet, captures d'écran comprises.
Avec LM Studio (zéro terminal) :
- 011. Télécharger l'installeurDepuis le site officiel de LM Studio, récupérez la version correspondant à votre système.
- 022. Ouvrir la recherche de modèlesAu premier lancement, ouvrez l'onglet de recherche (raccourci Ctrl/Cmd+Maj+M) pour parcourir le catalogue.
- 033. Choisir un modèle adaptéL'application affiche une estimation de compatibilité VRAM avant le téléchargement : privilégiez un modèle marqué compatible avec votre machine.
- 044. Charger le modèle et discuterOuvrez l'onglet Chat, chargez le modèle téléchargé dans le menu du haut, et posez votre première question.
Avec Ollama (terminal et API) :
- 011. Installer OllamaScript officiel sous Linux, installeur .exe ou .dmg sous Windows et macOS. L'application desktop se lance automatiquement après l'installation.
- 022. Lancer un premier modèleDans un terminal, la commande ollama run suivie du nom d'un modèle le télécharge puis démarre un chat directement dans le terminal.
- 033. Discuter ou brancher un outil tiersContinuez dans le terminal, ou pointez une application compatible OpenAI vers le serveur API local (port 11434 par défaut).
- 044. Gérer vos modèles installésListez, changez ou supprimez vos modèles à tout moment avec les commandes de gestion dédiées.
Avec llama.cpp (experts) :
- 011. Compiler le binaireClonez le dépôt et compilez pour votre matériel (CPU, CUDA, Metal ou ROCm selon votre configuration).
- 022. Télécharger un modèle GGUFRécupérez un fichier au format GGUF depuis Hugging Face, en choisissant la quantification adaptée à votre mémoire disponible.
- 033. Lancer le binaire de chatPointez vers le fichier GGUF téléchargé, avec les paramètres de contexte et de déchargement GPU de votre choix.
- 044. Ajuster l'offload GPU/CPUAffinez couche par couche la répartition entre GPU et CPU pour trouver le meilleur compromis vitesse/mémoire sur votre configuration.
#Télécharger son premier modèle
Le bon premier modèle dépend surtout de ce que votre machine peut tenir confortablement en mémoire, pas de la réputation du modèle. Voici des repères sûrs selon votre configuration.
- Machine modeste (8-16 Go de RAM, pas de GPU dédié)
- un petit modèle généraliste autour de 3-4B en Q4 : rapide même en CPU pur, largement suffisant pour discuter, résumer ou traduire un texte court.
- 8-12 Go de VRAM
- un modèle 7-8B en Q4_K_M, comme Qwen3 8B ou Mistral : le compromis qualité/vitesse le plus courant pour un usage quotidien.
- 16-24 Go de VRAM
- un modèle 14B, ou un 32B en Q4 si vous êtes en haut de cette fourchette, comme Gemma dans sa version la plus grande : plus de marge pour du raisonnement ou du code.
- Vous ne savez pas encore ce que vous voulez en faire
- commencez petit. Valider qu'un modèle léger répond correctement prend quelques minutes ; vous monterez en taille une fois le premier essai concluant.
#Erreurs courantes à éviter
La plupart des mauvaises premières impressions sur l'IA locale viennent d'un mauvais réglage plutôt que d'un vrai problème avec l'outil ou le modèle. Voici les pièges les plus fréquents chez qui installe son premier LLM en local, et comment les repérer rapidement.
- Modèle trop gros pour la VRAM
- le modèle déborde sur la RAM système, voire plante au chargement. Les réponses deviennent très lentes ou une erreur de mémoire s'affiche. Redescendez d'une taille de modèle, ou d'un cran de quantification.
- Quantification choisie au hasard
- télécharger la version la plus lourde disponible « pour avoir le mieux » finit souvent par ne pas tenir en mémoire. Partez de Q4_K_M, et ne montez que si la marge mémoire le permet vraiment.
- Ventilateur qui s'emballe et réponse qui traîne
- normal sur un premier gros modèle : l'inférence sollicite fortement le GPU ou le CPU. Si c'est trop lent à votre goût, c'est le signe d'un modèle surdimensionné pour votre machine, pas un bug à corriger.
- Tout télécharger avant de tester
- mieux vaut valider qu'un petit modèle fonctionne et répond correctement avant de lancer le téléchargement d'un modèle de plusieurs dizaines de Go.
#Et après ? RAG, copilote de code, API
Une fois un premier modèle installé et fonctionnel, plusieurs suites naturelles s'ouvrent selon votre usage : discuter avec vos propres documents, brancher un copilote de code dans votre éditeur, ou exposer le serveur API local à vos propres scripts et applications.
- Discuter avec vos documents (RAG)
- LM Studio propose un RAG intégré prêt à l'emploi. Sous Ollama, il faut associer un outil tiers comme Open WebUI ou un pipeline dédié pour obtenir un résultat équivalent.
- Copiloter votre éditeur de code
- le serveur API compatible OpenAI d'Ollama ou de LM Studio peut être branché à des extensions comme Cline pour coder avec une assistance 100 % locale.
- Automatiser via l'API
- les deux outils exposent un serveur local compatible OpenAI, réutilisable dans n'importe quel script ou application déjà pensée pour cette API, sans rien changer côté client.
#Questions fréquentes
Installer un LLM en local, c'est légal et gratuit ?+
Quelle configuration minimum pour se lancer ?+
Peut-on installer un LLM en local sans carte graphique ?+
Combien d'espace disque faut-il prévoir ?+
Quel modèle choisir pour commencer ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.