Débutant 12 minInstallation

Installer un LLM en local : le guide pas à pas (2026)

Réponse directe

Installer un LLM en local demande trois choses : une machine avec assez de RAM ou de VRAM pour la taille de modèle visée, un outil pour le faire tourner — LM Studio sans terminal, Ollama en ligne de commande, ou llama.cpp pour les experts — et un premier modèle quantifié adapté à ce matériel. Comptez de 10 à 15 minutes pour un premier chat local fonctionnel sur une machine récente, et plus aucune connexion internet nécessaire une fois le modèle téléchargé.

Vous voulez faire tourner une IA directement sur votre PC ou Mac, mais tous les noms d'outils et de modèles se ressemblent et vous ne savez pas par où commencer ? Ce guide est la vue d'ensemble qui manque avant de choisir : vérifier que votre machine peut suivre, comparer les trois méthodes d'installation, repérer votre premier modèle, et éviter les erreurs qui gâchent le premier essai. Chaque étape renvoie vers un guide dédié plus détaillé si vous voulez aller plus loin sur un point précis.

Par Mohamed Meguedmi·Màj 2026-08-24·Testé sur Windows, macOS, Linux

#Vérifier sa machine : RAM, VRAM et taille de modèle

Avant de choisir un outil, la question qui compte vraiment est : combien de mémoire votre machine peut-elle consacrer à un modèle ? Un modèle « 7B » ou « 32B » désigne son nombre de paramètres, mais c'est sa version quantifiée — compressée pour tenir en mémoire, au prix d'une petite perte de précision — qui détermine l'espace réellement nécessaire. La quantification Q4 (souvent notée Q4_K_M) est le compromis standard pour démarrer : elle réduit fortement la mémoire nécessaire par rapport au poids natif du modèle, pour une perte de qualité généralement peu perceptible à l'usage.

8 Go de RAM, pas de GPU dédié
des modèles légers autour de 3-4B en Q4 : usage basique, réponses plus lentes mais fonctionnelles.
16 Go de RAM (CPU) ou 8 Go de VRAM (GPU)
le point d'entrée le plus confortable, avec des modèles 7-8B en Q4 — le format le plus courant pour un premier vrai usage.
12 Go de VRAM
de la marge pour monter jusqu'à un modèle 14B sans souci particulier.
24 Go de VRAM (ou 32-48 Go de mémoire unifiée sur Mac)
un modèle 32B en quantification Q4 tourne confortablement.
64 Go et plus de RAM ou de mémoire unifiée
les modèles autour de 70B deviennent jouables, avec un déchargement partiel entre CPU et GPU et un débit nettement plus lent.
i
Ce sont des repères, pas des garanties
La longueur de contexte utilisée, le système d'exploitation et les autres applications ouvertes font varier la marge réelle disponible. Gardez toujours une marge d'environ 20 à 30 % au-delà du poids strict du modèle avant de considérer une configuration comme confortable.

#Choisir sa méthode : LM Studio, Ollama ou llama.cpp

Trois grandes voies permettent de faire tourner un LLM en local. Elles ne s'excluent pas entre elles, mais partent de philosophies différentes — le choix se fait surtout sur votre niveau de confort avec un terminal et sur ce que vous comptez faire du modèle une fois installé.

LM Studio — zéro terminal
application de bureau avec interface graphique complète, recherche de modèles intégrée, réglages GPU visuels. Le choix le plus direct pour un premier contact, disponible sur Windows, macOS (Apple Silicon) et Linux.
Ollama — terminal et API
installation en une commande, bibliothèque de modèles pilotée en ligne de commande, serveur API local compatible OpenAI actif par défaut. Le choix naturel si vous comptez scripter, automatiser ou brancher un outil tiers.
llama.cpp — pour les experts
le moteur d'inférence que beaucoup d'autres outils utilisent en coulisses, dont LM Studio. Compilation depuis les sources, contrôle fin de chaque paramètre, aucune interface — réservé à qui veut comprendre ou optimiser chaque détail.

En résumé : vous ne voulez ouvrir aucun terminal → LM Studio. Vous voulez appeler votre modèle depuis un script, une automatisation ou une application → Ollama. Vous voulez comprendre ou ajuster chaque paramètre de compilation, ou faire tourner le modèle sur un matériel inhabituel → llama.cpp.


#Installation express, étape par étape

Voici l'installation condensée pour chacune des trois voies. L'idée ici est d'avoir la vue d'ensemble pour démarrer en quelques minutes ; un guide dédié existe pour chaque outil si vous voulez le détail complet, captures d'écran comprises.

Avec LM Studio (zéro terminal) :

  1. 01
    1. Télécharger l'installeur
    Depuis le site officiel de LM Studio, récupérez la version correspondant à votre système.
  2. 02
    2. Ouvrir la recherche de modèles
    Au premier lancement, ouvrez l'onglet de recherche (raccourci Ctrl/Cmd+Maj+M) pour parcourir le catalogue.
  3. 03
    3. Choisir un modèle adapté
    L'application affiche une estimation de compatibilité VRAM avant le téléchargement : privilégiez un modèle marqué compatible avec votre machine.
  4. 04
    4. Charger le modèle et discuter
    Ouvrez l'onglet Chat, chargez le modèle téléchargé dans le menu du haut, et posez votre première question.

Avec Ollama (terminal et API) :

  1. 01
    1. Installer Ollama
    Script officiel sous Linux, installeur .exe ou .dmg sous Windows et macOS. L'application desktop se lance automatiquement après l'installation.
  2. 02
    2. Lancer un premier modèle
    Dans un terminal, la commande ollama run suivie du nom d'un modèle le télécharge puis démarre un chat directement dans le terminal.
  3. 03
    3. Discuter ou brancher un outil tiers
    Continuez dans le terminal, ou pointez une application compatible OpenAI vers le serveur API local (port 11434 par défaut).
  4. 04
    4. Gérer vos modèles installés
    Listez, changez ou supprimez vos modèles à tout moment avec les commandes de gestion dédiées.

Avec llama.cpp (experts) :

  1. 01
    1. Compiler le binaire
    Clonez le dépôt et compilez pour votre matériel (CPU, CUDA, Metal ou ROCm selon votre configuration).
  2. 02
    2. Télécharger un modèle GGUF
    Récupérez un fichier au format GGUF depuis Hugging Face, en choisissant la quantification adaptée à votre mémoire disponible.
  3. 03
    3. Lancer le binaire de chat
    Pointez vers le fichier GGUF téléchargé, avec les paramètres de contexte et de déchargement GPU de votre choix.
  4. 04
    4. Ajuster l'offload GPU/CPU
    Affinez couche par couche la répartition entre GPU et CPU pour trouver le meilleur compromis vitesse/mémoire sur votre configuration.
i
Pour le détail complet
Chacune de ces trois voies mérite son propre guide pas à pas, avec captures d'écran et options avancées. Cette version condensée suffit pour un premier modèle qui répond ; revenez sur le guide dédié dès que vous voulez creuser un point précis, comme le support GPU AMD ou la configuration réseau d'un serveur.

#Télécharger son premier modèle

Le bon premier modèle dépend surtout de ce que votre machine peut tenir confortablement en mémoire, pas de la réputation du modèle. Voici des repères sûrs selon votre configuration.

Machine modeste (8-16 Go de RAM, pas de GPU dédié)
un petit modèle généraliste autour de 3-4B en Q4 : rapide même en CPU pur, largement suffisant pour discuter, résumer ou traduire un texte court.
8-12 Go de VRAM
un modèle 7-8B en Q4_K_M, comme Qwen3 8B ou Mistral : le compromis qualité/vitesse le plus courant pour un usage quotidien.
16-24 Go de VRAM
un modèle 14B, ou un 32B en Q4 si vous êtes en haut de cette fourchette, comme Gemma dans sa version la plus grande : plus de marge pour du raisonnement ou du code.
Vous ne savez pas encore ce que vous voulez en faire
commencez petit. Valider qu'un modèle léger répond correctement prend quelques minutes ; vous monterez en taille une fois le premier essai concluant.
Le nom de quantification n'est pas cosmétique
Un tag comme Q4_K_M, Q5_K_M ou Q8_0 indique le niveau de compression du modèle. Plus le chiffre est bas, plus le modèle est léger et rapide, mais moins précis. Q4_K_M reste le meilleur point de départ pour un premier essai.

#Erreurs courantes à éviter

La plupart des mauvaises premières impressions sur l'IA locale viennent d'un mauvais réglage plutôt que d'un vrai problème avec l'outil ou le modèle. Voici les pièges les plus fréquents chez qui installe son premier LLM en local, et comment les repérer rapidement.

Modèle trop gros pour la VRAM
le modèle déborde sur la RAM système, voire plante au chargement. Les réponses deviennent très lentes ou une erreur de mémoire s'affiche. Redescendez d'une taille de modèle, ou d'un cran de quantification.
Quantification choisie au hasard
télécharger la version la plus lourde disponible « pour avoir le mieux » finit souvent par ne pas tenir en mémoire. Partez de Q4_K_M, et ne montez que si la marge mémoire le permet vraiment.
Ventilateur qui s'emballe et réponse qui traîne
normal sur un premier gros modèle : l'inférence sollicite fortement le GPU ou le CPU. Si c'est trop lent à votre goût, c'est le signe d'un modèle surdimensionné pour votre machine, pas un bug à corriger.
Tout télécharger avant de tester
mieux vaut valider qu'un petit modèle fonctionne et répond correctement avant de lancer le téléchargement d'un modèle de plusieurs dizaines de Go.

#Et après ? RAG, copilote de code, API

Une fois un premier modèle installé et fonctionnel, plusieurs suites naturelles s'ouvrent selon votre usage : discuter avec vos propres documents, brancher un copilote de code dans votre éditeur, ou exposer le serveur API local à vos propres scripts et applications.

Discuter avec vos documents (RAG)
LM Studio propose un RAG intégré prêt à l'emploi. Sous Ollama, il faut associer un outil tiers comme Open WebUI ou un pipeline dédié pour obtenir un résultat équivalent.
Copiloter votre éditeur de code
le serveur API compatible OpenAI d'Ollama ou de LM Studio peut être branché à des extensions comme Cline pour coder avec une assistance 100 % locale.
Automatiser via l'API
les deux outils exposent un serveur local compatible OpenAI, réutilisable dans n'importe quel script ou application déjà pensée pour cette API, sans rien changer côté client.
Une étape à la fois
Inutile de viser le RAG, le copilote de code et l'automatisation dès le premier jour. Validez d'abord un chat local qui répond correctement à vos questions ; les usages plus avancés se construisent naturellement une fois cette base solide.

#Questions fréquentes

Installer un LLM en local, c'est légal et gratuit ?+
Oui : les outils comme Ollama, LM Studio ou llama.cpp sont gratuits, et les modèles open-weights (Llama, Qwen, Mistral, Gemma...) sont publiés sous des licences qui autorisent l'usage personnel. Certaines licences ont des conditions spécifiques pour un usage commercial à grande échelle, à vérifier au cas par cas sur la fiche du modèle.
Quelle configuration minimum pour se lancer ?+
En pratique, 16 Go de RAM et un processeur récent suffisent pour un premier modèle de quelques milliards de paramètres. Un GPU avec au moins 8 Go de VRAM, ou une puce Apple Silicon avec suffisamment de mémoire unifiée, rend l'expérience nettement plus confortable dès que vous montez en taille de modèle.
Peut-on installer un LLM en local sans carte graphique ?+
Oui, les trois méthodes présentées ici tournent en CPU pur. Les modèles de 3 à 8B restent utilisables sans GPU, mais les réponses sont plus lentes qu'avec une carte dédiée.
Combien d'espace disque faut-il prévoir ?+
Chaque modèle quantifié pèse de quelques centaines de Mo pour les plus petits à plusieurs dizaines de Go pour les plus gros. Prévoyez une marge confortable sur un SSD si vous comptez tester plusieurs modèles avant de vous fixer.
Quel modèle choisir pour commencer ?+
Un modèle généraliste de 7 à 8B, comme Qwen3 8B ou Mistral, en quantification Q4_K_M, est un point de départ solide sur la plupart des machines récentes. Ajustez ensuite la taille selon votre RAM ou VRAM réelle et vos premiers essais.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.