Une IA hors ligne : utiliser un LLM sans connexion internet
Un LLM local n'a besoin d'internet que pour être téléchargé. Une fois le modèle sur votre disque, une IA hors ligne fonctionne intégralement sans connexion : en avion, en zone blanche, en rando ou sur un poste isolé du réseau. Ce guide montre comment préparer sa machine avant de partir, quels modèles compacts embarquer, et comment tout vérifier pour ne pas se retrouver bloqué au mauvais moment.
#Pourquoi une IA hors ligne
Les assistants du cloud (ChatGPT, Claude, Gemini) s'arrêtent net dès que la connexion tombe. Une IA hors ligne, elle, tourne entièrement sur votre machine : le modèle est chargé en mémoire et calcule vos réponses localement, sans jamais interroger un serveur distant. C'est le même principe qu'un LLM local classique, poussé à sa conclusion logique — zéro dépendance au réseau une fois la préparation faite.
Les situations où ça change tout sont plus fréquentes qu'on ne croit : un vol long-courrier, un déplacement en train sans 4G, une mission en zone blanche, un chantier ou un site industriel sans Wi-Fi, ou encore un poste volontairement coupé d'internet pour des raisons de confidentialité. Dans tous ces cas, une IA hors ligne bien préparée reste pleinement opérationnelle.
- Autonomie totale
- Aucune coupure quand le réseau disparaît : avion, tunnel, campagne, sous-sol.
- Confidentialité
- Rien ne sort de la machine. Idéal pour des données sensibles ou un poste air-gapped.
- Zéro coût récurrent
- Pas d'abonnement, pas de facturation au token, pas de quota.
- Latence stable
- La vitesse ne dépend que de votre matériel, pas d'un serveur surchargé à l'autre bout du monde.
#Ce qui a besoin du réseau (et ce qui n'en a pas)
Comprendre la frontière entre « en ligne » et « hors ligne » évite les mauvaises surprises. Une seule étape exige internet : le téléchargement. Tout le reste est local.
- Besoin du réseau (une fois)
- Télécharger l'application (Ollama, LM Studio), télécharger les modèles (fichiers GGUF), récupérer les mises à jour.
- 100 % hors ligne
- Charger un modèle déjà présent, discuter, générer du texte ou du code, résumer un document local, utiliser un RAG sur vos fichiers.
#Prérequis avant de partir
Une IA hors ligne tient sur un ordinateur portable ordinaire. Ce qui compte, c'est la RAM (ou la VRAM si vous avez un GPU) et l'espace disque pour stocker les modèles.
- Disque libre
- Prévoir 5 à 30 Go selon les modèles embarqués. Un modèle 7B en Q4_K_M pèse environ 4,5 Go, un 14B environ 9 Go.
- RAM / VRAM
- 8 Go pour un 3B, 16 Go pour un 7B confortable, 32 Go pour viser du 14B. Repères VRAM Q4 : 3B≈2 Go · 7B≈5 Go · 14B≈9 Go.
- GPU (optionnel)
- Un GPU accélère beaucoup mais n'est pas obligatoire. Un MacBook Apple Silicon (M-series) ou un PC 16 Go de RAM suffisent en CPU pur.
- Batterie
- L'inférence sollicite le CPU/GPU : sur portable débranché, comptez sur une autonomie réduite. Privilégiez des modèles compacts en mobilité.
#Tout télécharger avant de perdre le réseau
C'est l'étape décisive et la seule qui exige internet. Faites-la tranquillement chez vous ou au bureau, en Wi-Fi, quelques heures avant le départ — un modèle de plusieurs Go n'aime pas les connexions instables. Voici la marche à suivre avec Ollama, l'approche la plus simple pour une IA hors ligne.
- 01Installer Ollama pendant que vous avez du réseauTéléchargez et installez Ollama depuis ollama.com. C'est le daemon qui fera tourner vos modèles en local, écoutant sur http://localhost:11434. Installez-le avant tout, car l'app elle-même se télécharge en ligne.
- 02Télécharger un ou deux modèles compactsUtilisez ollama pull pour rapatrier les modèles sur le disque. Choisissez des tailles adaptées à votre machine (voir section suivante). Un pull en Wi-Fi stable prend de quelques minutes à un quart d'heure selon le débit et la taille.
- 03Installer une interface graphique (optionnel)Si vous préférez une fenêtre de chat à un terminal, installez LM Studio (tout-en-un, gère aussi le téléchargement) ou Open WebUI. LM Studio est particulièrement pratique en mobilité : app + modèles + interface dans un seul outil.
- 04Faire chauffer chaque modèle une foisLancez une conversation test avec chaque modèle téléchargé pendant que vous avez encore du réseau. Cela confirme que le fichier est complet et charge correctement en mémoire.
#Les modèles compacts qui suffisent en mobilité
En hors ligne sur portable, la sobriété prime : un petit modèle rapide et peu gourmand en batterie vaut mieux qu'un mastodonte qui rame et vide l'accu. Pour la majorité des usages en déplacement — rédaction, résumé, questions générales, aide au code — un 3B à 7B en Q4_K_M fait très bien le travail.
- Llama 3.2 3B
- ~2 Go. Le plus léger : idéal pour un vieux laptop ou pour préserver la batterie. Suffisant pour rédiger, reformuler, répondre à des questions simples.
- Qwen 2.5 7B
- ~4,7 Go. Excellent polyvalent, bon en raisonnement et en code. Le meilleur compromis pour un laptop 16 Go de RAM.
- Mistral 7B
- ~4,4 Go. Très à l'aise en français, réponses concises. Une valeur sûre pour l'écriture.
- Phi-3.5 mini
- ~2,3 Go. Compact et vif, taillé pour les machines modestes tout en restant capable.
La quantification Q4_K_M est le réglage recommandé par défaut : elle divise fortement la taille du modèle et la mémoire nécessaire, avec une perte de qualité minime et imperceptible sur la plupart des usages. Si vous avez de la marge en RAM/VRAM et cherchez un peu plus de finesse, Q5_K_M est une alternative. Réservez Q8_0 et FP16 aux machines très bien dotées.
#Vérifier que tout marche vraiment offline
Ne faites jamais confiance sur parole : testez en conditions réelles avant de vous retrouver sans réseau. Un test de trois minutes évite une déception à 10 000 mètres d'altitude.
- 01Couper le réseau pour de bonActivez le mode avion, désactivez le Wi-Fi ET l'Ethernet. L'objectif est de reproduire exactement l'absence totale de connexion.
- 02Lancer une conversationOuvrez votre terminal ou LM Studio et discutez avec chaque modèle téléchargé. Si le modèle répond, votre IA hors ligne est opérationnelle.
- 03Contrôler qu'aucune erreur réseau ne bloqueCertaines interfaces affichent un bandeau d'avertissement hors ligne : tant que la génération fonctionne, ignorez-le. Si le chat refuse de démarrer, le modèle n'était probablement pas complètement téléchargé.
#Poste isolé et usage air-gapped
Certaines machines sont volontairement coupées d'internet en permanence : postes traitant des données confidentielles, environnements industriels, laboratoires. C'est l'usage « air-gapped » — la machine cible n'aura jamais accès au réseau, y compris pour l'installation.
Le principe : préparer les fichiers sur une machine connectée, puis les transférer par clé USB ou disque externe vers le poste isolé. Ollama stocke ses modèles dans un répertoire que l'on peut copier tel quel.
- Installateurs hors ligne
- Récupérez le binaire d'installation d'Ollama ou de LM Studio depuis une machine connectée, puis copiez-le sur le poste isolé.
- Fichiers de modèles
- Sous Linux/macOS, les modèles Ollama vivent dans ~/.ollama/models ; sous Windows, dans %USERPROFILE%\.ollama\models. Copiez ce dossier vers le poste cible au même emplacement.
- Alternative GGUF
- Avec LM Studio, il suffit de copier les fichiers .gguf téléchargés dans le dossier de modèles de l'app sur la machine isolée.
#Mettre à jour ses modèles au retour du réseau
De retour dans une zone couverte, c'est le moment d'entretenir votre installation : récupérer les nouvelles versions des modèles, ajouter de nouveaux modèles repérés en route, et mettre l'application à jour. Rien de tout cela ne se fait hors ligne, d'où l'importance de le faire dès que le réseau revient.
- 01Rafraîchir les modèles existantsUn ollama pull sur un modèle déjà présent ne télécharge que les couches modifiées si une nouvelle version existe. C'est rapide et ça garde vos modèles à jour.
- 02Mettre à jour l'applicationRelancez l'installeur d'Ollama ou LM Studio pour bénéficier des correctifs et du support de nouveaux modèles. Les mises à jour sont fréquentes dans cet écosystème.
- 03Faire le ménageSupprimez les modèles que vous n'utilisez plus pour libérer de l'espace disque avant votre prochain départ.
- 04Re-tester en mode avionAprès toute mise à jour, refaites un test hors ligne : une nouvelle version d'app pourrait introduire un comportement inattendu sans réseau.
#Dépannage
- « Model not found » hors ligne
- Le modèle n'était pas (complètement) téléchargé avant la coupure. Reconnectez-vous, relancez ollama pull jusqu'au message success, puis vérifiez avec ollama list.
- L'app refuse de démarrer sans réseau
- Certaines interfaces tentent une vérification en ligne au lancement. Attendez quelques secondes qu'elle expire, ou désactivez la vérification de mise à jour dans les réglages.
- Réponses très lentes en déplacement
- En CPU pur et sur batterie, c'est normal. Passez à un modèle plus petit (3B) et fermez les applications gourmandes. Branchez le laptop si possible.
- Batterie qui fond à vue d'œil
- L'inférence sollicite fortement le processeur. Réduisez la taille du modèle, limitez la longueur des réponses, et activez le mode économie d'énergie pour les tâches non urgentes.
- Modèle copié qui ne se charge pas (air-gap)
- La copie était partielle : blobs ou manifests manquants. Recopiez l'intégralité du dossier .ollama/models.
- Pas assez de mémoire
- Le modèle dépasse votre RAM/VRAM. Choisissez une taille inférieure ou une quantification plus légère (Q4_K_M plutôt que Q8_0).
#Pour aller plus loin
Une IA hors ligne s'appuie sur les mêmes fondations qu'une installation locale classique. Ces guides du site complètent la préparation :
- Installer Ollama
- Pour poser le moteur d'inférence, l'étape à faire pendant que vous avez encore du réseau.
- Faire tourner un LLM en local sans GPU (CPU only)
- Indispensable pour la mobilité : modèles et vitesses attendues quand vous êtes en CPU pur sur batterie.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer entre taille sur disque, mémoire et qualité selon la machine que vous emportez.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.