Débutant 8 minHors ligne

Une IA hors ligne : utiliser un LLM sans connexion internet

Un LLM local n'a besoin d'internet que pour être téléchargé. Une fois le modèle sur votre disque, une IA hors ligne fonctionne intégralement sans connexion : en avion, en zone blanche, en rando ou sur un poste isolé du réseau. Ce guide montre comment préparer sa machine avant de partir, quels modèles compacts embarquer, et comment tout vérifier pour ne pas se retrouver bloqué au mauvais moment.

Par Léa B.·Màj 2026-07-27·Testé sur Windows, macOS, Linux

#Pourquoi une IA hors ligne

Les assistants du cloud (ChatGPT, Claude, Gemini) s'arrêtent net dès que la connexion tombe. Une IA hors ligne, elle, tourne entièrement sur votre machine : le modèle est chargé en mémoire et calcule vos réponses localement, sans jamais interroger un serveur distant. C'est le même principe qu'un LLM local classique, poussé à sa conclusion logique — zéro dépendance au réseau une fois la préparation faite.

Les situations où ça change tout sont plus fréquentes qu'on ne croit : un vol long-courrier, un déplacement en train sans 4G, une mission en zone blanche, un chantier ou un site industriel sans Wi-Fi, ou encore un poste volontairement coupé d'internet pour des raisons de confidentialité. Dans tous ces cas, une IA hors ligne bien préparée reste pleinement opérationnelle.

Autonomie totale
Aucune coupure quand le réseau disparaît : avion, tunnel, campagne, sous-sol.
Confidentialité
Rien ne sort de la machine. Idéal pour des données sensibles ou un poste air-gapped.
Zéro coût récurrent
Pas d'abonnement, pas de facturation au token, pas de quota.
Latence stable
La vitesse ne dépend que de votre matériel, pas d'un serveur surchargé à l'autre bout du monde.

#Ce qui a besoin du réseau (et ce qui n'en a pas)

Comprendre la frontière entre « en ligne » et « hors ligne » évite les mauvaises surprises. Une seule étape exige internet : le téléchargement. Tout le reste est local.

Besoin du réseau (une fois)
Télécharger l'application (Ollama, LM Studio), télécharger les modèles (fichiers GGUF), récupérer les mises à jour.
100 % hors ligne
Charger un modèle déjà présent, discuter, générer du texte ou du code, résumer un document local, utiliser un RAG sur vos fichiers.
i
Le piège classique
Beaucoup d'outils tentent une vérification de mise à jour ou un « pull » automatique au démarrage. Sans réseau, ce n'est pas bloquant tant que le modèle est déjà téléchargé — mais l'app peut afficher une erreur trompeuse. Testez toujours en mode avion AVANT de partir.

#Prérequis avant de partir

Une IA hors ligne tient sur un ordinateur portable ordinaire. Ce qui compte, c'est la RAM (ou la VRAM si vous avez un GPU) et l'espace disque pour stocker les modèles.

Disque libre
Prévoir 5 à 30 Go selon les modèles embarqués. Un modèle 7B en Q4_K_M pèse environ 4,5 Go, un 14B environ 9 Go.
RAM / VRAM
8 Go pour un 3B, 16 Go pour un 7B confortable, 32 Go pour viser du 14B. Repères VRAM Q4 : 3B≈2 Go · 7B≈5 Go · 14B≈9 Go.
GPU (optionnel)
Un GPU accélère beaucoup mais n'est pas obligatoire. Un MacBook Apple Silicon (M-series) ou un PC 16 Go de RAM suffisent en CPU pur.
Batterie
L'inférence sollicite le CPU/GPU : sur portable débranché, comptez sur une autonomie réduite. Privilégiez des modèles compacts en mobilité.
Sans GPU, ça marche quand même
En avion ou en train, vous serez souvent en CPU pur. Un modèle 3B ou 7B en Q4_K_M reste fluide sur un laptop récent. Le guide « LLM en local sans GPU » détaille les modèles et les vitesses attendues.

#Tout télécharger avant de perdre le réseau

C'est l'étape décisive et la seule qui exige internet. Faites-la tranquillement chez vous ou au bureau, en Wi-Fi, quelques heures avant le départ — un modèle de plusieurs Go n'aime pas les connexions instables. Voici la marche à suivre avec Ollama, l'approche la plus simple pour une IA hors ligne.

  1. 01
    Installer Ollama pendant que vous avez du réseau
    Téléchargez et installez Ollama depuis ollama.com. C'est le daemon qui fera tourner vos modèles en local, écoutant sur http://localhost:11434. Installez-le avant tout, car l'app elle-même se télécharge en ligne.
  2. 02
    Télécharger un ou deux modèles compacts
    Utilisez ollama pull pour rapatrier les modèles sur le disque. Choisissez des tailles adaptées à votre machine (voir section suivante). Un pull en Wi-Fi stable prend de quelques minutes à un quart d'heure selon le débit et la taille.
  3. 03
    Installer une interface graphique (optionnel)
    Si vous préférez une fenêtre de chat à un terminal, installez LM Studio (tout-en-un, gère aussi le téléchargement) ou Open WebUI. LM Studio est particulièrement pratique en mobilité : app + modèles + interface dans un seul outil.
  4. 04
    Faire chauffer chaque modèle une fois
    Lancez une conversation test avec chaque modèle téléchargé pendant que vous avez encore du réseau. Cela confirme que le fichier est complet et charge correctement en mémoire.
Terminal — préparation (avec réseau)
# Vérifier qu'Ollama est bien installé
ollama --version

# Télécharger des modèles compacts pour la mobilité
ollama pull llama3.2:3b        # ~2 Go, très léger
ollama pull qwen2.5:7b         # ~4,7 Go, bon polyvalent
ollama pull mistral:7b         # ~4,4 Go, solide en français

# Lister ce qui est déjà sur le disque
ollama list
!
Ne partez pas avec un pull à moitié fait
Un ollama pull interrompu laisse un modèle incomplet qui refusera de se charger hors ligne. Attendez le message « success » et confirmez la présence du modèle avec ollama list avant de couper le réseau.

#Les modèles compacts qui suffisent en mobilité

En hors ligne sur portable, la sobriété prime : un petit modèle rapide et peu gourmand en batterie vaut mieux qu'un mastodonte qui rame et vide l'accu. Pour la majorité des usages en déplacement — rédaction, résumé, questions générales, aide au code — un 3B à 7B en Q4_K_M fait très bien le travail.

Llama 3.2 3B
~2 Go. Le plus léger : idéal pour un vieux laptop ou pour préserver la batterie. Suffisant pour rédiger, reformuler, répondre à des questions simples.
Qwen 2.5 7B
~4,7 Go. Excellent polyvalent, bon en raisonnement et en code. Le meilleur compromis pour un laptop 16 Go de RAM.
Mistral 7B
~4,4 Go. Très à l'aise en français, réponses concises. Une valeur sûre pour l'écriture.
Phi-3.5 mini
~2,3 Go. Compact et vif, taillé pour les machines modestes tout en restant capable.
Emportez deux modèles, pas dix
Un petit (3B) pour économiser la batterie et répondre vite, un moyen (7B) pour les tâches exigeantes. C'est suffisant pour couvrir 95 % des besoins hors ligne sans saturer le disque.

La quantification Q4_K_M est le réglage recommandé par défaut : elle divise fortement la taille du modèle et la mémoire nécessaire, avec une perte de qualité minime et imperceptible sur la plupart des usages. Si vous avez de la marge en RAM/VRAM et cherchez un peu plus de finesse, Q5_K_M est une alternative. Réservez Q8_0 et FP16 aux machines très bien dotées.


#Vérifier que tout marche vraiment offline

Ne faites jamais confiance sur parole : testez en conditions réelles avant de vous retrouver sans réseau. Un test de trois minutes évite une déception à 10 000 mètres d'altitude.

  1. 01
    Couper le réseau pour de bon
    Activez le mode avion, désactivez le Wi-Fi ET l'Ethernet. L'objectif est de reproduire exactement l'absence totale de connexion.
  2. 02
    Lancer une conversation
    Ouvrez votre terminal ou LM Studio et discutez avec chaque modèle téléchargé. Si le modèle répond, votre IA hors ligne est opérationnelle.
  3. 03
    Contrôler qu'aucune erreur réseau ne bloque
    Certaines interfaces affichent un bandeau d'avertissement hors ligne : tant que la génération fonctionne, ignorez-le. Si le chat refuse de démarrer, le modèle n'était probablement pas complètement téléchargé.
Terminal — test hors ligne (mode avion activé)
# Le daemon tourne en local, aucun réseau requis
ollama run qwen2.5:7b "Résume en trois points les avantages d'une IA hors ligne."

# Vérifier que le serveur local répond bien sur son port par défaut
curl http://localhost:11434/api/tags
i
Le serveur reste local
Ollama écoute sur http://localhost:11434, une adresse interne à votre machine. Elle n'a rien à voir avec internet : elle fonctionne à l'identique avec ou sans connexion.

#Poste isolé et usage air-gapped

Certaines machines sont volontairement coupées d'internet en permanence : postes traitant des données confidentielles, environnements industriels, laboratoires. C'est l'usage « air-gapped » — la machine cible n'aura jamais accès au réseau, y compris pour l'installation.

Le principe : préparer les fichiers sur une machine connectée, puis les transférer par clé USB ou disque externe vers le poste isolé. Ollama stocke ses modèles dans un répertoire que l'on peut copier tel quel.

Installateurs hors ligne
Récupérez le binaire d'installation d'Ollama ou de LM Studio depuis une machine connectée, puis copiez-le sur le poste isolé.
Fichiers de modèles
Sous Linux/macOS, les modèles Ollama vivent dans ~/.ollama/models ; sous Windows, dans %USERPROFILE%\.ollama\models. Copiez ce dossier vers le poste cible au même emplacement.
Alternative GGUF
Avec LM Studio, il suffit de copier les fichiers .gguf téléchargés dans le dossier de modèles de l'app sur la machine isolée.
Terminal — transfert vers un poste isolé
# Sur la machine connectée : localiser les modèles
ls ~/.ollama/models

# Copier tout le dossier .ollama vers une clé USB
cp -r ~/.ollama /media/usb/ollama-backup

# Sur le poste air-gapped : restaurer au même emplacement
cp -r /media/usb/ollama-backup ~/.ollama

# Vérifier que les modèles sont bien reconnus
ollama list
!
Copie complète obligatoire
Le dossier models contient à la fois les blobs (les poids) et les manifests (les métadonnées). Copiez le dossier entier : un manifest sans son blob, ou l'inverse, rend le modèle inutilisable sur le poste cible.

#Mettre à jour ses modèles au retour du réseau

De retour dans une zone couverte, c'est le moment d'entretenir votre installation : récupérer les nouvelles versions des modèles, ajouter de nouveaux modèles repérés en route, et mettre l'application à jour. Rien de tout cela ne se fait hors ligne, d'où l'importance de le faire dès que le réseau revient.

  1. 01
    Rafraîchir les modèles existants
    Un ollama pull sur un modèle déjà présent ne télécharge que les couches modifiées si une nouvelle version existe. C'est rapide et ça garde vos modèles à jour.
  2. 02
    Mettre à jour l'application
    Relancez l'installeur d'Ollama ou LM Studio pour bénéficier des correctifs et du support de nouveaux modèles. Les mises à jour sont fréquentes dans cet écosystème.
  3. 03
    Faire le ménage
    Supprimez les modèles que vous n'utilisez plus pour libérer de l'espace disque avant votre prochain départ.
  4. 04
    Re-tester en mode avion
    Après toute mise à jour, refaites un test hors ligne : une nouvelle version d'app pourrait introduire un comportement inattendu sans réseau.
Terminal — entretien (avec réseau)
# Mettre à jour un modèle vers sa dernière version
ollama pull qwen2.5:7b

# Supprimer un modèle devenu inutile
ollama rm llama3.2:3b

# Voir l'espace occupé par chaque modèle
ollama list

#Dépannage

« Model not found » hors ligne
Le modèle n'était pas (complètement) téléchargé avant la coupure. Reconnectez-vous, relancez ollama pull jusqu'au message success, puis vérifiez avec ollama list.
L'app refuse de démarrer sans réseau
Certaines interfaces tentent une vérification en ligne au lancement. Attendez quelques secondes qu'elle expire, ou désactivez la vérification de mise à jour dans les réglages.
Réponses très lentes en déplacement
En CPU pur et sur batterie, c'est normal. Passez à un modèle plus petit (3B) et fermez les applications gourmandes. Branchez le laptop si possible.
Batterie qui fond à vue d'œil
L'inférence sollicite fortement le processeur. Réduisez la taille du modèle, limitez la longueur des réponses, et activez le mode économie d'énergie pour les tâches non urgentes.
Modèle copié qui ne se charge pas (air-gap)
La copie était partielle : blobs ou manifests manquants. Recopiez l'intégralité du dossier .ollama/models.
Pas assez de mémoire
Le modèle dépasse votre RAM/VRAM. Choisissez une taille inférieure ou une quantification plus légère (Q4_K_M plutôt que Q8_0).

#Pour aller plus loin

Une IA hors ligne s'appuie sur les mêmes fondations qu'une installation locale classique. Ces guides du site complètent la préparation :

Installer Ollama
Pour poser le moteur d'inférence, l'étape à faire pendant que vous avez encore du réseau.
Faire tourner un LLM en local sans GPU (CPU only)
Indispensable pour la mobilité : modèles et vitesses attendues quand vous êtes en CPU pur sur batterie.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer entre taille sur disque, mémoire et qualité selon la machine que vous emportez.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.