Intermédiaire 11 minObsidian

Obsidian + LLM local : Copilot et Smart Connections avec Ollama

Obsidian stocke vos notes en Markdown, en clair, sur votre disque. C'est le terrain idéal pour un assistant IA — à condition qu'il ne renvoie pas tout votre vault vers le cloud. Ce guide branche un LLM local via le couple obsidian + ollama : configuration du plugin Copilot, chat avec l'ensemble de vos notes, recherche sémantique avec Smart Connections, et le tout avec des embeddings qui restent sur votre machine.

Par Léa B.·Màj 2026-07-23·Testé sur Windows, macOS, Linux

#Pourquoi brancher un LLM local sur Obsidian

Un vault Obsidian contient souvent ce qu'on a de plus personnel : journal, notes de réunion, recherche, brouillons. Envoyer ce corpus à un service cloud pour « discuter avec ses notes » revient à confier l'intégralité de sa seconde mémoire à un tiers. Un LLM local règle le problème à la racine : le modèle, les embeddings et l'index restent sur votre disque.

Concrètement, obsidian + ollama permet trois usages : générer et reformuler du texte directement dans l'éditeur (autocomplétion, résumé, traduction), interroger l'ensemble du vault en langage naturel (« qu'ai-je noté sur le projet X ? »), et faire remonter automatiquement les notes sémantiquement proches de celle qu'on est en train d'écrire. Deux plugins couvrent ces besoins : Copilot pour le chat et la génération, Smart Connections pour la recherche par similarité.

Confidentialité
Aucune note, aucun embedding ne quitte la machine. Idéal pour un journal ou des données clients.
Hors-ligne
Fonctionne dans le train ou en avion, une fois les modèles téléchargés.
Coût nul
Pas d'abonnement ni de facturation à la requête, quel que soit le volume de notes.
Contrôle du modèle
Vous choisissez la taille, la quantification et le contexte selon votre matériel.

#Prérequis

Le montage repose sur trois briques : Obsidian, Ollama en tant que daemon local, et un plugin communautaire. Rien d'autre n'est nécessaire — pas de clé API, pas de compte.

Obsidian 1.5+
Version desktop (Windows, macOS ou Linux). Les plugins communautaires ne fonctionnent pas sur mobile de la même façon ; ce guide vise le desktop.
Ollama installé
Le daemon écoute par défaut sur http://localhost:11434. Si ce n'est pas encore fait, voir le guide d'installation d'Ollama référencé en fin d'article.
Un modèle de chat
Par exemple llama3.1:8b ou qwen2.5:7b en quantization Q4_K_M (≈5 Go de VRAM).
Un modèle d'embeddings
nomic-embed-text ou mxbai-embed-large, indispensables pour le chat sur vault et Smart Connections.
RAM/VRAM
8 Go de VRAM suffisent pour un 7B en Q4. En CPU pur, comptez plutôt un 3B et un peu de patience.
i
Chat ≠ embeddings
Deux modèles distincts entrent en jeu. Le modèle de chat génère les réponses ; le modèle d'embeddings transforme vos notes en vecteurs pour la recherche. Ne configurez pas un modèle de chat là où un modèle d'embeddings est attendu, et inversement — c'est l'erreur la plus fréquente.

#Préparer Ollama pour Obsidian

Avant de toucher à Obsidian, on télécharge les modèles et on vérifie que le daemon répond. Ollama expose une API compatible OpenAI sur le port 11434, ce que les plugins savent consommer.

Terminal
# Modèle de chat (généraliste, ~5 Go en Q4)
ollama pull llama3.1:8b

# Modèle d'embeddings (obligatoire pour le RAG)
ollama pull nomic-embed-text

# Vérifier que le daemon tourne
ollama ps

Un point spécifique à Obsidian : les plugins tournent dans un contexte de type navigateur (Electron), et les requêtes vers Ollama peuvent être bloquées par la politique CORS. Il faut donc autoriser Obsidian à appeler l'API. On définit la variable d'environnement OLLAMA_ORIGINS avant de lancer le daemon.

Linux / macOS
# Autoriser les origines Obsidian (app://) et relancer Ollama
export OLLAMA_ORIGINS="app://obsidian.md*"
ollama serve
Windows (PowerShell)
# Définir la variable puis relancer Ollama
setx OLLAMA_ORIGINS "app://obsidian.md*"
# Quitter Ollama depuis la barre système, puis le relancer
!
CORS : la cause n°1 des « connexion échouée »
Si Copilot ou Smart Connections affiche une erreur réseau alors que ollama ps fonctionne, c'est presque toujours OLLAMA_ORIGINS qui manque. Sur macOS avec l'app Ollama, utilisez launchctl setenv OLLAMA_ORIGINS "app://obsidian.md*" puis redémarrez l'application.

#Configurer le plugin Copilot sur Ollama

Copilot (par logancyang) est le plugin de chat et de génération le plus complet pour brancher un modèle local. Il gère aussi bien la reformulation dans l'éditeur que le chat conversationnel et le mode « Vault QA ». Voici l'installation pas à pas.

  1. 01
    Installer le plugin
    Réglages → Modules complémentaires tiers → Parcourir, chercher « Copilot » (logancyang), installer puis activer. Acceptez d'abord l'usage des plugins communautaires si Obsidian le demande.
  2. 02
    Ouvrir les réglages Copilot
    Dans Réglages → Copilot, section « Model ». Copilot propose des fournisseurs prédéfinis ; sélectionnez Ollama comme provider pour le chat.
  3. 03
    Renseigner l'URL et le modèle
    Base URL : http://localhost:11434 . Nom du modèle de chat : llama3.1:8b (exactement le tag qu'affiche ollama list). Laissez la clé API vide, elle est inutile en local.
  4. 04
    Configurer les embeddings
    Dans la section « Embedding Model », choisissez à nouveau Ollama comme provider et saisissez nomic-embed-text. C'est ce qui rendra possible le chat sur tout le vault.
  5. 05
    Tester
    Ouvrez le panneau Copilot (icône dans la barre latérale ou commande « Copilot: Open Chat »), posez une question simple. Une réponse locale confirme que la liaison fonctionne.

Copilot ajoute aussi des commandes contextuelles : sélectionnez un passage, ouvrez la palette (Ctrl/Cmd+P) et lancez « Copilot: Summarize », « Simplify » ou « Translate ». Le texte sélectionné est envoyé au modèle local et la réponse s'insère ou s'affiche selon la commande.

Fenêtre de contexte
Pour résumer de longues notes, augmentez le contexte du modèle. Créez un Modelfile avec PARAMETER num_ctx 8192 (ou plus) et recréez le modèle via ollama create. Un contexte trop court tronque silencieusement vos notes avant même que le modèle ne les lise.

#Chatter avec tout son vault en local

Le mode le plus puissant de Copilot est le « Vault QA » (aussi appelé QA mode) : au lieu de discuter avec le seul modèle, vous interrogez vos notes. En coulisses, Copilot construit un index vectoriel de votre vault avec le modèle d'embeddings, puis retrouve les passages pertinents et les injecte dans le prompt. C'est du RAG, appliqué à vos notes personnelles.

  1. 01
    Activer le mode Vault QA
    Dans le panneau de chat Copilot, basculez le sélecteur de mode de « Chat » vers « Vault QA » (ou « QA »).
  2. 02
    Construire l'index
    Lancez la commande « Copilot: Index (refresh) vault for QA ». Le plugin parcourt vos notes et calcule les embeddings via Ollama. La durée dépend de la taille du vault et du modèle.
  3. 03
    Poser des questions transverses
    Exemples : « Résume tout ce que j'ai noté sur l'architecture hexagonale » ou « Quelles réunions parlaient du budget Q3 ? ». Les réponses citent les notes sources.
  4. 04
    Réindexer après de gros changements
    L'index n'est pas magique : après avoir ajouté beaucoup de notes, relancez l'indexation pour qu'elles soient prises en compte.
i
L'index reste local
L'index vectoriel est stocké dans le dossier de configuration du plugin, à l'intérieur de votre vault. Rien n'est envoyé à l'extérieur : les embeddings sont calculés par Ollama sur votre machine et écrits sur votre disque.

#Smart Connections pour retrouver ses notes liées

Smart Connections (par Brian Petro) répond à un besoin différent : au lieu de poser des questions, il affiche en permanence les notes sémantiquement proches de celle qu'on édite. C'est un panneau latéral vivant qui remonte des liens que vous n'auriez jamais faits manuellement — l'équivalent d'un « related notes » automatique, calculé par similarité vectorielle.

  1. 01
    Installer Smart Connections
    Réglages → Modules complémentaires tiers → Parcourir, chercher « Smart Connections », installer et activer.
  2. 02
    Pointer les embeddings vers Ollama
    Dans les réglages du plugin, section embeddings, choisissez Ollama comme adaptateur, URL http://localhost:11434 et modèle nomic-embed-text (ou mxbai-embed-large pour plus de finesse).
  3. 03
    Laisser l'indexation se faire
    Au premier lancement, Smart Connections calcule les embeddings de toutes vos notes. Le panneau « Smart Connections » se remplit ensuite au fil de la navigation.
  4. 04
    Optionnel : le chat Smart
    Smart Connections embarque aussi un mode chat (Smart Chat) qui s'appuie sur ces mêmes embeddings et peut utiliser votre modèle de chat Ollama pour répondre à partir des notes proches.

L'intérêt de Smart Connections face à Copilot Vault QA : il est passif et continu. Vous n'avez rien à demander ; en écrivant une note sur un sujet, les notes anciennes liées remontent d'elles-mêmes, ce qui favorise la sérendipité dans un gros vault. Les deux plugins sont complémentaires et peuvent partager le même modèle d'embeddings Ollama.


#Modèles conseillés selon la taille du vault

Le bon modèle dépend d'abord de votre matériel, ensuite du volume de notes. Pour la génération de texte, un 7-8B en Q4_K_M offre le meilleur compromis qualité/VRAM pour la plupart des configurations. Pour les embeddings, nomic-embed-text est léger et suffisant ; mxbai-embed-large gagne en précision sur les gros vaults, au prix d'un index plus lourd.

Petit vault (< 500 notes)
Chat : qwen2.5:7b ou llama3.1:8b (Q4, ≈5 Go VRAM). Embeddings : nomic-embed-text. Tient sur une RTX 3060 12GB.
Vault moyen (500–3000 notes)
Chat : llama3.1:8b. Embeddings : mxbai-embed-large pour une meilleure pertinence des liens. RTX 4070/4080 confortables.
Gros vault (> 3000 notes)
Chat : un 14B en Q4 (≈9 Go) pour des synthèses plus fines. Embeddings : mxbai-embed-large. RTX 4090 24GB ou Mac M4 Pro à mémoire unifiée.
Sans GPU (CPU only)
Chat : un 3B (llama3.2:3b, ≈2 Go). Embeddings : nomic-embed-text, qui reste rapide en CPU. Réponses plus lentes mais utilisables.
Mac Apple Silicon
La mémoire unifiée est un atout : un M4 Pro 24–48 Go fait tourner un 14B et l'indexation embeddings sans souci.
Cohérence des embeddings
Ne changez pas de modèle d'embeddings à la légère : les vecteurs d'un modèle ne sont pas comparables à ceux d'un autre. Si vous passez de nomic-embed-text à mxbai-embed-large, il faut réindexer intégralement le vault, sinon les similarités deviennent incohérentes.

#Dépannage

La plupart des problèmes tiennent à trois causes : CORS, mauvais nom de modèle, ou daemon Ollama arrêté. Voici le tri rapide.

« Connexion échouée » / erreur réseau
OLLAMA_ORIGINS n'inclut pas Obsidian. Ajoutez app://obsidian.md* et redémarrez le daemon (pas seulement Obsidian).
« model not found »
Le tag saisi dans le plugin ne correspond pas. Vérifiez avec ollama list et copiez le nom exact, tag inclus (llama3.1:8b, pas llama3.1).
Réponses vides ou tronquées
Contexte trop court. Augmentez num_ctx via un Modelfile, ou réduisez la taille des notes envoyées.
Indexation très lente
Le modèle d'embeddings tourne en CPU ou le vault est énorme. Vérifiez ollama ps ; envisagez nomic-embed-text plus léger.
Smart Connections vide
L'index n'a pas fini de se construire, ou l'adaptateur pointe vers un modèle de chat au lieu d'un modèle d'embeddings.
Terminal
# Vérifier les modèles disponibles et leurs tags exacts
ollama list

# Confirmer que le daemon répond et voir ce qui est chargé en mémoire
ollama ps

# Test brut de l'API embeddings (doit renvoyer un vecteur)
curl http://localhost:11434/api/embeddings -d '{
  "model": "nomic-embed-text",
  "prompt": "note de test"
}'

#Pour aller plus loin

Une fois Obsidian branché sur votre modèle local, ces guides du site aident à peaufiner la stack et à comprendre les briques sous le capot :

Installer Ollama : Windows, macOS et Linux
La base de tout le montage : installation propre du daemon et gestion des modèles.
Choisir sa quantification (Q4, Q5, Q8, FP16)
Pour arbitrer entre qualité de génération et VRAM disponible sur votre carte.
AnythingLLM : RAG production-ready en local
Si vous voulez pousser le RAG au-delà d'Obsidian, avec workspaces et API.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.