Obsidian + LLM local : Copilot et Smart Connections avec Ollama
Obsidian stocke vos notes en Markdown, en clair, sur votre disque. C'est le terrain idéal pour un assistant IA — à condition qu'il ne renvoie pas tout votre vault vers le cloud. Ce guide branche un LLM local via le couple obsidian + ollama : configuration du plugin Copilot, chat avec l'ensemble de vos notes, recherche sémantique avec Smart Connections, et le tout avec des embeddings qui restent sur votre machine.
#Pourquoi brancher un LLM local sur Obsidian
Un vault Obsidian contient souvent ce qu'on a de plus personnel : journal, notes de réunion, recherche, brouillons. Envoyer ce corpus à un service cloud pour « discuter avec ses notes » revient à confier l'intégralité de sa seconde mémoire à un tiers. Un LLM local règle le problème à la racine : le modèle, les embeddings et l'index restent sur votre disque.
Concrètement, obsidian + ollama permet trois usages : générer et reformuler du texte directement dans l'éditeur (autocomplétion, résumé, traduction), interroger l'ensemble du vault en langage naturel (« qu'ai-je noté sur le projet X ? »), et faire remonter automatiquement les notes sémantiquement proches de celle qu'on est en train d'écrire. Deux plugins couvrent ces besoins : Copilot pour le chat et la génération, Smart Connections pour la recherche par similarité.
- Confidentialité
- Aucune note, aucun embedding ne quitte la machine. Idéal pour un journal ou des données clients.
- Hors-ligne
- Fonctionne dans le train ou en avion, une fois les modèles téléchargés.
- Coût nul
- Pas d'abonnement ni de facturation à la requête, quel que soit le volume de notes.
- Contrôle du modèle
- Vous choisissez la taille, la quantification et le contexte selon votre matériel.
#Prérequis
Le montage repose sur trois briques : Obsidian, Ollama en tant que daemon local, et un plugin communautaire. Rien d'autre n'est nécessaire — pas de clé API, pas de compte.
- Obsidian 1.5+
- Version desktop (Windows, macOS ou Linux). Les plugins communautaires ne fonctionnent pas sur mobile de la même façon ; ce guide vise le desktop.
- Ollama installé
- Le daemon écoute par défaut sur http://localhost:11434. Si ce n'est pas encore fait, voir le guide d'installation d'Ollama référencé en fin d'article.
- Un modèle de chat
- Par exemple llama3.1:8b ou qwen2.5:7b en quantization Q4_K_M (≈5 Go de VRAM).
- Un modèle d'embeddings
- nomic-embed-text ou mxbai-embed-large, indispensables pour le chat sur vault et Smart Connections.
- RAM/VRAM
- 8 Go de VRAM suffisent pour un 7B en Q4. En CPU pur, comptez plutôt un 3B et un peu de patience.
#Préparer Ollama pour Obsidian
Avant de toucher à Obsidian, on télécharge les modèles et on vérifie que le daemon répond. Ollama expose une API compatible OpenAI sur le port 11434, ce que les plugins savent consommer.
Un point spécifique à Obsidian : les plugins tournent dans un contexte de type navigateur (Electron), et les requêtes vers Ollama peuvent être bloquées par la politique CORS. Il faut donc autoriser Obsidian à appeler l'API. On définit la variable d'environnement OLLAMA_ORIGINS avant de lancer le daemon.
#Configurer le plugin Copilot sur Ollama
Copilot (par logancyang) est le plugin de chat et de génération le plus complet pour brancher un modèle local. Il gère aussi bien la reformulation dans l'éditeur que le chat conversationnel et le mode « Vault QA ». Voici l'installation pas à pas.
- 01Installer le pluginRéglages → Modules complémentaires tiers → Parcourir, chercher « Copilot » (logancyang), installer puis activer. Acceptez d'abord l'usage des plugins communautaires si Obsidian le demande.
- 02Ouvrir les réglages CopilotDans Réglages → Copilot, section « Model ». Copilot propose des fournisseurs prédéfinis ; sélectionnez Ollama comme provider pour le chat.
- 03Renseigner l'URL et le modèleBase URL : http://localhost:11434 . Nom du modèle de chat : llama3.1:8b (exactement le tag qu'affiche ollama list). Laissez la clé API vide, elle est inutile en local.
- 04Configurer les embeddingsDans la section « Embedding Model », choisissez à nouveau Ollama comme provider et saisissez nomic-embed-text. C'est ce qui rendra possible le chat sur tout le vault.
- 05TesterOuvrez le panneau Copilot (icône dans la barre latérale ou commande « Copilot: Open Chat »), posez une question simple. Une réponse locale confirme que la liaison fonctionne.
Copilot ajoute aussi des commandes contextuelles : sélectionnez un passage, ouvrez la palette (Ctrl/Cmd+P) et lancez « Copilot: Summarize », « Simplify » ou « Translate ». Le texte sélectionné est envoyé au modèle local et la réponse s'insère ou s'affiche selon la commande.
#Chatter avec tout son vault en local
Le mode le plus puissant de Copilot est le « Vault QA » (aussi appelé QA mode) : au lieu de discuter avec le seul modèle, vous interrogez vos notes. En coulisses, Copilot construit un index vectoriel de votre vault avec le modèle d'embeddings, puis retrouve les passages pertinents et les injecte dans le prompt. C'est du RAG, appliqué à vos notes personnelles.
- 01Activer le mode Vault QADans le panneau de chat Copilot, basculez le sélecteur de mode de « Chat » vers « Vault QA » (ou « QA »).
- 02Construire l'indexLancez la commande « Copilot: Index (refresh) vault for QA ». Le plugin parcourt vos notes et calcule les embeddings via Ollama. La durée dépend de la taille du vault et du modèle.
- 03Poser des questions transversesExemples : « Résume tout ce que j'ai noté sur l'architecture hexagonale » ou « Quelles réunions parlaient du budget Q3 ? ». Les réponses citent les notes sources.
- 04Réindexer après de gros changementsL'index n'est pas magique : après avoir ajouté beaucoup de notes, relancez l'indexation pour qu'elles soient prises en compte.
#Smart Connections pour retrouver ses notes liées
Smart Connections (par Brian Petro) répond à un besoin différent : au lieu de poser des questions, il affiche en permanence les notes sémantiquement proches de celle qu'on édite. C'est un panneau latéral vivant qui remonte des liens que vous n'auriez jamais faits manuellement — l'équivalent d'un « related notes » automatique, calculé par similarité vectorielle.
- 01Installer Smart ConnectionsRéglages → Modules complémentaires tiers → Parcourir, chercher « Smart Connections », installer et activer.
- 02Pointer les embeddings vers OllamaDans les réglages du plugin, section embeddings, choisissez Ollama comme adaptateur, URL http://localhost:11434 et modèle nomic-embed-text (ou mxbai-embed-large pour plus de finesse).
- 03Laisser l'indexation se faireAu premier lancement, Smart Connections calcule les embeddings de toutes vos notes. Le panneau « Smart Connections » se remplit ensuite au fil de la navigation.
- 04Optionnel : le chat SmartSmart Connections embarque aussi un mode chat (Smart Chat) qui s'appuie sur ces mêmes embeddings et peut utiliser votre modèle de chat Ollama pour répondre à partir des notes proches.
L'intérêt de Smart Connections face à Copilot Vault QA : il est passif et continu. Vous n'avez rien à demander ; en écrivant une note sur un sujet, les notes anciennes liées remontent d'elles-mêmes, ce qui favorise la sérendipité dans un gros vault. Les deux plugins sont complémentaires et peuvent partager le même modèle d'embeddings Ollama.
#Modèles conseillés selon la taille du vault
Le bon modèle dépend d'abord de votre matériel, ensuite du volume de notes. Pour la génération de texte, un 7-8B en Q4_K_M offre le meilleur compromis qualité/VRAM pour la plupart des configurations. Pour les embeddings, nomic-embed-text est léger et suffisant ; mxbai-embed-large gagne en précision sur les gros vaults, au prix d'un index plus lourd.
- Petit vault (< 500 notes)
- Chat : qwen2.5:7b ou llama3.1:8b (Q4, ≈5 Go VRAM). Embeddings : nomic-embed-text. Tient sur une RTX 3060 12GB.
- Vault moyen (500–3000 notes)
- Chat : llama3.1:8b. Embeddings : mxbai-embed-large pour une meilleure pertinence des liens. RTX 4070/4080 confortables.
- Gros vault (> 3000 notes)
- Chat : un 14B en Q4 (≈9 Go) pour des synthèses plus fines. Embeddings : mxbai-embed-large. RTX 4090 24GB ou Mac M4 Pro à mémoire unifiée.
- Sans GPU (CPU only)
- Chat : un 3B (llama3.2:3b, ≈2 Go). Embeddings : nomic-embed-text, qui reste rapide en CPU. Réponses plus lentes mais utilisables.
- Mac Apple Silicon
- La mémoire unifiée est un atout : un M4 Pro 24–48 Go fait tourner un 14B et l'indexation embeddings sans souci.
#Dépannage
La plupart des problèmes tiennent à trois causes : CORS, mauvais nom de modèle, ou daemon Ollama arrêté. Voici le tri rapide.
- « Connexion échouée » / erreur réseau
- OLLAMA_ORIGINS n'inclut pas Obsidian. Ajoutez app://obsidian.md* et redémarrez le daemon (pas seulement Obsidian).
- « model not found »
- Le tag saisi dans le plugin ne correspond pas. Vérifiez avec ollama list et copiez le nom exact, tag inclus (llama3.1:8b, pas llama3.1).
- Réponses vides ou tronquées
- Contexte trop court. Augmentez num_ctx via un Modelfile, ou réduisez la taille des notes envoyées.
- Indexation très lente
- Le modèle d'embeddings tourne en CPU ou le vault est énorme. Vérifiez ollama ps ; envisagez nomic-embed-text plus léger.
- Smart Connections vide
- L'index n'a pas fini de se construire, ou l'adaptateur pointe vers un modèle de chat au lieu d'un modèle d'embeddings.
#Pour aller plus loin
Une fois Obsidian branché sur votre modèle local, ces guides du site aident à peaufiner la stack et à comprendre les briques sous le capot :
- Installer Ollama : Windows, macOS et Linux
- La base de tout le montage : installation propre du daemon et gestion des modèles.
- Choisir sa quantification (Q4, Q5, Q8, FP16)
- Pour arbitrer entre qualité de génération et VRAM disponible sur votre carte.
- AnythingLLM : RAG production-ready en local
- Si vous voulez pousser le RAG au-delà d'Obsidian, avec workspaces et API.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.