Flowise : construire des agents IA en drag-and-drop sur Ollama
Flowise transforme la construction d'agents LLM en assemblage de blocs sur un canvas. Au lieu d'écrire du code LangChain, vous glissez des nœuds, tirez des connexions et testez en direct dans un chat intégré. Branché sur Ollama, le combo flowise ollama fait tourner chatflows, agents à outils et pipelines RAG entièrement en local, sans qu'une requête ne quitte votre machine. Ce guide part de l'installation, monte un premier chatflow, ajoute un RAG documentaire, puis publie un chatbot embarquable sur votre site.
#Pourquoi Flowise
Flowise est un constructeur visuel open-source (licence Apache 2.0) bâti au-dessus de LangChain et LangGraph. Il expose les mêmes briques — modèles, mémoire, retrievers, outils — sous forme de nœuds à connecter, ce qui fait passer un prototype d'agent de plusieurs centaines de lignes de Python à un graphe qu'on lit d'un coup d'œil.
Face à Dify, l'autre plateforme no-code du site, Flowise vise davantage l'orchestration fine : là où Dify propose une expérience produit très cadrée (apps, jeux de prompts, gestion d'équipe), Flowise laisse voir la plomberie LangChain et convient mieux quand vous voulez comprendre et ajuster chaque étape d'un agent. Les deux se branchent sur Ollama de la même manière.
- 100 % local
- Couplé à Ollama, aucun token ni document ne part vers une API cloud. Idéal pour des données sensibles ou un usage hors-ligne.
- Itération rapide
- Le chat de test est intégré au canvas : vous modifiez un nœud et vous voyez l'effet immédiatement, sans redéployer quoi que ce soit.
- Exposition API et widget
- Chaque chatflow devient automatiquement un endpoint REST et un widget web embarquable, sans écrire de backend.
- Extensible
- Marketplace de templates, nœuds personnalisés en JavaScript, et intégration d'outils (recherche web, calculatrice, appels HTTP).
#Prérequis
Ce guide t'amène au modèle. Le kit t'amène au copilote qui code dans ton éditeur.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Flowise est léger : c'est Ollama et le modèle chargé qui consomment la mémoire. Prévoyez une machine capable de faire tourner confortablement le LLM visé.
- Ollama installé
- Le daemon doit tourner et écouter sur http://localhost:11434 (valeur par défaut). Vérifiez avec « ollama list ».
- Un modèle de chat
- Un modèle capable de tool calling pour les agents : Qwen 3.5 8B, Granite 4.2 8B ou Mistral Small 24B selon votre VRAM (7B ≈ 5 Go, 14B ≈ 9 Go, 24B ≈ 16 Go en Q4_K_M).
- Un modèle d'embeddings
- Pour le RAG : « nomic-embed-text » ou « mxbai-embed-large », légers et disponibles via Ollama.
- Node.js 18.15+ ou Docker
- Flowise s'installe via npm ou en conteneur. Docker est recommandé pour un déploiement propre et persistant.
#Installer Flowise
Deux méthodes. La plus rapide pour tester est npx ; pour un usage durable avec des données qui persistent, préférez Docker.
Ouvrez ensuite http://localhost:3000 dans votre navigateur : l'interface du canvas s'affiche. Le volume monté (~/.flowise) conserve vos chatflows et vos clés entre deux redémarrages du conteneur.
#Connecter Ollama à Flowise
Le nœud « ChatOllama » est le pont entre Flowise et votre daemon local. Le point clé est l'URL de base : elle dépend de la façon dont Flowise est lancé.
- 01Ajouter le nœud ChatOllamaDans le canvas, ouvrez le panneau des nœuds, catégorie « Chat Models », et glissez « ChatOllama » sur la zone de travail.
- 02Renseigner l'URL de baseSi Flowise tourne en natif (npx/npm), utilisez http://localhost:11434. S'il tourne en Docker, utilisez http://host.docker.internal:11434 — le conteneur ne voit pas « localhost » de l'hôte.
- 03Choisir le modèleDans le champ « Model Name », saisissez le nom exact du modèle chargé dans Ollama, par exemple « qwen3.5:8b » ou « mistral-small ».
- 04Régler les paramètresAjustez Temperature (0,7 pour du chat, 0,1-0,3 pour du RAG factuel) et, si besoin, la taille de contexte via num_ctx dans les options avancées.
#Les nœuds essentiels d'un chatflow
Un chatflow se lit de gauche à droite : les nœuds fournisseurs (modèle, mémoire, outils) alimentent un nœud « chaîne » ou « agent » qui produit la réponse. Voici la poignée de blocs qui reviennent dans presque tous les flux.
- Chat Model (ChatOllama)
- Le cerveau : le LLM qui génère les réponses. Toujours présent.
- Memory (Buffer Memory)
- Conserve l'historique de conversation pour que l'agent garde le fil d'un tour à l'autre.
- Prompt Template
- Définit les instructions système et la mise en forme de la question. C'est ici qu'on donne un rôle et un cadre au modèle.
- Chain / Agent
- Le nœud terminal. « Conversation Chain » pour un simple chat ; « Tool Agent » quand le modèle doit décider d'appeler des outils.
- Tools
- Capacités externes : calculatrice, recherche web, requête HTTP, lecture de fichiers. Reliées à un agent, elles étendent ce qu'il sait faire.
- Document Loaders & Vector Store
- La brique RAG : chargent des documents, les découpent, les indexent et les rendent interrogeables (voir plus bas).
#Monter un premier chatflow
Commençons par le plus simple : un assistant conversationnel avec mémoire, branché sur Ollama. Il servira de base à tout le reste.
- 01Créer un nouveau ChatflowDepuis l'écran d'accueil, cliquez sur « Add New » dans l'onglet Chatflows. Un canvas vierge s'ouvre.
- 02Poser les trois nœuds de baseGlissez « ChatOllama », « Buffer Memory » et « Conversation Chain » sur le canvas.
- 03Câbler les connexionsReliez la sortie de ChatOllama à l'entrée « Chat Model » de la Conversation Chain, et la sortie de Buffer Memory à l'entrée « Memory » de la même chaîne.
- 04Personnaliser le prompt systèmeDans la Conversation Chain, ouvrez le champ System Message et donnez un rôle : « Tu es un assistant technique concis qui répond en français ».
- 05Tester dans le chat intégréCliquez sur l'icône de chat en haut à droite, posez une question, puis une seconde qui dépend de la première pour vérifier que la mémoire fonctionne.
#Un RAG complet en drag-and-drop
Le RAG (Retrieval-Augmented Generation) permet au modèle de répondre à partir de vos propres documents. Dans Flowise, tout se fait au canvas : on charge les fichiers, on les vectorise, et on branche le retriever sur une chaîne de questions-réponses.
- 01Charger les documentsAjoutez un nœud « Document Loader » adapté à votre source : PDF File, Text File, ou Folder. Il lit le contenu brut.
- 02Découper en chunksReliez un « Recursive Character Text Splitter » au loader. Réglez la taille des chunks autour de 1000 caractères avec 100 de chevauchement pour garder le contexte entre morceaux.
- 03Générer les embeddingsAjoutez un nœud « Ollama Embeddings » avec le modèle « nomic-embed-text » et la même URL de base que ChatOllama.
- 04Indexer dans un vector storeGlissez un « In-Memory Vector Store » (simple, pour démarrer) ou « Chroma » pour de la persistance. Reliez-y le splitter et les embeddings.
- 05Brancher un Retrieval QA ChainReliez le vector store (comme retriever) et ChatOllama à un nœud « Retrieval QA Chain » ou « Conversational Retrieval QA Chain » pour garder la mémoire de conversation.
- 06Interroger vos documentsSauvegardez, ouvrez le chat et posez une question dont la réponse est dans vos fichiers. Le modèle cite désormais votre contenu.
#Publier et intégrer le chatbot
Une fois le chatflow satisfaisant, Flowise l'expose de deux manières sans une ligne de backend : une API REST et un widget web à coller sur votre site.
Cliquez sur « API Endpoint » ou l'icône </> en haut à droite du canvas. Flowise génère l'URL de prédiction et des exemples prêts à copier. L'endpoint suit toujours le même schéma, avec l'identifiant unique du chatflow.
Pour l'intégration web, l'onglet « Embed » fournit un extrait de script à placer avant la balise de fermeture </body> de vos pages. Le widget affiche une bulle de chat flottante entièrement configurable (couleurs, message d'accueil, avatar).
#Dépannage des pièges fréquents
- « fetch failed » sur ChatOllama
- URL de base incorrecte. En Docker, utilisez host.docker.internal:11434, pas localhost. Vérifiez aussi qu'Ollama tourne bien (ollama list).
- Le modèle n'appelle jamais les outils
- Le LLM ne supporte pas ou mal le tool calling. Passez à un modèle récent entraîné pour (Qwen 3.5, Mistral Small) et vérifiez que vous utilisez un « Tool Agent », pas une simple chaîne.
- Réponses lentes ou tronquées
- Contexte trop grand pour la VRAM : le modèle déborde sur le CPU. Réduisez num_ctx, la taille des chunks RAG, ou choisissez un modèle plus petit.
- Le RAG ne trouve rien de pertinent
- Chunks mal dimensionnés ou mauvais modèle d'embeddings. Ajustez la taille des chunks, augmentez le nombre de documents remontés (top-k) et vérifiez que l'indexation s'est bien faite.
- Les données disparaissent au redémarrage
- En Docker sans volume monté, tout est perdu. Assurez-vous d'avoir « -v ~/.flowise:/root/.flowise » et utilisez un vector store persistant plutôt qu'en mémoire.
#Pour aller plus loin
Flowise n'est qu'une couche visuelle : la qualité de vos agents dépend surtout du modèle et de la stack en dessous. Trois guides du site prolongent celui-ci — installer proprement Ollama avant de connecter Flowise, comparer l'approche no-code de Dify à celle de Flowise, et comprendre les rouages d'un RAG en Python pour ajuster finement ce que le canvas automatise.
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.