Intermédiaire 10 minStack

Firecrawl : alimenter un RAG local avec des pages web

Firecrawl transforme une adresse web en texte propre, directement lisible par un modèle : le menu, la bannière cookies, les scripts et le pied de page disparaissent, l'article reste. C'est la première étape d'un pipeline RAG, celle qui décide de la qualité de tout ce qui suit. Le projet est ouvert et s'héberge chez soi, ce qui le rend compatible avec une installation entièrement locale — à condition de savoir que la version auto-hébergée n'est pas l'égale du service en ligne.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#Le problème que ça résout

Donner une page web à un modèle local en lui collant son code HTML gâche l'essentiel de la fenêtre de contexte en balises, en menus et en scripts. Pire : le modèle traite les entrées de navigation comme du contenu et vous répond à côté. Toute chaîne de recherche documentaire sérieuse commence donc par une étape d'extraction qui répond à une seule question : dans cette page, qu'est-ce qui est l'article ?

Firecrawl fait ce travail, et la logique de parcours qui va autour : suivre les liens internes, s'arrêter à une limite que vous fixez, exécuter le JavaScript des sites qui n'affichent rien sans lui, et rendre un résultat structuré par page. La sortie est du markdown ou du JSON, deux formats qui se découpent proprement en morceaux pour l'indexation.

#Scrape, crawl, map, extract : quatre métiers différents

Le kit RAG Local

Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Les quatre opérations et leur usage réel
OpérationCe qu'elle faitQuand l'utiliser
ScrapeUne adresse en entrée, le contenu nettoyé en sortieVous connaissez déjà la page exacte
CrawlParcourt un site depuis une adresse de départ en suivant les liens internesIngérer une documentation entière
MapRenvoie la liste des adresses d'un site sans récupérer le contenuDécider quoi ingérer avant d'y passer du temps
ExtractExtrait des champs structurés selon un schéma que vous fournissezVous voulez un tableau de prix ou de caractéristiques, pas de la prose

Deux habitudes évitent la majorité des mauvaises surprises : lancer un map avant un crawl, pour voir la forme du site avant de lancer un travail dessus ; et fixer une limite de pages explicite à chaque crawl, parce qu'une documentation avec pagination et variantes de langue est souvent dix fois plus grande qu'elle n'en a l'air.

#L'héberger chez soi

C'est la voie qui nous intéresse si l'objectif est de garder la chaîne sur votre matériel. Il s'agit d'une pile Docker Compose : le service d'API, un worker, une file d'attente, et éventuellement un service de navigateur sans interface pour les pages qui n'existent qu'une fois le JavaScript exécuté. Vous clonez le dépôt, copiez le fichier d'environnement d'exemple, démarrez la pile, et l'API répond sur un port local avec les mêmes formats de requête que la version en ligne.

  1. 01
    Lire d'abord la page d'auto-hébergement du projet
  2. 02
    Trancher la question du navigateur
  3. 03
    Vérifier la licence contre votre usage
!
Auto-héberger n'est pas être anonyme
Le robot va chercher les pages depuis votre adresse IP, avec un agent utilisateur identifiable, et reste soumis aux conditions d'utilisation du site visé et à son fichier robots.txt. Héberger le logiciel change l'endroit où le texte est traité, pas le droit de le collecter.

#Où ça se place dans un RAG local

Une chaîne locale qui fonctionne compte quatre étages, et Firecrawl n'occupe que le premier : l'ingestion transforme les adresses en documents ; le découpage et l'encodage les convertissent en vecteurs avec un modèle d'embedding local ; une base vectorielle stocke ces vecteurs et renvoie les passages les plus proches d'une question ; enfin un modèle local rédige la réponse à partir de ces passages.

Pour des fichiers déjà présents sur votre disque — PDF, documents bureautiques, présentations — ce n'est pas un robot d'exploration qu'il vous faut mais un convertisseur de documents. Et si votre besoin est qu'un modèle consulte le web au moment où il répond, plutôt qu'un corpus ingéré à l'avance, un métamoteur de recherche auto-hébergé est la brique adaptée : il renvoie des résultats à la demande au lieu d'un index à rafraîchir.

#Quand ne pas l'utiliser

Le bon outil selon le besoin
Votre besoinCe qui convient mieux
Convertir une page de temps en tempsUne petite bibliothèque HTML vers markdown dans votre script
Ingérer des PDF et des documents locauxUn convertisseur de documents, pas un robot web
Des réponses web en direct dans une conversationUn moteur de recherche auto-hébergé branché au modèle
Une documentation entière, régulièrement, de façon automatiséeFirecrawl — c'est exactement son cas

#Le point de vigilance juridique

Collecter automatiquement des pages engage votre responsabilité, pas celle de l'outil. Les conditions générales du site visé, ses directives robots, le droit applicable et l'usage que vous faites du contenu comptent davantage que la technique employée. Pour un corpus interne d'entreprise, la question se double de celle du traitement des données personnelles éventuellement présentes dans les pages collectées.

#FAQ

Firecrawl est-il gratuit en auto-hébergement ?+
Le code est ouvert et s'exécute sur votre matériel sans coût de licence, sous une licence libre à réciprocité assortie de conditions propres au service hébergé. Vous payez en revanche en temps d'exploitation : c'est une pile de plusieurs conteneurs que vous maintenez.
La version auto-hébergée fait-elle tout ce que fait le service en ligne ?+
Non, et le projet le dit explicitement dans sa documentation d'auto-hébergement : la version locale n'est pas équivalente en fonctionnalités et n'est pas supportée. Le cœur — récupérer et convertir des pages — fonctionne ; les extras gérés peuvent manquer.
Faut-il un GPU pour Firecrawl ?+
Non. Explorer le web et convertir du HTML sont des tâches de processeur et de réseau. Le GPU ne sert qu'au modèle qui lira ensuite le résultat.
Peut-il lire les sites qui ont besoin de JavaScript ?+
Oui, à condition d'inclure le service de rendu par navigateur dans votre déploiement. Une pile minimale sans ce service ne récupère que le HTML statique, ce qui échoue sur les applications monopage.
Quelle différence entre crawl et map ?+
Map liste les adresses trouvées sur un site sans récupérer leur contenu : c'est rapide et léger. Crawl récupère et convertit réellement chaque page. Cartographier d'abord, puis explorer un sous-ensemble filtré, évite d'ingérer des centaines de pages dont vous ne vouliez pas.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.