Le guide de référence · 16 chapitres · scripts inclus · mises à jour à vie

Un RAG local qui
tient vraiment la route

Le kit RAG Local : LE guide de référence pour construire un RAG fiable sur tes propres documents — PDF, notes, mails, bibliographie Zotero — sans rien envoyer dans le cloud. Le RAG qui tient la route sur 300 PDF, pas la démo qui marche une fois sur trois.

Obtenir le kit — 24 €

24 € · paiement unique · mises à jour à vie incluses

Accès immédiat (en ligne + PDF) Paiement sécurisé Stripe Remboursé 30 jours Édition vivante (mises à jour à vie)

Voir les 16 chapitres →

✓ Pour toi si…

tu es pro, chercheur ou développeur, à l'aise avec une ligne de commande (Python utile pour la majorité des chapitres, pas obligatoire), tu as déjà un usage IA locale (Ollama/LM Studio, éventuellement le kit IA Locale), et tu veux un RAG qui dépasse le clic-bouton sur des dizaines ou des centaines de documents — contrats, bibliographie Zotero, correspondance, wiki interne.

✗ Pas pour toi si…

tu veux juste poser une question à trois PDF de temps en temps (c'est déjà le kit IA Locale, Ch.8) ; tu cherches du RAG documentaire pour nourrir un copilote de code (c'est le kit Copilote Local) ; ou tu déploies pour plusieurs utilisateurs en entreprise avec des contraintes RGPD (le kit IA Locale en Entreprise).

24 € Paiement unique · mises à jour à vie incluses Garantie 30 jours — pas convaincu, remboursé en un email 7 guides RAG épars sur le site + des heures d'assemblage. Ce kit : 24 €, le pipeline déjà assemblé et testé.

Pourquoi tu peux t'y fier

Ce guide est écrit et maintenu par l'équipe de QuelLLM.fr — 243 modèles indexés, 251 guides en français, mis à jour chaque matin — qui opère aussi des plateformes IA en production toute l'année (RegulIA, IAPRO). Chaque commande, modèle et licence de ce guide est vérifié contre la source officielle à la date d'édition (et revérifié à chaque édition), sur les profils de machines que nous utilisons nous-mêmes (PC 8-16 Go de VRAM, Mac mini M4 24 Go) ; tous les scripts du pack compilent et sont relus un à un. Ce que tu lis est condensé, vérifié, sans détour. Pas une compilation de tutos trouvés au hasard. Qui est derrière QuelLLM →

Le problème

Tu as déjà un assistant IA local, peut-être déjà un RAG clic-bouton (AnythingLLM, Open WebUI). Tu glisses un PDF, tu poses une question, ça répond — et puis un jour ça répond à côté, ou pire, ça invente une citation qui n'existe pas dans le document. Sur 300 PDF, une bibliothèque Zotero entière ou des années de correspondance, le clic-bouton ne tient plus : chunking naïf, aucune citation vérifiable, et surtout rien n'est jamais mesuré — tu le crois sur trois exemples, pas sur un protocole.

L'information de base est déjà gratuite sur le site, éclatée sur 7 guides (ChromaDB, chunking, hybride BM25, Zotero, embeddings français, reranking, LlamaIndex). Le kit est LA méthode de référence : le pipeline complet assemblé et testé — ingestion, chunking mesuré, embeddings FR, index qui tient à l'échelle, recherche hybride, reranking, et une méthode pour vérifier que ça marche vraiment — pas une compilation de tutos à recouper toi-même.

Le RAG assemblé et mesuré vs le RAG clic-bouton vs coller tout au LLM

Le même besoin — interroger tes documents — trois façons d'y répondre. Le comparatif honnête :

RAG assemblé (ce kit)RAG clic-boutonTout coller au LLM
Tient sur des centaines de documentsOuiLimitéNon
Citation vérifiable systématiqueOui, exigéeRarement fiableNon
Recherche hybride (identifiants, noms propres)Oui (BM25 + vectoriel)NonNon applicable
Qualité mesurée (recall@k avant/après)Oui, protocole fourniNonNon
Mise en placePlusieurs sessions, pipeline propreQuelques minutesImmédiat
Confidentialité (100 % local)OuiOuiSelon le LLM utilisé
Coût0 €/mois une fois monté0 €/moisContexte cher au-delà de quelques docs

Le clic-bouton reste le bon choix pour un usage occasionnel sur trois documents (c'est le kit IA Locale, Ch.8). Ce kit prend le relais quand le corpus, l'enjeu ou la fiabilité exigée dépassent ce que le clic-bouton peut tenir.

Ce que tu obtiens

Outils : ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embeddings : bge-m3, nomic-embed-text-v2-moe. 100 % local, 0 €/mois une fois monté.

Les 16 chapitres du kit

103 pages, des fondations du pipeline au RAG mesuré et fiabilisé. Rien à sauter : chaque chapitre renvoie vers les suivants.

Partie 1 — Fondations d'un RAG qui tient la route
  • Ton RAG actuel ment (ou pourquoi ce kit existe)
  • Anatomie d'un pipeline RAG qui tient la route
  • Choisir sa stack : script, framework ou interface avancée
Partie 2 — Ingestion : au-delà du beau PDF
  • OCR, nettoyage, dédup : ingérer ce qu'on a vraiment
  • Zotero : brancher sa bibliographie sur un RAG qui cite vraiment
  • Mails et correspondance : un corpus qu'on oublie de RAGuer
  • Chunking : les 5 stratégies et comment mesurer laquelle gagne
Partie 3 — Le moteur : embeddings, index, retrieval
  • Embeddings multilingues FR : lequel choisir et comment vérifier
  • Index vectoriel local : ChromaDB, Qdrant, LanceDB — lequel en 2026
  • Recherche hybride : quand le vectoriel pur ne suffit pas
  • Reranking : le cross-encoder qui corrige le retrieval
Partie 4 — Orchestrer, mesurer, fiabiliser
  • LlamaIndex et LangChain en local : construire au-delà du script fait main
  • Open WebUI Knowledge et AnythingLLM en usage avancé
  • Évaluer son RAG : jeu de questions, citations, hallucinations
  • Coût, vitesse, dépannage par machine
  • RAG au travail — et ce qui suit

Édition vivante : chaque mise à jour enrichit ce sommaire (Update Log daté, ch.16) — tu ne rachètes rien à la prochaine version.

Trois quick wins avant même d'ouvrir un terminal

Le Chapitre 1 ne se contente pas de poser le décor : il te donne trois améliorations mesurables sur ton installation actuelle, chacune en moins de 30 minutes.

1 · Audite ton RAG actuel

La checklist 10 points repère en 10 minutes le point le plus faible de ton installation existante (ou l'absence d'installation).

2 · Change d'embedder en une commande

ollama pull bge-m3, tu bascules l'embedder dans AnythingLLM ou Open WebUI, tu compares avant/après.

3 · Exige une citation vérifiable

Une clause de citation stricte ajoutée à une question déjà posée — et tu vérifies que le passage cité existe vraiment.

4 · Puis construis le pipeline complet

Ingestion, chunking mesuré, embeddings FR, index, hybride, reranking : les Parties 2 à 4 t'y amènent pas à pas.

24 €
Paiement unique · mises à jour à vie incluses
7 guides RAG épars sur le site, des heures d'assemblage et de test. Ce kit : 24 € une seule fois, pipeline déjà assemblé.
Satisfait ou remboursé 30 jours — un email suffit.
  • L'espace en ligne à vie : 16 chapitres toujours à jour (sommaire complet plus haut)
  • Le guide PDF (103 pages) + les 20 fichiers (scripts, gabarits, comparatifs — Zotero, chunking, hybride, reranking, évaluation…) à télécharger
  • Les 2 profils d'ancrage (PC 8-16 Go, Mac 24 Go) et l'arbre de dépannage RAG
  • Toutes les éditions futures, à vie — elles apparaissent dans ton espace
  • Accès immédiat après paiement, clé d'accès envoyée par email
Je prends le kit — 24 €

Paiement sécurisé par Stripe. Facture PDF envoyée automatiquement · TVA non applicable, art. 293 B du CGI.

Je prends le kit — 24 €

La vérité honnête

Un RAG local assemblé et mesuré couvre très bien tes propres documents, mais ce n'est pas la solution à tout. Un guide de référence te doit cette carte honnête :

Ce kit gagneconfidentialité totale · citation vérifiable · tient sur des centaines de documents · qualité mesurée, pas supposée · 0 €/mois une fois monté
Le clic-bouton ou le cloud gardent l'avantageusage occasionnel sur 2-3 documents · mise en place immédiate sans script · déploiement multi-utilisateurs en entreprise · orchestration d'agents multi-étapes

À la fin, tu sais faire

Édition vivante — comme tous les kits QuelLLM

« Mises à jour à vie » n'est pas un slogan : le kit suit l'écosystème RAG (embedders, bases vectorielles, frameworks) pour toi, sans rien te faire repayer.

CHANGELOG.md — inclus dans le pack

v2026.09 (édition actuelle) — première édition du kit : 16 chapitres, 2 profils d'ancrage (PC 8-16 Go de VRAM, Mac mini M4 24 Go), 20 fichiers (scripts, gabarits, comparatifs).

Les prochaines éditions (nouveaux embedders, bases vectorielles, frameworks) s'ajoutent ici, datées, et t'arrivent dans ton espace sans rien repayer.

Questions fréquentes

Quelle est la différence avec le kit IA Locale, qui a déjà un chapitre RAG ?

Le kit IA Locale (Ch.8) t'installe un RAG clic-bouton dans AnythingLLM ou Open WebUI — glisser un PDF, poser une question, ça marche pour un usage occasionnel. Ce kit commence là où ce chapitre s'arrête : chunking mesuré, embeddings français comparés, index vectoriel qui tient à l'échelle, recherche hybride, reranking, et surtout une méthode pour vérifier que ton RAG répond juste — pas juste qu'il répond. Aucun contenu du Ch.8 n'est réexpliqué ici, seuls les réglages avancés et les briques absentes du clic-bouton le sont.

Quelle est la différence avec les 7 guides RAG gratuits du site ?

Les guides gratuits de QuelLLM.fr couvrent chaque brique séparément (ChromaDB seul, chunking seul, hybride BM25 seul, Zotero seul…). Le kit assemble le pipeline complet dans l'ordre (ingestion → chunking → embeddings → index → hybride → reranking → génération → citation → mesure), relie ce que chaque guide isolé ne relie pas, et fournit les 20 fichiers (scripts, gabarits, comparatifs) testés qu'aucun guide isolé ne donne — c'est l'assemblage et les scripts qui se paient, pas l'information de base.

Il faut savoir coder en Python pour suivre ce kit ?

Python 3.10+ est utile et te sert pour la majorité des chapitres (Ch.4 à Ch.12) — les scripts sont fournis, à adapter, pas à écrire de zéro. Le Chapitre 13 (Open WebUI Knowledge, AnythingLLM en réglages avancés) reste accessible sans écrire une ligne de code. Ce kit suppose une aisance avec une ligne de commande ; si tu pars de zéro sur l'IA locale, commence par le kit IA Locale.

Combien de temps pour un premier résultat concret ?

Le Chapitre 1 donne 3 quick wins de moins de 30 minutes chacun, applicables sur un RAG déjà en place (audit express, changement d'embedder en une commande, citation vérifiable exigée) — tu repars avec une amélioration mesurable avant même d'attaquer le pipeline complet. Construire un pipeline complet sur ton propre corpus (Parties 2 à 4) prend plusieurs sessions, pas une heure.

Ça marche sur quelle machine ?

Deux profils d'ancrage, nommés à chaque exemple : un PC avec 8 à 16 Go de VRAM (le modèle de génération recommandé change selon la borne), ou un Mac Apple Silicon avec 24 Go de mémoire unifiée. Dans un RAG, le goulot n'est presque jamais la génération mais l'ingestion (OCR, embeddings) et la taille de l'index — les deux profils couvrent l'essentiel des configurations pro/dev réelles.

Mes documents restent-ils confidentiels ?

C'est tout le principe : le pipeline (ingestion, embeddings, index, génération) tourne entièrement sur ta machine, rien ne part vers un tiers. Le Chapitre 15 aborde spécifiquement ce que ça change pour un corpus de mails ou de documents sensibles. Pour un déploiement multi-utilisateurs en entreprise (RGPD, AI Act, architecture serveur), c'est le kit IA Locale en Entreprise (quelllm.fr/kit-ia-entreprise), pas celui-ci.

Le kit couvre-t-il les agents ou l'automatisation ?

Le Chapitre 12 montre le RAG utilisé comme outil par un agent minimal (un agent, deux outils) — juste assez pour comprendre le principe, avec un renvoi explicite vers le kit Agents Locaux (quelllm.fr/kit-agents-locaux) pour l'orchestration multi-étapes, MCP ou n8n. Ce n'est pas le sujet de ce kit.

Et si ça ne me convient pas après achat ?

Satisfait ou remboursé pendant 30 jours, un email suffit, sans justification — comme sur tous les kits QuelLLM.

C'est livré comment, et pour combien de temps ?

Accès immédiat après paiement : ton espace en ligne à vie (toujours la dernière édition) + le PDF et le zip des 20 fichiers à télécharger, à toi pour toujours. Les mises à jour futures (nouveaux embedders, nouvelles bases vectorielles, frameworks qui évoluent) apparaissent dans ton espace sans rien repayer.

Puis-je avoir une facture ?

Oui, automatiquement. Dès le paiement (Stripe), tu reçois par email ton reçu Stripe et ta facture PDF au nom de Falcon Consulting (éditeur de QuelLLM), à tes coordonnées — indique ton entreprise ou ton SIREN dans le champ prévu au moment du paiement. TVA non applicable, art. 293 B du CGI.

Le kit reste-t-il à jour ? Les bases vectorielles et frameworks RAG évoluent vite.

C'est le principe des mises à jour à vie : quand un embedder change de statut, qu'une base vectorielle mûrit ou qu'un framework casse une compatibilité, l'édition suit — comme pour les autres kits QuelLLM. Le Chapitre 16 explique aussi comment vérifier toi-même la fraîcheur d'un fait cité entre deux éditions.

Et si je veux plusieurs kits QuelLLM ?

Le bundle « tous les kits, à vie » regroupe tous les kits actuels et futurs pour 49 €. Si tu as déjà acheté un kit à 24 €, l'upgrade vers le bundle te coûte 25 €, pas 49 € — le coupon s'applique automatiquement.

Construis un RAG qui tient la route.

Le guide de référence, du premier PDF ingéré au RAG mesuré et fiable sur ta bibliothèque entière — sans rien envoyer dans le cloud. Aujourd'hui, pas « un jour ».

Obtenir le kit — 24 €