Le guide de référence · 16 chapitres · scripts inclus · mises à jour à vie
Un RAG local qui
tient vraiment la route
Le kit RAG Local : LE guide de référence pour construire un RAG fiable sur tes propres documents — PDF, notes, mails, bibliographie Zotero — sans rien envoyer dans le cloud. Le RAG qui tient la route sur 300 PDF, pas la démo qui marche une fois sur trois.
Obtenir le kit — 24 €24 € · paiement unique · mises à jour à vie incluses
✓ Pour toi si…
tu es pro, chercheur ou développeur, à l'aise avec une ligne de commande (Python utile pour la majorité des chapitres, pas obligatoire), tu as déjà un usage IA locale (Ollama/LM Studio, éventuellement le kit IA Locale), et tu veux un RAG qui dépasse le clic-bouton sur des dizaines ou des centaines de documents — contrats, bibliographie Zotero, correspondance, wiki interne.
✗ Pas pour toi si…
tu veux juste poser une question à trois PDF de temps en temps (c'est déjà le kit IA Locale, Ch.8) ; tu cherches du RAG documentaire pour nourrir un copilote de code (c'est le kit Copilote Local) ; ou tu déploies pour plusieurs utilisateurs en entreprise avec des contraintes RGPD (le kit IA Locale en Entreprise).
Pourquoi tu peux t'y fier
Ce guide est écrit et maintenu par l'équipe de QuelLLM.fr — 243 modèles indexés, 251 guides en français, mis à jour chaque matin — qui opère aussi des plateformes IA en production toute l'année (RegulIA, IAPRO). Chaque commande, modèle et licence de ce guide est vérifié contre la source officielle à la date d'édition (et revérifié à chaque édition), sur les profils de machines que nous utilisons nous-mêmes (PC 8-16 Go de VRAM, Mac mini M4 24 Go) ; tous les scripts du pack compilent et sont relus un à un. Ce que tu lis est condensé, vérifié, sans détour. Pas une compilation de tutos trouvés au hasard. Qui est derrière QuelLLM →
Le problème
Tu as déjà un assistant IA local, peut-être déjà un RAG clic-bouton (AnythingLLM, Open WebUI). Tu glisses un PDF, tu poses une question, ça répond — et puis un jour ça répond à côté, ou pire, ça invente une citation qui n'existe pas dans le document. Sur 300 PDF, une bibliothèque Zotero entière ou des années de correspondance, le clic-bouton ne tient plus : chunking naïf, aucune citation vérifiable, et surtout rien n'est jamais mesuré — tu le crois sur trois exemples, pas sur un protocole.
L'information de base est déjà gratuite sur le site, éclatée sur 7 guides (ChromaDB, chunking, hybride BM25, Zotero, embeddings français, reranking, LlamaIndex). Le kit est LA méthode de référence : le pipeline complet assemblé et testé — ingestion, chunking mesuré, embeddings FR, index qui tient à l'échelle, recherche hybride, reranking, et une méthode pour vérifier que ça marche vraiment — pas une compilation de tutos à recouper toi-même.
Le RAG assemblé et mesuré vs le RAG clic-bouton vs coller tout au LLM
Le même besoin — interroger tes documents — trois façons d'y répondre. Le comparatif honnête :
| RAG assemblé (ce kit) | RAG clic-bouton | Tout coller au LLM | |
|---|---|---|---|
| Tient sur des centaines de documents | Oui | Limité | Non |
| Citation vérifiable systématique | Oui, exigée | Rarement fiable | Non |
| Recherche hybride (identifiants, noms propres) | Oui (BM25 + vectoriel) | Non | Non applicable |
| Qualité mesurée (recall@k avant/après) | Oui, protocole fourni | Non | Non |
| Mise en place | Plusieurs sessions, pipeline propre | Quelques minutes | Immédiat |
| Confidentialité (100 % local) | Oui | Oui | Selon le LLM utilisé |
| Coût | 0 €/mois une fois monté | 0 €/mois | Contexte cher au-delà de quelques docs |
Le clic-bouton reste le bon choix pour un usage occasionnel sur trois documents (c'est le kit IA Locale, Ch.8). Ce kit prend le relais quand le corpus, l'enjeu ou la fiabilité exigée dépassent ce que le clic-bouton peut tenir.
Ce que tu obtiens
- Ton espace en ligne, à vie — les 16 chapitres lisibles en web, toujours la dernière édition.
- Le guide complet en PDF (103 pages) — le même contenu, à toi pour toujours, hors-ligne.
- 20 fichiers prêts à l'emploi (scripts, gabarits, comparatifs) — bascule OCR→vision, pipeline Zotero avec citation, parsing mbox, 3 stratégies de chunking, comparatifs embeddings/bases vectorielles, recherche hybride RRF, ajout de reranker, pipelines LlamaIndex et agent LangChain, script de mesure recall@k, arbre de dépannage.
- 2 profils d'ancrage — PC 8-16 Go de VRAM, Mac mini M4 24 Go : tu retrouves ta configuration à chaque exemple, jamais un cas qui ne te concerne pas.
- Le protocole de mesure (Ch.14) — construire un jeu de 30-50 questions, mesurer un recall@k avant/après un changement, détecter une hallucination sans citation valide selon un vrai protocole, pas une impression.
- Édition vivante — chaque mise à jour (nouveaux embedders, bases vectorielles, frameworks) apparaît dans ton espace, à vie, sans rien repayer.
Outils : ChromaDB, Qdrant, LanceDB, LlamaIndex, LangChain, Open WebUI Knowledge, AnythingLLM. Embeddings : bge-m3, nomic-embed-text-v2-moe. 100 % local, 0 €/mois une fois monté.
Les 16 chapitres du kit
103 pages, des fondations du pipeline au RAG mesuré et fiabilisé. Rien à sauter : chaque chapitre renvoie vers les suivants.
- Ton RAG actuel ment (ou pourquoi ce kit existe)
- Anatomie d'un pipeline RAG qui tient la route
- Choisir sa stack : script, framework ou interface avancée
- OCR, nettoyage, dédup : ingérer ce qu'on a vraiment
- Zotero : brancher sa bibliographie sur un RAG qui cite vraiment
- Mails et correspondance : un corpus qu'on oublie de RAGuer
- Chunking : les 5 stratégies et comment mesurer laquelle gagne
- Embeddings multilingues FR : lequel choisir et comment vérifier
- Index vectoriel local : ChromaDB, Qdrant, LanceDB — lequel en 2026
- Recherche hybride : quand le vectoriel pur ne suffit pas
- Reranking : le cross-encoder qui corrige le retrieval
- LlamaIndex et LangChain en local : construire au-delà du script fait main
- Open WebUI Knowledge et AnythingLLM en usage avancé
- Évaluer son RAG : jeu de questions, citations, hallucinations
- Coût, vitesse, dépannage par machine
- RAG au travail — et ce qui suit
Édition vivante : chaque mise à jour enrichit ce sommaire (Update Log daté, ch.16) — tu ne rachètes rien à la prochaine version.
Trois quick wins avant même d'ouvrir un terminal
Le Chapitre 1 ne se contente pas de poser le décor : il te donne trois améliorations mesurables sur ton installation actuelle, chacune en moins de 30 minutes.
1 · Audite ton RAG actuel
La checklist 10 points repère en 10 minutes le point le plus faible de ton installation existante (ou l'absence d'installation).
2 · Change d'embedder en une commande
ollama pull bge-m3, tu bascules l'embedder dans AnythingLLM ou Open WebUI, tu compares avant/après.
3 · Exige une citation vérifiable
Une clause de citation stricte ajoutée à une question déjà posée — et tu vérifies que le passage cité existe vraiment.
4 · Puis construis le pipeline complet
Ingestion, chunking mesuré, embeddings FR, index, hybride, reranking : les Parties 2 à 4 t'y amènent pas à pas.
- L'espace en ligne à vie : 16 chapitres toujours à jour (sommaire complet plus haut)
- Le guide PDF (103 pages) + les 20 fichiers (scripts, gabarits, comparatifs — Zotero, chunking, hybride, reranking, évaluation…) à télécharger
- Les 2 profils d'ancrage (PC 8-16 Go, Mac 24 Go) et l'arbre de dépannage RAG
- Toutes les éditions futures, à vie — elles apparaissent dans ton espace
- Accès immédiat après paiement, clé d'accès envoyée par email
Paiement sécurisé par Stripe. Facture sur demande · TVA non applicable, art. 293 B du CGI.
La vérité honnête
Un RAG local assemblé et mesuré couvre très bien tes propres documents, mais ce n'est pas la solution à tout. Un guide de référence te doit cette carte honnête :
À la fin, tu sais faire
- Construire un pipeline RAG complet — ingestion, chunking, embeddings FR, index, hybride, reranking, génération avec citation.
- Brancher Zotero, ta correspondance mail ou des PDF scannés sur un RAG qui cite vraiment ses sources.
- Choisir chunking, embedder et base vectorielle en connaissance de cause, pas par défaut.
- Mesurer un recall@k avant/après un changement, au lieu de croire que « ça marche mieux ».
- Passer du script fait main à un framework (LlamaIndex/LangChain) ou pousser AnythingLLM/Open WebUI en réglages avancés selon ton besoin.
Édition vivante — comme tous les kits QuelLLM
« Mises à jour à vie » n'est pas un slogan : le kit suit l'écosystème RAG (embedders, bases vectorielles, frameworks) pour toi, sans rien te faire repayer.
v2026.09 (édition actuelle) — première édition du kit : 16 chapitres, 2 profils d'ancrage (PC 8-16 Go de VRAM, Mac mini M4 24 Go), 20 fichiers (scripts, gabarits, comparatifs).
Les prochaines éditions (nouveaux embedders, bases vectorielles, frameworks) s'ajoutent ici, datées, et t'arrivent dans ton espace sans rien repayer.
Questions fréquentes
Quelle est la différence avec le kit IA Locale, qui a déjà un chapitre RAG ?
Le kit IA Locale (Ch.8) t'installe un RAG clic-bouton dans AnythingLLM ou Open WebUI — glisser un PDF, poser une question, ça marche pour un usage occasionnel. Ce kit commence là où ce chapitre s'arrête : chunking mesuré, embeddings français comparés, index vectoriel qui tient à l'échelle, recherche hybride, reranking, et surtout une méthode pour vérifier que ton RAG répond juste — pas juste qu'il répond. Aucun contenu du Ch.8 n'est réexpliqué ici, seuls les réglages avancés et les briques absentes du clic-bouton le sont.
Quelle est la différence avec les 7 guides RAG gratuits du site ?
Les guides gratuits de QuelLLM.fr couvrent chaque brique séparément (ChromaDB seul, chunking seul, hybride BM25 seul, Zotero seul…). Le kit assemble le pipeline complet dans l'ordre (ingestion → chunking → embeddings → index → hybride → reranking → génération → citation → mesure), relie ce que chaque guide isolé ne relie pas, et fournit les 20 fichiers (scripts, gabarits, comparatifs) testés qu'aucun guide isolé ne donne — c'est l'assemblage et les scripts qui se paient, pas l'information de base.
Il faut savoir coder en Python pour suivre ce kit ?
Python 3.10+ est utile et te sert pour la majorité des chapitres (Ch.4 à Ch.12) — les scripts sont fournis, à adapter, pas à écrire de zéro. Le Chapitre 13 (Open WebUI Knowledge, AnythingLLM en réglages avancés) reste accessible sans écrire une ligne de code. Ce kit suppose une aisance avec une ligne de commande ; si tu pars de zéro sur l'IA locale, commence par le kit IA Locale.
Combien de temps pour un premier résultat concret ?
Le Chapitre 1 donne 3 quick wins de moins de 30 minutes chacun, applicables sur un RAG déjà en place (audit express, changement d'embedder en une commande, citation vérifiable exigée) — tu repars avec une amélioration mesurable avant même d'attaquer le pipeline complet. Construire un pipeline complet sur ton propre corpus (Parties 2 à 4) prend plusieurs sessions, pas une heure.
Ça marche sur quelle machine ?
Deux profils d'ancrage, nommés à chaque exemple : un PC avec 8 à 16 Go de VRAM (le modèle de génération recommandé change selon la borne), ou un Mac Apple Silicon avec 24 Go de mémoire unifiée. Dans un RAG, le goulot n'est presque jamais la génération mais l'ingestion (OCR, embeddings) et la taille de l'index — les deux profils couvrent l'essentiel des configurations pro/dev réelles.
Mes documents restent-ils confidentiels ?
C'est tout le principe : le pipeline (ingestion, embeddings, index, génération) tourne entièrement sur ta machine, rien ne part vers un tiers. Le Chapitre 15 aborde spécifiquement ce que ça change pour un corpus de mails ou de documents sensibles. Pour un déploiement multi-utilisateurs en entreprise (RGPD, AI Act, architecture serveur), c'est le kit IA Locale en Entreprise (quelllm.fr/kit-ia-entreprise), pas celui-ci.
Le kit couvre-t-il les agents ou l'automatisation ?
Le Chapitre 12 montre le RAG utilisé comme outil par un agent minimal (un agent, deux outils) — juste assez pour comprendre le principe, avec un renvoi explicite vers le kit Agents Locaux (quelllm.fr/kit-agents-locaux) pour l'orchestration multi-étapes, MCP ou n8n. Ce n'est pas le sujet de ce kit.
Et si ça ne me convient pas après achat ?
Satisfait ou remboursé pendant 30 jours, un email suffit, sans justification — comme sur tous les kits QuelLLM.
C'est livré comment, et pour combien de temps ?
Accès immédiat après paiement : ton espace en ligne à vie (toujours la dernière édition) + le PDF et le zip des 20 fichiers à télécharger, à toi pour toujours. Les mises à jour futures (nouveaux embedders, nouvelles bases vectorielles, frameworks qui évoluent) apparaissent dans ton espace sans rien repayer.
Puis-je avoir une facture ?
Oui. Le paiement passe par Stripe : reçu par email immédiat, facture sur simple demande en répondant à l'email de confirmation. TVA non applicable, art. 293 B du CGI.
Le kit reste-t-il à jour ? Les bases vectorielles et frameworks RAG évoluent vite.
C'est le principe des mises à jour à vie : quand un embedder change de statut, qu'une base vectorielle mûrit ou qu'un framework casse une compatibilité, l'édition suit — comme pour les autres kits QuelLLM. Le Chapitre 16 explique aussi comment vérifier toi-même la fraîcheur d'un fait cité entre deux éditions.
Et si je veux plusieurs kits QuelLLM ?
Le bundle « tous les kits, à vie » regroupe tous les kits actuels et futurs pour 49 €. Si tu as déjà acheté un kit à 24 €, l'upgrade vers le bundle te coûte 25 €, pas 49 € — le coupon s'applique automatiquement.
Construis un RAG qui tient la route.
Le guide de référence, du premier PDF ingéré au RAG mesuré et fiable sur ta bibliothèque entière — sans rien envoyer dans le cloud. Aujourd'hui, pas « un jour ».
Obtenir le kit — 24 €