Docling : convertir des PDF pour une IA locale
Le PDF est l'entrée la plus difficile de toute chaîne documentaire locale : deux colonnes lues en travers, un en-tête qui coupe une phrase en deux, un tableau de chiffres réduit à une colonne de nombres sans leurs intitulés. Docling est une bibliothèque libre qui analyse la mise en page, reconstruit l'ordre de lecture et récupère la structure des tableaux, puis exporte le tout en markdown ou en JSON. Le tout sur votre machine, sans API — ce qui est précisément la contrainte quand les documents sont des contrats ou des dossiers médicaux.
#L'étape qui décide de tout le reste
Quand un assistant documentaire répond mal, on accuse le modèle. La cause est presque toujours en amont. Un rapport exporté depuis un gabarit d'entreprise, passé dans un extracteur de texte naïf, devient un flux où l'en-tête de page interrompt un paragraphe, où la mise en deux colonnes est lue horizontalement, et où un tableau de résultats se transforme en suite de nombres orphelins.
Ces morceaux sont ensuite encodés, retrouvés, et présentés au modèle comme des faits. Le modèle fait ce qu'on lui demande : il lit une absurdité et la restitue avec assurance. Aucun modèle d'embedding, aucun reranker et aucun prompt ne rattrape une conversion ratée.
#Ce que fait Docling
Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
- Analyse de mise en page
- Identifie les zones d'une page et leur nature, pour qu'une légende ne se colle pas à un paragraphe et qu'un pied de page n'apparaisse pas au milieu d'une phrase.
- Ordre de lecture
- Reconstitue la séquence qu'un humain suivrait, ce qui rend enfin exploitables les documents en colonnes.
- Structure des tableaux
- Retrouve lignes, colonnes et cellules fusionnées, et les exporte comme de vrais tableaux.
- Reconnaissance optique au besoin
- Les pages scannées sans couche de texte passent par l'OCR au lieu d'être ingérées à vide.
- Un modèle de document unique
- Une représentation interne commune, plusieurs formats d'export : le reste de la chaîne ignore si l'entrée était un PDF ou un fichier bureautique.
Au-delà du PDF, les formats bureautiques courants, le HTML et les images sont pris en charge — ce qui compte, parce qu'un corpus réel n'est jamais homogène.
#Les tableaux, la vraie raison de s'embêter
Dans un document professionnel, les chiffres vivent presque toujours dans des tableaux, et c'est là que l'extraction naïve échoue le plus durement. Une ligne qui devient « Paris 12 480 3,2 » a perdu les intitulés de colonnes qui lui donnaient un sens. La recherche renvoie ensuite un extrait d'apparence correcte, le modèle invente la relation entre les valeurs, et la réponse est fausse d'une manière difficile à repérer.
Conserver la structure, même en markdown, maintient le lien entre chaque valeur et son intitulé. Sur un corpus où les réponses attendues sont des chiffres, cela justifie à soi seul un convertisseur plus lourd.
#Ce que ça coûte en calcul
| Configuration | Débit | Quand ça suffit |
|---|---|---|
| Processeur seul, sans OCR | Le plus lent : quelques secondes par page complexe | Petits corpus, conversions ponctuelles |
| Processeur seul, avec OCR | Plus lent encore, l'OCR domine | Quelques documents scannés |
| Avec GPU | Nettement plus rapide sur l'analyse de page et les tableaux | Milliers de pages, ingestion répétée |
La conséquence pratique : on convertit par lots, une fois, et on garde le résultat. Réindexer n'a de sens que si la source change. Et sur une machine qui sert aussi un modèle, les deux se disputent le même GPU : ingérer un corpus pendant que des utilisateurs posent des questions ralentit les deux.
#Sa place dans la chaîne
- 01Convertir
- 02Découper
- 03Encoder et stocker
- 04Répondre
- Stocker les vecteurs dans Qdrant
- Une application clé en main pour discuter avec ses documents
- Cas particulier : extraire des données de factures
#Là où ça coince encore
- Les scans de mauvaise qualité
- La précision de l'OCR sur une photocopie de travers est une limite physique, pas logicielle.
- Les mises en page très graphiques
- Magazines, texte habillant une figure, formulaires : difficiles pour tous les convertisseurs.
- L'écriture manuscrite
- Hors du périmètre de cette catégorie d'outils.
- Les graphiques
- Un graphique est une image ; les chiffres derrière ne sont pas dans le fichier. Vous n'obtiendrez que la légende.
#FAQ
Docling est-il gratuit ?+
Faut-il un GPU ?+
Sait-il lire les PDF scannés ?+
Docling ou un simple extracteur de texte ?+
Les données sortent-elles de ma machine ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.