Intermédiaire 10 minStack

Docling : convertir des PDF pour une IA locale

Le PDF est l'entrée la plus difficile de toute chaîne documentaire locale : deux colonnes lues en travers, un en-tête qui coupe une phrase en deux, un tableau de chiffres réduit à une colonne de nombres sans leurs intitulés. Docling est une bibliothèque libre qui analyse la mise en page, reconstruit l'ordre de lecture et récupère la structure des tableaux, puis exporte le tout en markdown ou en JSON. Le tout sur votre machine, sans API — ce qui est précisément la contrainte quand les documents sont des contrats ou des dossiers médicaux.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#L'étape qui décide de tout le reste

Quand un assistant documentaire répond mal, on accuse le modèle. La cause est presque toujours en amont. Un rapport exporté depuis un gabarit d'entreprise, passé dans un extracteur de texte naïf, devient un flux où l'en-tête de page interrompt un paragraphe, où la mise en deux colonnes est lue horizontalement, et où un tableau de résultats se transforme en suite de nombres orphelins.

Ces morceaux sont ensuite encodés, retrouvés, et présentés au modèle comme des faits. Le modèle fait ce qu'on lui demande : il lit une absurdité et la restitue avec assurance. Aucun modèle d'embedding, aucun reranker et aucun prompt ne rattrape une conversion ratée.

#Ce que fait Docling

Le kit RAG Local

Tes documents, ton IA : un RAG local fiable sur tes PDF, notes et mails — sans rien envoyer dans le cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j
Analyse de mise en page
Identifie les zones d'une page et leur nature, pour qu'une légende ne se colle pas à un paragraphe et qu'un pied de page n'apparaisse pas au milieu d'une phrase.
Ordre de lecture
Reconstitue la séquence qu'un humain suivrait, ce qui rend enfin exploitables les documents en colonnes.
Structure des tableaux
Retrouve lignes, colonnes et cellules fusionnées, et les exporte comme de vrais tableaux.
Reconnaissance optique au besoin
Les pages scannées sans couche de texte passent par l'OCR au lieu d'être ingérées à vide.
Un modèle de document unique
Une représentation interne commune, plusieurs formats d'export : le reste de la chaîne ignore si l'entrée était un PDF ou un fichier bureautique.

Au-delà du PDF, les formats bureautiques courants, le HTML et les images sont pris en charge — ce qui compte, parce qu'un corpus réel n'est jamais homogène.

#Les tableaux, la vraie raison de s'embêter

Dans un document professionnel, les chiffres vivent presque toujours dans des tableaux, et c'est là que l'extraction naïve échoue le plus durement. Une ligne qui devient « Paris 12 480 3,2 » a perdu les intitulés de colonnes qui lui donnaient un sens. La recherche renvoie ensuite un extrait d'apparence correcte, le modèle invente la relation entre les valeurs, et la réponse est fausse d'une manière difficile à repérer.

Conserver la structure, même en markdown, maintient le lien entre chaque valeur et son intitulé. Sur un corpus où les réponses attendues sont des chiffres, cela justifie à soi seul un convertisseur plus lourd.

!
Contrôlez cinq documents à la main
Avant d'ingérer un corpus entier, convertissez cinq documents représentatifs et lisez le markdown produit, en regardant précisément les tableaux et les ruptures de page. Dix minutes ici évitent une semaine à accuser le modèle.

#Ce que ça coûte en calcul

Ordre de grandeur selon la configuration
ConfigurationDébitQuand ça suffit
Processeur seul, sans OCRLe plus lent : quelques secondes par page complexePetits corpus, conversions ponctuelles
Processeur seul, avec OCRPlus lent encore, l'OCR domineQuelques documents scannés
Avec GPUNettement plus rapide sur l'analyse de page et les tableauxMilliers de pages, ingestion répétée

La conséquence pratique : on convertit par lots, une fois, et on garde le résultat. Réindexer n'a de sens que si la source change. Et sur une machine qui sert aussi un modèle, les deux se disputent le même GPU : ingérer un corpus pendant que des utilisateurs posent des questions ralentit les deux.

#Sa place dans la chaîne

  1. 01
    Convertir
  2. 02
    Découper
  3. 03
    Encoder et stocker
  4. 04
    Répondre

#Là où ça coince encore

Les scans de mauvaise qualité
La précision de l'OCR sur une photocopie de travers est une limite physique, pas logicielle.
Les mises en page très graphiques
Magazines, texte habillant une figure, formulaires : difficiles pour tous les convertisseurs.
L'écriture manuscrite
Hors du périmètre de cette catégorie d'outils.
Les graphiques
Un graphique est une image ; les chiffres derrière ne sont pas dans le fichier. Vous n'obtiendrez que la légende.

#FAQ

Docling est-il gratuit ?+
Oui, c'est un projet libre sous licence permissive, utilisable commercialement, qui tourne localement sans clé d'API ni facturation à la page.
Faut-il un GPU ?+
Non, il fonctionne sur processeur. Mais son analyse de mise en page et de tableaux repose sur des modèles : un GPU réduit fortement le temps de conversion sur un gros corpus. Pour quelques dizaines de documents, le processeur suffit.
Sait-il lire les PDF scannés ?+
Oui, via la reconnaissance optique, qu'il faut activer pour les documents sans couche de texte. La qualité dépend alors du scan : un document net à 300 points par pouce passe bien, une photocopie de travers non.
Docling ou un simple extracteur de texte ?+
Un extracteur simple est plus rapide et convient à du texte propre sur une colonne. Docling se justifie sur les mises en page complexes, les tableaux et les corpus hétérogènes — c'est-à-dire sur les documents réels.
Les données sortent-elles de ma machine ?+
Non, la conversion est locale une fois les modèles téléchargés. C'est précisément l'argument pour les documents confidentiels.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.