Intermédiaire 10 minVision

Tesseract OCR : lire un scan en local (guide français)

Un PDF scanné ne contient pas de texte : c'est une image de texte. Tant qu'on ne l'a pas fait passer par une reconnaissance optique, il s'indexe à vide et l'assistant documentaire jure que le document ne dit rien. Tesseract est le moteur libre de référence pour cette étape : gratuit, hors ligne, disponible partout, et bien plus dépendant de la qualité de l'image que de ses propres réglages.

Par Mohamed Meguedmi·Màj 2026-09-20·Testé sur Windows, macOS, Linux

#Ce qu'est Tesseract, et ce qu'il n'est pas

Tesseract est un moteur de reconnaissance optique de caractères, développé depuis les années 1980 et libéré sous licence Apache. Depuis sa quatrième version, il reconnaît les lignes de texte avec un réseau de neurones récurrent plutôt que caractère par caractère, ce qui a nettement amélioré sa précision sur les documents ordinaires.

Ce qu'il n'est pas : un outil de compréhension de documents. Il rend du texte, éventuellement avec des positions. Il ne dit pas qu'un bloc est un titre, ne reconstruit pas un tableau en lignes et colonnes, et ne comprend pas ce qu'il lit. Pour un document structuré, l'OCR n'est qu'une brique parmi d'autres.

#Le français : le fichier de langue

Le kit IA Locale

Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.

  • Espace en ligne à vie
  • PDF + fichiers
  • Remboursé 30 j

Par défaut, Tesseract lit l'anglais. Sur un document français, cela se traduit par des accents perdus et des mots approximatifs — et beaucoup de gens en concluent que le moteur est mauvais. Il faut installer le fichier de données de la langue et le demander explicitement à l'exécution.

Reconnaissance d'un scan français
# Debian/Ubuntu : installer les données françaises
sudo apt install tesseract-ocr tesseract-ocr-fra

# Reconnaître une image en français, sortie texte
tesseract scan.png sortie -l fra

# Plusieurs langues dans le même document
tesseract scan.png sortie -l fra+eng
i
Un PDF n'est pas une image
Tesseract attend des images. Un PDF doit d'abord être converti en images page par page, ou traité par un outil qui enchaîne les deux étapes et réinjecte le texte reconnu dans une couche invisible du PDF — c'est ce que font les outils dits « OCR de PDF ».

#La qualité de l'image fait tout

C'est le point que l'on découvre toujours trop tard : sur un scan médiocre, aucun réglage ne sauve le résultat, alors qu'un prétraitement de dix lignes transforme un texte illisible en texte propre.

Résolution
Environ 300 points par pouce est la cible. En dessous de 200, la précision s'effondre ; bien au-dessus, on ralentit sans gagner.
Redressement
Une page penchée de deux degrés coûte plus de précision que n'importe quel réglage du moteur.
Contraste et binarisation
Un texte gris clair sur fond gris doit devenir noir sur blanc avant d'arriver au moteur.
Découpage
Retirer les bords noirs de scan et les marges parasites évite des caractères fantômes.

#Les deux réglages qui changent le résultat

Les options qu'il faut connaître
OptionÀ quoi elle sertQuand y toucher
Mode de segmentation de pageIndique au moteur à quoi ressemble la page : bloc unique, colonne, ligne isolée, mot isoléSur un ticket, une étiquette, une colonne étroite : le mode par défaut se trompe souvent
Liste de caractères autorisésRestreint la reconnaissance à un alphabet donnéSur un champ purement numérique, cela élimine les confusions classiques entre O et 0

Le mode de segmentation est le réglage que l'on oublie le plus souvent. Sur une image contenant une seule ligne de texte, le moteur cherche par défaut une mise en page complète et rend parfois une chaîne vide : lui dire qu'il s'agit d'une ligne unique suffit à corriger.

#Tesseract ou un modèle de vision

Deux familles, deux usages
CritèreTesseractModèle de vision local
RessourcesProcesseur, quelques dizaines de mégaoctetsGPU souhaitable, plusieurs gigaoctets
VitesseTrès rapideNettement plus lent
Texte propre sur une colonneExcellentÉquivalent, plus cher
Mise en page complexe, tableauxFaibleBien meilleur
Compréhension du contenuAucunePeut répondre à une question sur le document
Risque d'inventionNul : il se trompe, il n'invente pasRéel : un modèle peut halluciner une valeur plausible

Cette dernière ligne est décisive pour tout contrôle documentaire : Tesseract produit des erreurs visibles — des caractères aberrants — là où un modèle de vision peut produire un nombre parfaitement formé et faux. Sur des pièces comptables ou administratives, c'est une différence de nature, pas de degré.

#L'insérer dans une chaîne locale

Dans une installation documentaire locale, Tesseract intervient à un seul endroit : juste avant l'indexation, sur les documents dépourvus de couche de texte. Le test à automatiser est simple — si l'extraction de texte d'un PDF rend moins de quelques dizaines de caractères par page, c'est un scan, et il part à l'OCR. Sans ce test, des documents entiers entrent silencieusement vides dans l'index, et personne ne s'en aperçoit avant qu'un utilisateur ne s'étonne.

#FAQ

Tesseract est-il gratuit ?+
Oui, c'est un logiciel libre sous licence Apache 2.0, utilisable commercialement, qui fonctionne hors ligne sans coût à la page.
Comment lui faire lire du français ?+
En installant le fichier de données de la langue française et en le demandant explicitement lors de l'appel. Sans cela, le moteur lit en anglais et massacre les accents.
Pourquoi mon résultat est-il illisible ?+
Dans l'immense majorité des cas, la qualité de l'image : résolution insuffisante, page penchée, contraste faible. Redresser, binariser et viser 300 points par pouce apporte plus que tous les réglages du moteur.
Tesseract sait-il lire les tableaux ?+
Il rend le texte, pas la structure. Les lignes et colonnes sont perdues. Pour des tableaux, il faut un outil d'analyse de mise en page ou un modèle de vision.
Faut-il préférer un modèle de vision ?+
Sur des mises en page complexes, oui. Sur du texte propre, Tesseract est plus rapide, plus léger et surtout il n'invente pas : ses erreurs se voient, alors qu'un modèle peut produire une valeur fausse mais crédible.
Ce guide vous a aidé ?

Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.