Tesseract OCR : lire un scan en local (guide français)
Un PDF scanné ne contient pas de texte : c'est une image de texte. Tant qu'on ne l'a pas fait passer par une reconnaissance optique, il s'indexe à vide et l'assistant documentaire jure que le document ne dit rien. Tesseract est le moteur libre de référence pour cette étape : gratuit, hors ligne, disponible partout, et bien plus dépendant de la qualité de l'image que de ses propres réglages.
#Ce qu'est Tesseract, et ce qu'il n'est pas
Tesseract est un moteur de reconnaissance optique de caractères, développé depuis les années 1980 et libéré sous licence Apache. Depuis sa quatrième version, il reconnaît les lignes de texte avec un réseau de neurones récurrent plutôt que caractère par caractère, ce qui a nettement amélioré sa précision sur les documents ordinaires.
Ce qu'il n'est pas : un outil de compréhension de documents. Il rend du texte, éventuellement avec des positions. Il ne dit pas qu'un bloc est un titre, ne reconstruit pas un tableau en lignes et colonnes, et ne comprend pas ce qu'il lit. Pour un document structuré, l'OCR n'est qu'une brique parmi d'autres.
#Le français : le fichier de langue
Ton ChatGPT privé et gratuit sur ta machine en 1 heure — LM Studio, Ollama, Open WebUI, tes documents, sans cloud.
- Espace en ligne à vie
- PDF + fichiers
- Remboursé 30 j
Par défaut, Tesseract lit l'anglais. Sur un document français, cela se traduit par des accents perdus et des mots approximatifs — et beaucoup de gens en concluent que le moteur est mauvais. Il faut installer le fichier de données de la langue et le demander explicitement à l'exécution.
#La qualité de l'image fait tout
C'est le point que l'on découvre toujours trop tard : sur un scan médiocre, aucun réglage ne sauve le résultat, alors qu'un prétraitement de dix lignes transforme un texte illisible en texte propre.
- Résolution
- Environ 300 points par pouce est la cible. En dessous de 200, la précision s'effondre ; bien au-dessus, on ralentit sans gagner.
- Redressement
- Une page penchée de deux degrés coûte plus de précision que n'importe quel réglage du moteur.
- Contraste et binarisation
- Un texte gris clair sur fond gris doit devenir noir sur blanc avant d'arriver au moteur.
- Découpage
- Retirer les bords noirs de scan et les marges parasites évite des caractères fantômes.
#Les deux réglages qui changent le résultat
| Option | À quoi elle sert | Quand y toucher |
|---|---|---|
| Mode de segmentation de page | Indique au moteur à quoi ressemble la page : bloc unique, colonne, ligne isolée, mot isolé | Sur un ticket, une étiquette, une colonne étroite : le mode par défaut se trompe souvent |
| Liste de caractères autorisés | Restreint la reconnaissance à un alphabet donné | Sur un champ purement numérique, cela élimine les confusions classiques entre O et 0 |
Le mode de segmentation est le réglage que l'on oublie le plus souvent. Sur une image contenant une seule ligne de texte, le moteur cherche par défaut une mise en page complète et rend parfois une chaîne vide : lui dire qu'il s'agit d'une ligne unique suffit à corriger.
#Tesseract ou un modèle de vision
| Critère | Tesseract | Modèle de vision local |
|---|---|---|
| Ressources | Processeur, quelques dizaines de mégaoctets | GPU souhaitable, plusieurs gigaoctets |
| Vitesse | Très rapide | Nettement plus lent |
| Texte propre sur une colonne | Excellent | Équivalent, plus cher |
| Mise en page complexe, tableaux | Faible | Bien meilleur |
| Compréhension du contenu | Aucune | Peut répondre à une question sur le document |
| Risque d'invention | Nul : il se trompe, il n'invente pas | Réel : un modèle peut halluciner une valeur plausible |
Cette dernière ligne est décisive pour tout contrôle documentaire : Tesseract produit des erreurs visibles — des caractères aberrants — là où un modèle de vision peut produire un nombre parfaitement formé et faux. Sur des pièces comptables ou administratives, c'est une différence de nature, pas de degré.
- Les modèles multimodaux locaux, ce qu'ils savent lire
- Extraire les données d'une facture : la chaîne complète
- Convertir des documents structurés avec Docling
#L'insérer dans une chaîne locale
Dans une installation documentaire locale, Tesseract intervient à un seul endroit : juste avant l'indexation, sur les documents dépourvus de couche de texte. Le test à automatiser est simple — si l'extraction de texte d'un PDF rend moins de quelques dizaines de caractères par page, c'est un scan, et il part à l'OCR. Sans ce test, des documents entiers entrent silencieusement vides dans l'index, et personne ne s'en aperçoit avant qu'un utilisateur ne s'étonne.
#FAQ
Tesseract est-il gratuit ?+
Comment lui faire lire du français ?+
Pourquoi mon résultat est-il illisible ?+
Tesseract sait-il lire les tableaux ?+
Faut-il préférer un modèle de vision ?+
Un retour, une erreur, une précision ? Faites-nous signe, ça améliore le guide pour tout le monde.