Reconnaissance caractères

Comment transformer une image en texte sous Linux ?

Plusieurs solutions existent.

Voici comment utiliser Tesseract (c'est ce que Google utilise comme solution OCR - Optical Character Recognition.)

Installation sous terminal et archlinux:
yay -S tesseract
il faut aussi installer les dictionnaires des langues à convertir — a minima, installer le paquet français tesseract-data-fra !

Utilisation : sous terminal

Allez dans le dossier ou se trouve votre image. Puis utilisez la syntaxe suivante :
tesseract image.extension NomTexte -l fra

Avec
tesseract, le nom du programme OCR
image.extension l'image et son extension, par exemple, plage.jpg
NomTexte le nom du fichier texte, l'extension .txt sera rajoutée. Exemple plage donnera le fichier plage.txt
- l fra 
la langue utilisée pour la traduction de l'image en texte.

Pour aller plus loin, sous terminal, écrivez man tesseract pour le manuel.

Conclusion
Simple, rapide, et surtout, efficace.
L'exemple ci-dessous convertit l'image I_IMG_6663.JPG en texte dans le fichier h.txt

⬆︎ ⬇︎

Contact Mentions Site created in 2018 Club informatique Aide