1. Des produits
  2.   OCR
  3.   Ruby
  4.   RTesseract
 
  

Bibliothèque Ruby gratuite pour convertir une image en texte et PDF recherchables

Bibliothèque OCR Ruby open source qui permet aux développeurs de logiciels d'effectuer la reconnaissance optique de caractères pour extraire du texte à partir de documents numérisés, d'images ou même de captures d'écran

Qu'est-ce que RTesseract ?

La reconnaissance optique de caractères (OCR) sert de pont transformateur entre les médias visuels et les données numériques, permettant aux machines d'extraire le texte des images et des documents numérisés avec précision. Pour les développeurs de l'écosystème Ruby, la bibliothèque open source RTesseract offre une passerelle haute efficacité vers la puissance du moteur OCR Tesseract. Initialement développée par Hewlett‑Packard puis affinée par Google, Tesseract est largement reconnue comme une solution de premier plan pour la conversion d'image en texte. En agissant comme une interface sophistiquée, RTesseract permet l'intégration fluide de Tesseract OCR dans tout projet Ruby, éliminant le besoin de gérer manuellement des interactions complexes en ligne de commande tout en conservant la précision requise pour la numérisation de documents de qualité professionnelle.

Au-delà de sa facilité d'utilisation, RTesseract est une bibliothèque Ruby polyvalente conçue pour prendre en charge une vaste gamme de formats d'image, y compris PNG, JPEG, BMP et TIFF. Cette flexibilité garantit la compatibilité avec pratiquement n'importe quelle source visuelle, tandis que sa capacité à exploiter les fichiers de données globaux de Tesseract permet une reconnaissance de texte multilingue avec une grande fiabilité. Pour renforcer davantage l'intégrité des données, la bibliothèque fournit des scores de confiance pour chaque mot reconnu, permettant aux développeurs d'évaluer programmatiquement la qualité du résultat OCR. En tant que projet open source, RTesseract offre une solution économique, personnalisable et robuste pour les équipes souhaitant automatiser les flux d'extraction de données et créer des applications Ruby plus intelligentes et conscientes du texte.

Previous Next

Premiers pas avec RTesseract

La méthode recommandée pour installer RTesseract est d'utiliser Rubygems. Veuillez utiliser la commande suivante pour une installation fluide.

Installer RTesseract via Rubygems

$ gem install rtesseract 

Installer RTesseract via GitHub

 git clone https://github.com/dannnylo/rtesseract.git  

Vous pouvez télécharger la bibliothèque partagée compilée depuis le dépôt GitHub.

Conversion d'image en texte via l'API Ruby

La bibliothèque RTesseract facilite aux développeurs le chargement et la conversion d’une image en texte au sein des applications Ruby. Le cas d’utilisation le plus simple consiste à convertir une image en une chaîne de texte. En quelques lignes de code seulement, vous pouvez extraire le texte d’un fichier image. L’exemple de code suivant charge l’image et la traite avec Tesseract, renvoyant le texte reconnu sous forme de chaîne Ruby à l’aide de commandes Ruby.

Comment charger une image et la convertir en texte via l'API Ruby ?

require 'rtesseract'
image = RTesseract.new("path/to/your_image.jpg")
text = image.to_s
puts "Extracted Text: #{text}"

Conversion d'image en PDF consultable via Ruby

La bibliothèque open source RTesseract offre une prise en charge complète de la conversion d’une image en PDF consultable, en préservant la mise en page et les couleurs de l’image dans les applications Ruby. L’exemple suivant montre comment les développeurs peuvent charger et générer un document PDF consultable à partir d’images à l’aide de commandes Ruby.

Comment convertir une image JPEG en fichier PDF consultable via la bibliothèque Ruby ?

require 'rtesseract'
image = RTesseract.new("path/to/my_image.jpg")
pdf_file = image.to_pdf  # Returns an open file handle for the PDF
File.write("output.pdf", pdf_file.read)

Configuration personnalisée pour Tesseract

La bibliothèque open source RTesseract permet aux professionnels du logiciel de configurer les paramètres de Tesseract, tels que la langue, le mode de segmentation de page, la restriction de l’OCR à la reconnaissance de chiffres et le mode du moteur OCR. Cela vous permet d’ajuster finement le processus d’OCR pour une meilleure précision. Vous pouvez personnaliser les paramètres de Tesseract à l’aide de l’option de configuration. Dans l’exemple suivant, psm (mode de segmentation de page) est réglé sur 6, et oem (mode du moteur OCR) est réglé sur 1.

Comment personnaliser les paramètres de Tesseract dans les applications Ruby ?

image = RTesseract.new('path/to/image.png', config: { psm: 6, oem: 1 })
text = image.to_s

puts text

Prise en charge multilingue

Si votre image contient du texte dans une langue spécifique, vous pouvez améliorer la précision en spécifiant la langue. La bibliothèque prend en charge des langues telles que l'anglais (par défaut), l'allemand, le français, l'italien, le néerlandais, le portugais, l'espagnol, le vietnamien, etc. Veuillez vous assurer que le pack de langue correspondant est installé avec Tesseract. Dans l'exemple suivant, l'option lang est définie sur 'fra' pour le français. Vous pouvez utiliser n'importe quel code de langue pris en charge par Tesseract.

Comment convertir une image en texte dans d'autres langues via la bibliothèque Ruby ?

image = RTesseract.new('path/to/image.png', lang: 'fra') # French language
text = image.to_s

puts text
 Français