1. Produkte
  2.   OCR
  3.   Ruby
  4.   RTesseract
 
  

Kostenlose Ruby‑Bibliothek zum Konvertieren von Bildern in Text & durchsuchbare PDFs

Open‑Source Ruby OCR‑Bibliothek, die Softwareentwicklern ermöglicht, optische Zeichenerkennung durchzuführen, um Text aus gescannten Dokumenten, Bildern oder sogar Screenshots zu extrahieren

Was ist RTesseract?

Optische Zeichenerkennung (OCR) dient als transformative Brücke zwischen visuellen Medien und digitalen Daten und ermöglicht es Maschinen, Text aus Bildern und gescannten Dokumenten präzise zu extrahieren. Für Entwickler im Ruby-Ökosystem bietet die Open-Source-Bibliothek RTesseract ein hocheffizientes Tor zur Leistungsfähigkeit der Tesseract-OCR-Engine. Ursprünglich von Hewlett‑Packard entwickelt und später von Google weiter verfeinert, wird Tesseract allgemein als erstklassige Lösung für die Bild‑zu‑Text‑Umwandlung anerkannt. Als ausgeklügelte Schnittstelle ermöglicht RTesseract die nahtlose Integration von Tesseract OCR in jedes Ruby‑Projekt, wodurch die manuelle Handhabung komplexer Befehlszeileninteraktionen entfällt und gleichzeitig die für die Digitalisierung von Dokumenten in professioneller Qualität erforderliche Genauigkeit erhalten bleibt.

Über seine Benutzerfreundlichkeit hinaus ist RTesseract eine vielseitige Ruby-Bibliothek, die entwickelt wurde, um ein umfangreiches Spektrum an Bildformaten zu unterstützen, einschließlich PNG, JPEG, BMP und TIFF. Diese Flexibilität gewährleistet die Kompatibilität mit praktisch jeder visuellen Quelle, während die Möglichkeit, die globalen Datendateien von Tesseract zu nutzen, eine mehrsprachige Texterkennung mit hoher Zuverlässigkeit ermöglicht. Um die Datenintegrität weiter zu verbessern, liefert die Bibliothek Vertrauenswerte für jedes erkannte Wort, sodass Entwickler die Qualität der OCR‑Ausgabe programmgesteuert bewerten können. Als Open‑Source‑Projekt bietet RTesseract eine kostengünstige, anpassbare und robuste Lösung für Teams, die Datenextraktions‑Workflows automatisieren und intelligentere, textbewusste Ruby‑Anwendungen erstellen möchten.

Previous Next

Erste Schritte mit RTesseract

Die empfohlene Methode, RTesseract zu installieren, ist die Verwendung von Rubygems. Bitte verwenden Sie den folgenden Befehl für eine reibungslose Installation.

RTesseract über Rubygems installieren

$ gem install rtesseract 

RTesseract über GitHub installieren

 git clone https://github.com/dannnylo/rtesseract.git  

Sie können die kompilierte Shared Library aus dem GitHub-Repository herunterladen.

Bild-zu-Text-Konvertierung über die Ruby-API

Die RTesseract-Bibliothek erleichtert Entwicklern das Laden und Konvertieren eines Bildes in Text innerhalb von Ruby-Anwendungen. Der einfachste Anwendungsfall ist das Konvertieren eines Bildes in eine Textzeichenkette. Mit nur wenigen Codezeilen können Sie Text aus einer Bilddatei extrahieren. Das folgende Codebeispiel lädt das Bild und verarbeitet es mit Tesseract, wobei der erkannte Text als Ruby-String mittels Ruby-Befehlen zurückgegeben wird.

Wie lädt man ein Bild und konvertiert es über die Ruby-API in Text?

require 'rtesseract'
image = RTesseract.new("path/to/your_image.jpg")
text = image.to_s
puts "Extracted Text: #{text}"

Bildkonvertierung in durchsuchbares PDF über Ruby

Die Open-Source-RTesseract-Bibliothek bietet vollständige Unterstützung für die Umwandlung eines Bildes in ein durchsuchbares PDF, wobei das Layout und die Farben des Bildes in Ruby-Anwendungen erhalten bleiben. Das folgende Beispiel zeigt, wie Softwareentwickler mithilfe von Ruby-Befehlen ein durchsuchbares PDF-Dokument aus Bildern erzeugen können.

Wie konvertiert man ein JPEG-Bild über die Ruby-Bibliothek in eine durchsuchbare PDF-Datei?

require 'rtesseract'
image = RTesseract.new("path/to/my_image.jpg")
pdf_file = image.to_pdf  # Returns an open file handle for the PDF
File.write("output.pdf", pdf_file.read)

Benutzerdefinierte Konfiguration für Tesseract

Die Open-Source-RTesseract-Bibliothek ermöglicht es Softwareprofis, die Einstellungen von Tesseract zu konfigurieren, wie Sprache, Seitensegmentierungsmodus, die Beschränkung der OCR auf Ziffernerkennung und den OCR-Engine-Modus. Dadurch können Sie den OCR-Prozess für höhere Genauigkeit feinabstimmen. Sie können die Tesseract-Einstellungen über die Config-Option anpassen. Im folgenden Beispiel ist psm (Seitensegmentierungsmodus) auf 6 und oem (OCR-Engine-Modus) auf 1 gesetzt.

Wie passt man die Einstellungen von Tesseract in Ruby-Anwendungen an?

image = RTesseract.new('path/to/image.png', config: { psm: 6, oem: 1 })
text = image.to_s

puts text

Mehrsprachige Unterstützung

Wenn Ihr Bild Text in einer bestimmten Sprache enthält, können Sie die Genauigkeit verbessern, indem Sie die Sprache angeben. Die Bibliothek unterstützt Sprachen wie Englisch (Standard), Deutsch, Französisch, Italienisch, Niederländisch, Portugiesisch, Spanisch, Vietnamesisch und weitere. Bitte stellen Sie sicher, dass das entsprechende Sprachpaket mit Tesseract installiert ist. Im folgenden Beispiel ist die Option lang auf 'fra' für Französisch gesetzt. Sie können jeden von Tesseract unterstützten Sprachcode verwenden.

Wie konvertiert man ein Bild in Text in anderen Sprachen über die Ruby-Bibliothek?

image = RTesseract.new('path/to/image.png', lang: 'fra') # French language
text = image.to_s

puts text
 Deutsch