Δωρεάν Ruby βιβλιοθήκη για μετατροπή εικόνας σε κείμενο & PDF με δυνατότητα αναζήτησης
Ανοιχτού κώδικα Ruby OCR βιβλιοθήκη που επιτρέπει στους προγραμματιστές λογισμικού να εκτελούν Οπτική Αναγνώριση Χαρακτήρων για την εξαγωγή κειμένου από σαρωμένα έγγραφα, εικόνες ή ακόμη και στιγμιότυπα οθόνης
Τι είναι το RTesseract;
Η Οπτική Αναγνώριση Χαρακτήρων (OCR) λειτουργεί ως ένας μετασχηματιστικός σύνδεσμος μεταξύ οπτικών μέσων και ψηφιακών δεδομένων, επιτρέποντας στις μηχανές να εξάγουν κείμενο από εικόνες και σαρωμένα έγγραφα με ακρίβεια. Για τους προγραμματιστές εντός του οικοσυστήματος Ruby, η ανοιχτού κώδικα βιβλιοθήκη RTesseract παρέχει μια υψηλής αποδοτικότητας πύλη στη δύναμη της μηχανής OCR Tesseract. Αρχικά αναπτυγμένη από την Hewlett-Packard και περαιτέρω βελτιωμένη από την Google, το Tesseract αναγνωρίζεται ευρέως ως κορυφαία λύση για τη μετατροπή εικόνας σε κείμενο. Λειτουργώντας ως μια εξελιγμένη διεπαφή, το RTesseract επιτρέπει την αδιάκοπη ενσωμάτωση του OCR Tesseract σε οποιοδήποτε έργο Ruby, εξαλείφοντας την ανάγκη χειροκίνητης διαχείρισης σύνθετων αλληλεπιδράσεων γραμμής εντολών, ενώ διατηρεί την ακρίβεια που απαιτείται για ψηφιοποίηση εγγράφων επαγγελματικού επιπέδου.
Πέρα από την ευκολία χρήσης του, το RTesseract είναι μια ευέλικτη βιβλιοθήκη Ruby σχεδιασμένη να υποστηρίζει μια εκτενή σειρά μορφών εικόνας, συμπεριλαμβανομένων των PNG, JPEG, BMP και TIFF. Αυτή η ευελιξία εξασφαλίζει συμβατότητα με σχεδόν οποιαδήποτε πηγή οπτικού περιεχομένου, ενώ η δυνατότητά της να αξιοποιεί τα παγκόσμια αρχεία δεδομένων του Tesseract επιτρέπει την αναγνώριση κειμένου σε πολλές γλώσσες με υψηλή αξιοπιστία. Για περαιτέρω ενίσχυση της ακεραιότητας των δεδομένων, η βιβλιοθήκη παρέχει βαθμολογίες εμπιστοσύνης για κάθε αναγνωρισμένη λέξη, επιτρέποντας στους προγραμματιστές να αξιολογούν προγραμματιστικά την ποιότητα του αποτελέσματος OCR. Ως έργο ανοιχτού κώδικα, το RTesseract προσφέρει μια οικονομικά αποδοτική, προσαρμόσιμη και αξιόπιστη λύση για ομάδες που επιθυμούν να αυτοματοποιήσουν τις ροές εξαγωγής δεδομένων και να δημιουργήσουν πιο έξυπνες, κειμενο‑συνειδητές εφαρμογές Ruby.
Ξεκινώντας με το RTesseract
Ο προτεινόμενος τρόπος εγκατάστασης του RTesseract είναι μέσω Rubygems. Παρακαλώ χρησιμοποιήστε την παρακάτω εντολή για ομαλή εγκατάσταση.
Εγκατάσταση του RTesseract μέσω Rubygems
$ gem install rtesseract Εγκατάσταση του RTesseract μέσω GitHub
git clone https://github.com/dannnylo/rtesseract.git Μπορείτε να κατεβάσετε τη μεταγλωττισμένη κοινόχρηστη βιβλιοθήκη από το αποθετήριο GitHub.
Μετατροπή εικόνας σε κείμενο μέσω Ruby API
Η βιβλιοθήκη RTesseract καθιστά εύκολο για τους προγραμματιστές να φορτώνουν και να μετατρέπουν μια εικόνα σε κείμενο μέσα σε εφαρμογές Ruby. Η πιο απλή περίπτωση χρήσης είναι η μετατροπή μιας εικόνας σε μια συμβολοσειρά κειμένου. Με λίγες μόνο γραμμές κώδικα, μπορείτε να εξάγετε κείμενο από ένα αρχείο εικόνας. Το παρακάτω παράδειγμα κώδικα φορτώνει την εικόνα και την επεξεργάζεται με το Tesseract, επιστρέφοντας το αναγνωρισμένο κείμενο ως συμβολοσειρά Ruby χρησιμοποιώντας εντολές Ruby.
Πώς να φορτώσετε μια εικόνα και να τη μετατρέψετε σε κείμενο μέσω του Ruby API;
require 'rtesseract'
image = RTesseract.new("path/to/your_image.jpg")
text = image.to_s
puts "Extracted Text: #{text}"
Μετατροπή εικόνας σε αναζητήσιμο PDF μέσω Ruby
Η ανοιχτού κώδικα βιβλιοθήκη RTesseract παρέχει πλήρη υποστήριξη για τη μετατροπή μιας εικόνας σε αναζητήσιμο PDF, διατηρώντας τη διάταξη και τα χρώματα της εικόνας μέσα σε εφαρμογές Ruby. Το παρακάτω παράδειγμα δείχνει πώς οι προγραμματιστές λογισμικού μπορούν να φορτώσουν και να δημιουργήσουν ένα αναζητήσιμο έγγραφο PDF από εικόνες χρησιμοποιώντας εντολές Ruby.
Πώς να μετατρέψετε μια εικόνα JPEG σε αρχείο PDF με δυνατότητα αναζήτησης μέσω της βιβλιοθήκης Ruby;
require 'rtesseract'
image = RTesseract.new("path/to/my_image.jpg")
pdf_file = image.to_pdf # Returns an open file handle for the PDF
File.write("output.pdf", pdf_file.read)
Προσαρμοσμένη διαμόρφωση για το Tesseract
Η ανοιχτού κώδικα βιβλιοθήκη RTesseract επιτρέπει στους επαγγελματίες λογισμικού να διαμορφώσουν τις ρυθμίσεις του Tesseract, όπως η γλώσσα, η λειτουργία διαχωρισμού σελίδας, ο περιορισμός του OCR στην αναγνώριση ψηφίων και η λειτουργία μηχανής OCR. Αυτό σας επιτρέπει να ρυθμίσετε λεπτομερώς τη διαδικασία OCR για καλύτερη ακρίβεια. Μπορείτε να προσαρμόσετε τις ρυθμίσεις του Tesseract χρησιμοποιώντας την επιλογή config. Στο παρακάτω παράδειγμα, το psm (λειτουργία διαχωρισμού σελίδας) ορίζεται σε 6 και το oem (λειτουργία μηχανής OCR) ορίζεται σε 1.
Πώς να προσαρμόσετε τις ρυθμίσεις του Tesseract μέσα σε εφαρμογές Ruby;
image = RTesseract.new('path/to/image.png', config: { psm: 6, oem: 1 })
text = image.to_s
puts text
Υποστήριξη πολλαπλών γλωσσών
Εάν η εικόνα σας περιέχει κείμενο σε συγκεκριμένη γλώσσα, μπορείτε να βελτιώσετε την ακρίβεια καθορίζοντας τη γλώσσα. Η βιβλιοθήκη υποστηρίζει γλώσσες όπως τα Αγγλικά (προεπιλογή), Γερμανικά, Γαλλικά, Ιταλικά, Ολλανδικά, Πορτογαλικά, Ισπανικά, Βιετναμέζικα κ.λπ. Παρακαλούμε βεβαιωθείτε ότι το αντίστοιχο πακέτο γλώσσας είναι εγκατεστημένο με το Tesseract. Στο παρακάτω παράδειγμα η επιλογή lang ορίζεται σε 'fra' για τα Γαλλικά. Μπορείτε να χρησιμοποιήσετε οποιονδήποτε κωδικό γλώσσας που υποστηρίζεται από το Tesseract
Πώς να μετατρέψετε εικόνα σε κείμενο σε άλλες γλώσσες μέσω της βιβλιοθήκης Ruby;
image = RTesseract.new('path/to/image.png', lang: 'fra') # French language
text = image.to_s
puts text