Бесплатная Ruby библиотека для преобразования изображений в текст и поисковые PDF
Библиотека Ruby OCR с открытым исходным кодом, позволяющая разработчикам программного обеспечения выполнять оптическое распознавание символов для извлечения текста из отсканированных документов, изображений или даже скриншотов
Что такое RTesseract?
Оптическое распознавание символов (OCR) служит трансформирующим мостом между визуальными медиа и цифровыми данными, позволяя машинам точно извлекать текст из изображений и отсканированных документов. Для разработчиков в экосистеме Ruby открытая библиотека RTesseract предоставляет высокоэффективный шлюз к мощности движка Tesseract OCR. Изначально разработанный Hewlett‑Packard и далее усовершенствованный Google, Tesseract широко признан ведущим решением для преобразования изображений в текст. Выступая в роли сложного интерфейса, RTesseract обеспечивает бесшовную интеграцию Tesseract OCR в любой Ruby‑проект, устраняя необходимость вручную управлять сложными командными взаимодействиями, при этом сохраняя точность, необходимую для профессиональной цифровизации документов.
Помимо простоты использования, RTesseract — это универсальная библиотека Ruby, разработанная для поддержки широкого спектра форматов изображений, включая PNG, JPEG, BMP и TIFF. Такая гибкость обеспечивает совместимость практически с любым визуальным источником, а возможность использовать глобальные файлы данных Tesseract позволяет выполнять распознавание текста на нескольких языках с высокой надёжностью. Для дальнейшего повышения целостности данных библиотека предоставляет оценки уверенности для каждого распознанного слова, позволяя разработчикам программно оценивать качество вывода OCR. Как проект с открытым исходным кодом, RTesseract предлагает экономичное, настраиваемое и надёжное решение для команд, желающих автоматизировать процессы извлечения данных и создавать более умные, ориентированные на текст приложения Ruby.
Начало работы с RTesseract
Рекомендуемый способ установки RTesseract — использовать Rubygems. Пожалуйста, используйте следующую команду для беспроблемной установки.
Установить RTesseract через Rubygems
$ gem install rtesseract Установить RTesseract через GitHub
git clone https://github.com/dannnylo/rtesseract.git Вы можете скачать скомпилированную общую библиотеку из репозитория GitHub.
Преобразование изображения в текст через Ruby API
Библиотека RTesseract упрощает разработчикам загрузку и преобразование изображения в текст внутри Ruby‑приложений. Самый простой сценарий использования — преобразование изображения в строку текста. Всего лишь несколькими строками кода вы можете извлечь текст из файла изображения. Приведённый ниже пример кода загружает изображение и обрабатывает его с помощью Tesseract, возвращая распознанный текст в виде строки Ruby, используя команды Ruby.
Как загрузить изображение и преобразовать его в текст с помощью Ruby API?
require 'rtesseract'
image = RTesseract.new("path/to/your_image.jpg")
text = image.to_s
puts "Extracted Text: #{text}"
Преобразование изображения в поисковый PDF через Ruby
Открытая библиотека RTesseract предоставляет полную поддержку преобразования изображения в поисковый PDF, сохраняющий макет и цвета изображения внутри Ruby‑приложений. Приведённый ниже пример демонстрирует, как разработчики могут загрузить и создать поисковый PDF‑документ из изображений, используя команды Ruby.
Как преобразовать JPEG‑изображение в поисковый PDF‑файл с помощью Ruby‑библиотеки?
require 'rtesseract'
image = RTesseract.new("path/to/my_image.jpg")
pdf_file = image.to_pdf # Returns an open file handle for the PDF
File.write("output.pdf", pdf_file.read)
Пользовательская конфигурация для Tesseract
Открытая библиотека RTesseract позволяет ИТ‑специалистам настраивать параметры Tesseract, такие как язык, режим сегментации страниц, ограничение OCR только распознаванием цифр и режим OCR‑движка. Это даёт возможность тонко настраивать процесс OCR для повышения точности. Вы можете изменять настройки Tesseract с помощью опции config. В следующем примере psm (режим сегментации страниц) установлен в 6, а oem (режим OCR‑движка) — в 1.
Как настроить параметры Tesseract внутри Ruby‑приложений?
image = RTesseract.new('path/to/image.png', config: { psm: 6, oem: 1 })
text = image.to_s
puts text
Поддержка нескольких языков
Если ваше изображение содержит текст на определённом языке, вы можете повысить точность, указав язык. Библиотека поддерживает такие языки, как английский (по умолчанию), немецкий, французский, итальянский, нидерландский, португальский, испанский, вьетнамский и др. Пожалуйста, убедитесь, что соответствующий языковой пакет установлен вместе с Tesseract. В следующем примере параметр lang установлен в 'fra' для французского. Вы можете использовать любой код языка, поддерживаемый Tesseract.
Как преобразовать изображение в текст на других языках с помощью Ruby‑библиотеки?
image = RTesseract.new('path/to/image.png', lang: 'fra') # French language
text = image.to_s
puts text