画像をテキストと検索可能なPDFに変換する無料のRubyライブラリ
ソフトウェア開発者が光学文字認識(OCR)を実行し、スキャンした文書、画像、またはスクリーンショットからテキストを抽出できるようにするオープンソースのRuby OCRライブラリ
RTesseractとは何ですか?
光学文字認識(OCR)は、視覚メディアとデジタルデータの間の変革的な橋渡しとして機能し、機械が画像やスキャンした文書から正確にテキストを抽出できるようにします。Ruby エコシステムの開発者にとって、オープンソースの RTesseract ライブラリは、Tesseract OCR エンジンのパワーへの高効率なゲートウェイを提供します。元々は Hewlett-Packard によって開発され、Google によってさらに改良された Tesseract は、画像からテキストへの変換における最高のソリューションとして広く認識されています。洗練されたインターフェースとして機能する RTesseract は、Tesseract OCR を任意の Ruby プロジェクトにシームレスに統合できるようにし、複雑なコマンドライン操作を手動で管理する必要を排除し、プロフェッショナル品質の文書デジタル化に必要な精度を維持します。
使いやすさを超えて、RTesseract は PNG、JPEG、BMP、TIFF などの幅広い画像フォーマットをサポートするよう設計された多用途の Ruby ライブラリです。この柔軟性により、事実上すべてのビジュアルソースとの互換性が確保され、Tesseract のグローバルデータファイルを活用できるため、高信頼性で多言語テキスト認識が可能になります。さらにデータの完全性を高めるため、ライブラリは認識された各単語に対して信頼度スコアを提供し、開発者は OCR 出力の品質をプログラム上で評価できます。オープンソースプロジェクトとして、RTesseract はコスト効果が高く、カスタマイズ可能で堅牢なソリューションを提供し、データ抽出ワークフローの自動化や、よりスマートでテキスト認識可能な Ruby アプリケーションの構築を目指すチームに最適です。
RTesseractの開始方法
RTesseract の推奨インストール方法は Rubygems を使用することです。スムーズなインストールのために以下のコマンドをご利用ください。
Rubygems 経由で RTesseract をインストールする
$ gem install rtesseract GitHub 経由で RTesseract をインストールする
git clone https://github.com/dannnylo/rtesseract.git コンパイル済みの共有ライブラリは GitHub リポジトリからダウンロードできます。
Ruby APIによる画像からテキストへの変換
RTesseract ライブラリは、開発者が Ruby アプリケーション内で画像をテキストにロードして変換することを簡単にします。最も単純なユースケースは、画像をテキスト文字列に変換することです。数行のコードだけで、画像ファイルからテキストを抽出できます。以下のコード例は画像をロードし、Tesseract で処理し、認識されたテキストを Ruby の文字列として返します。
Ruby API を使用して画像を読み込み、テキストに変換する方法は?
require 'rtesseract'
image = RTesseract.new("path/to/your_image.jpg")
text = image.to_s
puts "Extracted Text: #{text}"
Rubyによる画像を検索可能なPDFへ変換
オープンソースの RTesseract ライブラリは、画像を検索可能な PDF に変換し、画像のレイアウトと色を Ruby アプリケーション内で保持する完全なサポートを提供しています。以下の例は、ソフトウェア開発者が Ruby コマンドを使用して画像から検索可能な PDF ドキュメントを生成する方法を示しています。
Ruby ライブラリを使用して JPEG 画像を検索可能な PDF ファイルに変換する方法は?
require 'rtesseract'
image = RTesseract.new("path/to/my_image.jpg")
pdf_file = image.to_pdf # Returns an open file handle for the PDF
File.write("output.pdf", pdf_file.read)
Tesseractのカスタム設定
オープンソースの RTesseract ライブラリは、ソフトウェアプロフェッショナルが Tesseract の設定(言語、ページ分割モード、OCR を数字認識に限定すること、OCR エンジンモードなど)を構成できるようにします。これにより、精度向上のために OCR プロセスを微調整できます。config オプションを使用して Tesseract の設定をカスタマイズできます。以下の例では、psm(ページ分割モード)が 6 に、oem(OCR エンジンモード)が 1 に設定されています。
Ruby アプリ内で Tesseract の設定をカスタマイズする方法は?
image = RTesseract.new('path/to/image.png', config: { psm: 6, oem: 1 })
text = image.to_s
puts text
多言語サポート
画像に特定の言語のテキストが含まれている場合、言語を指定することで精度を向上させることができます。ライブラリは英語(デフォルト)、ドイツ語、フランス語、イタリア語、オランダ語、ポルトガル語、スペイン語、ベトナム語などの言語をサポートしています。Tesseract に対応する言語パックがインストールされていることを確認してください。以下の例では、lang オプションをフランス語の 'fra' に設定しています。Tesseract がサポートする任意の言語コードを使用できます。
Ruby ライブラリを使用して画像を他の言語のテキストに変換する方法は?
image = RTesseract.new('path/to/image.png', lang: 'fra') # French language
text = image.to_s
puts text