Biblioteca JavaScript Gratuita para Extrair Texto de Imagens e Formulários Escaneados
Biblioteca JavaScript de Reconhecimento Óptico de Caracteres (OCR) de código aberto para analisar texto de imagens e documentos escaneados em preto e branco com pré-processamento de imagem e suporte a modelos em aplicativos Web ou Node.js.
No mundo digital moderno, a tecnologia de reconhecimento óptico de caracteres (OCR) desempenha um papel crítico na transformação de imagens digitalizadas, anotações manuscritas ou documentos impressos em dados editáveis e pesquisáveis. Para desenvolvedores JavaScript que buscam uma solução leve e de código aberto, o Guten OCR oferece uma escolha atraente. Este motor OCR baseado em JavaScript foi projetado com simplicidade em mente, tornando-o ideal para incorporar recursos de OCR diretamente em aplicações baseadas em navegador ou Node.js. Existem várias funcionalidades importantes na biblioteca, como reconhecimento de caracteres por meio de modelos, limiarização e binarização de imagens, segmentação de caracteres, correspondência de modelos e montagem de texto, suporte a código modular e assim por diante. Ele se concentra no reconhecimento de texto impresso a partir de documentos escaneados em preto e branco e é mais adequado para textos bem formatados, como livros ou formulários.
Guten OCR é um motor OCR de código aberto em JavaScript criado pela Gutenye. Ao contrário de ferramentas OCR pesadas que requerem dependências externas ou configuração extensa, o Guten OCR é escrito inteiramente em JavaScript, o que significa que pode ser executado em um navegador web ou no servidor com Node.js. A biblioteca usa técnicas básicas de processamento de imagem para segmentar caracteres e identificá‑los usando um sistema de reconhecimento de padrões de caracteres. Embora ainda não concorra com motores OCR comerciais como o Tesseract em termos de suporte multilíngue ou a texto manuscrito, sua simplicidade e capacidade de hackeamento o tornam uma opção fantástica para projetos educacionais, provas de conceito ou recursos OCR incorporados em aplicativos web personalizados. Ao contrário do Tesseract ou de outros motores maiores, o Guten OCR é intencionalmente leve e focado — tornando‑se um excelente ponto de partida para quem deseja entender como o OCR funciona nos bastidores.
Começando com Guten OCR
A forma recomendada de instalar o Guten OCR é usando o Brew. Por favor, use o comando a seguir para uma instalação tranquila.
Instale Guten OCR via Brew
brew install git-lfs Instalar Guten OCR via GitHub
git clone git@github.com:gutenye/ocr.git Você também pode instalá-lo manualmente; baixe os arquivos da versão mais recente diretamente do repositório GitHub.
Pré-processamento de Imagem Antes das Operações de OCR
A biblioteca de OCR Guten de código aberto é escrita inteiramente em JavaScript, tornando-a compatível com ambientes de navegador e Node.js. Ela inclui funções integradas de pré-processamento de imagens para melhorar a precisão do reconhecimento. Suporta binarização de imagens (conversão para preto e branco), redução de ruído, correção de inclinação e muito mais. O exemplo a seguir mostra como os desenvolvedores podem aplicar múltiplas etapas de pré-processamento de imagem antes de executar a operação de OCR em imagens.
Como aplicar pré-processamento de imagem antes da operação OCR via biblioteca JavaScript?
const { preprocess } = require('guten-ocr');
// Apply multiple preprocessing steps
const processedImage = preprocess(imageData, [
'grayscale', // Convert to grayscale
'binarize', // Convert to black and white
'deskew', // Correct skew
'denoise' // Reduce noise
]);
// Then perform OCR on the processed image
ocr.recognize(processedImage).then(/* ... */);
Reconhecimento de Caracteres via Modelos
A biblioteca JavaScript Guten OCR forneceu suporte completo para realizar operações de OCR usando modelos dentro de aplicações JavaScript. No coração do Guten OCR está um sistema de correspondência de modelos. Em vez de treinar um modelo de aprendizado de máquina, ele usa padrões de caracteres predefinidos. Isso torna o sistema mais rápido e mais fácil de entender, mas mais sensível à consistência de fonte e layout. Para executar essa tarefa, a biblioteca renderiza cada caractere (A–Z, a–z, 0–9, etc.) em um canvas e então a matriz binária de cada caractere se torna um modelo de referência. Ao analisar uma imagem, a biblioteca compara os segmentos da imagem com esses modelos para encontrar a melhor correspondência. Ela faz isso usando uma combinação de varredura de linhas vertical e horizontal para localizar caixas delimitadoras.
Segmentação de Caracteres via Biblioteca OCR
A biblioteca JavaScript de código aberto Guten OCR permite que desenvolvedores de software realizem a segmentação de caracteres com facilidade. Uma vez que a imagem é binarizada, o próximo passo é segmentar caracteres individuais. O Guten OCR escaneia linhas e colunas para detectar regiões com pixels pretos densos, separando-as em caracteres potenciais. O exemplo a seguir demonstra como os desenvolvedores de software podem realizar a segmentação de caracteres usando a biblioteca OCR JavaScript.
Como realizar segmentação de caracteres usando biblioteca JavaScript?
const segment = require('guten-ocr/segment');
const boxes = segment(binarized); // returns array of [x, y, width, height]