1. Des produits
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

API Node.js gratuite pour ajouter des capacités OCR aux projets JS.

Bibliothèque OCR Node.js open source qui permet aux programmeurs de reconnaître et d'extraire du texte de divers formats de fichiers, y compris les images (JPEG, PNG), les PDF et les documents, gratuitement et en plusieurs langues.

Qu'est-ce que Node-Tesseract-OCR ?

À l'ère numérique actuelle, extraire du texte à partir d'images et de documents est devenu une tâche cruciale dans divers secteurs, notamment la gestion de documents, le traitement des données et l'intelligence artificielle. La technologie de reconnaissance optique de caractères (OCR) a rendu possible la conversion de documents numérisés, d'images et de PDF en formats de texte éditables. Node-Tesseract-OCR est une API open source qui intègre la puissance du moteur Tesseract OCR pour offrir une manière fluide et efficace d'effectuer des tâches d'OCR dans les applications Node.js.

Node-Tesseract-OCR est un wrapper Node.js pour le moteur OCR Tesseract, permettant aux développeurs de logiciels d'utiliser les puissantes fonctionnalités de reconnaissance de texte de Tesseract dans un environnement Node.js. L'API est maintenue sur ce dépôt GitHub et offre une gamme de fonctionnalités qui la rendent adaptée à divers cas d'utilisation, de l'extraction de texte simple aux tâches de traitement de documents plus complexes. Les développeurs peuvent extraire du texte à partir d'images et de documents en plusieurs langues, ce qui en fait un outil polyvalent pour diverses applications.

L'API Node-Tesseract-OCR offre des capacités avancées de traitement d'image, y compris le filtrage, le redimensionnement et le recadrage, afin de garantir que le texte extrait soit précis et fiable. Elle prend en charge plus de 100 langues, ce qui en fait une solution polyvalente pour les tâches OCR dans des environnements divers. Les développeurs peuvent extraire du texte à partir d'images, de PDF et de documents, et renvoyer le texte extrait dans divers formats, tels que JSON, XML et texte brut. Elle est conçue pour être légère, flexible et facile à utiliser, ce qui en fait un choix idéal pour les développeurs qui souhaitent ajouter des capacités OCR à leurs projets. Grâce à ses capacités avancées de traitement d'image, son support linguistique et ses mécanismes de gestion des erreurs, elle constitue un choix idéal pour les développeurs qui souhaitent ajouter des capacités OCR à leurs projets.

Previous Next

Commencer avec Node-Tesseract-OCR

La méthode recommandée pour installer Node-Tesseract-OCR est d'utiliser npm. Veuillez utiliser la commande suivante pour une installation fluide

Installer Node-Tesseract-OCR via npm

npm install node-tesseract-ocr 

Vous pouvez également l'installer manuellement ; téléchargez les derniers fichiers de version directement depuis le dépôt GitHub.

Extraction de texte à partir d'images dans l'API Node.js

La bibliothèque open source Node-Tesseract-OCR facilite la création d'applications qui extraient automatiquement du texte d'images dans les applications Node.js pour les développeurs de logiciels. Elle prend en charge l'extraction de texte à partir de documents numérisés, de PDF, de photos prises avec un appareil photo ou de photos de reçus. Cela peut être utile pour créer des archives consultables, automatiser la saisie de données ou traiter de grands volumes de documents dans des secteurs tels que la finance et la santé. Voici un exemple simple qui montre comment extraire du texte d'images de manière programmatique dans les applications Node.js.

Comment extraire du texte à partir d'images dans un environnement Node.js ?

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Meilleur prétraitement d'images dans Node.js

Le prétraitement des images avant d'appliquer l'OCR peut améliorer considérablement la précision de la reconnaissance de texte. La bibliothèque open source Node-Tesseract-OCR permet des techniques de prétraitement de base, telles que le redimensionnement, la binarisation et la correction d'inclinaison. Ces étapes de prétraitement peuvent être implémentées à l'aide de bibliothèques Node.js supplémentaires comme sharp ou jimp en conjonction avec Node-Tesseract-OCR. L'exemple suivant montre comment les développeurs logiciels utilisent les étapes de prétraitement pour améliorer la reconnaissance, notamment avec des images de qualité inférieure.

Comment appliquer des étapes de prétraitement pour améliorer la reconnaissance via l'API Node.js ?

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Texte reconnu en plusieurs langues

L'une des caractéristiques remarquables de Node-Tesseract-OCR est son support multilingue étendu. La bibliothèque Tesseract OCR prend en charge plus de 100 langues, ce qui en fait un choix idéal pour les applications qui doivent traiter des documents dans diverses langues. Les développeurs peuvent spécifier la ou les langues que Tesseract doit utiliser, améliorant ainsi la précision de la reconnaissance pour les textes non anglais. Voici un exemple qui montre comment les développeurs peuvent reconnaître du texte en français dans des applications Node.js ?

Comment reconnaître le texte d'une image en français via l'API JavaScript ?

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 Français