Gratis Node.js API om OCR-mogelijkheden toe te voegen aan JS-projecten.
Open Source Node.js OCR-bibliotheek die programmeurs in staat stelt tekst te herkennen en te extraheren uit verschillende bestandsformaten, waaronder afbeeldingen (JPEG, PNG), PDF's en documenten, gratis in meerdere talen.
Wat is Node-Tesseract-OCR?
In het digitale tijdperk van vandaag is het extraheren van tekst uit afbeeldingen en documenten een cruciale taak geworden in diverse sectoren, waaronder documentbeheer, gegevensverwerking en kunstmatige intelligentie. Technologie voor optische tekenherkenning (OCR) maakt het mogelijk om gescande documenten, afbeeldingen en PDF's om te zetten naar bewerkbare tekstformaten. Node-Tesseract-OCR is een open-source API die de kracht van de Tesseract OCR-engine combineert om een naadloze en efficiënte manier te bieden om OCR-taken uit te voeren in Node.js-toepassingen.
Node-Tesseract-OCR is een Node.js-wrapper voor de Tesseract OCR-engine, waarmee softwareontwikkelaars de krachtige tekstanalysefuncties van Tesseract kunnen gebruiken binnen een Node.js-omgeving. De API wordt onderhouden in deze GitHub-repository en biedt een reeks functionaliteiten die het geschikt maken voor verschillende gebruikssituaties, van eenvoudige tekstelextractie tot meer complexe documentverwerkingstaken. Softwareontwikkelaars kunnen tekst uit afbeeldingen en documenten in meerdere talen extraheren, waardoor het een veelzijdig hulpmiddel is voor diverse toepassingen.
De Node-Tesseract-OCR API biedt geavanceerde beeldverwerkingsmogelijkheden, waaronder beeldfiltering, schalen en bijsnijden, om ervoor te zorgen dat de geëxtraheerde tekst nauwkeurig en betrouwbaar is. Het ondersteunt meer dan 100 talen, waardoor het een veelzijdige oplossing is voor OCR-taken in diverse omgevingen. Softwareontwikkelaars kunnen tekst extraheren uit afbeeldingen, PDF's en documenten, en de geëxtraheerde tekst retourneren in verschillende formaten, zoals JSON, XML en platte tekst. Het is ontworpen om lichtgewicht, flexibel en eenvoudig te gebruiken te zijn, waardoor het een ideale keuze is voor ontwikkelaars die OCR-mogelijkheden aan hun projecten willen toevoegen. Met zijn geavanceerde beeldverwerkingsmogelijkheden, taalondersteuning en foutafhandelingsmechanismen is het een ideale keuze voor ontwikkelaars die OCR-mogelijkheden aan hun projecten willen toevoegen.
Aan de slag met Node-Tesseract-OCR
De aanbevolen manier om Node-Tesseract-OCR te installeren is via npm. Gebruik alstublieft het volgende commando voor een soepele installatie.
Installeer Node-Tesseract-OCR via npm
npm install node-tesseract-ocr U kunt het ook handmatig installeren; download de nieuwste release-bestanden rechtstreeks van de GitHub-repository.
Tekstextractie uit afbeeldingen in de Node.js API
De open-source Node-Tesseract-OCR-bibliotheek maakt het eenvoudig voor software-ontwikkelaars om applicaties te maken die automatisch tekst uit afbeeldingen halen binnen Node.js-applicaties. Ze ondersteunt het extraheren van tekst uit gescande documenten, PDF-bestanden, camerafoto's of bonfoto's. Dit kan nuttig zijn voor het creëren van doorzoekbare archieven, het automatiseren van gegevensinvoer, of het verwerken van grote hoeveelheden documenten in sectoren zoals financiën en gezondheidszorg. Hier is een eenvoudig voorbeeld dat laat zien hoe je programmatisch tekst uit afbeeldingen kunt extraheren binnen Node.js-applicaties.
Hoe tekst uit afbeeldingen te extraheren in een Node.js-omgeving?
const tesseract = require("node-tesseract-ocr");
tesseract.recognize("path/to/image.jpg")
.then(text => {
console.log("Recognized Text:", text);
})
.catch(error => {
console.error("Error:", error.message);
});
Betere beeldvoorverwerking binnen Node.js
Voorverwerking van afbeeldingen vóór het toepassen van OCR kan de nauwkeurigheid van teksterkenning aanzienlijk verbeteren. De open‑source Node‑Tesseract‑OCR‑bibliotheek biedt basisvoorverwerkingstechnieken, zoals schalen, binarisatie en kantcorrectie. Deze voorverwerkingstappen kunnen worden geïmplementeerd met extra Node.js‑bibliotheken zoals sharp of jimp in combinatie met Node‑Tesseract‑OCR. Het volgende voorbeeld toont hoe softwareontwikkelaars voorverwerkingstappen gebruiken om de herkenning te verbeteren, vooral bij afbeeldingen van lagere kwaliteit.
Hoe voorbewerkingsstappen toe te passen om herkenning te verbeteren via de Node.js API?
const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");
sharp("path/to/input.jpg")
.resize(800, 600) // Resize the image
.greyscale() // Convert to greyscale
.toBuffer()
.then(data => {
return tesseract.recognize(data, { lang: "eng" });
})
.then(text => {
console.log("Preprocessed Image Text:", text);
})
.catch(error => {
console.error("Error:", error.message);
});
Herkende tekst in meerdere talen
Een van de opvallende kenmerken van Node‑Tesseract‑OCR is de uitgebreide meertalige ondersteuning. De Tesseract‑OCR‑bibliotheek ondersteunt meer dan 100 talen, waardoor het een ideale keuze is voor toepassingen die documenten in verschillende talen moeten verwerken. Softwareontwikkelaars kunnen de taal (of talen) opgeven die Tesseract moet gebruiken, waardoor de herkenningsnauwkeurigheid voor niet‑Engelse teksten verbetert. Hier is een voorbeeld dat laat zien hoe softwareontwikkelaars tekst in het Frans kunnen herkennen binnen Node.js‑toepassingen?
Hoe tekst uit een afbeelding in het Frans te herkennen via de JavaScript API?
const config = {
lang: "fra", // French language support
oem: 1,
psm: 3
};
tesseract.recognize("path/to/french-text-image.jpg", config)
.then(text => {
console.log("Recognized Text in French:", text);
})
.catch(error => {
console.error("Error:", error.message);
});