1. Produkter
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

Gratis Node.js API for å legge til OCR-funksjoner i JS-prosjekter.

Åpen kildekode Node.js OCR-bibliotek som lar programmerere gjenkjenne og trekke ut tekst fra ulike filformater, inkludert bilder (JPEG, PNG), PDF-er og dokumenter gratis på flere språk.

Hva er Node-Tesseract-OCR?

I dagens digitale tidsalder har uttrekk av tekst fra bilder og dokumenter blitt en viktig oppgave i ulike bransjer, inkludert dokumenthåndtering, databehandling og kunstig intelligens. Teknologi for optisk tegngjenkjenning (OCR) har gjort det mulig å konvertere skannede dokumenter, bilder og PDF-filer til redigerbare tekstformater. Node-Tesseract-OCR er et åpen kildekode-API som integrerer kraften i Tesseract OCR-motoren for å tilby en sømløs og effektiv måte å utføre OCR-oppgaver i Node.js-applikasjoner.

Node-Tesseract-OCR er en Node.js-innpakning for Tesseract OCR-motoren, som gjør det mulig for programvareutviklere å bruke Tesseracts kraftige tekstgjenkjenningsfunksjoner i et Node.js-miljø. API-et vedlikeholdes i dette GitHub-repositoriet og tilbyr et spekter av funksjonaliteter som gjør det egnet for ulike bruksområder, fra enkel tekstuttrekking til mer komplekse dokumentbehandlingsoppgaver. Programvareutviklere kan trekke ut tekst fra bilder og dokumenter på flere språk, noe som gjør det til et allsidig verktøy for ulike applikasjoner.

Node-Tesseract-OCR API gir avanserte bildebehandlingsfunksjoner, inkludert bildfiltrering, endring av størrelse og beskjæring, for å sikre at den ekstraherte teksten er nøyaktig og pålitelig. Den støtter over 100 språk, noe som gjør den til en allsidig løsning for OCR-oppgaver i ulike miljøer. Programvareutviklere kan ekstrahere tekst fra bilder, PDF-er og dokumenter, og returnere den ekstraherte teksten i ulike formater, som JSON, XML og ren tekst. Den er designet for å være lettvektig, fleksibel og enkel å bruke, noe som gjør den til et ideelt valg for utviklere som ønsker å legge til OCR-funksjonalitet i prosjektene sine. Med sine avanserte bildebehandlingsfunksjoner, språkstøtte og feilhåndteringsmekanismer, er den et ideelt valg for utviklere som ønsker å legge til OCR-funksjonalitet i prosjektene sine.

Previous Next

Kom i gang med Node-Tesseract-OCR

Den anbefalte måten å installere Node-Tesseract-OCR på er ved å bruke npm. Vennligst bruk følgende kommando for en smidig installasjon

Installer Node-Tesseract-OCR via npm

npm install node-tesseract-ocr 

Du kan også installere det manuelt; last ned de nyeste utgivelsesfilene direkte fra GitHub-repoet.

Tekstuttrekk fra bilder i Node.js API

Det åpne kildekode‑biblioteket Node-Tesseract-OCR gjør det enkelt for programvareutviklere å lage applikasjoner som automatisk trekker ut tekst fra bilder i Node.js‑applikasjoner. Det støtter tekstuttrekk fra skannede dokumenter, PDF‑filer, kamerabilder eller kvitteringsbilder. Dette kan være nyttig for å lage søkbare arkiver, automatisere datainntasting eller behandle store mengder dokumenter i sektorer som finans og helsevesen. Her er et enkelt eksempel som viser hvordan man programmatisk kan trekke ut tekst fra bilder i Node.js‑applikasjoner.

Hvordan hente tekst fra bilder i Node.js-miljøet?

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Bedre bildeforbehandling i Node.js

Forbehandling av bilder før OCR kan betydelig forbedre nøyaktigheten til tekstgjenkjenning. Det åpne kildekodebiblioteket Node-Tesseract-OCR tillater grunnleggende forbehandlingsteknikker, som endring av størrelse, binarisering og retting av skjevhet. Disse forbehandlingsstegene kan implementeres ved hjelp av ekstra Node.js-biblioteker som sharp eller jimp i kombinasjon med Node-Tesseract-OCR. Følgende eksempel viser hvordan programvareutviklere bruker forbehandlingssteg for å forbedre gjenkjenning, spesielt med bilder av lavere kvalitet.

Hvordan bruke forhåndsbehandlingssteg for å forbedre gjenkjenning via Node.js API?

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Gjenkjent tekst på flere språk

En av de mest fremtredende funksjonene i Node-Tesseract-OCR er den omfattende flerspråklige støtten. Tesseract OCR-biblioteket støtter over 100 språk, noe som gjør det til et ideelt valg for applikasjoner som trenger å behandle dokumenter på ulike språk. Programvareutviklere kan spesifisere hvilke språk de vil at Tesseract skal bruke, noe som forbedrer gjenkjenningsnøyaktigheten for ikke-engelske tekster. Her er et eksempel som viser hvordan programvareutviklere kan gjenkjenne tekst på fransk i Node.js-applikasjoner?

Hvordan gjenkjenne tekst fra bilde på fransk via JavaScript API?

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 Norsk