1. Táirgí
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

API Node.js saor in aisce chun cumais OCR a chur le tionscadail JS.

Leabharlann OCR Node.js Foinse Oscailte a ligeann do ríomhchláróirí téacs a aithint & a bhaint as formáidí comhaid éagsúla, lena n-áirítear íomhánna (JPEG, PNG), PDFanna, agus cáipéisí saor in aisce i dteangacha iolracha.

Cad é Node-Tesseract-OCR?

Sa lá atá inniu ann i ré na ndíograis, tá bain amach téacs ó íomhánna agus cáipéisí tar éis bheith ina thasc ríthábhachtach i dtionscail éagsúla, lena n-áirítear bainistíocht cháipéisí, próiseáil sonraí, agus intleacht shaorga. Tá teicneolaíocht Aithint Carachtar Optúil (OCR) tar éis a dhéanamh indéanta cáipéisí scannta, íomhánna, agus PDFanna a thiontú go formáidí téacs inathraithe. Is API foinse oscailte é Node-Tesseract-OCR a chuimsíonn cumhacht innill Tesseract OCR chun bealach gan uaim agus éifeachtach a sholáthar chun tascanna OCR a dhéanamh i bhfeidhmchláir Node.js.

Is fillteán Node.js é Node-Tesseract-OCR don innill Tesseract OCR, ag ligean do fhorbróirí bogearraí gnéithe láidir aitheantais téacs Tesseract a úsáid laistigh de thimpeallacht Node.js. Tá an API á chothabháil ag an stór GitHub seo agus cuireann sé raon feidhmeanna ar fáil a fhágann go bhfuil sé oiriúnach do chásanna úsáide éagsúla, ó bhaint simplí téacs go tascanna próiseála doiciméad níos casta. Is féidir le fhorbróirí bogearraí téacs a bhaint as íomhánna agus doiciméid i dteangacha éagsúla, rud a fhágann gur uirlis ilúsáideach é do fheidhmchláir éagsúla.

Soláthraíonn API Node-Tesseract-OCR cumais chuncnóise íomhánna chun cinn, lena n-áirítear scagadh íomhá, athmhéadaíocht, agus gearradh, chun a chinntiú go bhfuil an téacs a bhaintear cruinn agus iontaofa. Tacaíonn sé le breis is 100 teanga, rud a fhágann go bhfuil sé ina réiteach ilúsáideach do thascanna OCR i dtimpeallachtaí éagsúla. Is féidir le forbróirí bogearraí téacs a bhaint as íomhánna, PDFanna, agus cáipéisí, agus an téacs a bhaintear a thabhairt ar ais i raon formáidí, mar JSON, XML, agus téacs simplí. Tá sé deartha chun a bheith éadrom, solúbtha, agus éasca le húsáid, rud a fhágann go bhfuil sé ina rogha idéalach do fhorbróirí a theastaíonn uathu cumais OCR a chur le a dtionscadail. Leis na cumais chuncnóise íomhánna chun cinn, tacaíocht teanga, agus meicníochtaí láimhseála earráidí, tá sé ina rogha idéalach do fhorbróirí a theastaíonn uathu cumais OCR a chur le a dtionscadail.

Previous Next

Ag Tosú le Node-Tesseract-OCR

Is é an bealach molta chun Node-Tesseract-OCR a shuiteáil ná úsáid a bhaint as npm. Úsáid an t-ordú seo a leanas le haghaidh suiteála réidh le do thoil.

Suiteáil Node-Tesseract-OCR trí npm

npm install node-tesseract-ocr 

Is féidir leat é a shuiteáil de láimh freisin; íoslódáil na comhaid eisiúna is déanaí go díreach ó GitHub stór.

Baint Téacs ó Íomhánna i API Node.js

Déanann leabharlann foinse oscailte Node-Tesseract-OCR sé éasca do fhorbróirí bogearraí feidhmchláir a chruthú a bhainfidh téacs as íomhánna go huathoibríoch laistigh de fheidhmchláir Node.js. Tacaíonn sé le baint téacs as cáipéisí scannta, PDFs, grianghraif ceamara nó grianghraif de cheannach. Is féidir é seo a úsáid chun cartlanna inathbharthacha a chruthú, iontráil sonraí a uathoibriú, nó méid mór cáipéisí a phróiseáil i réimsí mar airgeadas agus cúraim sláinte. Seo sampla simplí a thaispeánann conas téacs a bhaint go cláir ó íomhánna laistigh de fheidhmchláir Node.js.

Conas Téacs a Bhain amach ó Íomhánna i dtimpeallacht Node.js?

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Réamhphróiseáil Íomhá Níos Fearr i Node.js

Is féidir le réamhphróiseáil íomhánna roimh chur OCR i bhfeidhm feabhas suntasach a chur ar chruinneas an aitheantais téacs. Ceadaíonn an leabharlann foinse oscailte Node-Tesseract-OCR teicnící bunúsacha réamhphróiseála, mar shampla athmhéadaíocht, binárú, agus díshlándáil. Is féidir na céimeanna réamhphróiseála seo a chur i bhfeidhm ag baint úsáide as leabharlanna breise Node.js cosúil le sharp nó jimp i gcomhar le Node-Tesseract-OCR. Taispeánann an sampla thíos conas a úsáideann forbróirí bogearraí na céimeanna réamhphróiseála chun an t-aithint a fheabhsú, go háirithe le híomhánna ísealchaighdeáin.

Conas Céimeanna Réamhphróiseála a chur i bhfeidhm chun Feabhsú an Aithint trí API Node.js?

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Téacs Aithnithe i Ilteangacha

Ceann de na gnéithe a sheasann amach i Node-Tesseract-OCR ná a thacaíocht fhairsing ilteangach. Tacaíonn leabharlann Tesseract OCR le breis is 100 teanga, rud a fhágann go bhfuil sé ina rogha idéalach do fheidhmchláir a chaithfidh doiciméid a phróiseáil i dteangacha éagsúla. Is féidir le forbróirí bogearraí an teanga (nó na teangacha) a shonrú ar mhaith leo go n-úsáidfidh Tesseract, rud a fheabhsaíonn cruinneas an aitheantais do théacsanna nach bhfuil i mBéarla. Seo sampla a thaispeánann conas is féidir le forbróirí bogearraí téacs a aithint i bhFraincis laistigh de fheidhmchláir Node.js?

Conas Téacs a aithint ó íomhá i bhFraincis trí API JavaScript?

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 Gaeilge