API Node.js saor in aisce chun cumais OCR a chur le tionscadail JS.
Leabharlann OCR Node.js Foinse Oscailte a ligeann do ríomhchláróirí téacs a aithint & a bhaint as formáidí comhaid éagsúla, lena n-áirítear íomhánna (JPEG, PNG), PDFanna, agus cáipéisí saor in aisce i dteangacha iolracha.
Cad é Node-Tesseract-OCR?
Sa lá atá inniu ann i ré na ndíograis, tá bain amach téacs ó íomhánna agus cáipéisí tar éis bheith ina thasc ríthábhachtach i dtionscail éagsúla, lena n-áirítear bainistíocht cháipéisí, próiseáil sonraí, agus intleacht shaorga. Tá teicneolaíocht Aithint Carachtar Optúil (OCR) tar éis a dhéanamh indéanta cáipéisí scannta, íomhánna, agus PDFanna a thiontú go formáidí téacs inathraithe. Is API foinse oscailte é Node-Tesseract-OCR a chuimsíonn cumhacht innill Tesseract OCR chun bealach gan uaim agus éifeachtach a sholáthar chun tascanna OCR a dhéanamh i bhfeidhmchláir Node.js.
Is fillteán Node.js é Node-Tesseract-OCR don innill Tesseract OCR, ag ligean do fhorbróirí bogearraí gnéithe láidir aitheantais téacs Tesseract a úsáid laistigh de thimpeallacht Node.js. Tá an API á chothabháil ag an stór GitHub seo agus cuireann sé raon feidhmeanna ar fáil a fhágann go bhfuil sé oiriúnach do chásanna úsáide éagsúla, ó bhaint simplí téacs go tascanna próiseála doiciméad níos casta. Is féidir le fhorbróirí bogearraí téacs a bhaint as íomhánna agus doiciméid i dteangacha éagsúla, rud a fhágann gur uirlis ilúsáideach é do fheidhmchláir éagsúla.
Soláthraíonn API Node-Tesseract-OCR cumais chuncnóise íomhánna chun cinn, lena n-áirítear scagadh íomhá, athmhéadaíocht, agus gearradh, chun a chinntiú go bhfuil an téacs a bhaintear cruinn agus iontaofa. Tacaíonn sé le breis is 100 teanga, rud a fhágann go bhfuil sé ina réiteach ilúsáideach do thascanna OCR i dtimpeallachtaí éagsúla. Is féidir le forbróirí bogearraí téacs a bhaint as íomhánna, PDFanna, agus cáipéisí, agus an téacs a bhaintear a thabhairt ar ais i raon formáidí, mar JSON, XML, agus téacs simplí. Tá sé deartha chun a bheith éadrom, solúbtha, agus éasca le húsáid, rud a fhágann go bhfuil sé ina rogha idéalach do fhorbróirí a theastaíonn uathu cumais OCR a chur le a dtionscadail. Leis na cumais chuncnóise íomhánna chun cinn, tacaíocht teanga, agus meicníochtaí láimhseála earráidí, tá sé ina rogha idéalach do fhorbróirí a theastaíonn uathu cumais OCR a chur le a dtionscadail.
Ag Tosú le Node-Tesseract-OCR
Is é an bealach molta chun Node-Tesseract-OCR a shuiteáil ná úsáid a bhaint as npm. Úsáid an t-ordú seo a leanas le haghaidh suiteála réidh le do thoil.
Suiteáil Node-Tesseract-OCR trí npm
npm install node-tesseract-ocr Is féidir leat é a shuiteáil de láimh freisin; íoslódáil na comhaid eisiúna is déanaí go díreach ó GitHub stór.
Baint Téacs ó Íomhánna i API Node.js
Déanann leabharlann foinse oscailte Node-Tesseract-OCR sé éasca do fhorbróirí bogearraí feidhmchláir a chruthú a bhainfidh téacs as íomhánna go huathoibríoch laistigh de fheidhmchláir Node.js. Tacaíonn sé le baint téacs as cáipéisí scannta, PDFs, grianghraif ceamara nó grianghraif de cheannach. Is féidir é seo a úsáid chun cartlanna inathbharthacha a chruthú, iontráil sonraí a uathoibriú, nó méid mór cáipéisí a phróiseáil i réimsí mar airgeadas agus cúraim sláinte. Seo sampla simplí a thaispeánann conas téacs a bhaint go cláir ó íomhánna laistigh de fheidhmchláir Node.js.
Conas Téacs a Bhain amach ó Íomhánna i dtimpeallacht Node.js?
const tesseract = require("node-tesseract-ocr");
tesseract.recognize("path/to/image.jpg")
.then(text => {
console.log("Recognized Text:", text);
})
.catch(error => {
console.error("Error:", error.message);
});
Réamhphróiseáil Íomhá Níos Fearr i Node.js
Is féidir le réamhphróiseáil íomhánna roimh chur OCR i bhfeidhm feabhas suntasach a chur ar chruinneas an aitheantais téacs. Ceadaíonn an leabharlann foinse oscailte Node-Tesseract-OCR teicnící bunúsacha réamhphróiseála, mar shampla athmhéadaíocht, binárú, agus díshlándáil. Is féidir na céimeanna réamhphróiseála seo a chur i bhfeidhm ag baint úsáide as leabharlanna breise Node.js cosúil le sharp nó jimp i gcomhar le Node-Tesseract-OCR. Taispeánann an sampla thíos conas a úsáideann forbróirí bogearraí na céimeanna réamhphróiseála chun an t-aithint a fheabhsú, go háirithe le híomhánna ísealchaighdeáin.
Conas Céimeanna Réamhphróiseála a chur i bhfeidhm chun Feabhsú an Aithint trí API Node.js?
const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");
sharp("path/to/input.jpg")
.resize(800, 600) // Resize the image
.greyscale() // Convert to greyscale
.toBuffer()
.then(data => {
return tesseract.recognize(data, { lang: "eng" });
})
.then(text => {
console.log("Preprocessed Image Text:", text);
})
.catch(error => {
console.error("Error:", error.message);
});
Téacs Aithnithe i Ilteangacha
Ceann de na gnéithe a sheasann amach i Node-Tesseract-OCR ná a thacaíocht fhairsing ilteangach. Tacaíonn leabharlann Tesseract OCR le breis is 100 teanga, rud a fhágann go bhfuil sé ina rogha idéalach do fheidhmchláir a chaithfidh doiciméid a phróiseáil i dteangacha éagsúla. Is féidir le forbróirí bogearraí an teanga (nó na teangacha) a shonrú ar mhaith leo go n-úsáidfidh Tesseract, rud a fheabhsaíonn cruinneas an aitheantais do théacsanna nach bhfuil i mBéarla. Seo sampla a thaispeánann conas is féidir le forbróirí bogearraí téacs a aithint i bhFraincis laistigh de fheidhmchláir Node.js?
Conas Téacs a aithint ó íomhá i bhFraincis trí API JavaScript?
const config = {
lang: "fra", // French language support
oem: 1,
psm: 3
};
tesseract.recognize("path/to/french-text-image.jpg", config)
.then(text => {
console.log("Recognized Text in French:", text);
})
.catch(error => {
console.error("Error:", error.message);
});