1. Produkti
  2.   OCR
  3.   JavaScript
  4.   Guten OCR
 
  

Bezmaksas JavaScript bibliotēka, lai parsētu tekstu no skenētiem attēliem un formām

Atvērtā koda optiskās rakstzīmju atpazīšanas (OCR) JavaScript bibliotēka teksta parsēšanai no melnbaltām skenētām attēliem & dokumentiem ar attēlu priekšapstrādi & veidņu atbalstu tīmekļa vai Node.js lietotnēs.

Mūsdienu digitālajā pasaulē optiskās rakstzīmju atpazīšanas (OCR) tehnoloģija spēlē kritisku lomu, pārvēršot skenētos attēlus, rokraksta piezīmes vai drukātus dokumentus rediģējamos un meklējamos datos. JavaScript izstrādātājiem, kas meklē vieglu un atvērtā koda risinājumu, Guten OCR piedāvā pārliecinošu izvēli. Šis uz JavaScript balstītais OCR dzinējs ir izstrādāts ar vienkāršību prātā, padarot to par ideālu risinājumu OCR funkciju integrēšanai tieši pārlūkprogrammu vai Node.js lietojumprogrammās. Bibliotēkā ir vairākas svarīgas funkcijas, piemēram, rakstzīmju atpazīšana, izmantojot veidnes, attēlu sliekšņa noteikšana un binarizācija, rakstzīmju segmentēšana, veidņu saskaņošana un teksta apvienošana, moduļu koda bāzes atbalsts un tā tālāk. Tā koncentrējas uz drukāta teksta atpazīšanu melnbaltos skenētos dokumentos un vislabāk piemērota labi formatētam tekstam, piemēram, grāmatām vai anketām.

Guten OCR ir atvērtā koda JavaScript OCR dzinējs, ko izveidoja Gutenye. Atšķirībā no smagajiem OCR rīkiem, kas prasa ārējās atkarības vai plašu iestatīšanu, Guten OCR ir pilnīgi uzrakstīts JavaScript, kas nozīmē, ka tas var darboties tīmekļa pārlūkā vai serverī ar Node.js. Bibliotēka izmanto pamata attēlu apstrādes tehnikas, lai segmentētu rakstzīmes un identificētu tās, izmantojot rakstzīmju modeļu atpazīšanas sistēmu. Lai gan tas vēl nav spējīgs sacensties ar komerciālajiem OCR dzinējiem, piemēram, Tesseract, daudzvalodu vai rokraksta teksta atbalsta ziņā, tā vienkāršība un pārveidojamība padara to par fantastisku iespēju izglītības projektiem, pierādījumu konceptiem vai iebūvētiem OCR funkcijām pielāgotos tīmekļa lietojumprogrammās. Atšķirībā no Tesseract vai citiem lielākiem dzinējiem, Guten OCR ir apzināti viegls un koncentrēts — kas padara to par lielisku sākuma punktu tiem, kas vēlas izprast, kā OCR darbojas aizkulisēs.

Previous Next

Sākšana ar Guten OCR

Ieteicamais veids, kā instalēt Guten OCR, ir izmantot Brew. Lūdzu, izmantojiet šādu komandu, lai veiktu vienkāršu instalāciju

Instalējiet Guten OCR, izmantojot Brew

 brew install git-lfs 

Instalējiet Guten OCR caur GitHub

 git clone git@github.com:gutenye/ocr.git 

Jūs varat arī instalēt to manuāli; lejupielādējiet jaunākos izlaiduma failus tieši no GitHub krātuves.

Attēlu priekšapstrāde pirms OCR operācijām

Atvērtā koda Guten OCR bibliotēka ir pilnībā rakstīta JavaScript valodā, padarot to saderīgu gan ar pārlūkprogrammu, gan Node.js vidēm. Tā ietver iebūvētas attēlu priekšapstrādes funkcijas, lai uzlabotu atpazīšanas precizitāti. Tā atbalsta attēlu binarizāciju (pārvēršot melnbaltā), trokšņa samazināšanu, slīpuma korekciju un vairāk. Zemāk esošais piemērs parāda, kā izstrādātāji var piemērot vairākus attēlu priekšapstrādes soļus pirms OCR operācijas veikšanas attēlos.

Kā piemērot attēlu priekšapstrādi pirms OCR operācijas, izmantojot JavaScript bibliotēku?

const { preprocess } = require('guten-ocr');

// Apply multiple preprocessing steps
const processedImage = preprocess(imageData, [
  'grayscale',    // Convert to grayscale
  'binarize',     // Convert to black and white
  'deskew',       // Correct skew
  'denoise'       // Reduce noise
]);

// Then perform OCR on the processed image
ocr.recognize(processedImage).then(/* ... */);

Rakstzīmju atpazīšana, izmantojot veidnes

JavaScript bibliotēka Guten OCR ir nodrošinājusi pilnīgu atbalstu OCR operāciju veikšanai, izmantojot veidnes JavaScript lietojumprogrammās. Guten OCR sirdī ir veidņu atbilstības sistēma. Tā vietā, lai apmācītu mašīnmācīšanās modeli, tā izmanto iepriekš definētus rakstzīmju modeļus. Tas padara sistēmu ātrāku un vieglāk saprotamu, bet arī jutīgāku pret fonta un izkārtojuma konsekvenci. Lai veiktu šo uzdevumu, bibliotēka attēlo katru rakstzīmi (A–Z, a–z, 0–9 utt.) audeklā, un katras rakstzīmes binārā matrica kļūst par atsauces veidni. Analizējot attēlu, bibliotēka salīdzina attēla segmentus ar šīm veidnēm, lai atrastu vislabāko atbilstību. To dara, izmantojot kombināciju no vertikālas un horizontālas līniju skenēšanas, lai noteiktu robežkastes.

Rakstzīmju segmentēšana, izmantojot OCR bibliotēku

Atvērtā koda JavaScript bibliotēka Guten OCR ļauj programmatūras izstrādātājiem viegli veikt rakstzīmju segmentēšanu. Kad attēls ir binarizēts, nākamais solis ir atsevišķu rakstzīmju segmentēšana. Guten OCR skenē rindas un kolonnas, lai noteiktu blīvas melnas pikseļu zonas, tās sadalot potenciālajās rakstzīmēs. Zemāk esošais piemērs parāda, kā programmatūras izstrādātāji var veikt rakstzīmju segmentēšanu, izmantojot JavaScript OCR bibliotēku.

Kā veikt rakstzīmju segmentēšanu, izmantojot JavaScript bibliotēku?

const segment = require('guten-ocr/segment');
const boxes = segment(binarized); // returns array of [x, y, width, height]
 Latviski