1. Producten
  2.   OCR
  3.   JavaScript
  4.   Guten OCR
 
  

Gratis JavaScript-bibliotheek om tekst te parseren van gescande afbeeldingen & formulieren

Open source optische tekenherkenning (OCR) JavaScript-bibliotheek voor het parseren van tekst uit zwart-wit gescande afbeeldingen en documenten met beeldvoorbewerking en sjabloonondersteuning in web- of Node.js-applicaties.

In de moderne digitale wereld speelt optische tekenherkenning (OCR) technologie een cruciale rol bij het omzetten van gescande afbeeldingen, handgeschreven notities of gedrukte documenten naar bewerkbare en doorzoekbare gegevens. Voor JavaScript-ontwikkelaars die op zoek zijn naar een lichtgewicht en open-source oplossing, biedt Guten OCR een overtuigende keuze. Deze op JavaScript gebaseerde OCR-engine is ontworpen met eenvoud in gedachten, waardoor hij ideaal is voor het direct integreren van OCR-functies in browsergebaseerde of Node.js-toepassingen. Er zijn verschillende belangrijke functies onderdeel van de bibliotheek, zoals tekenherkenning via sjablonen, beelddrempeling en binarisatie, tekensegmentatie, sjabloonmatching en tekstassemblage, ondersteuning van een modulaire codebasis, enzovoort. Het richt zich op het herkennen van gedrukte tekst uit zwart-wit gescande documenten en is het meest geschikt voor goed geformatteerde tekst, zoals boeken of formulieren.

Guten OCR is een open-source JavaScript OCR-engine gemaakt door Gutenye. In tegenstelling tot zware OCR-tools die externe afhankelijkheden of een uitgebreide installatie vereisen, is Guten OCR volledig geschreven in JavaScript, wat betekent dat het kan draaien in een webbrowser of op de server met Node.js. De bibliotheek gebruikt basale beeldverwerkingstechnieken om tekens te segmenteren en te identificeren met behulp van een patroonherkenningssysteem voor tekens. Hoewel het nog niet kan concurreren met commerciële OCR-engines zoals Tesseract op het gebied van meertalige of handgeschreven tekstondersteuning, maken de eenvoud en hackbaarheid het een fantastische optie voor educatieve projecten, proof-of-concepts, of ingebedde OCR-functies in aangepaste webapps. In tegenstelling tot Tesseract of andere grotere engines is Guten OCR opzettelijk lichtgewicht en gericht—wat het een uitstekend startpunt maakt voor iedereen die wil begrijpen hoe OCR onder de motorkap werkt.

Previous Next

Aan de slag met Guten OCR

De aanbevolen manier om Guten OCR te installeren is met Brew. Gebruik alstublieft het volgende commando voor een soepele installatie

Installeer Guten OCR via Brew

 brew install git-lfs 

Installeer Guten OCR via GitHub

 git clone git@github.com:gutenye/ocr.git 

U kunt het ook handmatig installeren; download de nieuwste release‑bestanden rechtstreeks van de GitHub repository.

Beeldvoorbewerking vóór OCR-bewerkingen

De open‑source Guten OCR‑bibliotheek is volledig geschreven in JavaScript, waardoor hij compatibel is met zowel browser‑ als Node.js‑omgevingen. Hij bevat ingebouwde beeld‑preprocessing‑functies om de herkenningsnauwkeurigheid te verbeteren. Hij ondersteunt beeldbinarisatie (omzetten naar zwart‑wit), ruisreductie, scheefstandcorrectie en meer. Het volgende voorbeeld toont hoe ontwikkelaars meerdere beeld‑preprocessing‑stappen kunnen toepassen voordat ze een OCR‑bewerking op afbeeldingen uitvoeren.

Hoe pas je beeldvoorverwerking toe vóór OCR-bewerking via JavaScript-bibliotheek?

const { preprocess } = require('guten-ocr');

// Apply multiple preprocessing steps
const processedImage = preprocess(imageData, [
  'grayscale',    // Convert to grayscale
  'binarize',     // Convert to black and white
  'deskew',       // Correct skew
  'denoise'       // Reduce noise
]);

// Then perform OCR on the processed image
ocr.recognize(processedImage).then(/* ... */);

Tekenherkenning via sjablonen

De JavaScript-bibliotheek Guten OCR heeft volledige ondersteuning geboden voor het uitvoeren van OCR-bewerkingen met behulp van sjablonen binnen JavaScript-toepassingen. In het hart van Guten OCR bevindt zich een sjabloon‑matching systeem. In plaats van een machine‑learningmodel te trainen, gebruikt het vooraf gedefinieerde tekenpatronen. Dit maakt het systeem sneller en makkelijker te begrijpen, maar gevoeliger voor lettertype‑ en lay-outconsistentie. Om deze taak uit te voeren rendert de bibliotheek elk teken (A–Z, a–z, 0–9, enz.) in een canvas en wordt de binaire matrix voor elk teken een referentiesjabloon. Bij het analyseren van een afbeelding vergelijkt de bibliotheek afbeeldingssegmenten met deze sjablonen om de beste overeenkomst te vinden. Dit doet het met een combinatie van verticale en horizontale lijnscans om begrenzende vakken te lokaliseren.

Tekensegmentatie via OCR-bibliotheek

De open‑source JavaScript‑bibliotheek Guten OCR stelt software‑ontwikkelaars in staat om teken‑segmentatie moeiteloos uit te voeren. Zodra de afbeelding is binariseerd, is de volgende stap het segmenteren van individuele tekens. Guten OCR scant rijen en kolommen om gebieden met dichte zwarte pixels te detecteren, en scheidt deze in potentiële tekens. Het volgende voorbeeld toont hoe software‑ontwikkelaars teken‑segmentatie kunnen uitvoeren met behulp van de JavaScript OCR‑bibliotheek.

Hoe voer je tekensegmentatie uit met behulp van JavaScript-bibliotheek?

const segment = require('guten-ocr/segment');
const boxes = segment(binarized); // returns array of [x, y, width, height]
 Dutch