1. produkty
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

Bezplatné Node.js API pro přidání OCR funkcí do JS projektů.

Open source knihovna OCR pro Node.js, která umožňuje programátorům rozpoznávat a extrahovat text z různých formátů souborů, včetně obrázků (JPEG, PNG), PDF a dokumentů zdarma ve více jazycích.

Co je Node-Tesseract-OCR?

V dnešní digitální éře se extrakce textu z obrázků a dokumentů stala klíčovým úkolem v různých odvětvích, včetně správy dokumentů, zpracování dat a umělé inteligence. Technologie optického rozpoznávání znaků (OCR) umožnila převádět naskenované dokumenty, obrázky a PDF do editovatelných textových formátů. Node-Tesseract-OCR je open-source API, které využívá sílu OCR enginu Tesseract a poskytuje plynulý a efektivní způsob provádění OCR úloh v aplikacích Node.js.

Node-Tesseract-OCR je obal pro Node.js pro OCR engine Tesseract, který umožňuje vývojářům softwaru využívat výkonné funkce rozpoznávání textu Tesseractu v prostředí Node.js. API je udržováno v tomto úložišti na GitHubu a nabízí řadu funkcí, které ho činí vhodným pro různé případy použití, od jednoduchého extrahování textu po složitější úlohy zpracování dokumentů. Vývojáři softwaru mohou extrahovat text z obrázků a dokumentů v mnoha jazycích, což z něj dělá všestranný nástroj pro různé aplikace.

API Node-Tesseract-OCR poskytuje pokročilé možnosti zpracování obrazu, včetně filtrování, změny velikosti a ořezu, aby byl extrahovaný text přesný a spolehlivý. Podporuje více než 100 jazyků, což z něj činí univerzální řešení pro úlohy OCR v různorodých prostředích. Vývojáři softwaru mohou extrahovat text z obrázků, PDF a dokumentů a vracet extrahovaný text v různých formátech, jako je JSON, XML a prostý text. Je navrženo tak, aby bylo lehké, flexibilní a snadno použitelné, což z něj dělá ideální volbu pro vývojáře, kteří chtějí do svých projektů přidat funkce OCR. Díky svým pokročilým možnostem zpracování obrazu, podpoře jazyků a mechanismům pro zpracování chyb je ideální volbou pro vývojáře, kteří chtějí do svých projektů přidat funkce OCR.

Previous Next

Začínáme s Node-Tesseract-OCR

Doporučený způsob instalace Node-Tesseract-OCR je pomocí npm. Použijte prosím následující příkaz pro hladkou instalaci.

Nainstalujte Node-Tesseract-OCR pomocí npm

npm install node-tesseract-ocr 

Můžete jej také nainstalovat ručně; stáhněte nejnovější soubory vydání přímo z GitHub repozitáře.

Extrahování textu z obrázků v Node.js API

Open source knihovna Node-Tesseract-OCR usnadňuje vývojářům softwaru vytvářet aplikace, které automaticky extrahují text z obrázků v rámci aplikací Node.js. Podporuje extrakci textu ze skenovaných dokumentů, PDF, fotografií z kamery nebo fotografií účtenek. To může být užitečné pro vytváření prohledávatelných archivů, automatizaci zadávání dat nebo zpracování velkého objemu dokumentů v odvětvích jako finance a zdravotnictví. Zde je jednoduchý příklad, který ukazuje, jak programově extrahovat text z obrázků v aplikacích Node.js.

Jak extrahovat text z obrázků v prostředí Node.js?

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Lepší předzpracování obrázků v Node.js

Předzpracování obrázků před aplikací OCR může výrazně zlepšit přesnost rozpoznávání textu. Open‑source knihovna Node‑Tesseract‑OCR umožňuje základní techniky předzpracování, jako je změna velikosti, binarizace a odklonování. Tyto kroky předzpracování lze implementovat pomocí dalších knihoven Node.js, jako jsou sharp nebo jimp, ve spojení s Node‑Tesseract‑OCR. Následující příklad ukazuje, jak vývojáři softwaru používají kroky předzpracování ke zlepšení rozpoznávání, zejména u obrázků nižší kvality.

Jak aplikovat kroky předzpracování pro zlepšení rozpoznávání pomocí Node.js API?

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Rozpoznaný text ve více jazycích

Jednou z výrazných funkcí Node‑Tesseract‑OCR je jeho rozsáhlá podpora více jazyků. Knihovna Tesseract OCR podporuje více než 100 jazyků, což z ní činí ideální volbu pro aplikace, které potřebují zpracovávat dokumenty v různých jazycích. Vývojáři softwaru mohou specifikovat jazyk(y), které chtějí, aby Tesseract použil, čímž zvyšují přesnost rozpoznávání pro texty mimo angličtinu. Zde je příklad, který ukazuje, jak vývojáři softwaru mohou rozpoznat text ve francouzštině v aplikacích Node.js?

Jak rozpoznat text z obrázku ve francouzštině pomocí JavaScript API?

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 Čeština