1. Məhsullar
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

JS layihələrinə OCR imkanları əlavə etmək üçün pulsuz Node.js API.

Açıq mənbəli Node.js OCR kitabxanası, proqramçılara müxtəlif fayl formatlarından, o cümlədən Şəkillər (JPEG, PNG), PDF-lər və Sənədlərdən, çoxdilli şəkildə pulsuz olaraq mətn tanımaq və çıxarmaq imkanı verir.

Node-Tesseract-OCR nədir?

Bu günkü rəqəmsal dövrdə, şəkillərdən və sənədlərdən mətn çıxarmaq, sənəd idarəçiliyi, məlumat emalı və süni intellekt kimi müxtəlif sahələrdə vacib bir vəzifəyə çevrilib. Optik Simvol Tanıma (OCR) texnologiyası skan edilmiş sənədləri, şəkilləri və PDF-ləri redaktə edilə bilən mətn formatlarına çevirməyə imkan verir. Node-Tesseract-OCR, Tesseract OCR mühərrikinin gücünü birləşdirən açıq mənbəli API-dir və Node.js tətbiqlərində OCR vəzifələrini problemsiz və səmərəli şəkildə yerinə yetirməyə imkan verir.

Node-Tesseract-OCR, Tesseract OCR mühərrikinin Node.js üçün bir qablaşdırmasıdır, proqram inkişaf etdiricilərinə Tesseract-ın güclü mətn tanıma xüsusiyyətlərindən Node.js mühitində istifadə etməyə imkan verir. API bu GitHub deposunda saxlanılır və sadə mətn çıxarışından daha mürəkkəb sənəd emalı tapşırıqlarına qədər müxtəlif istifadə halları üçün uyğun edən bir sıra funksionallıqlar təklif edir. Proqram inkişaf etdiriciləri şəkillərdən və sənədlərdən bir neçə dildə mətn çıxara bilərlər, bu da onu müxtəlif tətbiqlər üçün çox yönlü bir alət edir.

Node-Tesseract-OCR API, çıxarılan mətnin dəqiq və etibarlı olmasını təmin etmək üçün şəkil filtrasiyası, ölçülərin dəyişdirilməsi və kəsilməsi kimi qabaqcıl şəkil emalı imkanları təqdim edir. O, 100-dən çox dili dəstəkləyir, bu da onu müxtəlif mühitlərdə OCR tapşırıqları üçün çoxistiqamətli həll edir. Proqram təminatı inkişaf etdiriciləri şəkillərdən, PDF-lərdən və sənədlərdən mətn çıxara və çıxarılan mətni JSON, XML və sadə mətn kimi müxtəlif formatlarda qaytara bilərlər. O, yüngül, elastik və istifadəsi asan olmaq üçün dizayn edilib, bu da OCR imkanlarını layihələrinə əlavə etmək istəyən inkişaf etdiricilər üçün ideal seçimdir. Qabaqcıl şəkil emalı imkanları, dil dəstəyi və səhv idarəetmə mexanizmləri ilə, OCR imkanlarını layihələrinə əlavə etmək istəyən inkişaf etdiricilər üçün ideal seçimdir.

Previous Next

Node-Tesseract-OCR ilə Başlamaq

Node-Tesseract-OCR quraşdırmağın tövsiyə olunan yolu npm istifadə etməkdir. Zəhmət olmasa, problemsiz quraşdırma üçün aşağıdakı əmri istifadə edin

Node-Tesseract-OCR-i npm vasitəsilə quraşdırın

npm install node-tesseract-ocr 

Siz həmçinin onu əl ilə quraşdıra bilərsiniz; son buraxılış fayllarını birbaşa GitHub deposundan yükləyin.

Node.js API-də Şəkillərdən Mətn Çıxarılması

Açıq mənbəli Node-Tesseract-OCR kitabxanası proqram inkişaf etdiricilərinə Node.js tətbiqlərində şəkillərdən mətn çıxaran tətbiqlər yaratmağı asanlaşdırır. O, skan edilmiş sənədlər, PDF-lər, kamera fotoşəkilləri və ya qəbz fotoşəkillərindən mətn çıxarılmasını dəstəkləyir. Bu, axtarışa yararlı arxivlər yaratmaq, məlumat daxil etməni avtomatlaşdırmaq və ya maliyyə və səhiyyə kimi sahələrdə böyük həcmli sənədlərin işlənməsi üçün faydalı ola bilər. Budur, Node.js tətbiqlərində şəkillərdən proqram vasitəsilə mətn çıxarmağın sadə nümunəsi.

Node.js mühitində şəkillərdən mətn necə çıxarılır?

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Node.js-də Daha Yaxşı Şəkil Ön İşlənməsi

OCR tətbiq etməzdən əvvəl şəkillərin ön emalı mətn tanıma dəqiqliyini əhəmiyyətli dərəcədə artıra bilər. Açıq mənbəli Node-Tesseract-OCR kitabxanası ölçüləndirmə, ikiliyə çevirmə və əyilmənin düzəldilməsi kimi əsas ön emal texnikalarını təmin edir. Bu ön emal addımları Node-Tesseract-OCR ilə birlikdə sharp və ya jimp kimi əlavə Node.js kitabxanaları istifadə edərək həyata keçirilə bilər. Aşağıdakı nümunə proqramçılara aşağı keyfiyyətli şəkillərdə tanımağı yaxşılaşdırmaq üçün ön emal addımlarından necə istifadə etdiklərini göstərir.

Node.js API vasitəsilə tanıma keyfiyyətini artırmaq üçün ön emal addımlarını necə tətbiq etmək olar?

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

Çox Dillərdə Tanınan Mətn

Node-Tesseract-OCR-un ən diqqətçəkən xüsusiyyətlərindən biri onun geniş çoxdilli dəstəyi‑dir. Tesseract OCR kitabxanası 100‑dən çox dili dəstəkləyir, bu da müxtəlif dillərdə sənədləri emal etməli olan tətbiqlər üçün ideal seçim edir. Proqramçılar Tesseract‑ın istifadə etməsini istədikləri dili(ləri) göstərə bilərlər, bu da ingilis dili olmayan mətnlərin tanıma dəqiqliyini artırır. Aşağıda Node.js tətbiqlərində proqramçıların fransız dilində mətnləri necə tanıya biləcəyini göstərən bir nümunə var?

JavaScript API vasitəsilə fransız dilində şəkildən mətn necə tanınır?

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 Azəri