1. Məhsullar
  2.   OCR
  3.   JavaScript
  4.   Scribe.js
 
  

Axtarışa yararlı PDF-lər yaratmaq üçün Açıq mənbəli OCR JavaScript API

Axtarışa yararlı PDF-lər yaratmaq və həm şəkillər (PNG, JPEG), həm də PDF fayllarından mətn çıxarmaq üçün OCR (Optik Simvol Tanıma) həyata keçirən aparıcı JavaScript OCR kitabxanası.

Scribe.js nədir?

Bu günün rəqəmsal dünyasında, dəyərli məlumatların böyük bir hissəsi şəkillərin içində həbs olunmuşdur—xətalı mesajların ekran görüntüləri, sənədlərin fotoşəkilləri, təqdimatdan slaydlar və ya hətta ağıllı mətnli memlər. Bu mətnləri əl ilə köçürmək yorucu və səhvlərə meylli bir prosesdir. Burada Optik Simvol Tanıma (OCR) texnologiyası kömək edir və Scribe.js onu veb layihələrinizə inteqrasiya etməyin ən inkişaf etdiriciyə dost yollarından birini təklif edir. Scribe.js, OCR həyata keçirən və həm şəkillərdən, həm də PDF fayllarından mətn çıxaran açıq mənbəli JavaScript kitabxanasıdır. Çoxsaylı OCR həllərinin arxa plan emalı və ya xarici API çağırışları tələb etməsindən fərqli olaraq, Scribe.js tamamilə müştəri tərəfində işləyir, məlumatlarınız üzərində tam nəzarət təmin edir və mətn tanıma vəzifələri üçün server xərclərini aradan qaldırır.

Scribe.js, Google Cloud Vision API üçün yüngül JavaScript müştərisidir. Bütün OCR əməliyyatları birbaşa istifadəçinin brauzerində və ya Node.js mühitinizdə həyata keçirilir, bu da məxfilik təmin edir və server infrastrukturunun xərclərini azaldır. Kitabxana, şəkillərinizi öncədən emal etmək, şəkillər üçün vahid iş axını, avtomatik aşkarlama, PDF qatları, aşağı etibarlılıqlı səhifələri filtr etmək, OCR mühərriklərini keşləmək və s. kimi müxtəlif xüsusiyyətləri dəstəkləyir. Kitabxana müasir JavaScript ESM (ECMAScript Modules) ilə qurulub, bu da mürəkkəb tikinti konfiqurasiyalarına ehtiyac olmadan müasir veb inkişaf iş axınlarına asanlıqla inteqrasiya olunmasını təmin edir. Bu inkişafçılar‑ə‑öncə yanaşma, sənədlərdən mətn çıxarmağa yalnız bir neçə sətir kodla başlamağa imkan verir.

Previous Next

Scribe.js ilə Başlamaq

Scribe.js‑i quraşdırmağın tövsiyə olunan yolu npm‑dən istifadə etməkdir. Sorunsuz quraşdırma üçün aşağıdakı əmri istifadə edin

Scribe.js-i npm vasitəsilə quraşdırın

 npm install scribe.js-ocr 

Siz həmçinin onu əl ilə quraşdıra bilərsiniz; son buraxılış fayllarını birbaşa GitHub deposundan yükləyin.

Şəkillərdən Mətn Tanıma

Scribe.js kitabxanasının ən əsas istifadə halı şəkil fayllarından mətn çıxarmaqdır. Kitabxana müxtəlif şəkil formatlarını dəstəkləyir və tək şəkilləri və bir əməliyyatda bir neçə şəkildən ibarət topluları emal edə bilir. Budur, JavaScript tətbiqlərində şəkil URL‑indən mətn çıxarılmasını nümayiş etdirən sadə bir nümunə. Bu parçacıq Scribe.js‑in təqdim etdiyi sadə API‑ni göstərir. extractText metodu şəkil URL‑lərinin massivini qəbul edir və tanınan mətnlə həll olunan Promise qaytarır.

JavaScript Kitabxanası vasitəsilə Şəkildən Mətn Necə Çıxarılır?

import scribe from 'scribe.js-ocr';

// Extract text from a single image
scribe.extractText(['https://example.com/sample-image.png'])
  .then((result) => {
    console.log('Extracted text:', result);
  })
  .catch((error) => {
    console.error('OCR failed:', error);
  });

JavaScript vasitəsilə Axtarışa Uyğun PDF-lər Yaratmaq

Scribe.js‑in ən güclü xüsusiyyətlərindən biri mövcud PDF fayllarına görünməz mətn qatları əlavə etmək qabiliyyətidir. Bu funksionallıq şəkil‑əsaslı PDF‑ləri vizual görünüşünü dəyişdirmədən axtarışa yararlı sənədlərə çevirir. PDF‑ə mətn qatı əlavə edildikdə, istifadəçilər sənəd daxilində xüsusi söz və ifadələri axtara, şəkil kimi görünən mətnləri seçib kopyalaya, skan edilmiş sənədlərlə ekran oxuyucular və əlçatanlıq alətlərindən istifadə edə, axtarış motorları və sənəd idarəetmə sistemləri tərəfindən indekslənməni aktivləşdirə və s. edə bilərlər.

JavaScript Kitabxanası vasitəsilə Axtarışa Uyğun PDF Sənədləri Necə Yaradılır?

import scribe from 'scribe.js-ocr';

// Add searchable text layer to an image-based PDF
async function makeSearchablePDF(inputPdfUrl) {
  try {
    // First, perform OCR on the PDF
    const ocrResult = await scribe.extractText([inputPdfUrl]);
    
    // Then create a new PDF with the text layer embedded
    const searchablePdf = await scribe.createSearchablePDF(
      inputPdfUrl,
      ocrResult
    );
    
    // The resulting PDF maintains the original appearance
    // but now contains selectable, searchable text
    return searchablePdf;
  } catch (error) {
    console.error('Failed to create searchable PDF:', error);
    throw error;
  }
}

JS vasitəsilə İrəli Səviyyəli Sənəd Mətn Aşkarlanması

Sıx mətnli və mürəkkəb tərtibatlı sənəd şəkilləri üçün (məsələn, skan edilmiş kitab səhifəsi və ya PDF ixracı), Scribe.js kitabxanası "Sənəd Mətninin Aşkarlanması" xüsusiyyətini təklif edir. Bu, paraqraf, söz və sətir fasiləsi detektorları daxil olmaqla, daha zəngin məlumatlar təqdim edir və orijinal sənədin strukturunu qorumağa kömək edir. Bu, mənbə materialının tərtibatı və strukturu vacib olan tətbiqlər üçün, məsələn, formaların, fakturaların və ya çoxsütunlu tərtibatların işlənməsi kimi, son dərəcə faydalıdır.

JavaScript Tətbiqlərində İrəli Səviyyəli Mətn Aşkarlanması Necə Aparılır?

const Scribe = require('scribejs');
const serviceAccountKey = require('./path-to-your-key.json');
const scribe = new Scribe(serviceAccountKey);

const documentImageUrl = 'https://example.com/scanned-invoice.png';

// Use the `documentText` method for advanced detection
scribe.documentText(documentImageUrl)
  .then(fullTextAnnotation => {
    // The fullTextAnnotation object contains detailed data
    console.log('Full Document Text:');
    console.log(fullTextAnnotation.text); // The plain text of the entire document

    // You can also iterate through pages, blocks, paragraphs, and words
    fullTextAnnotation.pages.forEach(page => {
      page.blocks.forEach(block => {
        console.log('\nBlock Confidence:', block.confidence);
        block.paragraphs.forEach(paragraph => {
          console.log(paragraph.text);
        });
      });
    });
  })
  .catch(error => {
    console.error('Document OCR Error:', error);
  });

JavaScript ilə Çoxlu Faylların Toplu Emalı

Real dünya tətbiqlərində, proqram təminatı mütəxəssisləri tez-tez bir neçə sənədi eyni anda işləmək məcburiyyətində qalırlar. Scribe.js qutudan çıxarıla bilən toplu emal dəstəyi verir, istifadəçilərə JavaScript tətbiqi daxilində bir əməliyyatda bir neçə şəkildən və ya PDF‑dən mətn çıxarmağa imkan verir. Aşağıdakı nümunə, proqramçılarının JavaScript əmrləri ilə sənədlərin toplu emalını necə həyata keçirə biləcəyini göstərir.

JavaScript Kitabxanası ilə Sənədlər Toplamını Necə Emal Etmək Olar?

import scribe from 'scribe.js-ocr';

// Process multiple documents at once
async function batchProcess(fileUrls) {
  try {
    // Pass an array of URLs to process multiple files
    const results = await scribe.extractText(fileUrls);
    
    // Results are returned in the same order as input
    results.forEach((text, index) => {
      console.log(`Document ${index + 1} text:`, text);
    });
    
    return results;
  } catch (error) {
    console.error('Batch processing failed:', error);
    throw error;
  }
}

// Process a batch of documents
const documents = [
  'https://example.com/receipt1.jpg',
  'https://example.com/receipt2.jpg',
  'https://example.com/invoice.pdf'
];

batchProcess(documents)
  .then(allText => {
    console.log('All documents processed successfully');
  });
 Azəri