API OCR JavaScript Foinse Oscailte chun PDFanna Inbhreathnaithe a Chruthú
Leabharlann OCR JavaScript Ceannródaíoch chun PDFanna Inbhreathnaithe a Chruthú agus a dhéanann OCR (Aithint Optúil Carachtair) agus a bhaintear téacs ó ghrianghraif (PNG, JPEG) agus comhaid PDF.
Cad é Scribe.js?
I ndomhanda digiteach inniu, tá méid ollmhór eolais luachmhairiúil gafa i d'íomhánna—gabhálacha scáileáin de theachtaireachtaí earráide, grianghraif de cháipéisí, sleamhnáin ó chur i láthair, nó fiú memes le téacs cruthaitheach. Is próiseas crua agus lán botún é an téacs a tharchur de láimh. Seo an áit a thagann teicneolaíocht Aithint Carachtar Optúil (OCR) chun cabhrú, agus cuireann Scribe.js ar fáil ceann de na bealaí is forbartha-úsáideora chun é a chomhtháthú i do thionscadail ghréasáin. Is leabharlann JavaScript foinse oscailte é Scribe.js a dhéanann OCR agus a bhaintear téacs ó íomhánna agus comhaid PDF araon. Níos mó ná go leor réitigh OCR a éilíonn próiseáil taobh thiar nó glaonna API seachtracha, rith Scribe.js go hiomlán ar thaobh an chliaint, ag tabhairt smacht iomlán duit ar do shonraí agus ag baint costas freastalaí de bharr tascanna aithint téacs.
Scribe.js ná cliant JavaScript éadrom le haghaidh Google Cloud Vision API. Déantar gach oibríocht OCR go díreach i mbrabhsálaí an úsáideora nó i do thimpeallacht Node.js, rud a chinntíonn príobháideacht agus a laghdaíonn costas infrastuctúir an fhreastalaí. Tá tacaíocht le haghaidh gnéithe éagsúla san leabharlann, mar shampla réamhphróiseáil do íomhánna, sreabhadh oibre aontaithe do íomhánna, braith uathoibríoch, sraitheanna PDF, scagadh leathanach le muinín íseal, taisceanna innill OCR agus mar sin de. Tá an leabharlann tógtha ag baint úsáide as JavaScript ESM (Modúil ECMAScript) nua-aimseartha, rud a fhágann go bhfuil sé simplí a chomhtháthú i bpróisis forbartha gréasáin comhaimseartha gan gá le cumraíochtaí tógála casta. Ciallaíonn an cur chuige a bhfuil an forbróir i gcroílár aige gur féidir leat téacs a bhaint as doiciméid le cúpla líne cód.
Ag Tosú le Scribe.js
Is é an bealach molta chun Scribe.js a shuiteáil ná úsáid a bhaint as npm. Úsáid an t-ordú seo a leanas le haghaidh suiteáil réidh.
Suiteáil Scribe.js trí npm
npm install scribe.js-ocr Is féidir leat é a shuiteáil de láimh freisin; íosluchtaigh na comhaid scaoilte is déanaí go díreach ón stór GitHub.
Aithint Téacs ó Íomhánna
Is é an cás úsáide is bunúsach don leabharlann Scribe.js ná téacs a bhaint as comhaid íomhá. Láimhseálann an leabharlann formáidí éagsúla íomhánna agus is féidir leis íomhánna aonair agus mairliú de íomhánna iolracha a phróiseáil i ngníomh amháin. Seo sampla bunúsach a thaispeánann baint téacs ó URL íomhá laistigh de fheidhmchláir JavaScript. Taispeánann an slabhra an API simplí a sholáthraíonn Scribe.js. Glacann an modh extractText le eagar de URLanna íomhá agus filleann sé ar Promise a réiteoidh leis an téacs a aithnítear.
Conas Téacs a Bhaint ó Íomhá trí Leabharlann JavaScript?
import scribe from 'scribe.js-ocr';
// Extract text from a single image
scribe.extractText(['https://example.com/sample-image.png'])
.then((result) => {
console.log('Extracted text:', result);
})
.catch((error) => {
console.error('OCR failed:', error);
});
Cruthaigh PDFanna Inaistrithe trí JavaScript
Ceann de na gnéithe is cumhachtaí ag Scribe.js ná a chumas sraitheanna téacs dofheicthe a chur le comhaid PDF atá ann cheana. Athraíonn an fheidhmiúlacht seo PDFanna bunaithe ar íomhá go cáipéisí inathraithe gan a n-íomhá a athrú. Nuair a chuirtear sraith téacs le PDF, is féidir le húsáideoirí cuardach a dhéanamh ar fhocail nó frásaí ar leith sa cháipéis, téacs a roghnú agus a chóipeáil ó rud a cheapann sé gur íomhá é, léitheoirí scáileáin agus uirlisí rochtana a úsáid le cáipéisí scanáilte, innéacsú a chumasú ag innill cuardaigh agus córais bhainistíochta cáipéisí, srl.
Conas Cáipéisí PDF Inathraithe a Chruthú trí Leabharlann JavaScript?
import scribe from 'scribe.js-ocr';
// Add searchable text layer to an image-based PDF
async function makeSearchablePDF(inputPdfUrl) {
try {
// First, perform OCR on the PDF
const ocrResult = await scribe.extractText([inputPdfUrl]);
// Then create a new PDF with the text layer embedded
const searchablePdf = await scribe.createSearchablePDF(
inputPdfUrl,
ocrResult
);
// The resulting PDF maintains the original appearance
// but now contains selectable, searchable text
return searchablePdf;
} catch (error) {
console.error('Failed to create searchable PDF:', error);
throw error;
}
}
Braite Téacs Chláir Casta trí JS
Le haghaidh íomhánna de cháipéisí le téacs dlúth agus le leagan amach casta (mar leathanach leabhair scanáilte nó easpórtáil PDF), cuireann leabharlann Scribe.js gné "Document Text Detection" ar fáil. Soláthraíonn sé seo eolas i bhfad níos saibhre, lena n-áirítear brathadóirí alt, focal, agus briseadh, a chabhraíonn le struchtúr na cáipéise bhunaidh a chaomhnú. Tá sé an-úsáideach do fheidhmchláir a bhfuil leagan amach agus struchtúr an mhainne ábhair tábhachtach, mar shampla próiseáil bhfoirmeacha, sonrasáin, nó leaganacha iolraí il-cholúnna.
Conas Braith Téacs Casta a Dhéanamh laistigh de Aipeanna JavaScript?
const Scribe = require('scribejs');
const serviceAccountKey = require('./path-to-your-key.json');
const scribe = new Scribe(serviceAccountKey);
const documentImageUrl = 'https://example.com/scanned-invoice.png';
// Use the `documentText` method for advanced detection
scribe.documentText(documentImageUrl)
.then(fullTextAnnotation => {
// The fullTextAnnotation object contains detailed data
console.log('Full Document Text:');
console.log(fullTextAnnotation.text); // The plain text of the entire document
// You can also iterate through pages, blocks, paragraphs, and words
fullTextAnnotation.pages.forEach(page => {
page.blocks.forEach(block => {
console.log('\nBlock Confidence:', block.confidence);
block.paragraphs.forEach(paragraph => {
console.log(paragraph.text);
});
});
});
})
.catch(error => {
console.error('Document OCR Error:', error);
});
Próiseáil Baiscéad de Ilchomhaid trí JavaScript
I bhfeidhmchláir sa saol fíor, bíonn gá ag gairmithe bogearraí go minic le próiseáil iolracha cáipéisí ag an am céanna. Tacaíonn Scribe.js le próiseáil bhairc as an mbosca, ag ligean d'úsáideoirí téacs a bhaint as iolracha íomhánna nó PDFanna i ngníomh amháin laistigh de fheidhmchlár JavaScript. Léiríonn an sampla seo a leanas conas is féidir le forbróirí bogearraí bhairc de cháipéisí a phróiseáil ag baint úsáide as orduithe JavaScript.
Conas Bhrabhsáil de Cháipéisí a Phróiseáil ag baint úsáide as Leabharlann JavaScript?
import scribe from 'scribe.js-ocr';
// Process multiple documents at once
async function batchProcess(fileUrls) {
try {
// Pass an array of URLs to process multiple files
const results = await scribe.extractText(fileUrls);
// Results are returned in the same order as input
results.forEach((text, index) => {
console.log(`Document ${index + 1} text:`, text);
});
return results;
} catch (error) {
console.error('Batch processing failed:', error);
throw error;
}
}
// Process a batch of documents
const documents = [
'https://example.com/receipt1.jpg',
'https://example.com/receipt2.jpg',
'https://example.com/invoice.pdf'
];
batchProcess(documents)
.then(allText => {
console.log('All documents processed successfully');
});