1. منتجات
  2.   OCR
  3.   JavaScript
  4.   Node-Tesseract-OCR
 
  

واجهة برمجة تطبيقات Node.js مجانية لإضافة قدرات OCR إلى مشاريع JavaScript.

مكتبة OCR مفتوحة المصدر لـ Node.js تتيح للمبرمجين التعرف على النص واستخراجه من صيغ ملفات متعددة، بما في ذلك الصور (JPEG، PNG)، ملفات PDF، والوثائق مجانًا بعدة لغات.

ما هو Node-Tesseract-OCR؟

في عصرنا الرقمي اليوم، أصبح استخراج النص من الصور والوثائق مهمة حاسمة في مختلف الصناعات، بما في ذلك إدارة الوثائق، ومعالجة البيانات، والذكاء الاصطناعي. جعلت تقنية التعرف الضوئي على الأحرف (OCR) من الممكن تحويل المستندات الممسوحة ضوئياً، والصور، وملفات PDF إلى صيغ نصية قابلة للتحرير. Node-Tesseract-OCR هو واجهة برمجة تطبيقات مفتوحة المصدر تدمج قوة محرك Tesseract OCR لتوفير طريقة سلسة وفعّالة لأداء مهام OCR في تطبيقات Node.js.

Node-Tesseract-OCR هو غلاف (wrapper) لـ Node.js لمحرك Tesseract OCR، يتيح لمطوري البرمجيات الاستفادة من ميزات التعرف على النص القوية في Tesseract داخل بيئة Node.js. يتم صيانة واجهة برمجة التطبيقات (API) في مستودع GitHub هذا وتوفر مجموعة من الوظائف التي تجعلها مناسبة لمجموعة متنوعة من حالات الاستخدام، من استخراج النص البسيط إلى مهام معالجة المستندات الأكثر تعقيدًا. يمكن لمطوري البرمجيات استخراج النص من الصور والمستندات بعدة لغات، مما يجعلها أداة متعددة الاستخدامات لتطبيقات مختلفة.

توفر واجهة برمجة تطبيقات Node-Tesseract-OCR قدرات متقدمة لمعالجة الصور، بما في ذلك تصفية الصور وتغيير حجمها واقتصاصها، لضمان أن النص المستخرج دقيق وموثوق. تدعم أكثر من 100 لغة، مما يجعلها حلاً متعدد الاستخدامات لمهام OCR في بيئات متنوعة. يمكن لمطوري البرمجيات استخراج النص من الصور وملفات PDF والمستندات، وإرجاع النص المستخرج بمجموعة متنوعة من الصيغ، مثل JSON وXML والنص العادي. تم تصميمها لتكون خفيفة الوزن ومرنة وسهلة الاستخدام، مما يجعلها خيارًا مثاليًا للمطورين الذين يرغبون في إضافة قدرات OCR إلى مشاريعهم. بفضل قدراتها المتقدمة في معالجة الصور، ودعم اللغات، وآليات معالجة الأخطاء، فهي خيار مثالي للمطورين الذين يرغبون في إضافة قدرات OCR إلى مشاريعهم.

Previous Next

البدء مع Node-Tesseract-OCR

الطريقة الموصى بها لتثبيت Node-Tesseract-OCR هي باستخدام npm. يرجى استخدام الأمر التالي لتثبيت سلس.

تثبيت Node-Tesseract-OCR عبر npm

npm install node-tesseract-ocr 

يمكنك أيضًا تثبيته يدويًا؛ قم بتنزيل أحدث ملفات الإصدار مباشرةً من مستودع GitHub.

استخراج النص من الصور في واجهة برمجة تطبيقات Node.js

مكتبة Node-Tesseract-OCR مفتوحة المصدر تجعل من السهل على مطوري البرمجيات إنشاء تطبيقات تستخرج النص تلقائيًا من الصور داخل تطبيقات Node.js. تدعم استخراج النص من المستندات الممسوحة ضوئيًا، ملفات PDF، صور الكاميرا أو صور الإيصالات. يمكن أن يكون ذلك مفيدًا لإنشاء أرشيفات قابلة للبحث، أتمتة إدخال البيانات، أو معالجة كميات كبيرة من المستندات في قطاعات مثل المالية والرعاية الصحية. إليك مثالًا بسيطًا يوضح كيفية استخراج النص برمجيًا من الصور داخل تطبيقات Node.js.

كيف تستخرج النص من الصور داخل بيئة Node.js؟

const tesseract = require("node-tesseract-ocr");

tesseract.recognize("path/to/image.jpg")
  .then(text => {
    console.log("Recognized Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

معالجة الصور المسبقة بشكل أفضل داخل Node.js

يمكن أن يؤدي المعالجة المسبقة للصور قبل تطبيق OCR إلى تحسين دقة التعرف على النص بشكل كبير. تسمح مكتبة Node-Tesseract-OCR المفتوحة المصدر بتقنيات معالجة مسبقة أساسية، مثل تغيير الحجم، والتحويل إلى ثنائي، وإزالة الانحراف. يمكن تنفيذ هذه الخطوات باستخدام مكتبات Node.js إضافية مثل sharp أو jimp بالتعاون مع Node-Tesseract-OCR. يوضح المثال التالي كيف يستخدم مطورو البرمجيات خطوات المعالجة المسبقة لتحسين التعرف، خاصةً مع الصور ذات الجودة المنخفضة.

كيف تطبق خطوات ما قبل المعالجة لتحسين التعرف عبر واجهة برمجة تطبيقات Node.js؟

const sharp = require("sharp");
const tesseract = require("node-tesseract-ocr");

sharp("path/to/input.jpg")
  .resize(800, 600) // Resize the image
  .greyscale() // Convert to greyscale
  .toBuffer()
  .then(data => {
    return tesseract.recognize(data, { lang: "eng" });
  })
  .then(text => {
    console.log("Preprocessed Image Text:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

النص المعترف به بلغات متعددة

إحدى الميزات البارزة في Node-Tesseract-OCR هي دعمه الواسع للغات المتعددة. تدعم مكتبة Tesseract OCR أكثر من 100 لغة، مما يجعلها خيارًا مثاليًا للتطبيقات التي تحتاج إلى معالجة مستندات بلغات مختلفة. يمكن لمطوري البرمجيات تحديد اللغة (اللغات) التي يرغبون في أن يستخدمها Tesseract، مما يحسن دقة التعرف على النصوص غير الإنجليزية. إليكم مثالًا يوضح كيف يمكن لمطوري البرمجيات التعرف على النص بالفرنسية داخل تطبيقات Node.js؟

كيف يتم التعرف على النص من صورة بالفرنسية عبر واجهة برمجة تطبيقات JavaScript؟

const config = {
  lang: "fra", // French language support
  oem: 1,
  psm: 3
};

tesseract.recognize("path/to/french-text-image.jpg", config)
  .then(text => {
    console.log("Recognized Text in French:", text);
  })
  .catch(error => {
    console.error("Error:", error.message);
  });

 عربي