مكتبة بايثون مجانية لاستخراج المحتوى من صفحات HTML
مكتبة بايثون مفتوحة المصدر لاستخراج محتوى صفحات الويب مثل الصور والنصوص، تاريخ النشر، معلومات اللغة، وغيرها..
في عصر المعلومات الرقمية، البيانات وفيرة ومتاحة بسهولة على الإنترنت. استخراج المعلومات ذات الصلة من المواقع قد يكون مهمة شاقة، ولكن مع مكتبة Python-Goose يصبح استخراج الويب سهلًا. Python-Goose هي مكتبة قوية وسهلة الاستخدام تتيح للمطورين استخراج البيانات المنظمة من صفحات الويب بسهولة. تم تطويرها بواسطة جوليان مورينو باتينيو وصُممت لاستخراج المحتوى المفيد، مثل المقالات، من صفحات الويب. تستخدم المكتبة مجموعة من الخوارزميات وتقنيات معالجة اللغة الطبيعية لتحليل مستندات HTML وتحديد المحتوى النصي ذي الصلة.
Python-Goose سهلة جدًا في التثبيت وقد وفرت دعمًا كاملاً للتعامل مع المواقع متعددة اللغات. تدمج المكتبة قدرات اكتشاف اللغة، التي تحدد تلقائيًا لغة محتوى صفحة الويب. هناك العديد من الميزات المهمة في المكتبة، مثل تجميع المحتوى، استخراج البيانات المنظمة لأغراض البحث والتحليل، استخراج الفيديو، إنشاء ملخصات للمقالات، معالجة بيانات الويب مسبقًا لتدريب نماذج التعلم الآلي، استخراج الصور من صفحات الويب، والعديد غيرها.
Python-Goose هي مكتبة مفتوحة المصدر مكتوبة بلغة بايثون وتوفر طريقة بسيطة وفعّالة للتعامل مع مهام استخراج البيانات من الويب التي تهدف إلى استخراج معلومات قيمة من صفحات الويب داخل تطبيقات بايثون. تستخدم خوارزميات وإحصاءات مختلفة لتحديد النص الأكثر صلة وتجاهل العناصر غير ذات الصلة. سواء كنت عالم بيانات أو باحث سوق أو تبني تطبيقًا يعتمد على البيانات أو تجري بحثًا، يمكن لـ Python-Goose أن يبسط سير عملك بشكل كبير ويساعدك على استخراج رؤى قيمة من الامتداد الواسع للإنترنت.
البدء مع Python-Goose
الطريقة الموصى بها والأسهل لتثبيت Python-Goose هي باستخدام Composer، أداة إدارة الاعتمادات للـ PHP. يرجى استخدام الأمر التالي لتثبيت سلس.
تثبيت Python-Goose عبر pip
pip install goose3 يمكنك أيضًا تثبيته يدويًا؛ قم بتحميل أحدث ملفات الإصدار مباشرةً من مستودع GitHub.
استخراج المقالات باستخدام واجهة برمجة تطبيقات Python
توفر مكتبة Python-Goose المفتوحة المصدر ميزات مفيدة جدًا لتحميل واستخراج المحتوى من أنواع مختلفة من المواقع الإلكترونية. تتخصص المكتبة في استخراج المقالات من صفحات الويب، وتصفية العناصر غير الضرورية مثل الإعلانات، والرؤوس، والتذييلات، والشريط الجانبي. علاوة على ذلك، تركز على استرجاع المحتوى الأساسي، بما في ذلك العنوان، والنص، والمؤلف، وتاريخ النشر، وغيرها من البيانات الوصفية ذات الصلة. إليكم مثالًا مفيدًا يوضح كيف يمكن للمستخدمين تحديد عنوان URL للصفحة التي يرغبون في استخراجها ويمكنهم بسهولة الوصول إلى مختلف خصائص كائن المقال، مثل العنوان، والمؤلفين، وتاريخ النشر، والنص المنقح.
كيف يمكن استخراج المقالات من موقع ويب عبر واجهة برمجة تطبيقات Python؟
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
استخراج معلومات صفحة ويب معينة بعدة لغات عبر Python
تدمج مكتبة Python-Goose وظيفة اكتشاف اللغة، مما يسمح لها بتحديد لغة محتوى صفحة الويب تلقائيًا. هذه الميزة مفيدة بشكل خاص عند التعامل مع مواقع متعددة اللغات أو عندما تريد تصفية المحتوى بناءً على اللغة. تتيح المكتبة للمطورين الوصول إلى جزء معين من صفحة الويب واستخراجه مثل النص الرئيسي للمقال، صور المقال، الوصف التعريفي، العلامات التعريفية، وما إلى ذلك. يوضح المثال التالي كيفية استخراج أو جمع محتوى إسباني باستخدام كود بايثون.
كيف يمكن استخراج المحتوى الإسباني من صفحة ويب داخل تطبيقات Python؟
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'