1. محصولات
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

کتابخانهٔ رایگان پایتون برای استخراج محتوا از صفحات HTML

کتابخانهٔ منبع باز پایتون برای استخراج محتویات صفحات وب مانند تصاویر و متن، تاریخ انتشار، اطلاعات زبان و غیره..

در عصر اطلاعات دیجیتال، داده‌ها به وفور و به راحتی در اینترنت در دسترس هستند. استخراج اطلاعات مرتبط از وب‌سایت‌ها می‌تواند کاری دشوار باشد، اما با کتابخانه Python‑Goose، وب‌اسکرپینگ به سادگی انجام می‌شود. Python‑Goose یک کتابخانه قدرتمند و کاربرپسند است که به توسعه‌دهندگان امکان استخراج داده‌های ساختاریافته از صفحات وب را به‌صورت بی‌دردسر می‌دهد. این کتابخانه توسط جولیان مورنو پاتینو توسعه یافته و برای استخراج محتوای معنادار، مانند مقالات، از صفحات وب طراحی شده است. این کتابخانه از مجموعه‌ای از هورستیک‌ها و تکنیک‌های پردازش زبان طبیعی برای تجزیه و تحلیل اسناد HTML و شناسایی محتوای متنی مرتبط استفاده می‌کند.

نصب Python‑Goose بسیار آسان است و پشتیبانی کامل برای کار با وب‌سایت‌های چندزبانه فراهم می‌کند. این کتابخانه قابلیت تشخیص زبان را در بر دارد که به‌صورت خودکار زبان محتوای صفحه وب را شناسایی می‌کند. ویژگی‌های مهمی در این کتابخانه وجود دارد، از جمله تجمیع محتوا، استخراج داده‌های ساختاریافته برای مقاصد تحقیق و تحلیل، استخراج ویدیو، تولید خلاصه‌ای از مقالات، پیش‌پردازش داده‌های وب برای آموزش مدل‌های یادگیری ماشین، استخراج تصاویر از صفحات وب و موارد دیگر.

Python-Goose یک کتابخانه منبع باز نوشته شده با پایتون است و روشی ساده اما مؤثر برای انجام وظایف وب‌اسکریپینگ که هدفشان استخراج اطلاعات ارزشمند از صفحات وب درون برنامه‌های پایتون است، فراهم می‌کند. این کتابخانه از الگوریتم‌ها و هورستیک‌های مختلف برای شناسایی مرتبط‌ترین متن و حذف عناصر نامرتبط استفاده می‌کند. چه شما یک دانشمند داده، محقق بازار، در حال ساخت یک برنامه مبتنی بر داده باشید یا تحقیق انجام می‌دهید، Python‑Goose می‌تواند به‌طور قابل‌توجهی جریان کار شما را ساده‌سازی کند و به شما کمک کند بینش‌های ارزشمند را از گستره وسیع اینترنت استخراج کنید.

Previous Next

شروع کار با Python-Goose

روش پیشنهادی و آسان برای نصب Python-Goose استفاده از Composer، ابزار مدیریت وابستگی برای PHP است. لطفاً برای نصب روان از فرمان زیر استفاده کنید.

نصب Python-Goose از طریق pip

pip install goose3 

همچنین می‌توانید به‌صورت دستی؛ فایل‌های آخرین نسخه را مستقیماً از مخزن GitHub دانلود کنید.

استخراج مقاله با استفاده از API پایتون

کتابخانه منبع باز Python‑Goose ویژگی‌های بسیار مفیدی برای بارگذاری و استخراج محتوا از انواع مختلف وب‌سایت‌ها فراهم کرده است. این کتابخانه در استخراج مقالات از صفحات وب تخصص دارد و عناصر غیرضروری مانند تبلیغات، سرصفحه‌ها، پاورقی‌ها و نوارهای کناری را فیلتر می‌کند. علاوه بر این، بر بازیابی محتوای اصلی تمرکز دارد، از جمله عنوان، متن، نویسنده، تاریخ انتشار و سایر متادیتاهای مرتبط. در اینجا یک مثال بسیار مفید آورده شده است که نشان می‌دهد کاربران چگونه می‌توانند URL صفحه وب مورد نظر خود را برای اسکریپت‌نویسی تعریف کنند و به راحتی به ویژگی‌های مختلف شی مقاله، مانند عنوان، نویسندگان، تاریخ انتشار و متن پاک‌سازی‌شده دسترسی پیدا کنند.

چگونه مقالات را از یک وب‌سایت با استفاده از API پایتون استخراج کنیم؟

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

استخراج اطلاعات خاص یک صفحه وب به چندین زبان با پایتون

کتابخانه Python‑Goose شامل قابلیت تشخیص زبان است که به آن امکان می‌دهد به‌صورت خودکار زبان محتوای یک صفحه وب را شناسایی کند. این ویژگی به‌ویژه هنگام کار با وب‌سایت‌های چندزبانه یا زمانی که می‌خواهید محتوا را بر اساس زبان فیلتر کنید، مفید است. این کتابخانه به توسعه‌دهندگان نرم‌افزار اجازه می‌دهد به بخش خاصی از صفحه وب دسترسی پیدا کنند و آن را استخراج کنند، مانند متن اصلی یک مقاله، تصاویر مقاله، توضیح متا، برچسب‌های متا و غیره. مثال زیر نشان می‌دهد چگونه می‌توان محتوای اسپانیایی را با استفاده از کد پایتون استخراج یا اسکرپ کرد.

چگونه محتوای اسپانیایی را از یک صفحه وب در برنامه‌های پایتون استخراج کنیم؟

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 فارسی