کتابخانهٔ رایگان پایتون برای استخراج محتوا از صفحات HTML
کتابخانهٔ منبع باز پایتون برای استخراج محتویات صفحات وب مانند تصاویر و متن، تاریخ انتشار، اطلاعات زبان و غیره..
در عصر اطلاعات دیجیتال، دادهها به وفور و به راحتی در اینترنت در دسترس هستند. استخراج اطلاعات مرتبط از وبسایتها میتواند کاری دشوار باشد، اما با کتابخانه Python‑Goose، وباسکرپینگ به سادگی انجام میشود. Python‑Goose یک کتابخانه قدرتمند و کاربرپسند است که به توسعهدهندگان امکان استخراج دادههای ساختاریافته از صفحات وب را بهصورت بیدردسر میدهد. این کتابخانه توسط جولیان مورنو پاتینو توسعه یافته و برای استخراج محتوای معنادار، مانند مقالات، از صفحات وب طراحی شده است. این کتابخانه از مجموعهای از هورستیکها و تکنیکهای پردازش زبان طبیعی برای تجزیه و تحلیل اسناد HTML و شناسایی محتوای متنی مرتبط استفاده میکند.
نصب Python‑Goose بسیار آسان است و پشتیبانی کامل برای کار با وبسایتهای چندزبانه فراهم میکند. این کتابخانه قابلیت تشخیص زبان را در بر دارد که بهصورت خودکار زبان محتوای صفحه وب را شناسایی میکند. ویژگیهای مهمی در این کتابخانه وجود دارد، از جمله تجمیع محتوا، استخراج دادههای ساختاریافته برای مقاصد تحقیق و تحلیل، استخراج ویدیو، تولید خلاصهای از مقالات، پیشپردازش دادههای وب برای آموزش مدلهای یادگیری ماشین، استخراج تصاویر از صفحات وب و موارد دیگر.
Python-Goose یک کتابخانه منبع باز نوشته شده با پایتون است و روشی ساده اما مؤثر برای انجام وظایف وباسکریپینگ که هدفشان استخراج اطلاعات ارزشمند از صفحات وب درون برنامههای پایتون است، فراهم میکند. این کتابخانه از الگوریتمها و هورستیکهای مختلف برای شناسایی مرتبطترین متن و حذف عناصر نامرتبط استفاده میکند. چه شما یک دانشمند داده، محقق بازار، در حال ساخت یک برنامه مبتنی بر داده باشید یا تحقیق انجام میدهید، Python‑Goose میتواند بهطور قابلتوجهی جریان کار شما را سادهسازی کند و به شما کمک کند بینشهای ارزشمند را از گستره وسیع اینترنت استخراج کنید.
شروع کار با Python-Goose
روش پیشنهادی و آسان برای نصب Python-Goose استفاده از Composer، ابزار مدیریت وابستگی برای PHP است. لطفاً برای نصب روان از فرمان زیر استفاده کنید.
نصب Python-Goose از طریق pip
pip install goose3 همچنین میتوانید بهصورت دستی؛ فایلهای آخرین نسخه را مستقیماً از مخزن GitHub دانلود کنید.
استخراج مقاله با استفاده از API پایتون
کتابخانه منبع باز Python‑Goose ویژگیهای بسیار مفیدی برای بارگذاری و استخراج محتوا از انواع مختلف وبسایتها فراهم کرده است. این کتابخانه در استخراج مقالات از صفحات وب تخصص دارد و عناصر غیرضروری مانند تبلیغات، سرصفحهها، پاورقیها و نوارهای کناری را فیلتر میکند. علاوه بر این، بر بازیابی محتوای اصلی تمرکز دارد، از جمله عنوان، متن، نویسنده، تاریخ انتشار و سایر متادیتاهای مرتبط. در اینجا یک مثال بسیار مفید آورده شده است که نشان میدهد کاربران چگونه میتوانند URL صفحه وب مورد نظر خود را برای اسکریپتنویسی تعریف کنند و به راحتی به ویژگیهای مختلف شی مقاله، مانند عنوان، نویسندگان، تاریخ انتشار و متن پاکسازیشده دسترسی پیدا کنند.
چگونه مقالات را از یک وبسایت با استفاده از API پایتون استخراج کنیم؟
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
استخراج اطلاعات خاص یک صفحه وب به چندین زبان با پایتون
کتابخانه Python‑Goose شامل قابلیت تشخیص زبان است که به آن امکان میدهد بهصورت خودکار زبان محتوای یک صفحه وب را شناسایی کند. این ویژگی بهویژه هنگام کار با وبسایتهای چندزبانه یا زمانی که میخواهید محتوا را بر اساس زبان فیلتر کنید، مفید است. این کتابخانه به توسعهدهندگان نرمافزار اجازه میدهد به بخش خاصی از صفحه وب دسترسی پیدا کنند و آن را استخراج کنند، مانند متن اصلی یک مقاله، تصاویر مقاله، توضیح متا، برچسبهای متا و غیره. مثال زیر نشان میدهد چگونه میتوان محتوای اسپانیایی را با استفاده از کد پایتون استخراج یا اسکرپ کرد.
چگونه محتوای اسپانیایی را از یک صفحه وب در برنامههای پایتون استخراج کنیم؟
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'