Безплатна Python библиотека за извличане на съдържание от HTML страници
Отворена Python библиотека за извличане на съдържание от уеб страници като изображения и текст, дата на публикуване, информация за езика и др.
В епохата на дигиталната информация данните са обилни и лесно достъпни в интернет. Извличането на релевантна информация от уебсайтове може да бъде трудоемка задача, но с библиотеката Python-Goose уеб скрейпингът става лесен. Python-Goose е мощна и удобна за потребителя библиотека, която позволява на разработчиците да извличат структурирани данни от уеб страници без усилие. Тя е разработена от Хулиан Морено Патиньо и е проектирана да извлича смислено съдържание, като статии, от уеб страници. Библиотеката използва набор от хевристики и техники за обработка на естествен език, за да анализира HTML документи и да идентифицира релевантното текстово съдържание.
Python-Goose е много лесен за инсталиране и предоставя пълна поддръжка за работа с многоезични уебсайтове. Библиотеката включва възможности за откриване на езика, които автоматично идентифицират езика на съдържанието на уеб страницата. Има няколко важни функции, част от библиотеката, като агрегация на съдържание, извличане на структурирани данни за изследователски и аналитични цели, извличане на видео, генериране на резюмета на статии, предварителна обработка на уеб данни за обучение на модели за машинно обучение, извличане на изображения от уеб страници и много други.
Python-Goose е отворена библиотека, написана на Python, и предоставя прост, но ефективен начин за обработка на задачи за уеб скрейпинг, които целят да извлекат ценна информация от уеб страници в Python приложения. Тя използва различни алгоритми и евристики, за да идентифицира най-релевантния текст и да отхвърля нерелевантните елементи. Независимо дали сте специалист по данни, пазарен изследовател, създавате приложение, базирано на данни, или провеждате изследвания, Python-Goose може значително да оптимизира вашия работен процес и да ви помогне да извлечете ценни прозрения от огромното пространство на интернет.
Започване с Python-Goose
Препоръчителният и най-лесен начин за инсталиране на Python-Goose е чрез Composer, инструмента за управление на зависимости за PHP. Моля, използвайте следната команда за гладка инсталация.
Инсталирайте Python-Goose чрез pip
pip install goose3 Можете също да го инсталирате ръчно; изтеглете последните файлове от последното издание директно от GitHub хранилището.
Извличане на статии с помощта на Python API
Отвореният код на библиотеката Python‑Goose предоставя много полезни функции за зареждане и извличане на съдържание от различни типове уебсайтове. Библиотеката е специализирана в извличането на статии от уеб страници, филтрирайки ненужните елементи като реклами, хедъри, футъри и странични панели. Освен това, тя се фокусира върху извличането на основното съдържание, включително заглавието, текста, автора, датата на публикуване и друга съответна мета информация. Ето много полезен пример, който показва как потребителите могат да зададат URL адреса на уеб страницата, която искат да изтеглят, и лесно да достъпят различни свойства на обекта article, като заглавие, автори, дата на публикуване и почистен текст.
Как да извлечете статии от уебсайт чрез Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Извличане на конкретна информация от уеб страница на множество езици чрез Python
Библиотеката Python-Goose включва функция за откриване на език, позволявайки автоматично да идентифицира езика на съдържанието на уеб страница. Тази функция е особено полезна при работа с многоезични уебсайтове или когато искате да филтрирате съдържанието според езика. Библиотеката позволява на софтуерните разработчици да достъпват определена част от уеб страницата и да я извличат, като например основния текст на статия, изображения на статията, мета описание, мета тагове и др. Следният пример показва как да извлечете или скрейпнете испанско съдържание, използвайки Python код.
Как да извлечете испанско съдържание от уеб страница в Python приложения?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'