1. Продукти
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Безкоштовна бібліотека Python для витягування вмісту з HTML‑сторінок

Відкрита бібліотека Python для витягування вмісту веб-сторінок, такого як зображення та текст, дата публікації, інформація про мову тощо.

У епоху цифрової інформації дані є надмірними та легко доступними в інтернеті. Витягування релевантної інформації з веб-сайтів може бути складним завданням, але за допомогою бібліотеки Python-Goose веб-скрапінг стає простим. Python-Goose — це потужна та зручна у використанні бібліотека, яка дозволяє розробникам без зусиль витягувати структуровані дані зі сторінок вебу. Вона була розроблена Джуліаном Морено Патіно і призначена для вилучення змістовного контенту, такого як статті, зі сторінок. Бібліотека використовує набір евристик та технології обробки природної мови для аналізу HTML‑документів і визначення релевантного текстового контенту.

Python-Goose дуже легко встановити, і вона забезпечує повну підтримку обробки багатомовних веб-сайтів. Бібліотека включає можливості визначення мови, які автоматично ідентифікують мову контенту веб-сторінки. Є кілька важливих функцій бібліотеки, таких як агрегація контенту, витягування структурованих даних для досліджень та аналізу, витягування відео, створення резюме статей, попередня обробка веб-даних для навчання моделей машинного навчання, витягування зображень зі сторінок та багато іншого.

Python-Goose — це бібліотека з відкритим кодом, написана на Python, і забезпечує простий, але ефективний спосіб виконання завдань веб-скрапінгу, спрямованих на отримання цінної інформації зі сторінок веб‑сайтів у Python‑додатках. Вона використовує різноманітні алгоритми та евристики для визначення найрелевантнішого тексту та відкидання непотрібних елементів. Незалежно від того, чи ви — дата‑науковець, маркетинговий дослідник, створюєте додаток, орієнтований на дані, чи проводите дослідження, Python-Goose може значно спростити ваш робочий процес і допомогти отримати цінні інсайти з безмежного простору інтернету.

Previous Next

Початок роботи з Python-Goose

Рекомендованим та найпростішим способом встановлення Python-Goose є використання Composer, інструменту керування залежностями для PHP. Будь ласка, використайте наступну команду для плавної інсталяції.

Встановіть Python-Goose через pip

pip install goose3 

Ви також можете встановити його вручну; завантажте останні файли релізу безпосередньо з репозиторію GitHub.

Витяг статей за допомогою Python API

Відкрита бібліотека Python-Goose надала дуже корисні функції для завантаження та витягнення вмісту з різних типів веб‑сайтів. Бібліотека спеціалізується на вилученні статей з веб‑сторінок, фільтруючи непотрібні елементи, такі як реклама, заголовки, підвал та бокові панелі. Крім того, вона зосереджена на отриманні основного контенту, включаючи заголовок, текст, автора, дату публікації та інші релевантні метадані. Ось дуже корисний приклад, який показує, як користувачі можуть визначити URL веб‑сторінки, яку вони хочуть скрапити, і легко отримати різні властивості об’єкта статті, такі як заголовок, автори, дата публікації та очищений текст.

Як витягнути статті з веб-сайту за допомогою Python API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Витяг конкретної інформації зі сторінки веб-сайту кількома мовами за допомогою Python

Бібліотека Python-Goose включає функціональність визначення мови, що дозволяє автоматично ідентифікувати мову вмісту веб-сторінки. Ця можливість особливо корисна при роботі з багатомовними сайтами або коли потрібно фільтрувати вміст за мовою. Бібліотека дозволяє розробникам програмного забезпечення отримувати доступ до певної частини веб-сторінки та витягувати її, наприклад, основний текст статті, зображення статті, мета‑опис, мета‑теги тощо. Нижче наведено приклад, який показує, як витягнути або скрапити іспанський вміст за допомогою коду Python.

Як витягнути іспанський контент зі сторінки веб-сайту у Python-додатках?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Українська