Бесплатная библиотека Python для извлечения содержимого из HTML‑страниц
Открытая библиотека Python для извлечения содержимого веб-страниц, такого как изображения и текст, дата публикации, информация о языке и т.д.
В эпоху цифровой информации данные изобилуют и легко доступны в интернете. Извлечение релевантной информации с веб‑сайтов может быть трудоёмкой задачей, но с библиотекой Python‑Goose веб‑скрапинг становится простым. Python‑Goose — это надёжная и удобная библиотека, позволяющая разработчикам без усилий извлекать структурированные данные со страниц. Она была разработана Хулианом Морено Патиньо и предназначена для извлечения значимого контента, такого как статьи, с веб‑страниц. Библиотека использует набор эвристик и методов обработки естественного языка для анализа HTML‑документов и выявления релевантного текстового контента.
Python‑Goose очень проста в установке и предоставляет полную поддержку работы с многоязычными сайтами. Библиотека включает возможности определения языка, автоматически определяя язык контента веб‑страницы. В неё входит несколько важных функций, таких как агрегация контента, извлечение структурированных данных для исследований и аналитики, извлечение видео, генерация резюме статей, предобработка веб‑данных для обучения моделей машинного обучения, извлечение изображений с веб‑страниц и многое другое.
Python-Goose — это открытая библиотека, написанная на Python, и предоставляет простой, но эффективный способ выполнения задач веб‑скрейпинга, направленных на извлечение ценной информации из веб‑страниц внутри Python‑приложений. Она использует различные алгоритмы и эвристики для определения наиболее релевантного текста и отбрасывания нерелевантных элементов. Будь вы специалистом по данным, исследователем рынка, разрабатываете приложение, основанное на данных, или проводите исследование, Python-Goose может значительно упростить ваш рабочий процесс и помочь извлечь ценные инсайты из огромного пространства интернета.
Начало работы с Python-Goose
Рекомендуемый и самый простой способ установить Python-Goose — использовать Composer, инструмент управления зависимостями для PHP. Пожалуйста, используйте следующую команду для плавной установки.
Установите Python-Goose через pip
pip install goose3 Вы также можете установить его вручную; загрузите последние файлы релиза напрямую из репозитория GitHub.
Извлечение статей с помощью Python API
Библиотека с открытым исходным кодом Python-Goose предоставляет очень полезные возможности для загрузки и извлечения содержимого с различных типов веб‑сайтов. Библиотека специализируется на извлечении статей со страниц, фильтруя ненужные элементы, такие как реклама, заголовки, подвал и боковые панели. Кроме того, она сосредоточена на получении основного контента, включая заголовок, текст, автора, дату публикации и другие релевантные метаданные. Ниже приведён очень полезный пример, показывающий, как пользователи могут задать URL веб‑страницы, которую они хотят скрапить, и легко получить доступ к различным свойствам объекта статьи, таким как заголовок, авторы, дата публикации и очищенный текст.
Как извлечь статьи с веб‑сайта с помощью Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Извлечение конкретной информации со страницы на нескольких языках с помощью Python
Библиотека Python-Goose включает функцию определения языка, позволяя автоматически идентифицировать язык содержимого веб-страницы. Эта возможность особенно полезна при работе с многоязычными сайтами или когда необходимо фильтровать контент по языку. Библиотека позволяет разработчикам программного обеспечения получать доступ к определённой части веб-страницы и извлекать её, например основной текст статьи, изображения статьи, мета‑описание, мета‑теги и т.д. Ниже приведён пример, показывающий, как извлечь или собрать испанский контент с помощью кода на Python.
Как извлечь испанский контент со страницы в приложениях Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'