Biblioteca Python gratuita para extraer contenidos de páginas HTML
Biblioteca Python de código abierto para extraer contenidos de páginas web como imágenes y texto, fecha de publicación, información de idioma, entre otros..
En la era de la información digital, los datos son abundantes y están fácilmente disponibles en internet. Extraer información relevante de los sitios web puede ser una tarea engorrosa, pero con la biblioteca Python-Goose, el web scraping se vuelve sencillo. Python-Goose es una biblioteca robusta y fácil de usar que permite a los desarrolladores extraer datos estructurados de las páginas web sin esfuerzo. Fue desarrollada por Julian Moreno Patiño y está diseñada para extraer contenido significativo, como artículos, de las páginas web. La biblioteca utiliza un conjunto de heurísticas y técnicas de procesamiento de lenguaje natural para analizar documentos HTML e identificar contenido textual relevante.
Python-Goose es muy fácil de instalar y ha proporcionado soporte completo para manejar sitios web multilingües. La biblioteca incorpora capacidades de detección de idioma, que identifican automáticamente el idioma del contenido de la página web. Hay varias características importantes de la biblioteca, como la agregación de contenido, la extracción de datos estructurados para fines de investigación y análisis, la extracción de videos, la generación de resúmenes de artículos, el preprocesamiento de datos web para entrenar modelos de aprendizaje automático, la extracción de imágenes de páginas web y muchas más.
Python-Goose es una biblioteca de código abierto escrita en Python y proporciona una forma simple pero eficaz de manejar tareas de raspado web que buscan extraer información valiosa de páginas web dentro de aplicaciones Python. Emplea varios algoritmos y heurísticas para identificar el texto más relevante y descartar elementos irrelevantes. Ya sea que seas científico de datos, investigador de mercado, estés construyendo una aplicación basada en datos o realizando una investigación, Python-Goose puede simplificar significativamente tu flujo de trabajo y ayudarte a extraer conocimientos valiosos del vasto extenso de Internet.
Comenzando con Python-Goose
La forma recomendada y más fácil de instalar Python-Goose es usando Composer, la herramienta de gestión de dependencias para PHP. Por favor, use el siguiente comando para una instalación sin problemas.
Instalar Python-Goose vía pip
pip install goose3 También puede instalarlo manualmente; descargue los archivos de la última versión directamente del repositorio GitHub.
Extracción de artículos usando la API de Python
La biblioteca de código abierto Python-Goose ha proporcionado funciones muy útiles para cargar y extraer contenidos de varios tipos de sitios web. La biblioteca se especializa en extraer artículos de páginas web, filtrando elementos innecesarios como anuncios, encabezados, pies de página y barras laterales. Además, se centra en recuperar el contenido principal, incluido el título, el texto, el autor, la fecha de publicación y otros metadatos relevantes. Aquí hay un ejemplo muy útil que muestra cómo los usuarios pueden definir la URL de la página web que desean rastrear y acceder fácilmente a varias propiedades del objeto artículo, como el título, los autores, la fecha de publicación y el texto limpio.
¿Cómo extraer artículos de un sitio web mediante la API de Python?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Extraer información específica de una página web en varios idiomas mediante Python
La biblioteca Python-Goose incorpora funcionalidad de detección de idioma, lo que le permite identificar automáticamente el idioma del contenido de una página web. Esta característica es particularmente útil al trabajar con sitios web multilingües o cuando se desea filtrar contenido según el idioma. La biblioteca permite a los desarrolladores de software acceder a una parte específica de la página y extraerla, como el texto principal de un artículo, imágenes del artículo, la descripción meta, etiquetas meta, etc. El siguiente ejemplo muestra cómo extraer o raspar contenido en español usando código Python.
¿Cómo extraer contenido en español de una página web dentro de aplicaciones Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'