1. Des produits
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Bibliothèque Python gratuite pour extraire le contenu des pages HTML

Bibliothèque Python open source pour extraire le contenu des pages Web comme les images et le texte, la date de publication, les informations de langue, etc.

À l'ère de l'information numérique, les données sont abondantes et facilement accessibles sur Internet. Extraire des informations pertinentes des sites web peut être une tâche fastidieuse, mais avec la bibliothèque Python‑Goose, le scraping web devient un jeu d'enfant. Python‑Goose est une bibliothèque robuste et conviviale qui permet aux développeurs d'extraire des données structurées des pages web sans effort. Elle a été développée par Julian Moreno Patiño et est conçue pour extraire du contenu significatif, tel que des articles, des pages web. La bibliothèque utilise un ensemble d'heuristiques et de techniques de traitement du langage naturel pour analyser les documents HTML et identifier le contenu textuel pertinent.

Python‑Goose est très facile à installer et offre un support complet pour la gestion des sites multilingues. La bibliothèque intègre des capacités de détection de langue, qui identifient automatiquement la langue du contenu de la page web. Plusieurs fonctionnalités importantes font partie de la bibliothèque, telles que l'agrégation de contenu, l'extraction de données structurées à des fins de recherche et d'analyse, l'extraction de vidéos, la génération de résumés d'articles, le prétraitement des données web pour l'entraînement de modèles d'apprentissage automatique, l'extraction d'images des pages web, et bien plus encore.

Python-Goose est une bibliothèque open source écrite en Python et offre une méthode simple mais efficace pour gérer les tâches de scraping web visant à extraire des informations précieuses des pages web au sein des applications Python. Elle utilise divers algorithmes et heuristiques pour identifier le texte le plus pertinent et éliminer les éléments non pertinents. Que vous soyez data scientist, chercheur de marché, développeur d'une application axée sur les données, ou que vous meniez des recherches, Python-Goose peut considérablement rationaliser votre flux de travail et vous aider à extraire des insights précieux de l'immense étendue d'Internet.

Previous Next

Premiers pas avec Python-Goose

La méthode recommandée et la plus simple pour installer Python-Goose est d'utiliser Composer, l'outil de gestion des dépendances pour PHP. Veuillez utiliser la commande suivante pour une installation fluide.

Installer Python-Goose via pip

pip install goose3 

Vous pouvez également l'installer manuellement ; téléchargez les derniers fichiers de version directement depuis le dépôt GitHub.

Extraction d'articles à l'aide de l'API Python

La bibliothèque open source Python-Goose offre des fonctionnalités très utiles pour charger et extraire le contenu de divers types de sites web. Elle se spécialise dans l'extraction d'articles à partir de pages web, en filtrant les éléments inutiles tels que les publicités, les en-têtes, les pieds de page et les barres latérales. De plus, elle se concentre sur la récupération du contenu principal, incluant le titre, le texte, l'auteur, la date de publication et d'autres métadonnées pertinentes. Voici un exemple très utile qui montre comment les utilisateurs peuvent définir l'URL de la page web qu'ils souhaitent scraper et accéder facilement à diverses propriétés de l'objet article, telles que le titre, les auteurs, la date de publication et le texte nettoyé.

Comment extraire des articles d'un site Web via l'API Python ?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Extraire des informations spécifiques d'une page Web en plusieurs langues via Python

La bibliothèque Python-Goose intègre une fonctionnalité de détection de langue, lui permettant d'identifier automatiquement la langue du contenu d'une page Web. Cette fonctionnalité est particulièrement utile lorsqu'on travaille avec des sites multilingues ou lorsqu'on souhaite filtrer le contenu en fonction de la langue. La bibliothèque permet aux développeurs de logiciels d'accéder à une partie particulière de la page Web et de l'extraire, comme le texte principal d'un article, les images de l'article, la méta description, les balises méta, etc. L'exemple suivant montre comment extraire ou scraper un contenu en espagnol à l'aide de code Python.

Comment extraire du contenu espagnol d'une page Web dans les applications Python ?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Français