1. Produkte
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Kostenlose Python-Bibliothek zum Extrahieren von Inhalten aus HTML-Seiten

Open-Source-Python-Bibliothek zum Extrahieren von Webseiteninhalten wie Bildern & Text, Veröffentlichungsdatum, Sprachinformationen und so weiter.

Im Zeitalter der digitalen Information sind Daten im Überfluss vorhanden und im Internet leicht zugänglich. Das Extrahieren relevanter Informationen von Websites kann eine mühsame Aufgabe sein, aber mit der Python-Goose-Bibliothek wird Web Scraping zum Kinderspiel. Python-Goose ist eine robuste und benutzerfreundliche Bibliothek, die Entwicklern ermöglicht, strukturierte Daten von Webseiten mühelos zu extrahieren. Sie wurde von Julian Moreno Patiño entwickelt und ist darauf ausgelegt, sinnvolle Inhalte, wie Artikel, von Webseiten zu extrahieren. Die Bibliothek verwendet eine Reihe von Heuristiken und Techniken der natürlichen Sprachverarbeitung, um HTML-Dokumente zu analysieren und relevante Textinhalte zu identifizieren.

Python-Goose ist sehr einfach zu installieren und bietet umfassende Unterstützung für die Verarbeitung mehrsprachiger Websites. Die Bibliothek integriert Funktionen zur Spracherkennung, die automatisch die Sprache des Inhalts einer Webseite identifizieren. Es gibt mehrere wichtige Funktionen der Bibliothek, wie Inhaltsaggregation, das Extrahieren strukturierter Daten für Forschungs- und Analysezwecke, Videoextraktion, das Erzeugen von Zusammenfassungen von Artikeln, die Vorverarbeitung von Webdaten für das Training von Machine-Learning-Modellen, das Extrahieren von Bildern aus Webseiten und vieles mehr.

Python-Goose ist eine Open-Source-Bibliothek, die in Python geschrieben ist und eine einfache, aber effektive Methode bietet, Web‑Scraping‑Aufgaben zu erledigen, die darauf abzielen, wertvolle Informationen aus Webseiten innerhalb von Python‑Anwendungen zu extrahieren. Sie verwendet verschiedene Algorithmen und Heuristiken, um den relevantesten Text zu identifizieren und irrelevante Elemente zu verwerfen. Egal, ob Sie Datenwissenschaftler, Marktforscher, Entwickler einer datengetriebenen Anwendung sind oder Forschung betreiben, kann Python‑Goose Ihren Arbeitsablauf erheblich vereinfachen und Ihnen helfen, wertvolle Erkenntnisse aus dem riesigen Internet zu gewinnen.

Previous Next

Erste Schritte mit Python-Goose

Die empfohlene und einfachste Methode, Python-Goose zu installieren, ist die Verwendung von Composer, dem Abhängigkeits‑Management‑Tool für PHP. Bitte verwenden Sie den folgenden Befehl für eine reibungslose Installation.

Python-Goose über pip installieren

pip install goose3 

Sie können es auch manuell installieren; laden Sie die neuesten Release‑Dateien direkt aus dem GitHub-Repository herunter.

Artikel-Extraktion mit der Python-API

Die Open-Source-Python-Goose-Bibliothek bietet sehr nützliche Funktionen zum Laden und Extrahieren von Inhalten aus verschiedenen Arten von Websites. Die Bibliothek ist darauf spezialisiert, Artikel von Webseiten zu extrahieren und unnötige Elemente wie Werbung, Header, Footer und Seitenleisten herauszufiltern. Darüber hinaus konzentriert sie sich darauf, den Kerninhalt abzurufen, einschließlich Titel, Text, Autor, Veröffentlichungsdatum und anderer relevanter Metadaten. Hier ist ein sehr nützliches Beispiel, das zeigt, wie Benutzer die URL der Webseite, die sie scrapen möchten, definieren können und leicht auf verschiedene Eigenschaften des Artikelobjekts zugreifen können, wie Titel, Autoren, Veröffentlichungsdatum und bereinigten Text.

Wie extrahiere ich Artikel von einer Website über die Python-API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Bestimmte Webseiteninformationen in mehreren Sprachen mit Python extrahieren

Die Python-Goose-Bibliothek integriert eine Sprachenerkennungsfunktion, die es ermöglicht, die Sprache des Inhalts einer Webseite automatisch zu identifizieren. Diese Funktion ist besonders nützlich beim Umgang mit mehrsprachigen Websites oder wenn Sie Inhalte nach Sprache filtern möchten. Die Bibliothek erlaubt Softwareentwicklern, auf einen bestimmten Teil der Webseite zuzugreifen und diesen zu extrahieren, z. B. den Haupttext eines Artikels, Bilder des Artikels, Meta‑Beschreibung, Meta‑Tags und so weiter. Das folgende Beispiel zeigt, wie man spanische Inhalte mit Python‑Code extrahiert oder scrapt.

Wie extrahiere ich spanischen Inhalt von einer Webseite in Python-Anwendungen?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Deutsch