1. Producten
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Gratis Python-bibliotheek om inhoud van HTML-pagina's te extraheren

Open source Python-bibliotheek voor het extraheren van webpagina-inhoud zoals afbeeldingen en tekst, publicatiedatum, taalinfo en meer.

In het tijdperk van digitale informatie is data overvloedig en gemakkelijk beschikbaar op internet. Het extraheren van relevante informatie van websites kan een omslachtige taak zijn, maar met de Python-Goose-bibliotheek wordt webscraping een fluitje van een cent. Python-Goose is een robuuste en gebruiksvriendelijke bibliotheek die ontwikkelaars in staat stelt gestructureerde gegevens moeiteloos van webpagina's te extraheren. Het is ontwikkeld door Julian Moreno Patiño en is ontworpen om betekenisvolle inhoud, zoals artikelen, van webpagina's te extraheren. De bibliotheek maakt gebruik van een reeks heuristieken en technieken voor natuurlijke taalverwerking om HTML-documenten te analyseren en relevante tekstuele inhoud te identificeren.

Python-Goose is zeer gemakkelijk te installeren en biedt volledige ondersteuning voor het omgaan met meertalige websites. De bibliotheek bevat mogelijkheden voor taaldetectie, die automatisch de taal van de inhoud van de webpagina identificeren. Er zijn verschillende belangrijke functies onderdeel van de bibliotheek, zoals contentaggregatie, het extraheren van gestructureerde gegevens voor onderzoeks- en analyse doeleinden, video-extractie, het genereren van samenvattingen van artikelen, het voorbewerken van webgegevens voor het trainen van machine learning-modellen, het extraheren van afbeeldingen van webpagina's, en nog veel meer.

Python-Goose is een open source bibliotheek geschreven in Python en biedt een eenvoudige maar effectieve manier om webscraping‑taken af te handelen die gericht zijn op het extraheren van waardevolle informatie van webpagina's binnen Python‑toepassingen. Het maakt gebruik van verschillende algoritmen en heuristieken om de meest relevante tekst te identificeren en irrelevante elementen te negeren. Of u nu data‑wetenschapper, marktonderzoeker bent, een data‑gedreven applicatie bouwt of onderzoek doet, Python-Goose kan uw workflow aanzienlijk stroomlijnen en u helpen waardevolle inzichten uit de enorme uitgestrektheid van het internet te halen.

Previous Next

Aan de slag met Python-Goose

De aanbevolen en eenvoudigste manier om Python-Goose te installeren is via Composer, de dependency‑managementtool voor PHP. Gebruik alstublieft het volgende commando voor een soepele installatie.

Installeer Python-Goose via pip

pip install goose3 

U kunt het ook handmatig installeren; download de nieuwste releasebestanden rechtstreeks van de GitHub repository.

Artikelextractie met Python API

De open source Python-Goose bibliotheek biedt zeer nuttige functies voor het laden en extraheren van inhoud van verschillende soorten websites. De bibliotheek is gespecialiseerd in het extraheren van artikelen van webpagina's, waarbij onnodige elementen zoals advertenties, kopteksten, voetteksten en zijbalken worden gefilterd. Bovendien richt het zich op het ophalen van de kerninhoud, inclusief de titel, tekst, auteur, publicatiedatum en andere relevante metadata. Hier is een zeer nuttig voorbeeld dat laat zien hoe gebruikers de URL van de webpagina die ze willen scrapen kunnen definiëren en gemakkelijk toegang hebben tot verschillende eigenschappen van het artikelobject, zoals de titel, auteurs, publicatiedatum en opgeschoonde tekst.

Hoe artikelen van een website extraheren via de Python API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Specifieke webpagina-informatie extraheren in meerdere talen via Python

De Python-Goose-bibliotheek bevat functionaliteit voor taaldetectie, waardoor deze automatisch de taal van de inhoud van een webpagina kan identificeren. Deze functie is bijzonder nuttig bij het werken met meertalige websites of wanneer je inhoud op basis van taal wilt filteren. De bibliotheek stelt softwareontwikkelaars in staat om een specifiek deel van de webpagina te benaderen en te extraheren, zoals de hoofdtekst van een artikel, afbeeldingen van het artikel, meta‑beschrijving, meta‑tags, enzovoort. Het volgende voorbeeld laat zien hoe je Spaanse inhoud kunt extraheren of scrapen met Python‑code.

Hoe Spaanse inhoud van een webpagina extraheren binnen Python-apps?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Dutch