Gratis Python-bibliotek til at udtrække indhold fra HTML-sider
Open source Python-bibliotek til at udtrække websiders indhold såsom billeder og tekst, udgivelsesdato, sproginfo og så videre..
I den digitale informationsalder er data rigelige og let tilgængelige på internettet. At udtrække relevant information fra hjemmesider kan være en besværlig opgave, men med Python-Goose-biblioteket bliver webscraping en leg. Python-Goose er et robust og brugervenligt bibliotek, der gør det muligt for udviklere at udtrække strukturerede data fra websider uden besvær. Det blev udviklet af Julian Moreno Patiño og er designet til at udtrække meningsfuldt indhold, såsom artikler, fra websider. Biblioteket bruger et sæt heuristikker og teknikker inden for naturlig sprogbehandling til at analysere HTML-dokumenter og identificere relevant tekstindhold.
Python-Goose er meget nemt at installere og har leveret fuld support til håndtering af flersprogede hjemmesider. Biblioteket indeholder funktioner til sprogdetektion, som automatisk identificerer sproget i websidens indhold. Der er flere vigtige funktioner som en del af biblioteket, såsom indholdsaggregation, udtrækning af strukturerede data til forsknings- og analyseformål, videoudtrækning, generering af sammendrag af artikler, forbehandling af webdata til træning af maskinlæringsmodeller, udtrækning af billeder fra websider og meget mere.
Python-Goose er et open source-bibliotek skrevet i Python og giver en enkel, men effektiv måde at håndtere webscraping-opgaver på, som har til formål at udtrække værdifuld information fra websider i Python-applikationer. Det anvender forskellige algoritmer og heuristikker til at identificere den mest relevante tekst og udelade irrelevante elementer. Uanset om du er datalog, markedsforsker, bygger en datadrevet applikation eller udfører forskning, kan Python-Goose betydeligt strømline din arbejdsproces og hjælpe dig med at udtrække værdifulde indsigter fra internettets enorme omfang.
Kom i gang med Python-Goose
Den anbefalede og nemmeste måde at installere Python-Goose på er ved at bruge Composer, afhængighedsstyringsværktøjet til PHP. Brug venligst følgende kommando for en problemfri installation.
Installer Python-Goose via pip
pip install goose3 Du kan også installere det manuelt; download de seneste udgivelsesfiler direkte fra GitHub-repository.
Artikeludtræk ved hjælp af Python API
Det open source Python-Goose-bibliotek har leveret meget nyttige funktioner til indlæsning og udtrækning af indhold fra forskellige typer af hjemmesider. Biblioteket specialiserer sig i at udtrække artikler fra websider og filtrere unødvendige elementer som reklamer, header, footer og sidebjælker. Desuden fokuserer det på at hente kerneindholdet, herunder titel, tekst, forfatter, udgivelsesdato og andre relevante metadata. Her er et meget nyttigt eksempel, der viser, hvordan brugere kan definere URL'en på den webside, de ønsker at skrabe, og nemt få adgang til forskellige egenskaber ved artikelobjektet, såsom titel, forfattere, udgivelsesdato og renset tekst.
Hvordan udtrækker man artikler fra et websted via Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Udtræk specifik websideinformation på flere sprog via Python
Python-Goose-biblioteket indeholder funktionalitet til sprogdetektion, så det automatisk kan identificere sproget i en websides indhold. Denne funktion er særligt nyttig, når man arbejder med flersprogede websteder eller når man ønsker at filtrere indhold baseret på sprog. Biblioteket giver softwareudviklere adgang til en bestemt del af websiden og kan udtrække den, såsom hovedteksten i en artikel, billeder i artiklen, meta‑beskrivelse, meta‑tags osv. Følgende eksempel viser, hvordan man udtrækker eller scraper spansk indhold ved hjælp af Python‑kode.
Hvordan udtrækker man spansk indhold fra en webside i Python‑apps?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'