Gratis Python-bibliotek for å hente innhold fra HTML-sider
Åpen kildekode Python-bibliotek for å hente innhold fra nettsider som bilder og tekst, publiseringsdato, språkinfo og så videre..
I den digitale informasjonsalderen er data rikelig og lett tilgjengelig på internett. Å trekke ut relevant informasjon fra nettsteder kan være en tungvint oppgave, men med Python-Goose-biblioteket blir nett-skraping en lek. Python-Goose er et robust og brukervennlig bibliotek som lar utviklere enkelt hente strukturert data fra websider. Det ble utviklet av Julian Moreno Patiño og er designet for å hente meningsfullt innhold, som artikler, fra websider. Biblioteket bruker et sett med heuristikker og teknikker for naturlig språkbehandling for å analysere HTML-dokumenter og identifisere relevant tekstlig innhold.
Python-Goose er veldig enkelt å installere og har gitt full støtte for håndtering av flerspråklige nettsteder. Biblioteket inneholder funksjoner for språkdeteksjon, som automatisk identifiserer språket i nettsidens innhold. Det finnes flere viktige funksjoner i biblioteket, som innholdsaggregasjon, uthenting av strukturert data for forsknings- og analyseformål, videoekstraksjon, generering av sammendrag av artikler, forhåndsbehandling av nettdata for trening av maskinlæringsmodeller, uthenting av bilder fra websider, og mange flere.
Python-Goose er et åpen kildekode-bibliotek skrevet i Python og gir en enkel, men effektiv måte å håndtere webskrapingoppgaver på som har som mål å hente verdifull informasjon fra nettsider i Python-applikasjoner. Det bruker ulike algoritmer og heuristikker for å identifisere den mest relevante teksten og forkaste irrelevante elementer. Enten du er datavitenskapsmann, markedsforsker, bygger en datadrevet applikasjon, eller utfører forskning, kan Python-Goose betydelig strømlinjeforme arbeidsflyten din og hjelpe deg med å hente verdifulle innsikter fra internettets enorme omfang.
Kom i gang med Python-Goose
Den anbefalte og enkleste måten å installere Python-Goose på er ved å bruke Composer, avhengighetsadministrasjonsverktøyet for PHP. Vennligst bruk følgende kommando for en smidig installasjon.
Installer Python-Goose via pip
pip install goose3 Du kan også installere manuelt; last ned de nyeste utgivelsesfilene direkte fra GitHub-repoet.
Artikkeluttrekk ved bruk av Python API
Det åpne kildekodebiblioteket Python-Goose har gitt svært nyttige funksjoner for lasting og uttrekking av innhold fra ulike typer nettsteder. Biblioteket er spesialisert på å trekke ut artikler fra websider, og filtrerer bort unødvendige elementer som annonser, topptekster, bunntekster og sidefelt. Videre fokuserer det på å hente kjerneinnholdet, inkludert tittel, tekst, forfatter, publiseringsdato og annen relevant metadata. Her er et svært nyttig eksempel som viser hvordan brukere kan definere URL-en til websiden de ønsker å skrape, og enkelt få tilgang til ulike egenskaper ved artikkelobjektet, som tittel, forfattere, publiseringsdato og renset tekst.
Hvordan hente artikler fra et nettsted via Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Uttrekk spesifikk nettsideinformasjon på flere språk via Python
Python-Goose-biblioteket inneholder funksjonalitet for språkdeteksjon, som gjør det mulig å automatisk identifisere språket i innholdet på en nettside. Denne funksjonen er spesielt nyttig når du håndterer flerspråklige nettsteder eller når du vil filtrere innhold basert på språk. Biblioteket lar programvareutviklere få tilgang til en bestemt del av nettsiden og hente den, for eksempel hovedteksten i en artikkel, bilder i artikkelen, metabeskrivelse, metatagger osv. Følgende eksempel viser hvordan du kan hente eller skrape spansk innhold ved hjelp av Python-kode.
Hvordan hente spansk innhold fra en nettside i Python‑apper?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'