Gratis Python-bibliotek för att extrahera innehåll från HTML-sidor
Öppen källkod Python-bibliotek för att extrahera webbsidors innehåll såsom bilder och text, publiceringsdatum, språkinformation med mera..
I den digitala informationsåldern är data rikligt och lättillgängligt på internet. Att extrahera relevant information från webbplatser kan vara en betungande uppgift, men med Python-Goose-biblioteket blir webbskrapning en barnlek. Python-Goose är ett robust och användarvänligt bibliotek som låter utvecklare extrahera strukturerad data från webbsidor utan ansträngning. Det utvecklades av Julian Moreno Patiño och är utformat för att extrahera meningsfullt innehåll, såsom artiklar, från webbsidor. Biblioteket använder en uppsättning heuristiker och tekniker för naturlig språkbehandling för att analysera HTML-dokument och identifiera relevant textinnehåll.
Python-Goose är mycket enkelt att installera och har fullständigt stöd för att hantera flerspråkiga webbplatser. Biblioteket innehåller funktioner för språkdetection som automatiskt identifierar språk på webbplatsens innehåll. Det finns flera viktiga funktioner i biblioteket, såsom innehållsaggregering, extrahering av strukturerad data för forsknings- och analysändamål, videoextraktion, generering av sammanfattningar av artiklar, förbehandling av webbdata för att träna maskininlärningsmodeller, extrahering av bilder från webbsidor och mycket mer.
Python-Goose är ett open source‑bibliotek skrivet i Python och erbjuder ett enkelt men effektivt sätt att hantera webbsökninguppgifter som syftar till att extrahera värdefull information från webbsidor i Python‑applikationer. Det använder olika algoritmer och heuristiker för att identifiera den mest relevanta texten och bortse från irrelevanta element. Oavsett om du är datavetare, marknadsundersökare, bygger en datadriven applikation eller bedriver forskning, kan Python-Goose avsevärt förenkla ditt arbetsflöde och hjälpa dig att extrahera värdefulla insikter från internets enorma omfattning.
Komma igång med Python-Goose
Det rekommenderade och enklaste sättet att installera Python-Goose är att använda Composer, beroendehanteringsverktyget för PHP. Använd följande kommando för en smidig installation.
Installera Python-Goose via pip
pip install goose3 Du kan också installera det manuellt; ladda ner de senaste release‑filerna direkt från GitHub repository.
Artikelutdrag med Python API
Det öppna källkodsbiblioteket Python-Goose har tillhandahållit mycket användbara funktioner för att ladda och extrahera innehåll från olika typer av webbplatser. Biblioteket är specialiserat på att extrahera artiklar från webbsidor, filtrera bort onödiga element såsom annonser, rubriker, sidfötter och sidofält. Dessutom fokuserar det på att hämta kärninnehållet, inklusive titel, text, författare, publiceringsdatum och annan relevant metadata. Här är ett mycket användbart exempel som visar hur användare kan definiera URL:en till den webbsida de vill skrapa och enkelt komma åt olika egenskaper hos artikelobjektet, såsom titel, författare, publiceringsdatum och rensad text.
Hur extraherar man artiklar från en webbplats via Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Extrahera specifik webbsidesinformation på flera språk via Python
Python-Goose-biblioteket innehåller funktion för språkdetektion, vilket gör att det automatiskt kan identifiera språket i en webbsidas innehåll. Denna funktion är särskilt användbar när man hanterar flerspråkiga webbplatser eller när man vill filtrera innehåll baserat på språk. Biblioteket låter mjukvaruutvecklare att komma åt en specifik del av webbsidan och extrahera den, såsom huvudtexten i en artikel, artikelbilder, metabeskrivning, metataggar och så vidare. Följande exempel visar hur man extraherar eller skrapar spanskt innehåll med Python-kod.
Hur extraherar man spanskt innehåll från en webbsida i Python-appar?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'