1. Prodotti
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Libreria Python gratuita per estrarre contenuti dalle pagine HTML

Libreria Python open source per estrarre contenuti delle pagine web come immagini e testo, data di pubblicazione, informazioni sulla lingua e così via.

Nell'era dell'informazione digitale, i dati sono abbondanti e facilmente disponibili su Internet. Estrarre informazioni rilevanti dai siti web può essere un compito gravoso, ma con la libreria Python-Goose il web scraping diventa un gioco da ragazzi. Python-Goose è una libreria robusta e intuitiva che consente agli sviluppatori di estrarre dati strutturati dalle pagine web senza sforzo. È stata sviluppata da Julian Moreno Patiño ed è progettata per estrarre contenuti significativi, come articoli, dalle pagine web. La libreria utilizza un insieme di euristiche e tecniche di elaborazione del linguaggio naturale per analizzare i documenti HTML e identificare i contenuti testuali pertinenti.

Python-Goose è molto facile da installare e offre un supporto completo per la gestione di siti web multilingue. La libreria incorpora capacità di rilevamento della lingua, che identificano automaticamente la lingua del contenuto della pagina web. Sono presenti diverse funzionalità importanti della libreria, come l'aggregazione di contenuti, l'estrazione di dati strutturati per scopi di ricerca e analisi, l'estrazione di video, la generazione di riassunti di articoli, la preelaborazione dei dati web per l'addestramento di modelli di apprendimento automatico, l'estrazione di immagini dalle pagine web e molto altro.

Python-Goose è una libreria open source scritta in Python e offre un modo semplice ma efficace per gestire attività di web scraping volte a estrarre informazioni preziose dalle pagine web all'interno di applicazioni Python. Utilizza vari algoritmi e euristiche per identificare il testo più rilevante e scartare gli elementi irrilevanti. Che tu sia un data scientist, un ricercatore di mercato, stia costruendo un'applicazione basata sui dati o conduca ricerche, Python-Goose può semplificare notevolmente il tuo flusso di lavoro e aiutarti a estrarre intuizioni preziose dall'immenso internet.

Previous Next

Iniziare con Python-Goose

Il modo consigliato e più semplice per installare Python-Goose è utilizzare Composer, lo strumento di gestione delle dipendenze per PHP. Si prega di utilizzare il seguente comando per un'installazione fluida.

Installa Python-Goose tramite pip

pip install goose3 

Puoi anche installarlo manualmente; scarica i file dell'ultima release direttamente dal repository GitHub.

Estrazione di articoli tramite API Python

La libreria open source Python-Goose ha fornito funzionalità molto utili per caricare ed estrarre contenuti da vari tipi di siti web. La libreria è specializzata nell'estrazione di articoli dalle pagine web, filtrando elementi non necessari come pubblicità, intestazioni, piè di pagina e barre laterali. Inoltre, si concentra sul recupero del contenuto principale, includendo il titolo, il testo, l'autore, la data di pubblicazione e altri metadati rilevanti. Ecco un esempio molto utile che mostra come gli utenti possano definire l'URL della pagina web che desiderano estrarre e accedere facilmente a varie proprietà dell'oggetto articolo, come il titolo, gli autori, la data di pubblicazione e il testo pulito.

Come estrarre articoli da un sito web tramite API Python?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Estrai informazioni specifiche di una pagina web in più lingue tramite Python

La libreria Python-Goose incorpora una funzionalità di rilevamento della lingua, consentendo di identificare automaticamente la lingua del contenuto di una pagina web. Questa caratteristica è particolarmente utile quando si gestiscono siti web multilingue o quando si desidera filtrare i contenuti in base alla lingua. La libreria permette agli sviluppatori di software di accedere a una parte specifica della pagina e di estrarla, come il testo principale di un articolo, le immagini dell'articolo, la meta description, i meta tag, ecc. L'esempio seguente mostra come estrarre o fare scraping di contenuti in spagnolo usando codice Python.

Come estrarre contenuti in spagnolo da una pagina web all'interno di app Python?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Italiano