1. Produse
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Bibliotecă Python gratuită pentru extragerea conținutului din paginile HTML

Bibliotecă Python open source pentru extragerea conținutului paginilor web, cum ar fi imagini și text, data publicării, informații despre limbă și altele.

În era informației digitale, datele sunt abundente și ușor accesibile pe internet. Extracția informațiilor relevante de pe site-uri poate fi o sarcină greoaie, dar cu biblioteca Python-Goose, scraping-ul web devine o joacă de copii. Python-Goose este o bibliotecă robustă și prietenoasă cu utilizatorul, care permite dezvoltatorilor să extragă date structurate de pe paginile web fără efort. A fost dezvoltată de Julian Moreno Patiño și este concepută pentru a extrage conținut semnificativ, cum ar fi articole, de pe paginile web. Biblioteca folosește un set de euristici și tehnici de procesare a limbajului natural pentru a analiza documentele HTML și a identifica conținutul textual relevant.

Python-Goose este foarte ușor de instalat și oferă suport complet pentru gestionarea site-urilor multilingve. Biblioteca încorporează capabilități de detectare a limbii, care identifică automat limba conținutului paginii web. Există mai multe funcționalități importante ale bibliotecii, cum ar fi agregarea de conținut, extragerea de date structurate pentru cercetare și analiză, extragerea de video, generarea de rezumate ale articolelor, preprocesarea datelor web pentru antrenarea modelelor de învățare automată, extragerea de imagini de pe paginile web și multe altele.

Python-Goose este o bibliotecă open source scrisă în Python și oferă o modalitate simplă, dar eficientă, de a gestiona sarcini de web scraping care vizează extragerea unor informații valoroase din paginile web în cadrul aplicațiilor Python. Folosește diverse algoritmi și euristici pentru a identifica textul cel mai relevant și a elimina elementele irelevante. Indiferent dacă ești data scientist, cercetător de piață, construiești o aplicație bazată pe date sau desfășori cercetări, Python-Goose poate simplifica semnificativ fluxul tău de lucru și te poate ajuta să extragi informații valoroase din vasta întindere a internetului.

Previous Next

Începerea cu Python-Goose

Cea mai recomandată și cea mai ușoară metodă de a instala Python-Goose este prin utilizarea Composer, instrumentul de gestionare a dependențelor pentru PHP. Vă rugăm să folosiți comanda următoare pentru o instalare fără probleme.

Instalați Python-Goose prin pip

pip install goose3 

Poți, de asemenea, să îl instalezi manual; descarcă cele mai recente fișiere de release direct din depozitul GitHub.

Extracție de articole utilizând API-ul Python

Biblioteca open source Python-Goose a oferit funcționalități foarte utile pentru încărcarea și extragerea conținutului din diverse tipuri de site-uri web. Biblioteca este specializată în extragerea articolelor din paginile web, filtrând elementele inutile precum reclamele, anteturile, subsolurile și barele laterale. În plus, se concentrează pe recuperarea conținutului de bază, inclusiv titlul, textul, autorul, data publicării și alte metadate relevante. Iată un exemplu foarte util care arată cum utilizatorii pot defini URL-ul paginii web pe care doresc să o extragă și pot accesa cu ușurință diverse proprietăți ale obiectului articol, cum ar fi titlul, autorii, data publicării și textul curățat.

Cum să extrageți articole dintr-un site web prin API-ul Python?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Extrage informații specifice ale paginii web în mai multe limbi prin Python

Biblioteca Python-Goose încorporează funcționalitatea de detectare a limbii, permițându-i să identifice automat limba conținutului unei pagini web. Această caracteristică este deosebit de utilă atunci când se lucrează cu site-uri multilingve sau când doriți să filtrați conținutul în funcție de limbă. Biblioteca permite dezvoltatorilor de software să acceseze o anumită parte a paginii web și să o extragă, cum ar fi textul principal al unui articol, imaginile articolului, descrierea Meta, etichetele Meta și altele. Exemplul următor arată cum să extrageți sau să preluați conținut în limba spaniolă utilizând cod Python.

Cum să extrageți conținut în spaniolă dintr-o pagină web în aplicații Python?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Română