1. Produktai
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Nemokama Python biblioteka turinio ištraukimui iš HTML puslapių

Atviro kodo Python biblioteka, skirta ištraukti interneto puslapių turinį, pvz., vaizdus ir tekstą, publikavimo datą, kalbos informaciją ir t.t.

Skaitmeninės informacijos amžiuje duomenys yra gausūs ir lengvai prieinami internete. Iš svetainių išgauti aktualią informaciją gali būti varginanti užduotis, tačiau su Python-Goose biblioteka web scraping tampa paprasta. Python-Goose yra patikima ir vartotojui draugiška biblioteka, leidžianti kūrėjams be vargo išgauti struktūruotus duomenis iš tinklalapių. Ji sukurta Julian Moreno Patiño ir skirta išgauti prasmingą turinį, pvz., straipsnius, iš tinklalapių. Biblioteka naudoja heuristikų rinkinį ir natūralios kalbos apdorojimo metodus HTML dokumentų analizei ir svarbaus teksto turinio identifikavimui.

Python-Goose yra labai lengvai įdiegiama ir suteikia pilną paramą daugiakalbių svetainių tvarkymui. Biblioteka įtraukia kalbos aptikimo funkcijas, kurios automatiškai nustato tinklalapio turinio kalbą. Bibliotekoje yra keli svarbūs funkcionalumai, tokie kaip turinio agregavimas, struktūruotų duomenų išgavimas tyrimų ir analizės tikslais, vaizdo išgavimas, straipsnių santraukų generavimas, tinklo duomenų išankstinis apdorojimas mašininio mokymosi modelių mokymui, vaizdų išgavimas iš tinklalapių ir daugelis kitų.

Python-Goose yra atviro kodo biblioteka, parašyta Python kalba, ir suteikia paprastą, bet veiksmingą būdą tvarkyti web scraping užduotis, kurių tikslas – išgauti vertingą informaciją iš interneto puslapių Python programose. Ji naudoja įvairius algoritmus ir heuristikas, kad identifikuotų svarbiausią tekstą ir atmestų nereikalingus elementus. Nesvarbu, ar esate duomenų mokslininkas, rinkos tyrėjas, kuriate duomenimis pagrįstą programą ar atliekate tyrimus, Python-Goose gali žymiai supaprastinti jūsų darbo eigą ir padėti išgauti vertingas įžvalgas iš milžiniško interneto.

Previous Next

Pradžia su Python-Goose

Rekomenduojamas ir paprasčiausias būdas įdiegti Python-Goose yra naudojant Composer – PHP priklausomybių valdymo įrankį. Prašome naudoti šią komandą sklandžiam įdiegimui.

Įdiekite Python-Goose per pip

pip install goose3 

Taip pat galite įdiegti rankiniu būdu; atsisiųskite naujausius leidimo failus tiesiai iš GitHub saugyklos.

Straipsnių išskyrimas naudojant Python API

Atviro kodo Python-Goose biblioteka suteikė labai naudingų funkcijų turinio įkėlimui ir išgavimui iš įvairių tipų svetainių. Biblioteka specializuojasi straipsnių išgavime iš tinklalapių, filtruoja nereikalingus elementus, tokius kaip reklamos, antraštės, poraštės ir šoninės juostos. Be to, ji sutelkia dėmesį į pagrindinio turinio išgavimą, įskaitant pavadinimą, tekstą, autorių, publikavimo datą ir kitus susijusius metaduomenis. Čia pateiktas labai naudingas pavyzdys, kuris rodo, kaip vartotojai gali apibrėžti norimos nuskaityti tinklalapio URL ir lengvai pasiekti įvairias straipsnio objekto savybes, tokias kaip pavadinimas, autoriai, publikavimo data ir išvalytas tekstas.

Kaip išskirti straipsnius iš svetainės naudojant Python API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Išskirkite konkrečios svetainės informaciją keliomis kalbomis naudojant Python

Python-Goose biblioteka įtraukia kalbos aptikimo funkciją, leidžiančią automatiškai nustatyti tinklalapio turinio kalbą. Ši savybė ypač naudinga dirbant su daugiakalbiais tinklalapiais arba kai norite filtruoti turinį pagal kalbą. Biblioteka leidžia programinės įrangos kūrėjams pasiekti konkrečią tinklalapio dalį ir ją išgauti, pavyzdžiui, pagrindinį straipsnio tekstą, straipsnio paveikslus, meta aprašymą, meta žymas ir pan. Žemiau pateiktas pavyzdys rodo, kaip išgauti arba nuskaityti ispanų kalbos turinį naudojant Python kodą.

Kaip išskirti ispanų kalbos turinį iš tinklalapio Python programose?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Lietuvių