Bezmaksas Python bibliotēka satura izgūšanai no HTML lapām
Atvērtā koda Python bibliotēka tīmekļa lapu satura izgūšanai, piemēram, attēlus un tekstu, publicēšanas datumu, valodas informāciju un tā tālāk.
Digitālās informācijas laikmetā dati ir bagātīgi un viegli pieejami internetā. Atbilstošas informācijas izguve no vietnēm var būt sarežģīta uzdevuma, bet ar Python-Goose bibliotēku tīmekļa skrāpēšana kļūst par vieglu uzdevumu. Python-Goose ir spēcīga un lietotājam draudzīga bibliotēka, kas ļauj izstrādātājiem bez piepūles izvilkt strukturētus datus no tīmekļa lapām. To izstrādāja Julian Moreno Patiño, un tā ir paredzēta, lai izvilktu nozīmīgu saturu, piemēram, rakstus, no tīmekļa lapām. Bibliotēka izmanto virkni heuristiku un dabiskās valodas apstrādes tehnoloģiju, lai analizētu HTML dokumentus un identificētu atbilstošu teksta saturu.
Python-Goose ir ļoti viegli instalējama un nodrošina pilnīgu atbalstu daudzvalodu vietņu apstrādei. Bibliotēka ietver valodas noteikšanas iespējas, kas automātiski identificē tīmekļa lapas satura valodu. Bibliotēkā ir vairākas svarīgas funkcijas, piemēram, satura apvienošana, strukturētu datu izguve pētniecības un analīzes nolūkiem, video izguve, rakstu kopsavilkumu ģenerēšana, tīmekļa datu priekšapstrāde mašīnmācīšanās modeļu apmācībai, attēlu izguve no tīmekļa lapām un daudz kas cits.
Python-Goose ir atvērtā koda bibliotēka, kas rakstīta Python valodā, un nodrošina vienkāršu, bet efektīvu veidu, kā apstrādāt tīmekļa skrāpēšanas uzdevumus, kuru mērķis ir izvilkt vērtīgu informāciju no tīmekļa lapām Python lietojumprogrammās. Tā izmanto dažādus algoritmus un heuristikas, lai identificētu visatbilstošāko tekstu un izslēgtu nevajadzīgus elementus. Neatkarīgi no tā, vai esat datu zinātnieks, tirgus pētnieks, veidojat datu vadītu lietojumprogrammu vai veicat pētījumus, Python-Goose var ievērojami vienkāršot jūsu darba plūsmu un palīdzēt izvilkt vērtīgus ieskatus no plašā interneta plašuma.
Sākšana ar Python-Goose
Ieteicamais un vienkāršākais veids, kā instalēt Python-Goose, ir izmantot Composer, PHP atkarību pārvaldības rīku. Lūdzu, izmantojiet šo komandu, lai veiktu gludu instalāciju.
Instalējiet Python-Goose, izmantojot pip
pip install goose3 Jūs varat arī instalēt to manuāli; lejupielādējiet jaunākos izlaiduma failus tieši no GitHub krātuves.
Rakstu izguve, izmantojot Python API
Atvērtā koda Python‑Goose bibliotēka ir nodrošinājusi ļoti noderīgas funkcijas satura ielādēšanai un izguvei no dažāda veida tīmekļa vietnēm. Bibliotēka specializējas rakstu izguvē no tīmekļa lapām, filtrējot nevajadzīgus elementus, piemēram, reklāmas, galvenes, kājenes un sānjoslas. Turklāt tā koncentrējas uz galvenā satura iegūšanu, ieskaitot virsrakstu, tekstu, autoru, publicēšanas datumu un citus svarīgus metadatus. Šeit ir ļoti noderīgs piemērs, kas parāda, kā lietotāji var definēt tīmekļa lapas URL, ko vēlas izvilkt, un viegli piekļūt dažādām raksta objekta īpašībām, piemēram, virsrakstam, autoriem, publicēšanas datumam un attīrītam tekstam.
Kā izguvēt rakstus no vietnes, izmantojot Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Izgūt konkrētu tīmekļa lapas informāciju vairākās valodās, izmantojot Python
Python-Goose bibliotēka ietver valodas noteikšanas funkcionalitāti, ļaujot tai automātiski identificēt tīmekļa lapas satura valodu. Šī funkcija ir īpaši noderīga, strādājot ar daudzvalodu vietnēm vai ja vēlaties filtrēt saturu pēc valodas. Bibliotēka ļauj programmatūras izstrādātājiem piekļūt konkrētai tīmekļa lapas daļai un izvilkt to, piemēram, raksta galveno tekstu, raksta attēlus, meta aprakstu, meta tagus utt. Zemāk esošais piemērs parāda, kā izvilkt vai skrāpēt spāņu valodas saturu, izmantojot Python kodu.
Kā izguvēt spāņu valodas saturu no tīmekļa lapas Python lietojumprogrammās?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'