Ilmainen Python-kirjasto sisällön poimimiseen HTML-sivuista
Avoimen lähdekoodin Python-kirjasto verkkosivujen sisällön, kuten kuvien ja tekstin, julkaisupäivän, kielitiedon ja muun poimimiseen.
Digitaalisen tiedon aikakaudella dataa on runsaasti ja se on helposti saatavilla internetissä. Merkityksellisen tiedon poimiminen verkkosivustoilta voi olla työläs tehtävä, mutta Python-Goose‑kirjaston avulla web‑kaavinta on helppoa. Python-Goose on vankka ja käyttäjäystävällinen kirjasto, jonka avulla kehittäjät voivat poimia rakenteellista dataa verkkosivuilta vaivattomasti. Sen on kehittänyt Julian Moreno Patiño, ja se on suunniteltu poimimaan merkityksellistä sisältöä, kuten artikkeleita, verkkosivuilta. Kirjasto käyttää joukkoa heuristiikkoja ja luonnollisen kielen käsittelytekniikoita HTML‑dokumenttien analysointiin ja relevantin tekstisisällön tunnistamiseen.
Python-Goose on erittäin helppo asentaa ja se tarjoaa täyden tuen monikielisten verkkosivustojen käsittelyyn. Kirjasto sisältää kielentunnistustoiminnon, joka automaattisesti tunnistaa verkkosivun sisällön kielen. Kirjastossa on useita tärkeitä ominaisuuksia, kuten sisällön aggregointi, rakenteellisen datan poiminta tutkimus- ja analyysitarkoituksiin, videoiden poiminta, artikkeleiden tiivistelmien luominen, verkkodatan esikäsittely koneoppimismallien kouluttamista varten, kuvien poiminta verkkosivuilta ja monia muita.
Python-Goose on avoimen lähdekoodin kirjasto, joka on kirjoitettu Pythonilla, ja se tarjoaa yksinkertaisen mutta tehokkaan tavan käsitellä web-scraping-tehtäviä, joiden tavoitteena on poimia arvokasta tietoa verkkosivuilta Python-sovellusten sisällä. Se käyttää erilaisia algoritmeja ja heuristiikkoja tunnistaakseen merkityksellisimmän tekstin ja hylkääkseen epäolennaiset elementit. Olitpa sitten datatieteilijä, markkinatutkija, data‑pohjaista sovellusta rakentava tai tutkimusta tekevä, Python-Goose voi merkittävästi tehostaa työnkulkuasi ja auttaa sinua poimimaan arvokkaita oivalluksia internetin laajasta maailmasta.
Aloita Python-Goose:n käyttö
Suositeltu ja helpoin tapa asentaa Python-Goose on käyttää Composeria, PHP:n riippuvuuksienhallintatyökalua. Käytä seuraavaa komentoa sujuvaan asennukseen.
Asenna Python-Goose pip:n kautta
pip install goose3 Voit myös asentaa sen manuaalisesti; lataa uusimmat julkaisutiedostot suoraan GitHub-varastosta.
Artikkelin poiminta Python API:n avulla
Avoimen lähdekoodin Python-Goose-kirjasto on tarjonnut erittäin hyödyllisiä ominaisuuksia sisällön lataamiseen ja poimimiseen erilaisilta verkkosivustoilta. Kirjasto on erikoistunut artikkelien poimimiseen verkkosivuilta, suodattamalla pois tarpeettomat elementit, kuten mainokset, otsikot, alatunnisteet ja sivupalkit. Lisäksi se keskittyy hakemaan ydinsisällön, mukaan lukien otsikko, teksti, tekijä, julkaisupäivämäärä ja muut asiaankuuluvat metatiedot. Tässä on erittäin hyödyllinen esimerkki, joka näyttää, miten käyttäjät voivat määrittää haluamansa verkkosivun URL-osoitteen ja helposti käyttää artikkeli-olion eri ominaisuuksia, kuten otsikkoa, tekijöitä, julkaisupäivää ja puhdistettua tekstiä.
Kuinka poimia artikkeleita verkkosivustolta Python API:n avulla?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Poimi tiettyjen verkkosivujen tiedot useilla kielillä Pythonin avulla
Python-Goose-kirjasto sisältää kielentunnistustoiminnon, jonka avulla se voi automaattisesti tunnistaa verkkosivun sisällön kielen. Tämä ominaisuus on erityisen hyödyllinen monikielisten verkkosivustojen kanssa työskenneltäessä tai kun haluat suodattaa sisältöä kielen perusteella. Kirjasto antaa ohjelmistokehittäjille mahdollisuuden päästä käsiksi tiettyyn osaan verkkosivua ja poimia sen, kuten artikkelin päätekstin, artikkelin kuvat, meta-kuvauksen, meta-tunnisteet ja niin edelleen. Seuraava esimerkki näyttää, miten espanjankielinen sisältö voidaan poimia tai kaapia Python-koodilla.
Kuinka poimia espanjankielistä sisältöä verkkosivulta Python-sovelluksissa?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'