1. Termékek
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Ingyenes Python könyvtár tartalom kinyeréséhez HTML oldalakból

Nyílt forráskódú Python könyvtár weboldalak tartalmának kinyeréséhez, például képek, szöveg, közzétételi dátum, nyelvi információk és egyéb adatok.

A digitális információ korában az adatok bőségesek és könnyen elérhetők az interneten. A releváns információk kinyerése a weboldalakról nehézkes feladat lehet, de a Python-Goose könyvtárral a webkaparás gyerekjáték. A Python-Goose egy robusztus és felhasználóbarát könyvtár, amely lehetővé teszi a fejlesztők számára, hogy strukturált adatokat nyerjenek ki a weboldalakról erőfeszítés nélkül. Ezt Julian Moreno Patiño fejlesztette, és úgy tervezték, hogy értelmes tartalmakat, például cikkeket nyerjen ki a weboldalakról. A könyvtár heurisztikák és természetes nyelvfeldolgozási technikák sorozatát használja a HTML-dokumentumok elemzésére és a releváns szöveges tartalom azonosítására.

A Python-Goose nagyon egyszerűen telepíthető, és teljes körű támogatást nyújt a többnyelvű weboldalak kezeléséhez. A könyvtár nyelvfelismerési képességeket tartalmaz, amelyek automatikusan azonosítják a weboldal tartalmának nyelvét. A könyvtár számos fontos funkcióval rendelkezik, például tartalom aggregálás, strukturált adatok kinyerése kutatási és elemzési célokra, videó kinyerés, cikkek összefoglalóinak generálása, webes adatok előfeldolgozása gépi tanulási modellek képzéséhez, képek kinyerése a weboldalakról, és még sok más.

A Python-Goose egy nyílt forráskódú könyvtár, amely Pythonban íródott, és egyszerű, mégis hatékony módot kínál a webkaparás feladatok kezelésére, amelyek célja értékes információk kinyerése a weboldalakról Python alkalmazásokon belül. Különféle algoritmusokat és heurisztikákat alkalmaz a legrelevánsabb szöveg azonosítására és a nem releváns elemek eldobására. Akár adatkutató, piackutató, adatvezérelt alkalmazást építő vagy kutatást végző vagy, a Python-Goose jelentősen leegyszerűsítheti a munkafolyamatodat, és segíthet értékes betekintést nyerni az internet hatalmas kiterjedéséből.

Previous Next

Első lépések a Python-Goose használatával

A Python-Goose telepítésének ajánlott és legegyszerűbb módja a Composer, a PHP függőségkezelő eszköz használata. Kérjük, használja a következő parancsot a zökkenőmentes telepítéshez.

Python-Goose telepítése pip segítségével

pip install goose3 

Telepítheti manuálisan is; töltse le a legújabb kiadási fájlokat közvetlenül a GitHub tárolóból.

Cikkek kinyerése Python API-val

Az nyílt forráskódú Python-Goose könyvtár nagyon hasznos funkciókat biztosít a különféle típusú weboldalak tartalmának betöltéséhez és kinyeréséhez. A könyvtár arra specializálódott, hogy cikkeket nyerjen ki a weboldalakról, kiszűrve a felesleges elemeket, mint például a hirdetések, fejlécek, láblécek és oldalsávok. Emellett a lényegi tartalom visszanyerésére összpontosít, beleértve a címet, a szöveget, a szerzőt, a közzétételi dátumot és egyéb releváns metaadatokat. Itt egy nagyon hasznos példa, amely megmutatja, hogyan definiálhatják a felhasználók a lekérdezni kívánt weboldal URL-jét, és könnyedén hozzáférhetnek a cikkobjektum különböző tulajdonságaihoz, mint a cím, a szerzők, a közzétételi dátum és a megtisztított szöveg.

Hogyan nyerhetünk ki cikkeket egy weboldalról Python API-val?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Adott weboldal információinak kinyerése több nyelven Python segítségével

A Python-Goose könyvtár nyelvfelismerési funkciót tartalmaz, amely lehetővé teszi, hogy automatikusan azonosítsa egy weboldal tartalmának nyelvét. Ez a funkció különösen hasznos többnyelvű webhelyek kezelésekor vagy amikor a tartalmat nyelv alapján szeretnénk szűrni. A könyvtár lehetővé teszi a szoftverfejlesztők számára, hogy egy adott részt a weboldalról elérjék és kinyerjék, például egy cikk fő szövegét, a cikk képeit, meta leírást, meta címkéket stb. Az alábbi példa bemutatja, hogyan lehet spanyol tartalmat kinyerni vagy lekérdezni Python kóddal.

Hogyan nyerhetünk ki spanyol tartalmat egy weboldalról Python alkalmazásokban?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Magyar