Bezplatná Python knihovna pro extrakci obsahu z HTML stránek
Open source Python knihovna pro extrakci obsahu webových stránek, jako jsou obrázky a text, datum publikace, informace o jazyce a další..
V době digitální informace jsou data hojně dostupná na internetu. Extrahování relevantních informací z webových stránek může být obtížný úkol, ale s knihovnou Python-Goose se web scraping stává hračkou. Python-Goose je robustní a uživatelsky přívětivá knihovna, která vývojářům umožňuje snadno získávat strukturovaná data z webových stránek. Byla vyvinuta Juliánem Moreno Patiñem a je navržena k extrakci smysluplného obsahu, jako jsou články, z webových stránek. Knihovna používá sadu heuristik a technik zpracování přirozeného jazyka k analýze HTML dokumentů a identifikaci relevantního textového obsahu.
Python-Goose je velmi snadno nainstalovatelná a poskytuje kompletní podporu pro práci s vícejazyčnými webovými stránkami. Knihovna zahrnuje funkce detekce jazyka, které automaticky identifikují jazyk obsahu webové stránky. Mezi důležité funkce knihovny patří například agregace obsahu, extrakce strukturovaných dat pro výzkumné a analytické účely, extrakce videí, generování souhrnů článků, předzpracování webových dat pro trénink modelů strojového učení, extrakce obrázků z webových stránek a mnoho dalšího.
Python-Goose je open source knihovna napsaná v Pythonu a poskytuje jednoduchý, ale účinný způsob, jak zvládat úlohy web scrapingu, které mají za cíl získat cenné informace z webových stránek v rámci Python aplikací. Používá různé algoritmy a heuristiky k identifikaci nejrelevantnějšího textu a odstraňování irelevantních prvků. Ať už jste datový vědec, výzkumník trhu, vytváříte datově řízenou aplikaci nebo provádíte výzkum, Python-Goose může výrazně zjednodušit váš pracovní postup a pomoci vám získat cenné poznatky z obrovského rozsahu internetu.
Začínáme s Python-Goose
Cílený a nejjednodušší způsob instalace Python-Goose je pomocí Composeru, nástroje pro správu závislostí v PHP. Použijte prosím následující příkaz pro hladkou instalaci.
Instalace Python-Goose pomocí pip
pip install goose3 Můžete jej také nainstalovat ručně; stáhněte nejnovější soubory vydání přímo z GitHub repozitáře.
Extrahování článků pomocí Python API
Open source knihovna Python-Goose poskytla velmi užitečné funkce pro načítání a extrahování obsahu z různých typů webových stránek. Knihovna se specializuje na extrahování článků z webových stránek, filtruje nepotřebné prvky, jako jsou reklamy, hlavičky, patičky a postranní panely. Navíc se zaměřuje na získání hlavního obsahu, včetně názvu, textu, autora, data publikace a dalších relevantních metadat. Tady je velmi užitečný příklad, který ukazuje, jak uživatelé mohou definovat URL webové stránky, kterou chtějí scrapovat, a snadno přistupovat k různým vlastnostem objektu článku, jako je název, autoři, datum publikace a vyčištěný text.
Jak extrahovat články z webové stránky pomocí Python API?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Extrahujte konkrétní informace z webové stránky ve více jazycích pomocí Pythonu
Knihovna Python-Goose obsahuje funkci detekce jazyka, která umožňuje automaticky identifikovat jazyk obsahu webové stránky. Tato funkce je zvláště užitečná při práci s vícejazyčnými weby nebo když chcete filtrovat obsah podle jazyka. Knihovna umožňuje vývojářům softwaru přistupovat k určité části webové stránky a extrahovat ji, například hlavní text článku, obrázky článku, meta popis, meta tagy a podobně. Následující příklad ukazuje, jak pomocí Python kódu extrahovat nebo scrapovat španělský obsah.
Jak extrahovat španělský obsah z webové stránky v Python aplikacích?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'