1. produkty
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Bezplatná Python knihovna pro extrakci obsahu z HTML stránek

Open source Python knihovna pro extrakci obsahu webových stránek, jako jsou obrázky a text, datum publikace, informace o jazyce a další..

V době digitální informace jsou data hojně dostupná na internetu. Extrahování relevantních informací z webových stránek může být obtížný úkol, ale s knihovnou Python-Goose se web scraping stává hračkou. Python-Goose je robustní a uživatelsky přívětivá knihovna, která vývojářům umožňuje snadno získávat strukturovaná data z webových stránek. Byla vyvinuta Juliánem Moreno Patiñem a je navržena k extrakci smysluplného obsahu, jako jsou články, z webových stránek. Knihovna používá sadu heuristik a technik zpracování přirozeného jazyka k analýze HTML dokumentů a identifikaci relevantního textového obsahu.

Python-Goose je velmi snadno nainstalovatelná a poskytuje kompletní podporu pro práci s vícejazyčnými webovými stránkami. Knihovna zahrnuje funkce detekce jazyka, které automaticky identifikují jazyk obsahu webové stránky. Mezi důležité funkce knihovny patří například agregace obsahu, extrakce strukturovaných dat pro výzkumné a analytické účely, extrakce videí, generování souhrnů článků, předzpracování webových dat pro trénink modelů strojového učení, extrakce obrázků z webových stránek a mnoho dalšího.

Python-Goose je open source knihovna napsaná v Pythonu a poskytuje jednoduchý, ale účinný způsob, jak zvládat úlohy web scrapingu, které mají za cíl získat cenné informace z webových stránek v rámci Python aplikací. Používá různé algoritmy a heuristiky k identifikaci nejrelevantnějšího textu a odstraňování irelevantních prvků. Ať už jste datový vědec, výzkumník trhu, vytváříte datově řízenou aplikaci nebo provádíte výzkum, Python-Goose může výrazně zjednodušit váš pracovní postup a pomoci vám získat cenné poznatky z obrovského rozsahu internetu.

Previous Next

Začínáme s Python-Goose

Cílený a nejjednodušší způsob instalace Python-Goose je pomocí Composeru, nástroje pro správu závislostí v PHP. Použijte prosím následující příkaz pro hladkou instalaci.

Instalace Python-Goose pomocí pip

pip install goose3 

Můžete jej také nainstalovat ručně; stáhněte nejnovější soubory vydání přímo z GitHub repozitáře.

Extrahování článků pomocí Python API

Open source knihovna Python-Goose poskytla velmi užitečné funkce pro načítání a extrahování obsahu z různých typů webových stránek. Knihovna se specializuje na extrahování článků z webových stránek, filtruje nepotřebné prvky, jako jsou reklamy, hlavičky, patičky a postranní panely. Navíc se zaměřuje na získání hlavního obsahu, včetně názvu, textu, autora, data publikace a dalších relevantních metadat. Tady je velmi užitečný příklad, který ukazuje, jak uživatelé mohou definovat URL webové stránky, kterou chtějí scrapovat, a snadno přistupovat k různým vlastnostem objektu článku, jako je název, autoři, datum publikace a vyčištěný text.

Jak extrahovat články z webové stránky pomocí Python API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Extrahujte konkrétní informace z webové stránky ve více jazycích pomocí Pythonu

Knihovna Python-Goose obsahuje funkci detekce jazyka, která umožňuje automaticky identifikovat jazyk obsahu webové stránky. Tato funkce je zvláště užitečná při práci s vícejazyčnými weby nebo když chcete filtrovat obsah podle jazyka. Knihovna umožňuje vývojářům softwaru přistupovat k určité části webové stránky a extrahovat ji, například hlavní text článku, obrázky článku, meta popis, meta tagy a podobně. Následující příklad ukazuje, jak pomocí Python kódu extrahovat nebo scrapovat španělský obsah.

Jak extrahovat španělský obsah z webové stránky v Python aplikacích?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Čeština