1. Produkty
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

Darmowa biblioteka Pythona do wyodrębniania treści ze stron HTML

Otwarta biblioteka Pythona do wyodrębniania treści ze stron internetowych, takich jak obrazy i tekst, data publikacji, informacje o języku i inne..

W erze informacji cyfrowej dane są obfite i łatwo dostępne w internecie. Wydobywanie istotnych informacji ze stron internetowych może być uciążliwym zadaniem, ale dzięki bibliotece Python-Goose scraping staje się prosty. Python-Goose to solidna i przyjazna dla użytkownika biblioteka, która pozwala programistom bez wysiłku wyodrębniać ustrukturyzowane dane ze stron WWW. Została opracowana przez Juliana Moreno Patiño i jest przeznaczona do wyciągania wartościowej treści, takiej jak artykuły, ze stron internetowych. Biblioteka wykorzystuje zestaw heurystyk i technik przetwarzania języka naturalnego do analizy dokumentów HTML i identyfikacji istotnej treści tekstowej.

Python-Goose jest bardzo łatwy w instalacji i zapewnia pełne wsparcie dla obsługi wielojęzycznych stron internetowych. Biblioteka zawiera funkcje wykrywania języka, które automatycznie identyfikują język treści strony WWW. W skład biblioteki wchodzi wiele istotnych funkcji, takich jak agregacja treści, wyodrębnianie ustrukturyzowanych danych do celów badawczych i analitycznych, ekstrakcja wideo, generowanie streszczeń artykułów, wstępne przetwarzanie danych internetowych do trenowania modeli uczenia maszynowego, wyciąganie obrazów ze stron oraz wiele innych.

Python-Goose jest otwarto‑źródłową biblioteką napisaną w języku Python i zapewnia prosty, a jednocześnie skuteczny sposób obsługi zadań związanych z web scrapingiem, które mają na celu wyodrębnienie cennych informacji ze stron internetowych w aplikacjach Pythona. Wykorzystuje różne algorytmy i heurystyki, aby zidentyfikować najbardziej istotny tekst i odrzucić nieistotne elementy. Niezależnie od tego, czy jesteś data scientist, badaczem rynku, tworzysz aplikację opartą na danych, czy prowadzisz badania, Python-Goose może znacząco usprawnić Twój przepływ pracy i pomóc wyciągnąć cenne wnioski z ogromnej sieci internetowej.

Previous Next

Rozpoczęcie pracy z Python-Goose

Zalecanym i najprostszym sposobem instalacji Python-Goose jest użycie Composer, narzędzia do zarządzania zależnościami dla PHP. Proszę użyć poniższego polecenia, aby przeprowadzić płynną instalację.

Zainstaluj Python-Goose za pomocą pip

pip install goose3 

Możesz również zainstalować go ręcznie; pobierz najnowsze pliki wydania bezpośrednio z repozytorium GitHub.

Ekstrakcja artykułów przy użyciu API Pythona

Biblioteka open source Python-Goose zapewnia bardzo przydatne funkcje do ładowania i wyodrębniania treści z różnych typów stron internetowych. Biblioteka specjalizuje się w wyciąganiu artykułów ze stron internetowych, filtrując niepotrzebne elementy, takie jak reklamy, nagłówki, stopki i paski boczne. Ponadto koncentruje się na pobieraniu podstawowej treści, w tym tytułu, tekstu, autora, daty publikacji oraz innych istotnych metadanych. Oto bardzo przydatny przykład, który pokazuje, jak użytkownicy mogą zdefiniować adres URL strony, którą chcą zeskrobać, i łatwo uzyskać dostęp do różnych właściwości obiektu artykułu, takich jak tytuł, autorzy, data publikacji i oczyszczony tekst.

Jak wyodrębnić artykuły ze strony internetowej przy użyciu API Pythona?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Wyodrębnianie konkretnych informacji ze stron internetowych w wielu językach przy użyciu Pythona

Biblioteka Python-Goose zawiera funkcję wykrywania języka, umożliwiając automatyczne rozpoznawanie języka treści strony internetowej. Ta funkcja jest szczególnie przydatna przy obsłudze wielojęzycznych witryn lub gdy chcesz filtrować treści w zależności od języka. Biblioteka pozwala programistom na dostęp do określonej części strony i wyodrębnienie jej, takiej jak główny tekst artykułu, obrazy artykułu, opis meta, tagi meta i tak dalej. Poniższy przykład pokazuje, jak wyodrębnić lub zeskrobać hiszpańską treść przy użyciu kodu Python.

Jak wyodrębnić hiszpańską treść ze strony internetowej w aplikacjach Pythona?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 Polski