Darmowa biblioteka Pythona do wyodrębniania treści ze stron HTML
Otwarta biblioteka Pythona do wyodrębniania treści ze stron internetowych, takich jak obrazy i tekst, data publikacji, informacje o języku i inne..
W erze informacji cyfrowej dane są obfite i łatwo dostępne w internecie. Wydobywanie istotnych informacji ze stron internetowych może być uciążliwym zadaniem, ale dzięki bibliotece Python-Goose scraping staje się prosty. Python-Goose to solidna i przyjazna dla użytkownika biblioteka, która pozwala programistom bez wysiłku wyodrębniać ustrukturyzowane dane ze stron WWW. Została opracowana przez Juliana Moreno Patiño i jest przeznaczona do wyciągania wartościowej treści, takiej jak artykuły, ze stron internetowych. Biblioteka wykorzystuje zestaw heurystyk i technik przetwarzania języka naturalnego do analizy dokumentów HTML i identyfikacji istotnej treści tekstowej.
Python-Goose jest bardzo łatwy w instalacji i zapewnia pełne wsparcie dla obsługi wielojęzycznych stron internetowych. Biblioteka zawiera funkcje wykrywania języka, które automatycznie identyfikują język treści strony WWW. W skład biblioteki wchodzi wiele istotnych funkcji, takich jak agregacja treści, wyodrębnianie ustrukturyzowanych danych do celów badawczych i analitycznych, ekstrakcja wideo, generowanie streszczeń artykułów, wstępne przetwarzanie danych internetowych do trenowania modeli uczenia maszynowego, wyciąganie obrazów ze stron oraz wiele innych.
Python-Goose jest otwarto‑źródłową biblioteką napisaną w języku Python i zapewnia prosty, a jednocześnie skuteczny sposób obsługi zadań związanych z web scrapingiem, które mają na celu wyodrębnienie cennych informacji ze stron internetowych w aplikacjach Pythona. Wykorzystuje różne algorytmy i heurystyki, aby zidentyfikować najbardziej istotny tekst i odrzucić nieistotne elementy. Niezależnie od tego, czy jesteś data scientist, badaczem rynku, tworzysz aplikację opartą na danych, czy prowadzisz badania, Python-Goose może znacząco usprawnić Twój przepływ pracy i pomóc wyciągnąć cenne wnioski z ogromnej sieci internetowej.
Rozpoczęcie pracy z Python-Goose
Zalecanym i najprostszym sposobem instalacji Python-Goose jest użycie Composer, narzędzia do zarządzania zależnościami dla PHP. Proszę użyć poniższego polecenia, aby przeprowadzić płynną instalację.
Zainstaluj Python-Goose za pomocą pip
pip install goose3 Możesz również zainstalować go ręcznie; pobierz najnowsze pliki wydania bezpośrednio z repozytorium GitHub.
Ekstrakcja artykułów przy użyciu API Pythona
Biblioteka open source Python-Goose zapewnia bardzo przydatne funkcje do ładowania i wyodrębniania treści z różnych typów stron internetowych. Biblioteka specjalizuje się w wyciąganiu artykułów ze stron internetowych, filtrując niepotrzebne elementy, takie jak reklamy, nagłówki, stopki i paski boczne. Ponadto koncentruje się na pobieraniu podstawowej treści, w tym tytułu, tekstu, autora, daty publikacji oraz innych istotnych metadanych. Oto bardzo przydatny przykład, który pokazuje, jak użytkownicy mogą zdefiniować adres URL strony, którą chcą zeskrobać, i łatwo uzyskać dostęp do różnych właściwości obiektu artykułu, takich jak tytuł, autorzy, data publikacji i oczyszczony tekst.
Jak wyodrębnić artykuły ze strony internetowej przy użyciu API Pythona?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Wyodrębnianie konkretnych informacji ze stron internetowych w wielu językach przy użyciu Pythona
Biblioteka Python-Goose zawiera funkcję wykrywania języka, umożliwiając automatyczne rozpoznawanie języka treści strony internetowej. Ta funkcja jest szczególnie przydatna przy obsłudze wielojęzycznych witryn lub gdy chcesz filtrować treści w zależności od języka. Biblioteka pozwala programistom na dostęp do określonej części strony i wyodrębnienie jej, takiej jak główny tekst artykułu, obrazy artykułu, opis meta, tagi meta i tak dalej. Poniższy przykład pokazuje, jak wyodrębnić lub zeskrobać hiszpańską treść przy użyciu kodu Python.
Jak wyodrębnić hiszpańską treść ze strony internetowej w aplikacjach Pythona?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'