Perpustakaan Python Gratis untuk Mengekstrak Konten dari Halaman HTML
Perpustakaan Python Open Source untuk Mengekstrak Konten Halaman Web seperti Gambar & Teks, Tanggal Publikasi, Info Bahasa, dan sebagainya..
Di era informasi digital, data melimpah dan mudah diakses di internet. Mengekstrak informasi relevan dari situs web dapat menjadi tugas yang merepotkan, tetapi dengan pustaka Python-Goose, web scraping menjadi mudah. Python-Goose adalah pustaka yang kuat dan ramah pengguna yang memungkinkan pengembang mengekstrak data terstruktur dari halaman web dengan mudah. Pustaka ini dikembangkan oleh Julian Moreno Patiño dan dirancang untuk mengekstrak konten bermakna, seperti artikel, dari halaman web. Pustaka ini menggunakan sekumpulan heuristik dan teknik pemrosesan bahasa alami untuk menganalisis dokumen HTML dan mengidentifikasi konten teks yang relevan.
Python-Goose sangat mudah dipasang dan menyediakan dukungan lengkap untuk menangani situs web multibahasa. Pustaka ini menggabungkan kemampuan deteksi bahasa, yang secara otomatis mengidentifikasi bahasa konten halaman web. Ada beberapa fitur penting dalam pustaka ini, seperti agregasi konten, mengekstrak data terstruktur untuk keperluan penelitian dan analisis, ekstraksi video, menghasilkan ringkasan artikel, pra-pemrosesan data web untuk melatih model pembelajaran mesin, mengekstrak gambar dari halaman web, dan masih banyak lagi.
Python-Goose adalah pustaka sumber terbuka yang ditulis dalam Python dan menyediakan cara yang sederhana namun efektif untuk menangani tugas web scraping yang bertujuan mengekstrak informasi berharga dari halaman web dalam aplikasi Python. Ia menggunakan berbagai algoritma dan heuristik untuk mengidentifikasi teks yang paling relevan dan mengabaikan elemen yang tidak relevan. Baik Anda seorang ilmuwan data, peneliti pasar, membangun aplikasi berbasis data, atau melakukan penelitian, Python-Goose dapat secara signifikan menyederhanakan alur kerja Anda dan membantu Anda mengekstrak wawasan berharga dari luasnya internet.
Memulai dengan Python-Goose
Cara yang direkomendasikan dan paling mudah untuk menginstal Python-Goose adalah menggunakan Composer, alat manajemen dependensi untuk PHP. Silakan gunakan perintah berikut untuk instalasi yang lancar.
Instal Python-Goose via pip
pip install goose3 Anda juga dapat menginstalnya secara manual; unduh file rilis terbaru langsung dari GitHub repository.
Ekstraksi Artikel menggunakan API Python
Perpustakaan Python-Goose sumber terbuka telah menyediakan fitur yang sangat berguna untuk memuat dan mengekstrak konten dari berbagai jenis situs web. Perpustakaan ini mengkhususkan diri dalam mengekstrak artikel dari halaman web, menyaring elemen yang tidak diperlukan seperti iklan, header, footer, dan sidebar. Selain itu, ia fokus pada pengambilan konten inti, termasuk judul, teks, penulis, tanggal publikasi, dan metadata relevan lainnya. Berikut adalah contoh yang sangat berguna yang menunjukkan bagaimana pengguna dapat menentukan URL halaman web yang ingin mereka scrape dan dengan mudah mengakses berbagai properti objek artikel, seperti judul, penulis, tanggal publikasi, dan teks yang telah dibersihkan.
Cara Mengekstrak Artikel dari Situs Web melalui API Python?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Ekstrak Informasi Halaman Web Tertentu dalam Berbagai Bahasa melalui Python
Library Python-Goose menggabungkan fungsi deteksi bahasa, memungkinkan ia mengidentifikasi bahasa konten halaman web secara otomatis. Fitur ini sangat berguna saat menangani situs web multibahasa atau ketika Anda ingin memfilter konten berdasarkan bahasa. Library ini memungkinkan pengembang perangkat lunak mengakses bagian tertentu dari halaman web dan mengekstraknya seperti teks utama artikel, gambar artikel, deskripsi Meta, tag Meta, dan sebagainya. Contoh berikut menunjukkan cara mengekstrak atau meng-scrape konten berbahasa Spanyol menggunakan kode Python.
Cara Mengekstrak Konten Bahasa Spanyol dari Halaman Web dalam Aplikasi Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'