Perpustakaan Python Percuma untuk Mengekstrak Kandungan dari Halaman HTML
Perpustakaan Python Sumber Terbuka untuk Mengekstrak Kandungan Halaman Web seperti Imej & Teks, Tarikh Penerbitan, Maklumat Bahasa dan sebagainya..
Pada era maklumat digital, data berlimpah dan mudah didapati di internet. Mengekstrak maklumat yang relevan dari laman web boleh menjadi tugas yang sukar, tetapi dengan perpustakaan Python-Goose, pengikisan web menjadi mudah. Python-Goose adalah perpustakaan yang kukuh dan mesra pengguna yang membolehkan pemaju mengekstrak data berstruktur dari halaman web dengan mudah. Ia dibangunkan oleh Julian Moreno Patiño dan direka untuk mengekstrak kandungan bermakna, seperti artikel, dari halaman web. Perpustakaan ini menggunakan satu set heuristik dan teknik pemprosesan bahasa semula jadi untuk menganalisis dokumen HTML dan mengenal pasti kandungan teks yang relevan.
Python-Goose sangat mudah dipasang dan menyediakan sokongan lengkap untuk mengendalikan laman web berbilang bahasa. Perpustakaan ini menggabungkan keupayaan pengesanan bahasa, yang secara automatik mengenal pasti bahasa kandungan halaman web. Terdapat beberapa ciri penting dalam perpustakaan ini, seperti pengagregatan kandungan, mengekstrak data berstruktur untuk tujuan penyelidikan dan analisis, pengekstrakan video, menjana ringkasan artikel, pra-pemprosesan data web untuk melatih model pembelajaran mesin, mengekstrak imej dari halaman web, dan banyak lagi.
Python-Goose ialah perpustakaan sumber terbuka yang ditulis dalam Python dan menyediakan cara yang mudah tetapi berkesan untuk mengendalikan tugas pengikisan web yang bertujuan mengekstrak maklumat berharga daripada halaman web dalam aplikasi Python. Ia menggunakan pelbagai algoritma dan heuristik untuk mengenal pasti teks yang paling relevan dan menyingkirkan elemen yang tidak relevan. Sama ada anda seorang saintis data, penyelidik pasaran, membina aplikasi berasaskan data, atau menjalankan penyelidikan, Python-Goose dapat memperkemas aliran kerja anda dengan ketara dan membantu anda mengekstrak wawasan berharga daripada luasnya internet.
Mula Menggunakan Python-Goose
Cara yang disyorkan dan paling mudah untuk memasang Python-Goose ialah menggunakan Composer, alat pengurusan kebergantungan untuk PHP. Sila gunakan perintah berikut untuk pemasangan yang lancar.
Pasang Python-Goose melalui pip
pip install goose3 Anda juga boleh memasangnya secara manual; muat turun fail pelepasan terkini secara langsung dari repositori GitHub.
Pengekstrakan Artikel menggunakan API Python
Perpustakaan sumber terbuka Python-Goose telah menyediakan ciri-ciri yang sangat berguna untuk memuatkan dan mengekstrak kandungan daripada pelbagai jenis laman web. Perpustakaan ini khusus dalam mengekstrak artikel daripada halaman web, menapis elemen yang tidak diperlukan seperti iklan, tajuk, kaki halaman, dan bar sisi. Selain itu, ia menumpukan pada mendapatkan kandungan teras, termasuk tajuk, teks, pengarang, tarikh penerbitan, dan metadata relevan lain. Berikut adalah contoh yang sangat berguna yang menunjukkan bagaimana pengguna boleh menentukan URL halaman web yang ingin mereka scrape dan dengan mudah mengakses pelbagai sifat objek artikel, seperti tajuk, pengarang, tarikh terbit, dan teks yang telah dibersihkan.
Bagaimana Mengekstrak Artikel dari Laman Web melalui API Python?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Ekstrak Maklumat Laman Web Tertentu dalam Pelbagai Bahasa melalui Python
Perpustakaan Python-Goose menggabungkan fungsi pengesanan bahasa, membolehkannya mengenal pasti bahasa kandungan halaman web secara automatik. Ciri ini sangat berguna apabila berurusan dengan laman web berbilang bahasa atau apabila anda ingin menapis kandungan berdasarkan bahasa. Perpustakaan ini membolehkan pemaju perisian mengakses bahagian tertentu halaman web dan mengekstraknya seperti teks utama artikel, imej artikel, deskripsi Meta, tag Meta, dan sebagainya. Contoh berikut menunjukkan cara mengekstrak atau mengikis kandungan bahasa Sepanyol menggunakan kod Python.
Bagaimana Mengekstrak Kandungan Sepanyol dari Laman Web dalam Aplikasi Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'