1. Produk
  2.   HTML
  3.   Python
  4.   Requests-HTML
 
  

Perpustakaan Python untuk Penguraian HTML & Pengikisan Web

Perpustakaan Python Sumber Terbuka yang Memudahkan Penguraian Laman Web, Pengekstrakan Data & Pengikisan Web. Ia membenarkan penguraian HTML lanjutan, rendering JavaScript, dan banyak lagi.

Web adalah lautan maklumat, dan sebagai pembangun perisian, kami sering mendapati diri kami memerlukan mengekstrak data khusus daripada laman web. Web scraping adalah teknik yang kuat yang membolehkan kami mengautomasikan proses pengumpulan data daripada halaman web. Antara pelbagai perpustakaan yang tersedia, Requests-HTML menonjol sebagai pilihan yang serba boleh dan mesra pengguna. Ia adalah perpustakaan Python yang membolehkan web scraping dengan menggabungkan kuasa dua perpustakaan popular - Requests dan BeautifulSoup. Ia direka dengan kesederhanaan dan kemudahan penggunaan dalam fikiran, menjadikannya pilihan yang cemerlang untuk pemula serta pembangun berpengalaman.

Perpustakaan Requests-HTML menyediakan API intuitif yang direka untuk terasa serupa dengan perpustakaan Requests yang terkenal, memudahkan sesiapa yang biasa dengan permintaan HTTP untuk menggunakannya. Terdapat beberapa ciri penting dalam perpustakaan ini, seperti mengurai fail HTML besar, sokongan pemilih CSS, sokongan pemilih XPath, user-agent tiruan, pengalihan automatik, mendapatkan senarai semua pautan pada halaman, mendapatkan kandungan teks elemen, mencari pautan dalam elemen, mengekalkan ketekalan sesi, putaran user-agent yang mudah dan banyak lagi.

Berbeza dengan pengurai HTML tradisional, Requests-HTML mampu merender kandungan JavaScript, menjadikannya sesuai untuk laman web yang memuat data secara dinamik menggunakan AJAX atau kerangka kerja JavaScript. API yang intuitif, sokongan untuk rendering JavaScript, dan pemilihan elemen yang fleksibel menggunakan pemilih CSS atau XPath menjadikannya alat yang berharga untuk sebarang projek pengikisan web. Sama ada anda mengumpul data untuk penyelidikan atau membina aplikasi web, perpustakaan Requests-HTML pasti patut dipertimbangkan. Jadi, mengapa tidak mencubanya dalam projek pengikisan web anda yang seterusnya? Selamat mengekod!

Previous Next

Mula Menggunakan Requests-HTML

Cara yang disyorkan dan paling mudah untuk memasang Requests-HTML ialah menggunakan pip. Sila gunakan perintah berikut untuk pemasangan yang lancar.

Pasang Requests-HTML melalui pip

pip install requests-html

Anda juga boleh memasangnya secara manual; muat turun fail pelepasan terkini secara langsung dari repositori GitHub.

Ekstrak Kandungan dari Halaman HTML melalui Python

Perpustakaan sumber terbuka Requests-HTML membolehkan pembangun perisian memuat dan mengekstrak kandungan daripada fail HTML dalam aplikasi Python. Salah satu ciri teras yang membezakan perpustakaan ini ialah integrasinya yang lancar dengan PyQuery. Integrasi ini membolehkan perpustakaan dengan mudah mengurai dokumen HTML dan mengekstrak data menggunakan pemilih berjenis jQuery. Fleksibiliti ini mempermudah pengekstrakan data dan menjimatkan masa serta usaha pembangun. Contoh berikut menunjukkan bagaimana pembangun perisian dapat mengekstrak tajuk dan pautan halaman web dengan hanya beberapa baris kod Python.

Bagaimana Mengekstrak Tajuk dan Pautan Halaman Web melalui API Python?

from requests_html import HTMLSession

url = 'https://www.example-blog.com'
session = HTMLSession()
response = session.get(url)

# Render JavaScript to ensure dynamic content loads
response.html.render()

# Extract titles and links of the latest articles
articles = response.html.find('.article')

for article in articles:
    title = article.find('.title', first=True).text
    link = article.find('a', first=True).attrs['href']
    print(f"Title: {title}\nLink: {link}\n")

Menghurai Halaman Web & Mengekstrak Elemen Partikel melalui Python

Perpustakaan sumber terbuka Requests-HTML telah menyediakan ciri yang sangat berguna untuk mengekstrak elemen tertentu dalam dokumen HTML melalui API Python. Perpustakaan ini menyokong kedua-dua pemilih CSS dan ekspresi XPath, memberikan anda fleksibiliti dalam memilih dan mengekstrak elemen khusus dari halaman HTML. Perpustakaan ini juga menyokong penggunaan ekspresi XPath untuk pemilihan elemen yang lebih kompleks. Selain itu, perpustakaan ini menyediakan sokongan penuh untuk berinteraksi dengan borang web. Contoh berikut menunjukkan betapa mudahnya mengikis halaman web menggunakan perpustakaan Requests-HTML.

Bagaimana Mengekstrak Elemen Tertentu dari Halaman HTMP melalui Perpustakaan Python?

from requests_html import HTMLSession

# Create an HTML session
session = HTMLSession()

# Send a GET request and render JavaScript (if any)
response = session.get('https://example.com')

# Access page content
html_content = response.text

# Extract specific elements using CSS selectors
titles = response.html.find('.article-title')

# Print the titles
for title in titles:
    print(title.text)

 Melayu