1. Məhsullar
  2.   HTML
  3.   Python
  4.   Requests-HTML
 
  

HTML Parsinqi və Veb Kazıma üçün Python Kitabxanası

Veb səhifə parsinqi, məlumat çıxarışı və veb kazıma işini asanlaşdıran Açıq Mənbəli Python Kitabxanası. Bu, inkişaf etmiş HTML parsinqi, JavaScript renderinqi və daha çoxunu təmin edir.

Veb informasiya okeanıdır və proqram təminatı inkişaf etdiriciləri kimi, tez-tez veb saytlarından xüsusi məlumatları çıxarmağa ehtiyac duyuruq. Veb kazıma məlumatları veb səhifələrdən toplama prosesini avtomatlaşdırmağa imkan verən güclü bir texnikadır. Mövcud çoxsaylı kitabxanalardan Requests-HTML çox yönlü və istifadəçi dostu bir seçim kimi önə çıxır. Bu, Requests və BeautifulSoup adlı iki məşhur kitabxananın gücünü birləşdirərək veb kazımanı mümkün edən Python kitabxanasıdır. Sadəlik və istifadənin asanlığı nəzərə alınaraq hazırlanmışdır, bu da onu həm yeni başlayanlar, həm də təcrübəli inkişaf etdiricilər üçün mükəmməl seçim edir.

Requests-HTML kitabxanası, tanınmış Requests kitabxanasına bənzər hiss etdirəcək şəkildə dizayn edilmiş intuitiv API təqdim edir, bu da HTTP sorğularına aşina olan hər kəs üçün asanlıqla öyrənilə bilmək deməkdir. Kitabxananın bir neçə vacib xüsusiyyəti var, məsələn, böyük HTML fayllarının parsinqi, CSS seçicilərin dəstəyi, XPath seçicilərin dəstəyi, saxta istifadəçi-agentı, avtomatik yönləndirmələrin izlənməsi, səhifədəki bütün linklərin siyahısını əldə etmək, elementin mətn məzmununu götürmək, element daxilində link axtarmaq, sessiya davamlılığını qorumaq, asan istifadəçi-agentı rotasiyası və daha bir çox şey.

Ənənəvi HTML parserlərindən fərqli olaraq, Requests-HTML JavaScript məzmununu renderləyə bilir, bu da AJAX və ya JavaScript çərçivələri vasitəsilə dinamik olaraq məlumat yükləyən veb saytlar üçün uyğun edir. Onun intuitiv API‑si, JavaScript renderləməsini dəstəkləməsi və CSS seçiciləri və ya XPath vasitəsilə elastik element seçimi hər hansı bir veb kazıma layihəsi üçün dəyərli bir alət edir. Araşdırma üçün məlumat toplayırsınızsa və ya veb tətbiqi qurursunuzsa, Requests-HTML kitabxanasını mütləq nəzərə almalısınız. Beləliklə, növbəti veb kazıma layihənizdə ona bir şans verməyə nə deyirsiniz? Kodlaşdırmağınız uğurlu olsun!

Previous Next

Requests-HTML ilə Başlanğıc

Tövsiyə olunan və ən asan yol Requests-HTML-i pip vasitəsilə quraşdırmaqdır. Zəhmət olmasa, problemsiz quraşdırma üçün aşağıdakı əmri istifadə edin.

Requests-HTML-i pip vasitəsilə quraşdırın

pip install requests-html

Siz həmçinin onu əl ilə quraşdıra bilərsiniz; son buraxılış fayllarını birbaşa GitHub deposundan yükləyin.

Python vasitəsilə HTML səhifəsindən məzmunu çıxarmaq

Açıq mənbəli Requests-HTML kitabxanası proqram inkişaf etdiricilərinə Python tətbiqləri daxilində HTML fayldan məzmunu yükləmək və çıxarmaq imkanı verir. Kitabxananı fərqləndirən əsas xüsusiyyətlərdən biri onun PyQuery ilə problemsiz inteqrasiyasıdır. Bu inteqrasiya kitabxananın HTML sənədlərini asanlıqla təhlil etməsinə və jQuery‑ə bənzər seçicilərdən istifadə edərək məlumatları çıxarmasına imkan verir. Bu çeviklik məlumat çıxarılmasını sadələşdirir və inkişaf etdiricilərin vaxt və səyini qənaət edir. Aşağıdakı nümunələr proqram inkişaf etdiricilərinin yalnız bir neçə Python sətiri ilə veb səhifənin başlıqlarını və linklərini necə çıxara biləcəyini göstərir.

Python API vasitəsilə veb səhifənin başlıqlarını və linklərini necə çıxarmaq olar?

from requests_html import HTMLSession

url = 'https://www.example-blog.com'
session = HTMLSession()
response = session.get(url)

# Render JavaScript to ensure dynamic content loads
response.html.render()

# Extract titles and links of the latest articles
articles = response.html.find('.article')

for article in articles:
    title = article.find('.title', first=True).text
    link = article.find('a', first=True).attrs['href']
    print(f"Title: {title}\nLink: {link}\n")

Veb səhifəni təhlil edin və Python vasitəsilə müəyyən element çıxarın

Açıq mənbəli Requests-HTML kitabxanası Python API vasitəsilə HTML sənədində müəyyən bir elementi çıxarmaq üçün çox faydalı bir xüsusiyyət təqdim edib. Kitabxana həm CSS seçicilərini, həm də XPath ifadələrini dəstəkləyir, bu da HTML səhifəsindən xüsusi elementləri seçmək və çıxarmaq üçün sizə çeviklik verir. Kitabxana daha mürəkkəb element seçimi üçün XPath ifadələrindən istifadəni də dəstəkləyir. Həmçinin kitabxana veb formaları ilə qarşılıqlı əlaqə üçün tam dəstək təmin edir. Aşağıdakı nümunə Requests-HTML kitabxanası ilə veb səhifəni necə asanlıqla kazımaq (scrape) oluna biləcəyini göstərir.

Python kitabxanası ilə HTMP səhifəsinin müəyyən elementini necə çıxarmaq olar?

from requests_html import HTMLSession

# Create an HTML session
session = HTMLSession()

# Send a GET request and render JavaScript (if any)
response = session.get('https://example.com')

# Access page content
html_content = response.text

# Extract specific elements using CSS selectors
titles = response.html.find('.article-title')

# Print the titles
for title in titles:
    print(title.text)

 Azəri