1. Producten
  2.   HTML
  3.   Python
  4.   Requests-HTML
 
  

Python-bibliotheek voor HTML-parsing en webscraping

Open source Python-bibliotheek die webpagina-parsing, gegevensextractie en webscraping mogelijk maakt. Het ondersteunt geavanceerde HTML-parsing, JavaScript-rendering en meer.

Het web is een oceaan van informatie, en als softwareontwikkelaars komen we vaak in de situatie waarin we specifieke gegevens van websites moeten extraheren. Webscraping is een krachtige techniek die ons in staat stelt het proces van het verzamelen van gegevens van webpagina's te automatiseren. Van de vele beschikbare bibliotheken springt Requests-HTML eruit als een veelzijdige en gebruiksvriendelijke optie. Het is een Python-bibliotheek die webscraping mogelijk maakt door de kracht van twee populaire bibliotheken te combineren - Requests en BeautifulSoup. Het is ontworpen met eenvoud en gebruiksgemak in gedachten, waardoor het een uitstekende keuze is voor zowel beginners als ervaren ontwikkelaars.

De Requests-HTML bibliotheek biedt een intuïtieve API die is ontworpen om vergelijkbaar aan te voelen met de bekende Requests-bibliotheek, waardoor het gemakkelijk op te pakken is voor iedereen die bekend is met HTTP-verzoeken. Er zijn verschillende belangrijke functies onderdeel van de bibliotheek, zoals het parseren van grote HTML-bestanden, ondersteuning voor CSS-selectors, ondersteuning voor XPath-selectors, gesimuleerde user-agent, automatische volg van redirects, het ophalen van een lijst met alle links op de pagina, het ophalen van de tekstinhoud van een element, zoeken naar links binnen een element, het behouden van sessie‑persistentie, eenvoudige rotatie van user-agents en nog veel meer.

In tegenstelling tot traditionele HTML-parsers kan Requests-HTML JavaScript-inhoud renderen, waardoor het geschikt is voor websites die gegevens dynamisch laden met AJAX of JavaScript-frameworks. De intuïtieve API, ondersteuning voor JavaScript-rendering en flexibele elementselectie met CSS-selectors of XPath maken het een waardevol hulpmiddel voor elk webscraping-project. Of je nu gegevens verzamelt voor onderzoek of een webapplicatie bouwt, de Requests-HTML-bibliotheek is zeker het overwegen waard. Dus, waarom probeer je het niet in je volgende webscraping-project? Veel plezier met coderen!

Previous Next

Aan de slag met Requests-HTML

De aanbevolen en gemakkelijkste manier om Requests-HTML te installeren is via pip. Gebruik alstublieft het volgende commando voor een soepele installatie.

Installeer Requests-HTML via pip

pip install requests-html

Je kunt het ook handmatig installeren; download de nieuwste releasebestanden rechtstreeks van de GitHub repository.

Inhoud extraheren van een HTML-pagina via Python

De open source Requests-HTML bibliotheek stelt softwareontwikkelaars in staat om inhoud te laden en te extraheren uit een HTML‑bestand binnen Python‑toepassingen. Een van de kernfuncties die de bibliotheek onderscheidt, is de naadloze integratie met PyQuery. Deze integratie maakt het mogelijk de bibliotheek HTML‑documenten moeiteloos te parseren en gegevens te extraheren met jQuery‑achtige selectors. Deze flexibiliteit vereenvoudigt gegevensextractie en bespaart ontwikkelaars tijd en moeite. De volgende voorbeelden laten zien hoe softwareontwikkelaars de titels en links van een webpagina kunnen extraheren met slechts een paar regels Python‑code.

Hoe de titels en links van een webpagina extraheren via de Python API?

from requests_html import HTMLSession

url = 'https://www.example-blog.com'
session = HTMLSession()
response = session.get(url)

# Render JavaScript to ensure dynamic content loads
response.html.render()

# Extract titles and links of the latest articles
articles = response.html.find('.article')

for article in articles:
    title = article.find('.title', first=True).text
    link = article.find('a', first=True).attrs['href']
    print(f"Title: {title}\nLink: {link}\n")

Een webpagina parseren & een specifiek element extraheren via Python

De open source Requests-HTML bibliotheek biedt een zeer handige functie voor het extraheren van een specifiek element binnen een HTML‑document via de Python‑API. De bibliotheek ondersteunt zowel CSS‑selectors als XPath‑expressies, waardoor je flexibiliteit hebt bij het selecteren en extraheren van specifieke elementen van de HTML‑pagina. De bibliotheek ondersteunt ook het gebruik van XPath‑expressies voor complexere elementselectie. Daarnaast biedt de bibliotheek volledige ondersteuning voor interactie met webformulieren. Het volgende voorbeeld laat zien hoe eenvoudig het is om een webpagina te scrapen met de Requests-HTML bibliotheek.

Hoe een specifiek element van een HTML-pagina extraheren via een Python-bibliotheek?

from requests_html import HTMLSession

# Create an HTML session
session = HTMLSession()

# Send a GET request and render JavaScript (if any)
response = session.get('https://example.com')

# Access page content
html_content = response.text

# Extract specific elements using CSS selectors
titles = response.html.find('.article-title')

# Print the titles
for title in titles:
    print(title.text)

 Dutch