Thư viện Python miễn phí để trích xuất Nội dung từ các Trang HTML
Thư viện Python mã nguồn mở để trích xuất Nội dung các Trang Web như Hình ảnh & Văn bản, Ngày xuất bản, Thông tin ngôn ngữ và các thứ khác..
Trong thời đại thông tin kỹ thuật số, dữ liệu phong phú và sẵn có trên internet. Việc trích xuất thông tin liên quan từ các trang web có thể là một nhiệm vụ khó khăn, nhưng với thư viện Python-Goose, việc thu thập dữ liệu web trở nên dễ dàng. Python-Goose là một thư viện mạnh mẽ và thân thiện với người dùng, cho phép các nhà phát triển trích xuất dữ liệu có cấu trúc từ các trang web một cách dễ dàng. Nó được phát triển bởi Julian Moreno Patiño và được thiết kế để trích xuất nội dung có ý nghĩa, chẳng hạn như các bài báo, từ các trang web. Thư viện sử dụng một tập hợp các heuristic và kỹ thuật xử lý ngôn ngữ tự nhiên để phân tích tài liệu HTML và xác định nội dung văn bản liên quan.
Python-Goose rất dễ cài đặt và đã cung cấp hỗ trợ đầy đủ cho việc xử lý các trang web đa ngôn ngữ. Thư viện tích hợp khả năng phát hiện ngôn ngữ, tự động xác định ngôn ngữ của nội dung trang web. Có nhiều tính năng quan trọng của thư viện, chẳng hạn như tổng hợp nội dung, trích xuất dữ liệu có cấu trúc cho mục đích nghiên cứu và phân tích, trích xuất video, tạo bản tóm tắt các bài báo, tiền xử lý dữ liệu web để huấn luyện mô hình học máy, trích xuất hình ảnh từ các trang web, và nhiều hơn nữa.
Python-Goose là một thư viện mã nguồn mở được viết bằng Python và cung cấp một cách đơn giản nhưng hiệu quả để xử lý các nhiệm vụ thu thập dữ liệu web nhằm trích xuất thông tin có giá trị từ các trang web trong các ứng dụng Python. Nó sử dụng nhiều thuật toán và heuristics để xác định văn bản liên quan nhất và loại bỏ các yếu tố không liên quan. Dù bạn là nhà khoa học dữ liệu, nhà nghiên cứu thị trường, đang xây dựng một ứng dụng dựa trên dữ liệu, hay thực hiện nghiên cứu, Python-Goose có thể tối ưu hoá quy trình làm việc của bạn một cách đáng kể và giúp bạn trích xuất những hiểu biết giá trị từ không gian rộng lớn của internet.
Bắt đầu với Python-Goose
Cách đề xuất và dễ nhất để cài đặt Python-Goose là sử dụng Composer, công cụ quản lý phụ thuộc cho PHP. Vui lòng sử dụng lệnh sau để cài đặt suôn sẻ.
Cài đặt Python-Goose qua pip
pip install goose3 Bạn cũng có thể cài đặt thủ công; tải xuống các tệp phát hành mới nhất trực tiếp từ GitHub kho.
Trích xuất bài viết bằng API Python
Thư viện mã nguồn mở Python-Goose đã cung cấp các tính năng rất hữu ích để tải và trích xuất nội dung từ nhiều loại trang web khác nhau. Thư viện này chuyên về việc trích xuất các bài báo từ các trang web, lọc bỏ các yếu tố không cần thiết như quảng cáo, tiêu đề, chân trang và thanh bên. Hơn nữa, nó tập trung vào việc lấy nội dung cốt lõi, bao gồm tiêu đề, văn bản, tác giả, ngày xuất bản và các siêu dữ liệu liên quan khác. Dưới đây là một ví dụ rất hữu ích cho thấy cách người dùng có thể định nghĩa URL của trang web mà họ muốn thu thập dữ liệu và dễ dàng truy cập các thuộc tính khác nhau của đối tượng bài báo, chẳng hạn như tiêu đề, tác giả, ngày xuất bản và văn bản đã được làm sạch.
Cách trích xuất bài viết từ một trang web qua API Python?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Trích xuất thông tin trang web cụ thể bằng nhiều ngôn ngữ thông qua Python
Thư viện Python-Goose tích hợp chức năng phát hiện ngôn ngữ, cho phép nó tự động xác định ngôn ngữ của nội dung trên một trang web. Tính năng này đặc biệt hữu ích khi làm việc với các trang web đa ngôn ngữ hoặc khi bạn muốn lọc nội dung dựa trên ngôn ngữ. Thư viện cho phép các nhà phát triển phần mềm truy cập vào một phần cụ thể của trang web và trích xuất nó, chẳng hạn như văn bản chính của một bài viết, hình ảnh của bài viết, mô tả Meta, thẻ Meta, v.v. Ví dụ sau đây cho thấy cách trích xuất hoặc thu thập nội dung tiếng Tây Ban Nha bằng mã Python.
Cách trích xuất nội dung tiếng Tây Ban Nha từ một trang web trong các ứng dụng Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'