HTMLページからコンテンツを抽出する無料のPythonライブラリ
画像やテキスト、公開日、言語情報など、Webページのコンテンツを抽出するオープンソースPythonライブラリ
デジタル情報の時代において、データは豊富でインターネット上で容易に入手できます。ウェブサイトから関連情報を抽出することは手間のかかる作業ですが、Python-Goose ライブラリを使用すれば、ウェブスクレイピングが楽になります。Python-Goose は堅牢で使いやすいライブラリで、開発者がウェブページから構造化データを簡単に抽出できるようにします。Julian Moreno Patiño によって開発され、ウェブページから記事などの有意義なコンテンツを抽出するよう設計されています。このライブラリはヒューリスティックと自然言語処理技術のセットを使用して HTML ドキュメントを分析し、関連するテキストコンテンツを特定します。
Python-Goose はインストールが非常に簡単で、多言語ウェブサイトの処理に完全に対応しています。このライブラリは言語検出機能を組み込んでおり、ウェブページのコンテンツの言語を自動的に識別します。ライブラリには、コンテンツの集約、研究・分析目的の構造化データ抽出、動画抽出、記事の要約生成、機械学習モデルの訓練用ウェブデータの前処理、ウェブページからの画像抽出など、重要な機能が多数含まれています。
Python-Goose は Python で書かれたオープンソースライブラリで、Python アプリケーション内でウェブページから有用な情報を抽出することを目的としたウェブスクレイピングタスクをシンプルかつ効果的に処理する方法を提供します。さまざまなアルゴリズムとヒューリスティックを用いて、最も関連性の高いテキストを特定し、不要な要素を除去します。データサイエンティスト、マーケットリサーチャー、データ駆動型アプリケーションの構築者、あるいは研究者であっても、Python-Goose はワークフローを大幅に効率化し、インターネット上の膨大な情報から貴重な洞察を抽出するのに役立ちます。
Python-Goose の入門
Python-Goose をインストールする推奨かつ最も簡単な方法は、PHP 用の依存管理ツールである Composer を使用することです。スムーズなインストールのために、以下のコマンドをご利用ください。
pip で Python-Goose をインストール
pip install goose3 手動でインストールすることもできます。最新のリリースファイルは GitHub リポジトリから直接ダウンロードしてください。
Python API を使用した記事抽出
オープンソースの Python-Goose ライブラリは、さまざまな種類のウェブサイトからコンテンツを読み込み、抽出するための非常に便利な機能を提供しています。このライブラリはウェブページから記事を抽出することに特化しており、広告、ヘッダー、フッター、サイドバーなどの不要な要素を除去します。さらに、タイトル、本文、著者、公開日、その他の関連メタデータなど、コアコンテンツの取得に重点を置いています。以下は、ユーザーがスクレイピングしたいウェブページの URL を定義し、記事オブジェクトのタイトル、著者、公開日、クリーンテキストなどのさまざまなプロパティに簡単にアクセスできる非常に有用な例です。
Python API を使用してウェブサイトから記事を抽出する方法は?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Python を使用して複数言語で特定のウェブページ情報を抽出する
Python-Goose ライブラリは言語検出機能を組み込んでおり、ウェブページのコンテンツの言語を自動的に識別できます。この機能は、多言語サイトを扱う場合や言語に基づいてコンテンツをフィルタリングしたい場合に特に有用です。ライブラリはソフトウェア開発者がウェブページの特定の部分にアクセスし、記事の本文、記事の画像、メタディスクリプション、メタタグなどを抽出できるようにします。以下の例は、Python コードを使用してスペイン語のコンテンツを抽出またはスクレイピングする方法を示しています。
Python アプリ内でウェブページからスペイン語コンテンツを抽出する方法は?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'