1. 제품
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

HTML 페이지에서 콘텐츠를 추출하는 무료 파이썬 라이브러리

이미지와 텍스트, 게시 날짜, 언어 정보 등 웹 페이지 콘텐츠를 추출하는 오픈 소스 파이썬 라이브러리

디지털 정보의 시대에 데이터는 풍부하고 인터넷에서 쉽게 접근할 수 있습니다. 웹사이트에서 관련 정보를 추출하는 일은 번거로운 작업이 될 수 있지만, Python-Goose 라이브러리를 사용하면 웹 스크래핑이 쉬워집니다. Python-Goose는 개발자가 웹 페이지에서 구조화된 데이터를 손쉽게 추출할 수 있게 해주는 견고하고 사용자 친화적인 라이브러리입니다. 이 라이브러리는 Julian Moreno Patiño에 의해 개발되었으며, 웹 페이지에서 기사와 같은 의미 있는 콘텐츠를 추출하도록 설계되었습니다. 이 라이브러리는 휴리스틱과 자연어 처리 기술을 사용하여 HTML 문서를 분석하고 관련 텍스트 콘텐츠를 식별합니다.

Python-Goose는 설치가 매우 간단하며 다국어 웹사이트 처리를 위한 완전한 지원을 제공합니다. 이 라이브러리는 언어 감지 기능을 포함하고 있어 웹 페이지 콘텐츠의 언어를 자동으로 식별합니다. 라이브러리에는 콘텐츠 집계, 연구 및 분석을 위한 구조화된 데이터 추출, 비디오 추출, 기사 요약 생성, 머신러닝 모델 학습을 위한 웹 데이터 전처리, 웹 페이지에서 이미지 추출 등 여러 중요한 기능이 포함되어 있습니다.

Python-Goose는 Python으로 작성된 오픈 소스 라이브러리로, Python 애플리케이션 내에서 웹 페이지로부터 유용한 정보를 추출하는 웹 스크래핑 작업을 간단하면서도 효과적으로 처리할 수 있게 해줍니다. 다양한 알고리즘과 휴리스틱을 사용하여 가장 관련성 높은 텍스트를 식별하고 불필요한 요소를 제거합니다. 데이터 과학자, 시장 조사자, 데이터 기반 애플리케이션을 구축하는 사람이나 연구를 수행하는 경우, Python-Goose는 작업 흐름을 크게 간소화하고 방대한 인터넷에서 귀중한 인사이트를 추출하는 데 도움을 줄 수 있습니다.

Previous Next

Python-Goose 시작하기

Python-Goose를 설치하는 권장되고 가장 쉬운 방법은 PHP용 의존성 관리 도구인 Composer를 사용하는 것입니다. 원활한 설치를 위해 다음 명령을 사용하십시오.

pip으로 Python-Goose 설치

pip install goose3 

수동으로 설치할 수도 있습니다; 최신 릴리스 파일을 GitHub 저장소에서 직접 다운로드하십시오.

Python API를 사용한 기사 추출

오픈 소스 Python-Goose 라이브러리는 다양한 유형의 웹사이트에서 콘텐츠를 로드하고 추출하는 데 매우 유용한 기능을 제공했습니다. 이 라이브러리는 웹 페이지에서 기사 추출을 전문으로 하며, 광고, 헤더, 푸터, 사이드바와 같은 불필요한 요소를 필터링합니다. 또한 제목, 텍스트, 저자, 발행일 및 기타 관련 메타데이터를 포함한 핵심 콘텐츠를 가져오는 데 중점을 둡니다. 아래는 사용자가 스크랩하려는 웹 페이지의 URL을 정의하고, 기사 객체의 제목, 저자, 발행일, 정제된 텍스트와 같은 다양한 속성에 쉽게 접근할 수 있는 매우 유용한 예시입니다.

Python API를 통해 웹사이트에서 기사 추출하는 방법은?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Python을 통해 여러 언어로 특정 웹페이지 정보 추출

Python-Goose 라이브러리는 언어 감지 기능을 포함하고 있어 웹 페이지 콘텐츠의 언어를 자동으로 식별할 수 있습니다. 이 기능은 다국어 웹사이트를 다루거나 언어별로 콘텐츠를 필터링하려는 경우에 특히 유용합니다. 이 라이브러리를 사용하면 소프트웨어 개발자가 웹 페이지의 특정 부분에 접근하여 기사 본문 텍스트, 기사 이미지, 메타 설명, 메타 태그 등과 같은 내용을 추출할 수 있습니다. 다음 예제는 Python 코드를 사용하여 스페인어 콘텐츠를 추출하거나 스크랩하는 방법을 보여줍니다.

Python 애플리케이션 내에서 웹페이지의 스페인어 콘텐츠를 추출하는 방법은?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 한국인