1. สินค้า
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

ไลบรารี Python ฟรีสำหรับดึงเนื้อหาจากหน้า HTML

ไลบรารี Python แบบโอเพนซอร์สสำหรับดึงเนื้อหาหน้าเว็บ เช่น รูปภาพและข้อความ, วันที่เผยแพร่, ข้อมูลภาษา และอื่น ๆ

ในยุคของข้อมูลดิจิทัล ข้อมูลมีมากมายและพร้อมใช้งานบนอินเทอร์เน็ต การสกัดข้อมูลที่เกี่ยวข้องจากเว็บไซต์อาจเป็นงานที่ยุ่งยาก แต่ด้วยไลบรารี Python‑Goose การทำเว็บสครัปปิ้งก็กลายเป็นเรื่องง่าย Python‑Goose เป็นไลบรารีที่แข็งแกร่งและใช้งานง่าย ซึ่งช่วยให้นักพัฒนาสามารถสกัดข้อมูลเชิงโครงสร้างจากหน้าเว็บได้อย่างไม่มีความยุ่งยาก มันถูกพัฒนาโดย Julian Moreno Patiño และออกแบบมาเพื่อสกัดเนื้อหาที่มีความหมาย เช่น บทความ จากหน้าเว็บ ไลบรารีนี้ใช้ชุดของอัลกอริทึมและเทคนิคการประมวลผลภาษาธรรมชาติเพื่อวิเคราะห์เอกสาร HTML และระบุเนื้อหาข้อความที่เกี่ยวข้อง

Python‑Goose ติดตั้งได้ง่ายมากและให้การสนับสนุนเต็มรูปแบบสำหรับการจัดการเว็บไซต์หลายภาษา ไลบรารีนี้รวมความสามารถในการตรวจจับภาษา ซึ่งจะระบุภาษาของเนื้อหาในหน้าเว็บโดยอัตโนมัติ มีคุณลักษณะที่สำคัญหลายอย่างเป็นส่วนหนึ่งของไลบรารี เช่น การรวบรวมเนื้อหา การสกัดข้อมูลเชิงโครงสร้างเพื่อการวิจัยและการวิเคราะห์ การสกัดวิดีโอ การสร้างสรุปของบทความ การเตรียมข้อมูลเว็บสำหรับการฝึกโมเดลแมชชีนเลิร์นนิง การสกัดรูปภาพจากหน้าเว็บ และอื่น ๆ อีกมากมาย

Python-Goose เป็นไลบรารีโอเพ่นซอร์สที่เขียนด้วยภาษา Python และให้วิธีการที่ง่ายแต่มีประสิทธิภาพในการจัดการงานเว็บสเกรปที่มุ่งหมายดึงข้อมูลที่มีคุณค่าจากหน้าเว็บภายในแอปพลิเคชัน Python มันใช้หลายอัลกอริทึมและฮิวริสติกเพื่อระบุข้อความที่เกี่ยวข้องที่สุดและละทิ้งองค์ประกอบที่ไม่เกี่ยวข้อง ไม่ว่าคุณจะเป็นนักวิทยาศาสตร์ข้อมูล, นักวิจัยตลาด, ผู้สร้างแอปพลิเคชันที่ขับเคลื่อนด้วยข้อมูล, หรือกำลังทำการวิจัย, Python-Goose สามารถทำให้กระบวนการทำงานของคุณเป็นระบบและช่วยดึงข้อมูลเชิงลึกที่มีค่าออกจากอินเทอร์เน็ตที่กว้างใหญ่ได้อย่างมีประสิทธิภาพ.

Previous Next

เริ่มต้นกับ Python-Goose

วิธีที่แนะนำและง่ายที่สุดในการติดตั้ง Python-Goose คือการใช้ Composer ซึ่งเป็นเครื่องมือจัดการการพึ่งพาสำหรับ PHP. กรุณาใช้คำสั่งต่อไปนี้เพื่อการติดตั้งที่ราบรื่น.

ติดตั้ง Python-Goose ผ่าน pip

pip install goose3 

คุณยังสามารถติดตั้งด้วยตนเองได้; ดาวน์โหลดไฟล์เวอร์ชันล่าสุดโดยตรงจาก GitHub คลังข้อมูล.

การสกัดบทความโดยใช้ Python API

ไลบรารี Python‑Goose แบบโอเพนซอร์สได้มอบคุณลักษณะที่มีประโยชน์อย่างมากสำหรับการโหลดและสกัดเนื้อหาจากเว็บไซต์ประเภทต่าง ๆ ไลบรารีนี้เชี่ยวชาญในการสกัดบทความจากหน้าเว็บ โดยกรองเอาองค์ประกอบที่ไม่จำเป็นออก เช่น โฆษณา, ส่วนหัว, ส่วนท้าย และแถบด้านข้าง นอกจากนี้ยังมุ่งเน้นการดึงเนื้อหาหลัก รวมถึงหัวเรื่อง, ข้อความ, ผู้เขียน, วันที่เผยแพร่ และเมตาดาต้าที่เกี่ยวข้องอื่น ๆ ตัวอย่างที่มีประโยชน์มากนี้แสดงให้เห็นว่าผู้ใช้สามารถกำหนด URL ของหน้าเว็บที่ต้องการสแกนและเข้าถึงคุณสมบัติต่าง ๆ ของอ็อบเจกต์บทความได้อย่างง่ายดาย เช่น หัวเรื่อง, ผู้เขียน, วันที่เผยแพร่ และข้อความที่ทำความสะอาดแล้ว

วิธีสกัดบทความจากเว็บไซต์โดยใช้ Python API?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

สกัดข้อมูลหน้าเว็บเฉพาะในหลายภาษาโดยใช้ Python

ไลบรารี Python‑Goose รวมฟังก์ชันการตรวจจับภาษาไว้ ทำให้สามารถระบุภาษาของเนื้อหาในหน้าเว็บโดยอัตโนมัติ ฟีเจอร์นี้มีประโยชน์อย่างยิ่งเมื่อทำงานกับเว็บไซต์หลายภาษา หรือเมื่อคุณต้องการกรองเนื้อหาตามภาษา ไลบรารีนี้อนุญาตให้ผู้พัฒนาซอฟต์แวร์เข้าถึงส่วนเฉพาะของหน้าเว็บและสกัดออก เช่น ข้อความหลักของบทความ รูปภาพของบทความ คำอธิบาย Meta แท็ก Meta เป็นต้น ตัวอย่างต่อไปนี้แสดงวิธีสกัดหรือดึงข้อมูลเนื้อหาภาษาสเปนโดยใช้โค้ด Python

วิธีสกัดเนื้อหาเป็นภาษาสเปนจากหน้าเว็บในแอป Python?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 ไทย