HTML पेजों से सामग्री निकालने के लिए मुफ्त पायथन लाइब्रेरी
वेब पेजों की सामग्री जैसे इमेज और टेक्स्ट, प्रकाशन तिथि, भाषा जानकारी आदि निकालने के लिए ओपन सोर्स पायथन लाइब्रेरी।
डिजिटल सूचना के युग में, डेटा प्रचुर मात्रा में उपलब्ध है और इंटरनेट पर आसानी से उपलब्ध है। वेबसाइटों से प्रासंगिक जानकारी निकालना एक कठिन कार्य हो सकता है, लेकिन Python-Goose लाइब्रेरी के साथ वेब स्क्रैपिंग बहुत आसान हो जाती है। Python-Goose एक मजबूत और उपयोगकर्ता‑मित्र लाइब्रेरी है जो डेवलपर्स को वेब पेजों से संरचित डेटा आसानी से निकालने की अनुमति देती है। इसे जूलियन मोरेनो पाटिनो द्वारा विकसित किया गया था और यह वेब पेजों से लेखों जैसी सार्थक सामग्री निकालने के लिए डिज़ाइन किया गया है। यह लाइब्रेरी हीयुरिस्टिक्स और प्राकृतिक भाषा प्रसंस्करण तकनीकों का उपयोग करके HTML दस्तावेज़ों का विश्लेषण करती है और प्रासंगिक पाठ्य सामग्री की पहचान करती है।
Python-Goose को स्थापित करना बहुत आसान है और यह बहुभाषी वेबसाइटों को संभालने के लिए पूर्ण समर्थन प्रदान करता है। लाइब्रेरी में भाषा पहचान क्षमता शामिल है, जो स्वचालित रूप से वेब पेज की सामग्री की भाषा का पता लगाती है। लाइब्रेरी की कई महत्वपूर्ण विशेषताएँ हैं, जैसे सामग्री का संकलन, शोध और विश्लेषण उद्देश्यों के लिए संरचित डेटा निकालना, वीडियो निष्कर्षण, लेखों का सारांश बनाना, मशीन लर्निंग मॉडल के प्रशिक्षण के लिए वेब डेटा का पूर्वप्रसंस्करण, वेब पेजों से छवियों का निष्कर्षण, और कई अन्य।
Python-Goose एक ओपन सोर्स लाइब्रेरी है जो Python में लिखी गई है और वेब स्क्रैपिंग कार्यों को संभालने का एक सरल yet प्रभावी तरीका प्रदान करती है, जिसका उद्देश्य Python अनुप्रयोगों के भीतर वेब पेजों से मूल्यवान जानकारी निकालना है। यह विभिन्न एल्गोरिदम और ह्यूरिस्टिक्स का उपयोग करके सबसे प्रासंगिक टेक्स्ट की पहचान करती है और अप्रासंगिक तत्वों को हटाती है। चाहे आप डेटा वैज्ञानिक हों, मार्केट रिसर्चर, डेटा-ड्रिवन एप्लिकेशन बना रहे हों, या शोध कर रहे हों, Python-Goose आपके कार्यप्रवाह को काफी सरल बना सकता है और इंटरनेट के विशाल विस्तार से मूल्यवान अंतर्दृष्टि निकालने में मदद कर सकता है।
Python-Goose के साथ शुरुआत
Python-Goose को स्थापित करने का अनुशंसित और सबसे आसान तरीका Composer का उपयोग करना है, जो PHP के लिए निर्भरता प्रबंधन टूल है। कृपया सुगम स्थापना के लिए निम्नलिखित कमांड का उपयोग करें।
pip के माध्यम से Python-Goose स्थापित करें
pip install goose3 आप इसे मैन्युअल रूप से भी स्थापित कर सकते हैं; नवीनतम रिलीज़ फ़ाइलें सीधे GitHub रिपॉजिटरी से डाउनलोड करें।
Python API का उपयोग करके लेख निष्कर्षण
ओपन सोर्स Python-Goose लाइब्रेरी ने विभिन्न प्रकार की वेबसाइटों से सामग्री लोड करने और निकालने के लिए बहुत उपयोगी सुविधाएँ प्रदान की हैं। यह लाइब्रेरी वेब पेजों से लेख निकालने में विशेषज्ञता रखती है, विज्ञापनों, हेडर, फुटर और साइडबार जैसे अनावश्यक तत्वों को फ़िल्टर करती है। इसके अलावा, यह शीर्षक, पाठ, लेखक, प्रकाशन तिथि और अन्य प्रासंगिक मेटाडेटा सहित मुख्य सामग्री को प्राप्त करने पर केंद्रित है। यहाँ एक बहुत उपयोगी उदाहरण दिया गया है जो दर्शाता है कि उपयोगकर्ता वह वेब पेज का URL कैसे निर्धारित कर सकते हैं जिसे वे स्क्रैप करना चाहते हैं और लेख ऑब्जेक्ट की विभिन्न विशेषताओं जैसे शीर्षक, लेखक, प्रकाशन तिथि और साफ़ किया गया पाठ आसानी से एक्सेस कर सकते हैं।
Python API के माध्यम से वेबसाइट से लेख कैसे निकालें?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Python के माध्यम से कई भाषाओं में विशिष्ट वेबपेज जानकारी निकालें
Python-Goose लाइब्रेरी भाषा पहचान कार्यक्षमता को शामिल करती है, जिससे यह वेब पेज की सामग्री की भाषा को स्वचालित रूप से पहचान सकती है। यह सुविधा विशेष रूप से बहुभाषी वेबसाइटों के साथ काम करते समय या जब आप भाषा के आधार पर सामग्री को फ़िल्टर करना चाहते हैं, उपयोगी होती है। लाइब्रेरी सॉफ़्टवेयर डेवलपर्स को वेबपेज के किसी विशेष भाग तक पहुँचने और उसे निकालने की अनुमति देती है, जैसे लेख का मुख्य पाठ, लेख की छवियाँ, मेटा विवरण, मेटा टैग आदि। निम्नलिखित उदाहरण दिखाता है कि Python कोड का उपयोग करके स्पेनिश सामग्री को कैसे निकालें या स्क्रैप करें।
Python ऐप्स के भीतर वेबपेज से स्पेनिश सामग्री कैसे निकालें?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'