1. পণ্য
  2.   HTML
  3.   Python
  4.   Python-Goose
 
  

HTML পেজ থেকে কন্টেন্ট বের করার জন্য ফ্রি পাইথন লাইব্রেরি

ওয়েব পেজের কন্টেন্ট যেমন ছবি ও টেক্সট, প্রকাশের তারিখ, ভাষা তথ্য ইত্যাদি বের করার জন্য ওপেন সোর্স পাইথন লাইব্রেরি।

ডিজিটাল তথ্যের যুগে, ডেটা প্রচুর এবং ইন্টারনেটে সহজলভ্য। ওয়েবসাইট থেকে প্রাসঙ্গিক তথ্য বের করা একটি কষ্টকর কাজ হতে পারে, তবে Python-Goose লাইব্রেরির সাহায্যে ওয়েব স্ক্র্যাপিং সহজ হয়ে যায়। Python-Goose একটি শক্তিশালী এবং ব্যবহারকারী-বান্ধব লাইব্রেরি যা ডেভেলপারদের ওয়েব পেজ থেকে কাঠামোগত ডেটা সহজে বের করতে সহায়তা করে। এটি জুলিয়ান মরেনো পাটিনো দ্বারা উন্নত করা হয়েছে এবং ওয়েব পেজ থেকে প্রবন্ধের মতো অর্থবহ বিষয়বস্তু বের করার জন্য ডিজাইন করা হয়েছে। লাইব্রেরিটি হিউরিস্টিক্স এবং প্রাকৃতিক ভাষা প্রক্রিয়াকরণ কৌশল ব্যবহার করে HTML ডকুমেন্ট বিশ্লেষণ করে এবং প্রাসঙ্গিক টেক্সট বিষয়বস্তু সনাক্ত করে।

Python-Goose ইনস্টল করা খুবই সহজ এবং বহুভাষিক ওয়েবসাইট পরিচালনার জন্য সম্পূর্ণ সমর্থন প্রদান করে। লাইব্রেরিটি ভাষা সনাক্তকরণ ক্ষমতা অন্তর্ভুক্ত করে, যা স্বয়ংক্রিয়ভাবে ওয়েব পেজের বিষয়বস্তুর ভাষা নির্ধারণ করে। লাইব্রেরির বেশ কিছু গুরুত্বপূর্ণ বৈশিষ্ট্য রয়েছে, যেমন বিষয়বস্তু সংহতি, গবেষণা ও বিশ্লেষণের জন্য কাঠামোগত ডেটা বের করা, ভিডিও এক্সট্র্যাকশন, প্রবন্ধের সারাংশ তৈরি করা, মেশিন লার্নিং মডেল প্রশিক্ষণের জন্য ওয়েব ডেটা প্রি-প্রসেসিং, ওয়েব পেজ থেকে ছবি বের করা এবং আরও অনেক কিছু।

Python-Goose হল একটি ওপেন সোর্স লাইব্রেরি যা পাইথনে লেখা এবং এটি ওয়েব স্ক্র্যাপিং কাজগুলোকে সহজ yet কার্যকরীভাবে পরিচালনা করার উপায় প্রদান করে, যা পাইথন অ্যাপ্লিকেশনের মধ্যে ওয়েব পেজ থেকে মূল্যবান তথ্য সংগ্রহের লক্ষ্য রাখে। এটি বিভিন্ন অ্যালগরিদম এবং হিউরিস্টিক ব্যবহার করে সবচেয়ে প্রাসঙ্গিক টেক্সট চিহ্নিত করে এবং অপ্রাসঙ্গিক উপাদানগুলো বাদ দেয়। আপনি যদি ডেটা সায়েন্টিস্ট, মার্কেট রিসার্চার, ডেটা-চালিত অ্যাপ্লিকেশন তৈরি করছেন, অথবা গবেষণা করছেন, Python-Goose আপনার কর্মপ্রবাহকে উল্লেখযোগ্যভাবে সরল করতে পারে এবং ইন্টারনেটের বিশাল বিস্তারে থেকে মূল্যবান অন্তর্দৃষ্টি বের করতে সাহায্য করে।

Previous Next

Python-Goose দিয়ে শুরু করা

Python-Goose ইনস্টল করার সুপারিশকৃত এবং সহজতম উপায় হল Composer ব্যবহার করা, যা PHP-এর জন্য নির্ভরতা ব্যবস্থাপনা টুল। মসৃণ ইনস্টলেশনের জন্য দয়া করে নিম্নলিখিত কমান্ডটি ব্যবহার করুন।

pip এর মাধ্যমে Python-Goose ইনস্টল করুন

pip install goose3 

আপনি ম্যানুয়ালি ইনস্টল করতেও পারেন; সর্বশেষ রিলিজ ফাইলগুলো সরাসরি GitHub রেপোজিটরি থেকে ডাউনলোড করুন।

Python API ব্যবহার করে নিবন্ধ নিষ্কাশন

ওপেন সোর্স Python-Goose লাইব্রেরি বিভিন্ন ধরনের ওয়েবসাইট থেকে কন্টেন্ট লোড এবং এক্সট্র্যাক্ট করার জন্য খুবই উপযোগী ফিচার প্রদান করেছে। এই লাইব্রেরি ওয়েব পেজ থেকে আর্টিকেল এক্সট্র্যাক্ট করতে বিশেষজ্ঞ, বিজ্ঞাপন, হেডার, ফুটার এবং সাইডবারের মতো অপ্রয়োজনীয় উপাদানগুলো ফিল্টার করে। এছাড়াও, এটি শিরোনাম, টেক্সট, লেখক, প্রকাশের তারিখ এবং অন্যান্য প্রাসঙ্গিক মেটাডেটা সহ মূল কন্টেন্ট পুনরুদ্ধারে মনোযোগ দেয়। এখানে একটি খুবই উপযোগী উদাহরণ দেওয়া হয়েছে যা দেখায় কীভাবে ব্যবহারকারীরা স্ক্র্যাপ করতে চাওয়া ওয়েব পেজের URL নির্ধারণ করতে পারেন এবং সহজে আর্টিকেল অবজেক্টের বিভিন্ন প্রপার্টি, যেমন শিরোনাম, লেখকগণ, প্রকাশের তারিখ এবং পরিষ্কৃত টেক্সট, অ্যাক্সেস করতে পারেন।

Python API ব্যবহার করে একটি ওয়েবসাইট থেকে নিবন্ধ কীভাবে নিষ্কাশন করবেন?

from goose3 import Goose

url = "https://example.com/article"
g = Goose()
article = g.extract(url)

print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)

Python এর মাধ্যমে একাধিক ভাষায় নির্দিষ্ট ওয়েবপেজের তথ্য নিষ্কাশন করুন

Python-Goose লাইব্রেরি ভাষা সনাক্তকরণ কার্যকারিতা অন্তর্ভুক্ত করে, যা স্বয়ংক্রিয়ভাবে একটি ওয়েব পেজের বিষয়বস্তুর ভাষা শনাক্ত করতে সক্ষম। এই বৈশিষ্ট্যটি বহুভাষিক ওয়েবসাইটের সঙ্গে কাজ করার সময় বা ভাষার ভিত্তিতে বিষয়বস্তু ফিল্টার করতে চাইলে বিশেষভাবে উপকারী। লাইব্রেরিটি সফটওয়্যার ডেভেলপারদেরকে ওয়েবপেজের নির্দিষ্ট অংশে প্রবেশ করে তা বের করার সুযোগ দেয়, যেমন কোনো প্রবন্ধের মূল পাঠ্য, প্রবন্ধের ছবি, মেটা বর্ণনা, মেটা ট্যাগ ইত্যাদি। নিম্নের উদাহরণটি দেখায় কীভাবে পাইথন কোড ব্যবহার করে স্প্যানিশ বিষয়বস্তু বের বা স্ক্র্যাপ করা যায়।

Python অ্যাপের মধ্যে একটি ওয়েবপেজ থেকে স্প্যানিশ বিষয়বস্তু কীভাবে নিষ্কাশন করবেন?

from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'

 বাংলা