HTML səhifələrdən məzmun çıxarmaq üçün pulsuz Python kitabxanası
Açıq mənbəli Python kitabxanası veb səhifələrin məzmununu, məsələn şəkillər və mətn, nəşr tarixi, dil məlumatı və s. çıxarmaq üçün.
Rəqəmsal məlumat dövründə, məlumatlar bolluq təşkil edir və internetdə asanlıqla mövcuddur. Veb saytlarından müvafiq məlumatların çıxarılması çətin bir iş ola bilər, lakin Python-Goose kitabxanası ilə veb kazıma çox asanlaşır. Python-Goose güclü və istifadəçi‑dostu bir kitabxanadır və inkişafçılara veb səhifələrdən strukturlaşdırılmış məlumatları asanlıqla çıxarmağa imkan verir. Bu kitabxana Julian Moreno Patiño tərəfindən hazırlanmışdır və veb səhifələrdən məqalələr kimi mənalı məzmunu çıxarmaq üçün nəzərdə tutulmuşdur. Kitabxana HTML sənədlərini təhlil etmək və müvafiq mətn məzmununu müəyyən etmək üçün bir sıra heuristikalar və təbii dil emalı texnikalarından istifadə edir.
Python-Goose quraşdırmaq çox asandır və çoxdilli veb saytların idarə olunması üçün tam dəstək təqdim edir. Kitabxana dil aşkarlama imkanlarını özündə birləşdirir, bu da veb səhifənin məzmununun dilini avtomatik olaraq müəyyən edir. Kitabxananın bir neçə vacib xüsusiyyəti var, məsələn məzmunun toplanması, tədqiqat və təhlil məqsədləri üçün strukturlaşdırılmış məlumatların çıxarılması, video çıxarılması, məqalələrin xülasələrinin yaradılması, maşın öyrənmə modellərinin təlimi üçün veb məlumatların əvvəlcədən işlənməsi, veb səhifələrdən şəkillərin çıxarılması və daha çox.
Python-Goose, Python dilində yazılmış açıq mənbəli kitabxanadır və Python tətbiqlərində veb səhifələrdən dəyərli məlumatları çıxarmağı hədəfləyən veb kazıma tapşırıqlarını idarə etmək üçün sadə, lakin effektiv bir yol təqdim edir. O, ən uyğun mətnləri müəyyən etmək və lazımsız elementləri aradan qaldırmaq üçün müxtəlif alqoritmlər və heuristiklərdən istifadə edir. Siz məlumat elmləri mütəxəssisi, bazar tədqiqatçısı, məlumat‑əsaslı tətbiq yaradan və ya tədqiqat aparan olsanız da, Python-Goose iş axınınızı əhəmiyyətli dərəcədə sadələşdirə və internetin geniş sahəsindən dəyərli anlayışlar əldə etməyə kömək edə bilər.
Python-Goose ilə Başlamaq
Python-Goose‑u quraşdırmağın tövsiyə olunan və ən asan yolu PHP üçün asılılıq idarəetmə aləti olan Composer‑dən istifadə etməkdir. Zəhmət olmasa, aşağıdakı əmri istifadə edərək quraşdırmanı problemsiz həyata keçirin.
Python-Goose-u pip vasitəsilə quraşdırın
pip install goose3 Bunu həmçinin əl ilə quraşdıra bilərsiniz; son buraxılış fayllarını birbaşa GitHub deposundan yükləyin.
Python API istifadə edərək Məqalə Çıxarışı
Açıq mənbəli Python-Goose kitabxanası müxtəlif növ veb saytlarından məzmunu yükləmək və çıxarmaq üçün çox faydalı xüsusiyyətlər təqdim edib. Kitabxana veb səhifələrdən məqalələri çıxarmaqda ixtisaslaşıb, reklamlar, başlıqlar, altbilgilər və yan panel kimi lazımsız elementləri filtr edir. Bundan əlavə, o, başlıq, mətn, müəllif, nəşr tarixi və digər əlaqəli meta məlumatlar daxil olmaqla əsas məzmunu əldə etməyə yönəlib. Budur, istifadəçilərin istədikləri veb səhifənin URL‑ni təyin edə biləcəyi və məqalə obyektinin başlıq, müəlliflər, nəşr tarixi və təmizlənmiş mətn kimi müxtəlif xüsusiyyətlərinə asanlıqla daxil ola biləcəklərini göstərən çox faydalı bir nümunə.
Python API vasitəsilə Vebsaytdan Məqalələri Necə Çıxarmaq Olar?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Python vasitəsilə Çoxsaylı Dillərdə Müəyyən Veb Səhifə Məlumatını Çıxarmaq
Python-Goose kitabxanası dil aşkarlama funksiyasını özündə birləşdirir, bu da veb səhifənin məzmununun dilini avtomatik olaraq müəyyən etməyə imkan verir. Bu xüsusiyyət çoxdilli veb saytlarla işləyərkən və ya məzmunu dilə əsasən filtr etmək istədiyiniz zaman xüsusilə faydalıdır. Kitabxana proqramçılara veb səhifənin müəyyən bir hissəsinə daxil olub onu çıxarmağa imkan verir, məsələn məqalənin əsas mətni, məqalənin şəkilləri, Meta təsviri, Meta teqləri və s. Aşağıdakı nümunə Python kodundan istifadə edərək İspan məzmununu necə çıxarmaq və ya kazımaq olduğunu göstərir.
Python Tətbiqlərində Veb Səhifədən İspan Məzmununu Necə Çıxarmaq Olar?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'