HTML Sayfalarından İçerik Çıkaran Ücretsiz Python Kütüphanesi
Görüntü ve Metin, Yayın Tarihi, Dil Bilgisi gibi Web Sayfası İçeriklerini Çıkaran Açık Kaynak Python Kütüphanesi...
Dijital bilginin çağında, veri bol ve internette kolayca erişilebilir. Web sitelerinden ilgili bilgileri çıkarmak zahmetli bir görev olabilir, ancak Python-Goose kütüphanesiyle web kazıma çok kolaylaşır. Python-Goose, geliştiricilerin web sayfalarından yapılandırılmış verileri zahmetsizce çıkarmasını sağlayan sağlam ve kullanıcı dostu bir kütüphanedir. Julian Moreno Patiño tarafından geliştirilmiş olup, web sayfalarından makaleler gibi anlamlı içerikleri çıkarmak için tasarlanmıştır. Kütüphane, HTML belgelerini analiz etmek ve ilgili metin içeriğini belirlemek için bir dizi sezgi ve doğal dil işleme teknikleri kullanır.
Python-Goose kurulumu çok kolaydır ve çok dilli web sitelerini yönetme konusunda tam destek sağlar. Kütüphane, web sayfasının içeriğinin dilini otomatik olarak belirleyen dil tespiti yeteneklerini içerir. Kütüphanenin içerdiği birkaç önemli özellik vardır; içerik toplama, araştırma ve analiz amaçları için yapılandırılmış veri çıkarma, video çıkarma, makalelerin özetlerini oluşturma, makine öğrenimi modelleri için web verilerini ön işleme, web sayfalarından görüntü çıkarma ve daha fazlası.
Python-Goose, Python ile yazılmış açık kaynaklı bir kütüphanedir ve Python uygulamaları içinde web sayfalarından değerli bilgiler çıkarmayı amaçlayan web kazıma görevlerini yönetmenin basit ama etkili bir yolunu sunar. En ilgili metni belirlemek ve alakasız öğeleri atmak için çeşitli algoritmalar ve sezgisel yöntemler kullanır. Veri bilimcisi, pazar araştırmacısı, veri odaklı bir uygulama geliştiren ya da araştırma yapan olun, Python-Goose iş akışınızı önemli ölçüde hızlandırabilir ve internetin geniş alanından değerli içgörüler elde etmenize yardımcı olabilir.
Python-Goose ile Başlarken
Python-Goose'u kurmanın önerilen ve en kolay yolu, PHP için bağımlılık yönetim aracı Composer'ı kullanmaktır. Sorunsuz bir kurulum için lütfen aşağıdaki komutu kullanın.
Python-Goose'u pip ile Kurun
pip install goose3 Ayrıca manuel olarak da kurabilirsiniz; en son sürüm dosyalarını doğrudan GitHub deposundan indirin.
Python API'si kullanarak Makale Çıkarma
Açık kaynak Python-Goose kütüphanesi, çeşitli web sitesi türlerinden içerik yükleme ve çıkarma konusunda çok faydalı özellikler sunmuştur. Kütüphane, web sayfalarından makaleleri çıkarmada uzmanlaşmıştır; reklamlar, başlıklar, altbilgiler ve kenar çubukları gibi gereksiz öğeleri filtreler. Ayrıca, başlık, metin, yazar, yayın tarihi ve diğer ilgili meta veriler dahil olmak üzere temel içeriği almaya odaklanır. İşte kullanıcıların kazımak istedikleri web sayfasının URL'sini tanımlayabilecekleri ve makale nesnesinin başlık, yazarlar, yayın tarihi ve temizlenmiş metin gibi çeşitli özelliklerine kolayca erişebilecekleri çok faydalı bir örnek.
Python API'si ile Bir Web Sitesinden Makaleler Nasıl Çıkarılır?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Python aracılığıyla Çoklu Dillerde Belirli Web Sayfası Bilgilerini Çıkarma
Python-Goose kütüphanesi, dil algılama işlevi içerir ve bir web sayfasının içeriğinin dilini otomatik olarak belirlemesini sağlar. Bu özellik, çok dilli web siteleriyle çalışırken veya içeriği dile göre filtrelemek istediğinizde özellikle faydalıdır. Kütüphane, yazılım geliştiricilerin bir web sayfasının belirli bir bölümüne erişip bunu, örneğin bir makalenin ana metni, makale görselleri, meta açıklama, meta etiketleri vb. gibi öğeleri çıkarmasına olanak tanır. Aşağıdaki örnek, Python kodu kullanarak İspanyolca içeriği nasıl çıkaracağınızı veya kazıyacağınızı gösterir.
Python Uygulamalarında Bir Web Sayfasından İspanyolca İçerik Nasıl Çıkarılır?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'