ספרייה חינמית של פייתון לחילוץ תוכן מדפי HTML
ספרייה קוד פתוח של פייתון לחילוץ תוכן מדפי אינטרנט כגון תמונות וטקסט, תאריך פרסום, מידע על שפה ועוד.
בעידן המידע הדיגיטלי, הנתונים שופעים וזמינים בקלות באינטרנט. חילוץ מידע רלוונטי מאתרים יכול להיות משימה מסורבלת, אך עם ספריית Python-Goose, סריקת האינטרנט הופכת לקלה. Python-Goose היא ספרייה חזקה וידידותית למשתמש המאפשרת למפתחים לחלץ נתונים מובנים מדפי אינטרנט ללא מאמץ. היא פותחה על ידי ג'וליאן מורנו פטיניו ומיועדת לחלץ תוכן משמעותי, כגון מאמרים, מדפי אינטרנט. הספרייה משתמשת במערך של השערות וטכניקות עיבוד שפה טבעית כדי לנתח מסמכי HTML ולזהות תוכן טקסטואלי רלוונטי.
Python-Goose קלה מאוד להתקנה ומספקת תמיכה מלאה בטיפול באתרים רב-לשוניים. הספרייה משלבת יכולות זיהוי שפה, אשר מזהות באופן אוטומטי את השפה של תוכן דף האינטרנט. קיימות מספר תכונות חשובות כחלק מהספרייה, כגון איסוף תוכן, חילוץ נתונים מובנים למטרות מחקר וניתוח, חילוץ וידאו, יצירת תקצירי מאמרים, קדם-עיבוד של נתוני אינטרנט לאימון מודלים של למידת מכונה, חילוץ תמונות מדפי אינטרנט, ועוד רבות אחרות.
Python-Goose היא ספרייה קוד פתוח שנכתבה בפייתון ומספקת דרך פשוטה אך יעילה לטיפול במשימות סקרייפינג של אתרי אינטרנט שמטרתן לחלץ מידע בעל ערך מדפי אינטרנט בתוך יישומי פייתון. היא משתמשת באלגוריתמים ובשיטות שונות כדי לזהות את הטקסט הרלוונטי ביותר ולדלג על אלמנטים לא רלוונטיים. בין אם אתה מדען נתונים, חוקר שוק, בונה יישום מונחה נתונים, או מבצע מחקר, Python-Goose יכולה לייעל משמעותית את זרימת העבודה שלך ולעזור לך לחלץ תובנות חשובות מהאינטרנט העצום.
התחלה עם Python-Goose
הדרך המומלצת והקלה ביותר להתקנת Python-Goose היא באמצעות Composer, כלי ניהול התלויות עבור PHP. אנא השתמשו בפקודה הבאה להתקנה חלקה.
התקנת Python-Goose באמצעות pip
pip install goose3 אתם יכולים גם להתקין זאת ידנית; הורידו את קבצי השחרור האחרונים ישירות ממאגר GitHub.
חילוץ מאמרים באמצעות API של Python
הספרייה הקודפת Python-Goose מספקת תכונות מאוד שימושיות לטעינה והוצאת תוכן מסוגים שונים של אתרי אינטרנט. הספרייה מתמחה בחילוץ מאמרים מדפי אינטרנט, סינון אלמנטים מיותרים כגון פרסומות, כותרות, כותרות תחתונות וסרגלי צד. בנוסף, היא מתמקדת באחזור התוכן המרכזי, כולל הכותרת, הטקסט, המחבר, תאריך הפרסום ונתוני מטא רלוונטיים אחרים. הנה דוגמה מאוד שימושית שמראה כיצד משתמשים יכולים להגדיר את כתובת ה-URL של דף האינטרנט שהם רוצים לגרד ולגשת בקלות למאפיינים שונים של אובייקט המאמר, כגון הכותרת, המחברים, תאריך הפרסום והטקסט המנוקה.
איך לחלץ מאמרים מאתר אינטרנט באמצעות API של Python?
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
חילוץ מידע ספציפי מדף אינטרנט במספר שפות באמצעות Python
ספריית Python-Goose משלב פונקציונליות לזיהוי שפה, המאפשרת לה לזהות באופן אוטומטי את השפה של תוכן דף האינטרנט. תכונה זו שימושית במיוחד בעת עבודה עם אתרים רב-לשוניים או כאשר ברצונך לסנן תוכן לפי שפה. הספרייה מאפשרת למפתחים לגשת לחלק מסוים של דף האינטרנט ולחלץ אותו, כגון הטקסט הראשי של מאמר, תמונות המאמר, תיאור Meta, תגיות Meta, וכן הלאה. הדוגמה הבאה מציגה כיצד לחלץ או לגרוד תוכן ספרדי באמצעות קוד Python.
איך לחלץ תוכן ספרדי מדף אינטרנט בתוך אפליקציות Python?
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'