Δωρεάν βιβλιοθήκη Python για εξαγωγή περιεχομένου από σελίδες HTML
Ανοιχτού κώδικα βιβλιοθήκη Python για εξαγωγή περιεχομένου ιστοσελίδων όπως εικόνες & κείμενο, ημερομηνία δημοσίευσης, πληροφορίες γλώσσας κ.ά..
Στην εποχή της ψηφιακής πληροφορίας, τα δεδομένα είναι άφθονα και εύκολα προσβάσιμα στο διαδίκτυο. Η εξαγωγή σχετικών πληροφοριών από ιστοσελίδες μπορεί να είναι μια επίπονη εργασία, αλλά με τη βιβλιοθήκη Python‑Goose η εξόρυξη δεδομένων από το web γίνεται παιχνιδάκι. Η Python‑Goose είναι μια ισχυρή και φιλική προς το χρήστη βιβλιοθήκη που επιτρέπει στους προγραμματιστές να εξάγουν δομημένα δεδομένα από ιστοσελίδες χωρίς κόπο. Αναπτύχθηκε από τον Julian Moreno Patiño και σχεδιάστηκε για να εξάγει ουσιαστικό περιεχόμενο, όπως άρθρα, από ιστοσελίδες. Η βιβλιοθήκη χρησιμοποιεί ένα σύνολο ευρετικών και τεχνικών επεξεργασίας φυσικής γλώσσας για να αναλύει έγγραφα HTML και να εντοπίζει σχετικό κειμενικό περιεχόμενο.
Η Python‑Goose είναι πολύ εύκολη στην εγκατάσταση και παρέχει πλήρη υποστήριξη για τη διαχείριση πολυγλωσσικών ιστοσελίδων. Η βιβλιοθήκη ενσωματώνει δυνατότητες ανίχνευσης γλώσσας, οι οποίες εντοπίζουν αυτόματα τη γλώσσα του περιεχομένου της ιστοσελίδας. Υπάρχουν πολλές σημαντικές λειτουργίες της βιβλιοθήκης, όπως η συγκέντρωση περιεχομένου, η εξαγωγή δομημένων δεδομένων για ερευνητικούς και αναλυτικούς σκοπούς, η εξαγωγή βίντεο, η δημιουργία περιλήψεων άρθρων, η προεπεξεργασία δεδομένων web για την εκπαίδευση μοντέλων μηχανικής μάθησης, η εξαγωγή εικόνων από ιστοσελίδες και πολλά άλλα.
Το Python-Goose είναι μια ανοιχτού κώδικα βιβλιοθήκη γραμμένη σε Python και παρέχει έναν απλό αλλά αποτελεσματικό τρόπο διαχείρισης εργασιών web scraping που στοχεύουν στην εξαγωγή πολύτιμων πληροφοριών από ιστοσελίδες μέσα σε εφαρμογές Python. Χρησιμοποιεί διάφορους αλγόριθμους και ευρετικές μεθόδους για να εντοπίζει το πιο σχετικό κείμενο και να απορρίπτει τα άσχετα στοιχεία. Είτε είστε επιστήμονας δεδομένων, ερευνητής αγοράς, δημιουργείτε μια εφαρμογή βασισμένη σε δεδομένα ή διεξάγετε έρευνα, το Python-Goose μπορεί να βελτιώσει σημαντικά τη ροή εργασίας σας και να σας βοηθήσει να εξάγετε πολύτιμες γνώσεις από την τεράστια έκταση του διαδικτύου.
Ξεκινώντας με το Python-Goose
Ο συνιστώμενος και πιο εύκολος τρόπος εγκατάστασης του Python-Goose είναι μέσω του Composer, του εργαλείου διαχείρισης εξαρτήσεων για PHP. Παρακαλώ χρησιμοποιήστε την παρακάτω εντολή για μια ομαλή εγκατάσταση.
Εγκατάσταση του Python-Goose μέσω pip
pip install goose3 Μπορείτε επίσης να το εγκαταστήσετε χειροκίνητα· κατεβάστε τα τελευταία αρχεία έκδοσης απευθείας από το αποθετήριο GitHub.
Εξαγωγή Άρθρων χρησιμοποιώντας το Python API
Η ανοιχτού κώδικα βιβλιοθήκη Python-Goose έχει προσφέρει πολύ χρήσιμες λειτουργίες για τη φόρτωση και εξαγωγή περιεχομένου από διάφορους τύπους ιστοσελίδων. Η βιβλιοθήκη ειδικεύεται στην εξαγωγή άρθρων από ιστοσελίδες, φιλτράροντας ανεπιθύμητα στοιχεία όπως διαφημίσεις, κεφαλίδες, υποσέλιδα και πλαϊνές στήλες. Επιπλέον, εστιάζει στην ανάκτηση του βασικού περιεχομένου, συμπεριλαμβανομένου του τίτλου, του κειμένου, του συγγραφέα, της ημερομηνίας δημοσίευσης και άλλων σχετικών μεταδεδομένων. Ακολουθεί ένα πολύ χρήσιμο παράδειγμα που δείχνει πώς οι χρήστες μπορούν να ορίσουν το URL της ιστοσελίδας που θέλουν να συλλέξουν και να έχουν εύκολη πρόσβαση σε διάφορες ιδιότητες του αντικειμένου άρθρου, όπως ο τίτλος, οι συγγραφείς, η ημερομηνία δημοσίευσης και το καθαρισμένο κείμενο.
Πώς να εξάγετε άρθρα από έναν ιστότοπο μέσω Python API;
from goose3 import Goose
url = "https://example.com/article"
g = Goose()
article = g.extract(url)
print("Title:", article.title)
print("Authors:", article.authors)
print("Publish Date:", article.publish_date)
print("Article Text:", article.cleaned_text)
Εξαγωγή Συγκεκριμένων Πληροφοριών Ιστοσελίδας σε Πολλές Γλώσσες μέσω Python
Η βιβλιοθήκη Python-Goose ενσωματώνει λειτουργία ανίχνευσης γλώσσας, επιτρέποντάς της να αναγνωρίζει αυτόματα τη γλώσσα του περιεχομένου μιας ιστοσελίδας. Αυτή η δυνατότητα είναι ιδιαίτερα χρήσιμη όταν εργάζεστε με πολυγλωσσικές ιστοσελίδες ή όταν θέλετε να φιλτράρετε το περιεχόμενο βάσει γλώσσας. Η βιβλιοθήκη επιτρέπει στους προγραμματιστές λογισμικού να έχουν πρόσβαση σε συγκεκριμένο τμήμα της ιστοσελίδας και να το εξάγουν, όπως το κύριο κείμενο ενός άρθρου, εικόνες του άρθρου, μετα-περιγραφή, μετα-ετικέτες κ.λπ. Το παρακάτω παράδειγμα δείχνει πώς να εξάγετε ή να κάνετε scraping ισπανικού περιεχομένου χρησιμοποιώντας κώδικα Python.
Πώς να εξάγετε ισπανικό περιεχόμενο από μια ιστοσελίδα σε εφαρμογές Python;
from goose import Goose
url = 'http://sociedad.elpais.com/sociedad/2012/10/27/actualidad/1351332873_157836.html'
g = Goose()
article = g.extract(url=url)
article.title
u'Las listas de espera se agravan'
article.cleaned_text[:150]
u'Los recortes pasan factura a los pacientes. De diciembre de 2010 a junio de 2012 las listas de espera para operarse aumentaron un 125%. Hay m\xe1s ciudad'