{ "cells": [ { "cell_type": "markdown", "source": [ "# Πρόκληση: Ανάλυση Κειμένου σχετικά με την Επιστήμη Δεδομένων\n", "\n", "> *Σε αυτό το τετράδιο, πειραματιζόμαστε με τη χρήση διαφορετικού URL - άρθρο της wikipedia για τη Μηχανική Μάθηση. Μπορείτε να δείτε ότι, σε αντίθεση με την Επιστήμη Δεδομένων, αυτό το άρθρο περιέχει πολλούς όρους, γεγονός που καθιστά την ανάλυση πιο προβληματική. Πρέπει να βρούμε έναν άλλο τρόπο να καθαρίσουμε τα δεδομένα μετά την εξαγωγή λέξεων-κλειδιών, για να απαλλαγούμε από κάποιους συχνούς, αλλά μη σημαντικούς συνδυασμούς λέξεων.*\n", "\n", "Σε αυτό το παράδειγμα, ας κάνουμε μια απλή άσκηση που καλύπτει όλα τα βήματα μιας παραδοσιακής διαδικασίας επιστήμης δεδομένων. Δεν χρειάζεται να γράψετε κώδικα, μπορείτε απλώς να κάνετε κλικ στα κελιά παρακάτω για να τα εκτελέσετε και να παρατηρήσετε το αποτέλεσμα. Ως πρόκληση, ενθαρρύνεστε να δοκιμάσετε αυτόν τον κώδικα με διαφορετικά δεδομένα.\n", "\n", "## Στόχος\n", "\n", "Στο μάθημα αυτό, συζητάμε διάφορες έννοιες σχετικές με την Επιστήμη Δεδομένων. Ας προσπαθήσουμε να ανακαλύψουμε περισσότερες σχετικές έννοιες κάνοντας **εξόρυξη κειμένου**. Θα ξεκινήσουμε με ένα κείμενο για την Επιστήμη Δεδομένων, θα εξαγάγουμε λέξεις-κλειδιά από αυτό, και έπειτα θα προσπαθήσουμε να οπτικοποιήσουμε το αποτέλεσμα.\n", "\n", "Ως κείμενο, θα χρησιμοποιήσω τη σελίδα για την Επιστήμη Δεδομένων από τη Wikipedia:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Βήμα 1: Απόκτηση των Δεδομένων\n", "\n", "Το πρώτο βήμα σε κάθε διαδικασία επιστήμης δεδομένων είναι η απόκτηση των δεδομένων. Θα χρησιμοποιήσουμε τη βιβλιοθήκη `requests` για να το κάνουμε αυτό:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "
\n", "\n", "