{ "cells": [ { "cell_type": "markdown", "source": [ "# Meydan Okuma: Veri Bilimi Hakkında Metin Analizi\n", "\n", "> *Bu not defterinde, Farklı bir URL - Wikipedia makalesi olan Makine Öğrenimi üzerinde denemeler yapıyoruz. Veri Bilimi ile karşılaştırıldığında, bu makalenin çok fazla terim içerdiğini görebilirsiniz; bu da analizi daha sorunlu hale getiriyor. Anahtar kelime çıkarımı yaptıktan sonra veriyi temizlemek için başka bir yol bulmamız gerekiyor; böylece bazı sık kullanılan ama anlamlı olmayan kelime kombinasyonlarından kurtulabiliriz.*\n", "\n", "Bu örnekte, geleneksel bir veri bilimi sürecinin tüm adımlarını kapsayan basit bir egzersiz yapalım. Herhangi bir kod yazmanıza gerek yok, yalnızca aşağıdaki hücrelere tıklayarak çalıştırabilir ve sonucu gözlemleyebilirsiniz. Bir meydan okuma olarak, bu kodu farklı verilerle denemeniz teşvik edilir.\n", "\n", "## Amaç\n", "\n", "Bu derste, Veri Bilimi ile ilgili farklı kavramlardan bahsettik. Bazı **metin madenciliği** yaparak daha fazla ilgili kavram keşfetmeye çalışalım. Veri Bilimi hakkında bir metinle başlayacağız, ondan anahtar kelimeler çıkaracağız ve ardından sonucu görselleştirmeye çalışacağız.\n", "\n", "Metin olarak, Wikipedia’daki Veri Bilimi sayfasını kullanacağım:\n" ], "metadata": {} }, { "cell_type": "markdown", "source": [], "metadata": {} }, { "cell_type": "code", "execution_count": 2, "source": [ "url = 'https://en.wikipedia.org/wiki/Data_science'\r\n", "url = 'https://en.wikipedia.org/wiki/Machine_learning'" ], "outputs": [], "metadata": {} }, { "cell_type": "markdown", "source": [ "## Adım 1: Veriyi Alma\n", "\n", "Her veri bilimi sürecinin ilk adımı veriyi almaktır. Bunu yapmak için `requests` kütüphanesini kullanacağız:\n" ], "metadata": {} }, { "cell_type": "code", "execution_count": 3, "source": [ "import requests\r\n", "\r\n", "text = requests.get(url).content.decode('utf-8')\r\n", "print(text[:1000])" ], "outputs": [ { "output_type": "stream", "name": "stdout", "text": [ "\n", "\n", "\n", "\n", "Machine learning - Wikipedia\n", "