Python ile CSV Veri Temizleme Yöntemleri ve Uygulamaları

0 Cavab 1 Baxış
·
İştirakçılar
Mövzunu Açan #1
CSV dosyaları, veri bilimi ve analiz projelerinde sıkça kullanılır. Ancak, gerçek dünya verileri genellikle hatalar, eksiklikler ve tutarsızlıklar içerir. Bu nedenle, CSV verilerini kullanmadan önce temizlemek ve yapılandırmak önemli bir adımdır. Python’un güçlü kütüphaneleri sayesinde bu süreç otomasyona bağlanabilir ve zaman kazandırabilir.


Python'da CSV veri temizleme işlemi, genellikle pandas kütüphanesi temel alınarak gerçekleştirilir. Pandas, veri çerçevesi (DataFrame) yapısıyla veriyi manipüle etmeyi ve temizlemeyi kolaylaştırır. Temel adımlar şu şekildedir:

  • Eksik verilerin tespiti ve doldurulması: Birçok durumda, eksik değerleri (NaN) tespit edip, ortalama, medyan veya belirli bir değeri atamak gerekebilir. Örneğin, df['sütun'].fillna(df['sütun'].mean(), inplace=True) komutuyla eksik hücreleri doldurabilirsiniz.[/*]
  • Aykırı değerlerin tespiti ve çıkarılması: İstatistiksel yöntemlerle veya görsel analizle aykırı değerleri belirleyip, gerekirse silmek veya dönüştürmek gerekir. Z-score veya IQR gibi teknikler bu amaçla kullanılır.[/*]
  • Veri tiplerinin standartlaştırılması: Sayısal, kategorik veya tarihsel verilerin uygun formatlara dönüştürülmesi, analiz sırasında hataları önler. Örneğin, tarihleri pd.to_datetime() ile dönüştürmek yaygın bir uygulamadır.[/*]
  • Gereksiz veya hatalı sütunların kaldırılması: Kullanılmayan veya yanlış isimlendirilmiş sütunlar, drop() fonksiyonuyla kaldırılabilir.[/*]
  • Tekrarlanan kayıtların temizlenmesi: Aynı verinin tekrar edilmesi durumunda, drop_duplicates() kullanılır.[/*]


Bir örnek üzerinden açıklayacak olursak, aşağıdaki gibi bir kod parçası veri temizleme sürecini anlatır:

[code]
import pandas as pd

CSV dosyasını okuma
df = pd.read_csv('veri.csv')

Eksik verileri doldurma
df['Fiyat'].fillna(df['Fiyat'].mean(), inplace=True)

Tarih formatını düzeltiyoruz
df['Tarih'] = pd.to_datetime(df['Tarih'], errors='coerce')

Aykırı değerleri belirleme ve çıkarma
Q1 = df['Değer'].quantile(0.25)
Q3 = df['Değer'].quantile(0.75)
IQR = Q3 - Q1
sınır_alt = Q1 - 1.5 * IQR
sınır_üst = Q3 + 1.5 * IQR
df = df[(df['Değer'] >= sınır_alt) & (df['Değer']

Cavab vermək üçün daxil olmalısınız.

Bu mövzunu görüntüləyən istifadəçilər (Cəmi: 2, Üzvlər: 2, Qonaqlar: 0)
Cəmi: 2 (üzvlər: 2, qonaqlar: 0)
0 sitat seçildi