Veri analizi projelerinde en önemli adımlardan biri, ham veriyi temizlemek ve düzenlemektir. Excel dosyalarında genellikle eksik veriler, hatalı girişler, biçimlendirme sorunları ve tutarsızlıklar bulunur. Python'un güçlü kütüphaneleri sayesinde bu süreç otomatik hale getirilebilir ve zaman kazanılır. Bu yazıda, pandas kütüphanesi kullanarak Excel veri temizleme tekniklerine detaylıca değineceğim.
Python'da veri temizleme işlemlerinin temel taşlarından biri pandas kütüphanesidir. pandas, özellikle DataFrame yapısı ile büyük veri setlerini kolayca işleyip, analiz edebilmeyi sağlar. İlk adım olarak, Excel dosyasını pandas ile içeri aktarırız:
12import pandas as pd
df = pd.read_excel('dosya.xlsx')
Eksik verileri tespit etmek ve doldurmak için çeşitli yöntemler mevcuttur. Örneğin,
isnull() ve
fillna() fonksiyonları kullanılır:
12345678# Eksik veriyi kontrol
df.isnull().sum()
[b]Eksik değerleri belirli bir değerle doldurma[/b]
df['SütunAdi'].fillna(0, inplace=True)
[b]Tüm eksik hücreleri ortalama ile doldurma[/b]
df.fillna(df.mean(), inplace=True)
Veri tutarsızlıklarını gidermek adına, veri tipi dönüşümleri ve biçimlendirme standartlaştırmaları yapılabilir. Örneğin, metin biçimlendirmeleri:
12345# Büyük harfe çevirme
df['İsim'] = df['İsim'].str.upper()
[b]Boşlukları kaldırma[/b]
df['Adres'] = df['Adres'].str.strip()
Ayrıca, yinelenen kayıtları silmek veya belirli kriterlere göre filtreleme yapmak da önemli adımlardır:
12345# Yinelenenleri kaldırma
df.drop_duplicates(inplace=True)
[b]Belirli kriterlere göre filtreleme[/b]
df_filtered = df[df['Yaş'] > 30]
Son olarak, işlenmiş veriyi tekrar Excel'e kaydetmek için:
1df.to_excel('temizlenmis_veri.xlsx', index=False)
Python ile Excel veri temizleme, manuel işlemlerden çok daha hızlı ve hatasız sonuçlar alınmasını sağlar. Bu teknikleri kullanarak, büyük veri setlerini etkili biçimde hazırlayabilir, analiz ve raporlama aşamalarına geçişi kolaylaştırabilirsiniz.