Python'da CSV Dosyasında Tekrarlı Verileri Nasıl Silinir?

0 الردود 1 المشاهدات
·
المشاركون
صاحب الموضوع #1
CSV dosyalarında tekrarlı verileri temizlemek, veri analizi ve işleme süreçlerinde sık karşılaşılan önemli bir adımdır. Python’un güçlü kütüphaneleri sayesinde bu işlem oldukça basit ve etkilidir. İşte detaylı bir açıklama ve örnekler:

İlk olarak, Python’un csv modülü veya pandas kütüphanesi kullanılarak tekrarlı satırları kolayca kaldırabilirsiniz. pandas, özellikle veri manipülasyonu ve temizliği konusunda çok daha esnek ve kullanışlıdır.

Öncelikle pandas kullanımıyla örneği inceleyelim:

كود
1234567891011
import pandas as pd

[b]CSV dosyasını okuma[/b]
df = pd.read_csv('ornek.csv')

[b]Tekrarlı satırları kaldırma[/b]
df_temiz = df.drop_duplicates()

[b]Temizlenmiş veriyi yeni dosyaya kaydetme[/b]
df_temiz.to_csv('temizlenmis.csv', index=False)


Burada, drop_duplicates() fonksiyonu, tüm satırları karşılaştırarak tamamen aynı olanları (yani tüm kolonlar aynı olanları) kaldırır. Eğer belirli kolonlarda tekrarlayan kayıtları silmek istiyorsanız, subset parametresini kullanabilirsiniz:

كود
12
df_temiz = df.drop_duplicates(subset=['Kolon1', 'Kolon2'])


Bu yöntem, özellikle büyük veri setlerinde önemli ölçüde zaman tasarrufu sağlar ve veri kalitesini artırır. Ayrıca, pandas’ın keep parametresi ile hangi kaydın tutulacağını belirleyebilirsiniz.

Sonuç olarak, Python ve pandas kullanarak CSV dosyalarındaki tekrarlı verileri hızlıca temizleyebilirsiniz. Bu adım, veri analizinde kesinlikle dikkat edilmesi gereken bir aşamadır ve veri bütünlüğünü sağlar.

يجب تسجيل الدخول للرد.

المستخدمون الذين يشاهدون هذا الموضوع (الإجمالي: 2, الأعضاء: 2, الضيوف: 0)
الإجمالي: 2 (الأعضاء: 2, الضيوف: 0)
0 اقتباسات محددة