Thread Starter
#0
Python, veri işleme ve analizi için oldukça güçlü bir dildir. Özellikle pandas kütüphanesi, veri çerçeveleri üzerinde işlem yaparken duplicate (tekrarlanan) verileri kolayca temizleme imkanı sunar. Bu yazımda, pandas kütüphanesi kullanarak duplicate verilerin nasıl silineceğine dair detaylı bir rehber sunacağım.
Öncelikle pandas kütüphanesini projemize dahil etmemiz gerekiyor. Bunu yapmak için aşağıdaki satırı çalıştırabilirsiniz:
Daha sonra, bir veri çerçevesi oluşturabiliriz. Örneğin, bir liste üzerinden basit bir veri çerçevesi oluşturalım:
Bu veri çerçevesinde "Ali" isminde iki kişi bulunmaktadır. Duplicate verileri silmek için pandas’ın
Yukarıdaki kodu çalıştırdığınızda,
Sonuç olarak, Python ve pandas kullanarak duplicate verileri silmek oldukça basit bir işlemdir. Bu yöntem, büyük veri setlerinde veri temizliği yaparken zaman kazandırır ve analizlerinizi daha sağlıklı hale getirir. Sizlerin bu konudaki deneyimleri veya farklı yaklaşımlarınız var mı? Paylaşımlarınızı bekliyorum!
Öncelikle pandas kütüphanesini projemize dahil etmemiz gerekiyor. Bunu yapmak için aşağıdaki satırı çalıştırabilirsiniz:
CODE
12
import pandas as pd
Daha sonra, bir veri çerçevesi oluşturabiliriz. Örneğin, bir liste üzerinden basit bir veri çerçevesi oluşturalım:
CODE
123456
data = {
'İsim': ['Ali', 'Ayşe', 'Ali', 'Fatma', 'Mehmet'],
'Yaş': [25, 30, 25, 35, 40]
}
df = pd.DataFrame(data)
Bu veri çerçevesinde "Ali" isminde iki kişi bulunmaktadır. Duplicate verileri silmek için pandas’ın
drop_duplicates() fonksiyonunu kullanabiliriz. Bu fonksiyon, varsayılan olarak tüm sütunları kontrol eder ve duplicate kayıtları siler.CODE
12
df_deduplicated = df.drop_duplicates()
Yukarıdaki kodu çalıştırdığınızda,
df_deduplicated veri çerçevesinde "Ali" ismi yalnızca bir kez yer alacaktır. Eğer yalnızca belirli bir sütunu kontrol ederek duplicate verileri silmek isterseniz, subset parametresini kullanabilirsiniz. Örneğin, sadece "İsim" sütununa göre duplicate kayıtları silmek için:CODE
12
df_deduplicated = df.drop_duplicates(subset=['İsim'])
Sonuç olarak, Python ve pandas kullanarak duplicate verileri silmek oldukça basit bir işlemdir. Bu yöntem, büyük veri setlerinde veri temizliği yaparken zaman kazandırır ve analizlerinizi daha sağlıklı hale getirir. Sizlerin bu konudaki deneyimleri veya farklı yaklaşımlarınız var mı? Paylaşımlarınızı bekliyorum!