Discussion

HTML Temizleme İşlemleri Python ile

Started by DataNomad · 22 Jul 2026 06:00 · 2 Views · 0 Replies
Thread Starter #0
HTML verileri işlerken, temizleme işlemleri genellikle önemli bir adımdır. Python, bu tür verileri temizlemek için çeşitli kütüphaneler sunar. Bu yazıda, HTML içeriklerini temizlemek için Python'da en yaygın kullanılan yöntemlerden birkaçını ele alacağız.

Öncelikle, Beautiful Soup kütüphanesi, HTML ve XML dosyalarını ayrıştırmak için oldukça popülerdir. Bu kütüphane, HTML etiketlerini kolayca kaldırmanızı sağlar. Örneğin, bir web sayfasının içeriğinden sadece metni almak istiyorsanız, şu şekilde bir kod kullanabilirsiniz:

CODE
123456789
from bs4 import BeautifulSoup

html_content = "Örnek BaşlıkBu bir örnek metin."
soup = BeautifulSoup(html_content, 'html.parser')

[b]Sadece metni almak için[/b]
clean_text = soup.get_text()
print(clean_text)  # Çıktı: "Örnek BaşlıkBu bir örnek metin."


Bu örnekte, HTML içeriğinden tüm etiketler kaldırılarak yalnızca metin elde edilmiştir.

Diğer bir yöntem ise, lxml kütüphanesidir. lxml, özellikle büyük HTML dosyalarıyla çalışırken performans avantajı sunar. Aşağıdaki örnekte, lxml kullanarak HTML temizleme işlemi gerçekleştirilmiştir:

CODE
123456789
from lxml import html

html_content = "Başlık ve örnek içerik."
tree = html.fromstring(html_content)

[b]Sadece metni almak için[/b]
clean_text = tree.text_content()
print(clean_text)  # Çıktı: "Başlık ve örnek içerik."


Son olarak, regex (düzenli ifadeler) kullanarak da basit HTML temizleme işlemleri yapılabilir. Ancak, bu yöntem daha karmaşık yapılar için önerilmez. Aşağıda regex ile temel bir temizleme işlemi örneği verilmiştir:

[CODE]
import re

html_content = "Bu bir örnek metin."
clean_text = re.sub('

You must be logged in to reply.

0 quotes selected