Python ile Canonical URL Nasıl Çekilir?

0 Yanıt 0 Görüntülenme
·
Katılımcılar
Konuyu Açan #1
Büyük ölçüde SEO ve web geliştirme alanında, bir sayfanın "canonical" URL'si, arama motorlarına hangi sayfanın ana versiyon olduğunu gösterir. Bu URL, genellikle sayfa kaynak kodunda etiketiyle belirtilir. Python kullanarak bu bilgiyi otomatik almak, özellikle SEO analizi veya içerik yönetimi otomasyonları için oldukça faydalı olabilir. Bu noktada birkaç önemli adım ve dikkat edilmesi gereken konu var.

İlk olarak, sayfa içeriğini çekmek için genellikle requests kütüphanesi kullanılır. Bu sayede URL'den HTML kaynağı alınır. Sonrasında, HTML'den canonical URL'yi ayıklamak için ise BeautifulSoup gibi bir HTML ayrıştırıcı kullanmak en uygun yöntemdir. Bu iki adımı birleştirdiğinizde, herhangi bir web sayfasının canonical URL'sini programatik olarak elde etmek mümkün hale gelir.

Örnek bir Python kodu aşağıdaki gibidir:

KOD
123456789101112131415161718
import requests
from bs4 import BeautifulSoup

def get_canonical_url(url):
    response = requests.get(url, headers={'User-Agent': 'Mozilla/5.0'})
    if response.status_code != 200:
        return None
    soup = BeautifulSoup(response.text, 'html.parser')
    canonical_link = soup.find('link', rel='canonical')
    if canonical_link:
        return canonical_link['href']
    return None

[b]Kullanım[/b]
url = 'https://ornekwebsitesi.com/ornek-sayfa'
canonical_url = get_canonical_url(url)
print('Canonical URL:', canonical_url)


Burada dikkat edilmesi gereken noktalar:
  • requests ile sayfa indirilirken uygun headers kullanmak, bot tespit edilmesini engeller.
  • canonical etiketi bulunamazsa, fonksiyon None döner.
  • URL'nin mutlak veya göreli olmasına göre, gerekirse canonical URL'yi mutlak hale getirmek gerekebilir.


Bu yöntemi kullanarak, büyük ölçekli SEO taramalarında veya içerik analizlerinde otomatik olarak canonical URL'leri toplayabilir, böylece benzer içeriklerin dağılımını ve sayfa yapısını daha iyi anlayabilirsiniz. Bu teknik, özellikle çok sayfalı sitelerde, URL kirliliğini önlemek ve arama motoru optimizasyonunu güçlendirmek adına önemli bir araçtır.

Bu konu hakkında daha detaylı örnekler veya farklı yaklaşımlar hakkında düşünceleriniz nelerdir?

Yanıt vermek için giriş yapmış olmalısınız.

Bu konuyu görüntüleyen kullanıcılar (Toplam: 4, Üyeler: 4, Misafirler: 0)
Toplam: 4 (üyeler: 4, misafirler: 0)
0 alıntı seçildi