narvals//labs

SEO & GEO · Karar rehberi

Crawl budget nedir? Googlebot tarama verimliliği rehberi

Crawl budget, Googlebot’un bir site için taramak istediği ve sunucuyu zorlamadan tarayabildiği URL miktarının pratik birleşimidir. Google, tarama bütçesi yönetimini öncelikle çok büyük veya çok sık değişen siteler için önemli görür. Onlarca ya da yüzlerce temiz URL’si olan bir sitede indeks sorunu çoğu zaman bütçeden değil; erişim, canonical, iç bağlantı, kopya sayfa veya içerik değerinden kaynaklanır.

Önce gerçekten tarama bütçesi sorununuz olup olmadığını belirleyin.

Google tarama kapasitesini sunucunun verdiği yanıtlara göre sınırlar; tarama talebini ise URL’nin algılanan önemi, güncelliği ve benzeri sinyaller etkileyebilir. Bu iki unsurun kesişimi pratik tarama miktarını oluşturur.

“Discovered – currently not indexed” raporu tek başına sunucunun yetersiz olduğunu kanıtlamaz. URL hiç taranmamış olabilir; fakat neden düşük öncelik, zayıf iç bağlantı, çok sayıda benzer şablon veya sınırlı site sinyali de olabilir. Reddit TechSEO ve BigSEO tartışmalarında bunlar sık tekrarlanır, ancak tekil vakalar nedensel kanıt değildir.

Belirtiİlk kanıtOlası sonraki adım
5xx veya 429 artışıSunucu/CDN logu ve Crawl StatsKapasite, cache ve hata nedenini düzeltin
Çok sayıda parametre URL’siLoglarda sorgu parametresi dağılımıİç link, canonical ve gerektiğinde robots kurallarını sadeleştirin
Discovered, not indexedURL Inspection ve iç bağlantı yoluŞablon değerini, keşif yolunu ve site talebini birlikte inceleyin
Crawled, not indexedGoogle canonical ve render edilmiş HTMLKopya, soft 404 ve içerik değerini kontrol edin

Crawl Stats ile başlayın, ham logla doğrulayın.

Search Console; istek sayısı, toplam indirme boyutu, ortalama yanıt süresi, dosya türü, amaç ve yanıt kodu dağılımını özetler. Ortalama grafikler, sürekli fakat düşük oranlı bir 5xx problemini veya belirli bir URL şablonundaki israfı saklayabilir.

Ham erişim logunda bot kimliğini yalnız user-agent ile kabul etmeyin. Sahte Googlebot kolaydır; Google’ın önerdiği reverse DNS ya da yayımlanmış IP aralıklarıyla doğrulayın. Ardından bot, gün, URL şablonu, durum kodu, yanıt süresi ve bayt dağılımını çıkarın.

  • Googlebot istekleri doğrulanmış IP veya reverse DNS ile ayrıldı.
  • 200, 3xx, 4xx, 429 ve 5xx oranları URL şablonuna göre hesaplandı.
  • En çok taranan fakat indekslenmesi istenmeyen URL kalıpları çıkarıldı.
  • Önemli URL’lerin son tarama zamanı ile gerçek lastmod tarihi karşılaştırıldı.
  • CSS, JS ve görsel dosyalarının Google render erişimi engellenmiyor.

Tarama israfını URL ve sunucu katmanında azaltın.

  1. Tek kanonik URL: HTTP/HTTPS, www/çıplak host, slash ve index.html varyasyonlarını tek adrese yönlendirin.
  2. Gerçek durum kodu: Silinen sayfaya 404/410; geçici sunucu sorununa 5xx; kalıcı taşımaya tek atlamalı 301/308 verin.
  3. Temiz keşif: Sitemap’e yalnız indekslenmesini istediğiniz kanonik 200 URL’leri koyun ve lastmod’u yalnız materyal değişiklikte güncelleyin.
  4. İç bağlantı: Önemli sayfaları trafik ve konu bakımından alakalı hub ve içeriklerden normal `a href` bağlantılarıyla bulunabilir yapın.
  5. URL uzayını sınırla: Takvim, filtre, dahili arama, oturum ve sıralama parametrelerinin sonsuz kombinasyon üretmesini önleyin.
  6. Sunucu sağlığı: Yanıt süresini, 429/5xx taban oranını ve WAF bot challenge’larını düzenli izleyin.

Narvals tarama yüzeyini küçük, kanonik ve denetlenebilir tutuyor.

Bu projede tüm indekslenebilir URL’ler tek veri kaynağından sitemap, RSS ve keşif dosyalarına üretilir. Derleme; canonical, title, meta robots, yapılandırılmış veri, iç bağlantı, gerçek hedef dosya, sitemap lastmod ve yetim sayfa kontrolleri başarısız olursa durur.

Canlı denetim bilinmeyen URL’nin gerçek 404 verdiğini, slash/index.html varyasyonlarının tek atlamalı yönlendiğini ve Googlebot, Bingbot, OAI-SearchBot, Claude-SearchBot, PerplexityBot ile Applebot user-agent’larının WAF’tan 200 HTML alabildiğini test eder. Bu uygunluk sağlar; indeks veya sıra garantisi vermez.

Kısa ve doğrudan cevaplar.

Crawl budget küçük siteler için önemli mi?

Google’ın rehberine göre yüz milyonlarca dönemsel URL veya on milyonlarca sık değişen URL gibi çok büyük ölçekler asıl crawl budget adaylarıdır. Küçük siteler önce erişim, canonical, kalite ve iç bağlantıyı denetlemelidir.

Sitemap göndermek bütün sayfaları indeksletir mi?

Hayır. Sitemap tercih edilen kanonik URL’leri keşfetmeye yardım eder; tarama, indeks veya sıralama garantisi vermez.

Googlebot taramasını nasıl ölçerim?

Search Console Crawl Stats genel görünüm sağlar. En kesin URL ve durum kodu ayrımı için doğrulanmış Googlebot isteklerini ham CDN veya sunucu erişim loglarında analiz edin.

IndexNow Google’a URL gönderir mi?

Hayır. IndexNow Bing, Yandex ve diğer katılımcı motorlar içindir; Google şu anda IndexNow protokolünü desteklemez.

Kaynaklar ve kapsam.

Bağlantılar içerikteki değişebilir veya dış doğrulama gerektiren bilgilerin kaynağıdır. Ticari ilişki veya sponsorlu bağlantı değildir.

  1. Google Search Central — Büyük sitelerde crawl budget yönetimi
  2. Google Search Central — Googlebot taramasını doğrulama
  3. Google Search Central — Sitemap oluşturma ve gönderme
  4. Google Search Console — Crawl Stats raporu
  5. IndexNow — Katılımcı arama motorları ve protokol

İlgili rehberlerle devam edin.

SEO & GEOGoogle ve AI botları sitenizi nasıl tarar? İndeksleme rehberiSEO & GEOWeb sitesi Google’da neden çıkmıyor? Teşhis rehberiSEO & GEOWeb sitesi teknik SEO kontrol listesi: yayından önce ve sonra

Bu kararı projenize uyarlayalım.

Mevcut durumu, hedefi ve en kritik sınırı paylaşın; gerekli kapsamı birlikte netleştirelim.

Teknik SEO ve web altyapısını inceleyin Tarama Bütçesi ve Bot Taranabilirlik Aracı Projeyi konuşalım