İçeriğe geç
Flatinium
SEO6 dk okuma

Googlebot ne iş yapar? Tarama, indeksleme ve bütçe

Googlebot, internetteki sayfaları bulup Google’ın dizinine ekleyen tarayıcı programdır. Sitenizin aramada görünmesi, önce bu botun sayfalarınıza ulaşabilmesine bağlı.

Googlebot ne iş yapar? Tarama, indeksleme ve bütçe — Flatinium SEO yazısının kapak görseli

Kısaca

Googlebot, Google’ın web'i gezen yazılımı. İki iş yapıyor: yeni ve değişmiş sayfaları bulmak (tarama), sonra bunları işleyip arama dizinine hazırlamak.

Sitenizin Google'da görünmesinin ilk şartı bu botun sayfanıza ulaşabilmesi. Ulaşamıyorsa içeriğin kalitesi hiç konuşulmuyor bile.

Tarama, indeksleme, sıralama — üçü ayrı

Google bu ayrımı kendi belgelerinde de koruyor. Tarayıcı listesi hangi botun hangi işi yaptığını tek tek sayıyor; tarama davranışının nasıl sınırlanacağı ise robots.txt belgesinde anlatılıyor. İkisini karıştırmak, indekslemeyi engellemek isterken taramayı kapatmak gibi ters sonuçlar üretiyor.

Karıştırılan üç aşama:

Aşama

Ne oluyor

Nerede görülür

Tarama

Bot sayfayı indiriyor

Sunucu kayıtları, Search Console tarama istatistikleri

İşleme

HTML ayrıştırılıyor, JavaScript çalıştırılıyor

Search Console URL denetimi

İndeksleme

Sayfa dizine ekleniyor

Search Console sayfa raporu

Sıralama

Arama sonucunda sıra alıyor

Search Console performans raporu

Bir sayfa taranmış olabilir ama indekslenmemiş olabilir. İndekslenmiş olabilir ama hiç gösterim almıyor olabilir. Sorun teşhisinde önce hangi aşamada takıldığını bulmak gerekiyor — çözümler tamamen farklı.

İki ayrı Googlebot

Google iki ana bot kimliği kullanıyor:

  • Googlebot Smartphone — varsayılan. Mobil öncelikli indeksleme sebebiyle sitenizin mobil hâlini esas alıyor.
  • Googlebot Desktop — çok daha az kullanılıyor.

Bunun pratik sonucu şu: mobilde gizlediğiniz içerik Google için yok sayılabiliyor. Masaüstünde uzun bir açıklama gösterip mobilde kısaltıyorsanız, Google kısa hâli görüyor.

Bunun dışında Google’ın görsel, video, haber ve reklam için ayrı botları var. Hepsi robots.txt kurallarına uyuyor.

Tarama bütçesi gerçekten sorun mu?

Google her siteye sınırsız zaman ayırmıyor. Ne kadar ayırdığı iki şeye bağlı: sunucunuz ne kadar hızlı cevap veriyor ve sitenizde ne kadar değerli içerik var.

Ama şunu netleştirelim — çoğu site için tarama bütçesi bir sorun değil. Birkaç yüz sayfalık kurumsal sitede Google zaten her şeyi geziyor. Konu şu durumlarda önem kazanıyor:

  • On binlerce adres varsa (e-ticaret, ilan siteleri)
  • Filtre ve sıralama parametreleri sonsuz adres üretiyorsa
  • Sunucu yavaşsa ve bot geri çekiliyorsa

Küçük bir sitede tarama bütçesiyle uğraşmak, çözülecek gerçek sorunlardan dikkat çalıyor.

Botun sitenizi nasıl gördüğünü kontrol etmek

Üç yöntem, kolaydan zora:

1. Search Console URL denetimi. Adresi girip "Canlı URL'yi test et" deyin. Google’ın gördüğü HTML'i ve ekran görüntüsünü gösteriyor. En hızlı ve en güvenilir yol.

2. Tarayıcıda JavaScript kapatmak. Sayfa boşalıyorsa içeriğiniz tamamen JavaScript'e bağlı demektir. Google JavaScript çalıştırıyor ama bu ikinci bir aşama ve gecikebiliyor.

3. Screaming Frog ile Googlebot kimliğiyle tarama. Sitenin bota nasıl davrandığını toplu görmenizi sağlıyor. Screaming Frog rehberimizde ayrıntısı var.

Botu yanlışlıkla engelleyen dört şey

robots.txt hatası. Tek bir yanlış satır tüm siteyi kapatabiliyor. Sahne ortamından canlıya taşınırken en sık yapılan hata bu — geliştirme sırasındaki engelleme kuralı unutuluyor.

noindex etiketi. Sayfa taranıyor ama dizine girmiyor. Yine taşıma sonrası unutulan ayarlardan.

Güvenlik duvarı ve bot koruması. Cloudflare ve benzeri servisler agresif ayarda gerçek Googlebot'u da engelleyebiliyor. Search Console'da ani tarama düşüşü görüyorsanız buraya bakın.

Giriş zorunluluğu. İçeriğin arkasında oturum açma varsa bot göremiyor.

Belirti

Muhtemel sebep

Nereden bakılır

Hiç taranmıyor

robots.txt engeli, DNS sorunu

Search Console tarama istatistikleri

Taranıyor, indekslenmiyor

noindex, kanonik başka sayfaya, zayıf içerik

Sayfa indeksleme raporu

İndeksli, gösterim yok

Kelime hedefi yok veya rekabet çok yüksek

Performans raporu

Tarama aniden düştü

Sunucu hataları, bot engeli

Sunucu kayıtları

Sahte Googlebot

Kendini Googlebot olarak tanıtan botların hepsi gerçek değil. Kimlik dizesi taklit edilebiliyor.

Doğrulama yöntemi: IP adresine ters DNS sorgusu yapıp googlebot.com veya google.com alan adına düşüp düşmediğine bakmak, sonra o alan adını tekrar IP'ye çözmek. Google bu IP listelerini de yayınlıyor.

Bu ayrım şu yüzden önemli: gerçek Googlebot'u engellemek felaket, sahtesini engellemek sunucu yükünüzü azaltıyor.

Search Console’daki tarama istatistikleri nasıl okunur?

Ayarlar bölümündeki tarama istatistikleri raporu, çoğu kişinin hiç açmadığı ama en çok bilgi veren yerlerden biri. Üç grafiğe bakın:

Toplam tarama isteği. Zaman içinde düz bir çizgi normal. Ani düşüş sorun işareti — genelde sunucu hatası, robots.txt değişikliği veya bot engeli. Ani yükseliş de dikkat ister; genellikle istemeden üretilmiş binlerce yeni adres anlamına geliyor (filtre parametreleri gibi).

Ortalama cevap süresi. 500 ms üstüne çıkıyorsa bot tarama hızını kendiliğinden düşürüyor. Bu grafiği düz ve düşük tutmak, tarama bütçesi için yapabileceğiniz en etkili şey.

Cevap koduna göre dağılım. 200 dışındaki kodların payı yükseliyorsa bir şey bozulmuş demektir. Özellikle 5xx oranındaki artış acil müdahale gerektiriyor — Google sunucuyu zorlamamak için taramayı kısıyor.

Rapor ayrıca dosya türüne ve tarama amacına (keşif mi, yenileme mi) göre kırılım veriyor. Keşif oranının yüksek olması sitede çok sayıda yeni adres üretildiğini gösteriyor; yenileme ağırlıklıysa Google mevcut sayfaları kontrol ediyor demektir.

Dikkat — Cloudflare ve benzeri bot koruma servisleri agresif ayarda gerçek Googlebot'u da engelleyebiliyor. Belirtisi Search Console'da ani tarama düşüşü. Bunu fark etmek haftalar sürebiliyor çünkü sıralama hemen düşmüyor, yavaşça eriyor.

Botun işini kolaylaştırmak

Karmaşık bir iş değil, dört madde:

  1. Site haritası verin. XML site haritası ve Search Console'a bildirimi. Google yeni sayfaları çok daha hızlı buluyor.
  2. İç link kurun. Hiçbir sayfaya link verilmemişse bot oraya zor ulaşıyor. Her sayfa en az bir yerden linklenmiş olmalı.
  3. Sunucuyu hızlandırın. Yavaş cevap veren sunucuda bot geri çekiliyor. Sunucu cevap süresi 200 ms altında olmalı.
  4. Yönlendirme zincirlerini temizleyin. Her zincir adımı ekstra istek demek.
Örnek senaryo — Bir müşterinin 900 sayfalık e-ticaret sitesinde Googlebot günde 12.000 istek yapıyordu ama bunun %70'i filtre parametreli adreslere gidiyordu. Gerçek ürün sayfaları haftada bir taranıyordu. Parametreleri kapatınca ürün sayfalarının tarama sıklığı üç güne indi ve yeni ürünler günler içinde indekslenmeye başladı.

Ne zaman bu konuyla uğraşmaya değmez?

Sitenizde 50 sayfa varsa ve hepsi Search Console'da indeksli görünüyorsa, tarama optimizasyonu size bir şey kazandırmayacak. O noktada enerjiyi içeriğe ve kelime hedeflemesine ayırmak çok daha verimli.

Bu konu şu durumda gerçek: Search Console'da "Taranmadı" veya "Keşfedildi, henüz indekslenmedi" durumunda çok sayıda önemli sayfa varsa. İkinci ifade özellikle dikkat ister — Google adresi bulmuş ama taramaya değer görmemiş demektir. Sebebi genelde ya sitenin genel kalite değerlendirmesi ya da o sayfaya hiç iç link verilmemiş olması. Her iki durumda da çözüm teknik değil, içerik ve site yapısı tarafında.

Sitenizin tarama tarafında sorun olup olmadığını bizim çıkarmamızı isterseniz SEO denetimi ve analiz hizmetimiz bunu kapsıyor. Teknik SEO tarafında ise tespit edilen sorunları biz düzeltiyoruz.

Bu konuyla ilgili

SSS

Sık sorulan sorular

Googlebot siteme ne sıklıkta geliyor?

Sitenin güncellenme sıklığına, otoritesine ve sunucu hızına göre değişiyor. Sık güncellenen haber siteleri günde birçok kez taranırken, nadiren değişen küçük siteler haftalarda bir ziyaret edilebiliyor. Kesin cevabı sunucu kayıtlarınızda bulursunuz.

robots.txt ile noindex arasındaki fark ne?

robots.txt taramayı engeller: bot sayfaya hiç bakmaz. noindex ise sayfanın dizine eklenmesini engeller ama bot sayfayı görür. Kritik ayrıntı şu: robots.txt ile engellenmiş bir sayfadaki noindex etiketini Google okuyamaz, dolayısıyla sayfa yine indekslenebilir.

Sayfam taranıyor ama indekslenmiyor, neden?

Genellikle içerik değersiz veya başka bir sayfanın kopyası bulunuyor. Search Console’daki Sayfalar raporu sebebi kategori olarak gösteriyor. En sık görülenler: "Taranan ancak dizine eklenmeyen sayfa" ve "Kopya, kullanıcı tarafından seçilen standart sayfa yok".

Sayfam indekslenmiyor, ne yapmalıyım?

Önce Search Console’daki URL denetimi aracıyla sebebini görün. En sık üç sebep: robots.txt engeli, noindex etiketi veya kanonik etiketin başka sayfayı göstermesi. Üçü de değilse sayfa "keşfedildi, indekslenmedi" durumundadır ve bu genellikle içerik kalitesi veya iç link eksikliğine işaret ediyor.