Dosya alanadiniz.com/robots.txt adresinde bulunur ve User-agent, Disallow, Allow ile Sitemap satırlarından oluşur. Her kural belirli bir tarayıcıya (örneğin Googlebot, Bingbot, GPTBot) veya * ile tümüne yazılabilir. Kurallar 2022'de RFC 9309 olarak standartlaştı.
En sık yanılgı robots.txt'nin bir sayfayı dizinden çıkardığını düşünmektir. Engellenmiş bir sayfa, başka sitelerden bağlantı alıyorsa içeriği okunmadan yalnızca adresiyle dizinde görünebilir. Dizinden çıkarmak için sayfanın taranmasına izin verip noindex kullanmak gerekir. Google, robots.txt içindeki noindex satırını da 2019'dan beri desteklemiyor.
Yapay zekâ çağında robots.txt yeni bir önem kazandı. GPTBot, OAI-SearchBot veya Google-Extended gibi belirteçleri ayrı ayrı engelleyerek içeriğinizin model eğitiminde kullanılmasını sınırlarken yapay zekâ aramasında görünmeye devam edebilirsiniz. Hepsini körü körüne engellemek, ChatGPT gibi asistanlarda kaynak olma şansını da ortadan kaldırabilir.
Ciddi bir hata: geliştirme ortamından kalan Disallow: / satırının canlı siteye taşınması. Tek satır, tüm sitenin taranmasını durdurur.
Sitenizde nasıl kontrol edilir?
- alanadiniz.com/robots.txt adresini tarayıcıda açın.
- Search Console'daki robots.txt raporunda Google'ın dosyayı hatasız okuyup okumadığına bakın.
- Önemli sayfalarınızın ve CSS/JS dosyalarınızın engellenmediğini kontrol edin.
Ayrıntı ve uygulama: robots.txt ve site haritası denetimi
İlgili terimler
- noindexnoindex, bir sayfanın arama motoru dizinine eklenmemesini isteyen yönergedir. HTML'de <meta name="robots" content="noindex"> etiketiyle veya HTTP yanıtında X-Robots-Tag başlığıyla verilir; Google bunu bir talimat olarak uygular.
- XML site haritasıXML site haritası, bir sitedeki dizine eklenmesi istenen adresleri ve isteğe bağlı olarak son değiştirilme tarihlerini arama motorlarına liste halinde sunan dosyadır. Keşfi kolaylaştırır, ama listedeki sayfaların dizine ekleneceğini garanti etmez.
- GooglebotGooglebot, Google Arama'nın web sayfalarını keşfetmek ve taramak için kullandığı tarayıcının genel adıdır. Akıllı telefon ve masaüstü olmak üzere iki ana türü vardır; sitelerin büyük çoğunluğu akıllı telefon Googlebot'u ile taranır.
- GPTBotGPTBot, OpenAI'ın içerikleri üretken yapay zekâ modellerinin eğitiminde kullanılmak üzere toplayan tarayıcısıdır. robots.txt ile engellenmesi, sitenin içeriğinin model eğitiminde kullanılmamasını ister; ChatGPT arama sonuçlarındaki görünürlüğü ise OAI-SearchBot belirler.
- Google-ExtendedGoogle-Extended, site sahiplerinin Google'ın taradığı içeriğin Gemini modellerinin eğitiminde ve Gemini uygulamaları ile Vertex AI'daki grounding işleminde kullanılıp kullanılmayacağını robots.txt üzerinden yönetmesini sağlayan belirteçtir. Google Arama'yı ve yapay zekâ özetlerini etkilemez.
Sözlüğün tamamı (70 terim) · Sitenizi kontrol edin: web sitesi kontrol aracı