Robots.txt
Kısa tanım
Robots.txt, bir sitenin kök dizininde duran ve arama motoru ile diğer tarayıcılara hangi sayfaları tarayabileceklerini söyleyen basit bir metin dosyasıdır.
Bir site, yönetim paneli ya da sepet sayfası gibi arama sonuçlarında görünmesi gerekmeyen bölümleri robots.txt üzerinden tarayıcılara kapatabilir. Dosya bir kural değil bir yönergedir, saygılı tarayıcılar buna uyar ama zorlayıcı bir engel değildir.
Robots.txt yanlış yazıldığında bütün site yanlışlıkla taramaya kapatılabilir, bu da sitenin arama sonuçlarından tamamen kaybolmasına yol açar. Son dönemde dosya, yapay zekâ tarayıcılarının içeriği eğitim verisi olarak toplayıp toplayamayacağını belirtmek için de kullanılıyor.
Robots.txt genellikle noindex etiketiyle karıştırılır, oysa ikisi farklı iş yapar: disallow bir sayfanın taranmasını engeller ama başka bir sayfa ona bağlantı veriyorsa arama motoru o adresi açıklamasız biçimde yine de listeleyebilir, sayfayı gerçekten indeksten çıkarmak için noindex etiketi ya da kaldırma talebi gerekir. Dosyanın gerçekte nasıl okunduğu Google Search Console'un URL denetleme aracından görülebilir.
Neden önemli
Yanlış yapılandırılmış bir robots.txt, sitenin tamamının ya da en kritik sayfalarının arama motorundan görünmez hale gelmesine neden olabilir. Doğru kurulum, hem gizli kalması gereken sayfaları korur hem de önemli sayfaların taranmasını garantiler.
Örnek senaryo
Bir yazılım güncellemesi sırasında yanlışlıkla tüm siteyi kapatan bir robots.txt satırı bırakılan bir işletme, bir hafta boyunca aramada hiç görünmedi.
