llms.txt ve AI crawler yönetimi: erişim stratejisi
AI crawler'larına ne açacağınıza karar verme çerçevesi: robots.txt ile eğitim, arama ve kullanıcı botlarını ayırma, llms.txt'nin yeri ve log doğrulaması.
Yazan Roozbeh Nazari · CEO
Sitenizi bugün ziyaret eden botların önemli bir kısmı artık arama motoru değil. Model eğitimi için içerik toplayan, AI arama sonuçları için indeks kuran ve bir kullanıcının sorusu üzerine sayfayı anlık çeken üç farklı bot ailesi var; hepsi aynı robots.txt dosyasını okuyor ama her birinin sitenize verdiği ve sizden aldığı şey farklı. Bu yazı, hangi bota ne açılacağına nasıl karar verileceğini ve llms.txt'nin bu kararın neresinde durduğunu anlatıyor.
Erişim stratejisi, AI arama görünürlüğü çalışmasının ilk adımı; hangi botun sayfanızı göremediğini bilmeden hangi cevapta çıkmadığınızı yorumlayamazsınız. Görünürlüğün içerik tarafını, yani bir pasajın alıntılanabilir hâle nasıl geldiğini passage citability yazısında anlatmıştık.
Üç bot ailesi, üç ayrı karar
Büyük sağlayıcıların dokümantasyonu bu ayrımı kendi elleriyle yapıyor. OpenAI üç ana kullanıcı aracısı tanımlıyor: GPTBot model eğitimi için tarar, OAI-SearchBot ChatGPT'nin arama özelliği için indeks kurar ve ChatGPT-User bir kullanıcının isteğiyle sayfayı çeker. Anthropic aynı üçlüyü ClaudeBot, Claude-SearchBot ve Claude-User adlarıyla belgeliyor. Google tarafında ise Google-Extended, sitenizden taranan içeriğin Gemini modellerinin eğitiminde kullanılıp kullanılmayacağını yöneten ayrı bir ürün belirteci; Google'ın dokümanı bunun arama sıralamasını etkilemediğini açıkça yazıyor.
Bu ayrımın pratik sonucu şu: "AI botlarını engelleyelim mi" tek bir soru değil, üç soru. Eğitim botlarına kapatıp arama botlarına açık kalmak mümkün ve dokümantasyon bunu açıkça destekliyor; OpenAI, her ayarın bağımsız çalıştığını, bir sitenin OAI-SearchBot'a izin verip GPTBot'u reddedebileceğini yazıyor. Kullanıcı tetiklemeli botlar için ise ayrı bir not var: bunlar otomatik tarama olmadığı için robots.txt kuralları her durumda uygulanmayabiliyor.
Karar matrisi: hangi bota ne açılır
Kararı sayfa tipine göre vermek gerekiyor. Aşağıdaki çerçeve, ajans olarak kliniklerde ve B2B sitelerinde uyguladığımız pratiğin özeti; her sitede aynı sonucu vermez, ama soruları doğru sırada sordurur.
- Arama botları (OAI-SearchBot, Claude-SearchBot ve benzerleri): görünmek istediğiniz her sayfaya açık. Bunları kapatmak, AI arama sonuçlarından çekilmek demek; OpenAI bunu doğrudan yazıyor.
- Eğitim botları (GPTBot, ClaudeBot, Google-Extended): sitenin iş modeline göre. Blog ve rehber içerik için açık bırakmak görünürlüğe dolaylı katkı sağlayabilir; özgün veri, araştırma ve ücretli içerik için kapatmak savunulabilir bir tercih.
- Kullanıcı tetiklemeli botlar (ChatGPT-User, Claude-User): açık. Bu botun geldiği an, gerçek bir kullanıcının sayfanızı bir cevabın içinde görmek üzere olduğu an.
Türkiye'deki klinik sitelerinde en sık gördüğümüz hata, "AI'ya kapalıyız" kararının tek satırla verilip arama botlarının da engellenmesi. Bu sitelerin sahipleri birkaç ay sonra "ChatGPT bizi neden önermiyor" diye soruyor; cevap kendi robots.txt dosyalarında.
robots.txt: gerçekten ne yapar, ne yapmaz
Google'ın dokümantasyonu robots.txt'nin sınırını açık yazıyor: dosya, tarayıcıların hangi URL'lere erişebileceğini söyler ve esas olarak sitenin isteklerle boğulmasını önlemek içindir; bir sayfayı Google'ın dışında tutmanın aracı değildir. Bir sayfayı indeksten çıkarmak için noindex ya da parola koruması gerekiyor. Aynı mantık AI botları için de geçerli: robots.txt bir istek, teknik bir duvar değil. Dokümantasyonu olan büyük sağlayıcılar bu isteğe uyduklarını belgeliyor; belgelenmemiş botlar için tek güvence sunucu tarafı erişim kontrolü.
Uygulamada dosyayı üç blok hâlinde yazmak okunabilirliği artırıyor: arama motoru botları, AI arama ve kullanıcı botları, AI eğitim botları. Her blokta hangi yolun neden açık ya da kapalı olduğunu yorum satırıyla not etmek, altı ay sonra dosyayı açan kişi için zaman kazandırıyor. OpenAI, robots.txt değişikliklerinin kendi sistemlerine yaklaşık 24 saat içinde yansıdığını yazıyor; değişikliği yapıp aynı gün log'da sonuç aramak yanıltıcı.
llms.txt: ne olduğu, ne olmadığı
llms.txt, sitenin kök dizinine konan ve dil modellerine sitenin ne hakkında olduğunu ve önemli kaynakların nerede bulunduğunu Markdown biçiminde anlatan bir dosya önerisi. Önerinin kendi metni biçimi tanımlıyor: bir H1 başlık, bir alıntı bloğu içinde özet, ardından H2 başlıklar altında açıklamalı bağlantı listeleri. Amaç, bir modelin siteyi HTML'in tamamını işlemeden anlayabilmesi.
Burada dürüst olmak gerekiyor. llms.txt bir erişim kontrol mekanizması değil; hiçbir botu engellemez ve hiçbir botu zorunlu tutmaz. Google'ın tarayıcı dokümantasyonu bu dosyayı desteklenen bir mekanizma olarak listelemiyor; OpenAI ve Anthropic'in bot dokümanları da robots.txt'yi esas alıyor. Yani llms.txt, robots.txt'nin yerine geçen bir şey değil, olsa olsa ona eşlik eden bir tanıtım dosyası. Yayınlamanın maliyeti düşük, ama ondan görünürlük beklemek ölçülmemiş bir varsayım.
Pratik önerimiz şu: llms.txt'yi hazırlayın, ama içinde sitenin gerçekten en iyi on beş yirmi sayfası olsun, tüm sitemap değil. Dosyanın kimin tarafından okunduğunu anlamanın tek yolu sunucu log'unda o yola gelen istekleri saymak; sayfayı yayınladıktan sonra bu sayıyı üç ay takip edin ve karara ancak o zaman dönün.
Log doğrulaması: dosya değil, davranış
Erişim stratejisi robots.txt'ye yazılan bir şey değil, log'da görülen bir şey. Her ay yapılması gereken iş, sunucu log'unda kullanıcı aracısı adlarına göre istekleri gruplamak ve üç soruya bakmak: engellediğiniz bot hâlâ geliyor mu, açtığınız bot geliyor mu ve hangi sayfaları çekiyor. Birinci sorunun cevabı "evet" ise ya kural yanlış yazılmış, ya bot dokümante edilmemiş bir kimlikle geliyor.
Kullanıcı aracısı adı taklit edilebilir. Google ve büyük sağlayıcılar bu yüzden kendi botlarının IP aralıklarını yayınlıyor; şüpheli trafikte adı değil, IP aralığını doğrulayın. Sitede AI kaynaklı yükle ilgili bir sorun görüyorsanız, çözüm genellikle tüm botları engellemek değil, taklit trafiği ayırıp gerçek botlara Crawl-delay ya da sunucu tarafı hız sınırı uygulamak.
Bu doğrulama işini teknik SEO denetiminin sabit bir maddesi olarak tutuyoruz; robots.txt'nin son hâli ile log'daki davranış arasındaki fark, sitenin gerçekte hangi botlara ne söylediğinin tek ölçüsü.
Sonuç
AI crawler yönetimi tek bir engelleme kararı değil, üç bot ailesine üç ayrı cevap. Arama botlarına açık kalmak görünürlüğün ön şartı, eğitim botları iş modeline göre karar, kullanıcı botları neredeyse her zaman açık. robots.txt bu kararların yazıldığı yer, log doğrulaması ise kararların gerçekten uygulanıp uygulanmadığının tek kanıtı. llms.txt bu tablonun içinde küçük bir tanıtım dosyası; hazırlamak zarar vermiyor, ama stratejinin kendisi o değil.