13 AI botunun tam listesi ve ne işe yaradıkları
GPTBot, ClaudeBot, PerplexityBot ve diğerleri — hangisi ne yapıyor, engellenirse ne kaybedersiniz ve hangi ikisi aslında tarayıcı bile değil.
Yapay zekâ tarayıcıları tek bir kategori değil. Bazıları model eğitimi için içerik topluyor, bazıları arama dizini kuruyor, bazıları da kullanıcı bir bağlantı verdiğinde anlık olarak sayfayı okuyor. İkisi ise tarayıcı bile değil.
Bu ayrımlar önemli, çünkü hepsini aynı kefeye koyup toptan engellemek ya da toptan açmak farklı sonuçlar doğurur.
Üç rol, üç farklı sonuç
Arama yüzlü botlar engellenirse markanız bugün görünmez olur. Bir kullanıcı soru sorduğunda model web'de arama yapar ve sitenizi kaynak listesine alamaz.
Eğitim botları engellenirse etkisi uzun vadede ortaya çıkar. Model, bir sonraki sürümünde markanızı tanımaz; kategori sorularında adınız aklına gelmez.
Kullanıcı tetikli ajanlar engellenirse en can sıkıcı durum oluşur: kullanıcı sizin bağlantınızı yapıştırır, model "bu sayfaya erişemiyorum" der.
Tam liste
OpenAI
| Belirteç | Rol | Engellenirse |
|---|---|---|
GPTBot | Model eğitimi | ChatGPT markanızı öğrenemez |
OAI-SearchBot | ChatGPT arama dizini | ChatGPT arama sonuçlarında çıkmazsınız |
ChatGPT-User | Kullanıcı isteğiyle anlık okuma | Kullanıcı linkinizi verse bile sayfa okunamaz |
OAI-SearchBot bu üçlünün en kritiğidir. ChatGPT'nin web araması bu botun kurduğu dizini kullanır; engellendiğinde kaynak listesinde hiç görünmezsiniz.
Anthropic
| Belirteç | Rol | Engellenirse |
|---|---|---|
ClaudeBot | Model eğitimi | Claude markanızı öğrenemez |
Claude-SearchBot | Claude arama dizini | Claude sitenizi kaynak gösteremez |
Claude-User | Kullanıcı isteğiyle anlık okuma | Paylaşılan bağlantı okunamaz |
Perplexity
| Belirteç | Rol | Engellenirse |
|---|---|---|
PerplexityBot | Arama dizini | Perplexity cevaplarında kaynak gösterilmezsiniz |
Perplexity-User | Kullanıcı isteğiyle anlık okuma | Kullanıcı sayfanızı açtırmak isterse okunamaz |
Perplexity cevaplarının her birinin altında numaralı kaynak listesi bulunur. O listede olmak, Perplexity'de görünürlüğün tamamıdır.
Eğitim ve arşiv
| Belirteç | Rol | Not |
|---|---|---|
CCBot | Common Crawl açık arşivi | Birçok model bu arşivle eğitilir — dolaylı ama geniş etki |
meta-externalagent | Meta AI / Llama eğitimi | Meta AI markanızı öğrenemez |
Bytespider | ByteDance / Doubao | Çin pazarı hedefinizde değilse engellemek meşru |
CCBot'un etkisi hafife alınır. Common Crawl birçok açık modelin eğitim verisinin temelidir; engellemek, adını hiç duymadığınız onlarca modelden birden düşmek demektir.
Tarayıcı olmayan ikisi
Bu iki belirteç listelerde sürekli "bot" diye geçer ama hiçbir istek atmazlar:
Google-Extended — İçeriği Googlebot çeker. Bu belirteç yalnızca içeriğinizin Gemini ve AI Overviews yanıtlarında kullanılıp kullanılmayacağını belirler. Yasaklamak normal Google sıralamanızı etkilemez.
Applebot-Extended — Aynı mantık. İçeriği Applebot çeker; bu belirteç Apple Intelligence kullanımını denetler. Siri ve Spotlight aramasını etkilemez.
Bu ayrımı yapmayan araçlar bu iki belirteçle gerçek istek atmaya kalkar ve anlamsız sonuç üretir. Doğru davranış, ikisini yalnızca robots.txt beyanı üzerinden değerlendirmektir.
Hangi botu engellemeli: karar tablosu
Toptan açmak ya da toptan kapatmak yerine role göre karar verin:
| Durum | Arama yüzlü | Eğitim | Bölgesel |
|---|---|---|---|
| Görünürlük istiyorsunuz | Açık | Açık | Tercihe bağlı |
| İçerik telife tabi / ücretli | Açık | Kapalı | Kapalı |
| Sunucu yükü sorun | Açık | Hız sınırı | Kapalı |
| Hedef pazar yalnızca Türkiye | Açık | Açık | Kapalı |
Dikkat edilecek nokta: arama yüzlü botları engellemek görünürlüğü doğrudan bitirir. Eğitim botlarını engellemek bir tercih, arama botlarını engellemek genellikle kazadır.
İzin veren robots.txt örneği
Görünürlük istiyor ama yönetim alanlarını kapatmak istiyorsanız:
User-agent: *
Disallow: /wp-admin/
Disallow: /sepet/
Disallow: /hesabim/
Allow: /
Sitemap: https://siteniz.com/sitemap.xml
Bu yeterlidir. AI botları * grubuna dahildir ve ayrıca listelenmeleri gerekmez. Yine de açık olmak isterseniz her botu tek tek yazabilirsiniz — ardışık User-agent satırları tek grup oluşturur:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Disallow: /wp-admin/
Allow: /
Seçici robots.txt: eğitime kapalı, aramaya açık
Yayıncılar için tipik yapılandırma — içerik modelin eğitiminde kullanılmasın ama arama cevaplarında kaynak gösterilsin:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Allow: /
Önemli ayrıntı: bir bot için özel grup tanımladığınızda o bot grubunu tamamen yok sayar. Yani GPTBot grubunda yalnızca Disallow: / yazıyorsa, grubundaki diğer kurallarınız GPTBot için hiç geçerli olmaz.
Sahte bot trafiğine dikkat
User-agent dizgisi kolayca taklit edilir. Günlüklerinizde GPTBot görmeniz, isteğin gerçekten OpenAI'dan geldiği anlamına gelmez — içerik kazıyıcılar meşru bot adlarını sık sık kullanır.
Doğrulama yöntemi ters DNS sorgusudur:
host 203.0.113.42
# -> crawl-203-0-113-42.openai.com gibi bir sonuç dönmeli
host crawl-203-0-113-42.openai.com
# -> tekrar 203.0.113.42 donmeli
İki yönlü eşleşme sağlanmıyorsa istek sahtedir. Sağlayıcılar ayrıca yayımlanmış IP aralıkları tutar; yüksek hacimli engelleme kararlarını user-agent yerine bu aralıklara dayandırmak daha güvenlidir.
Bu ayrım pratikte şu anlama gelir: user-agent'a izin vermek güvenlik açığı değildir, çünkü zaten taklit edilebilir bir alandır. AI botlarına izin vermek sitenizi kazınmaya açmaz; kazımak isteyen zaten normal tarayıcı gibi davranır.
Kullanıcı tetikli ajanlar robots.txt'e bakmayabilir
ChatGPT-User, Claude-User ve Perplexity-User gibi ajanlar, kullanıcının açık isteğiyle tek bir sayfayı getirir. Tasarım gereği bunlar bir tarayıcı isteğine daha yakındır ve robots.txt kurallarını kendi ayrı yorumlarına göre uygular.
Pratik sonucu şu: bu ajanları gerçekten durdurmak istiyorsanız robots.txt yeterli olmayabilir, sunucu tarafında denetim gerekir. Tersi de geçerli — robots.txt bunlara izin veriyor diye erişebildiklerini varsaymayın.
Liste zamanla değişir
Bu on üç belirteç bugünün listesi. Yeni sağlayıcılar çıkıyor, mevcutlar belirteç adı değiştiriyor, bazıları ikiye ayrılıyor — Claude-Web belirteci ClaudeBot ve Claude-SearchBot olarak ayrıldığında pek çok site eski adı engellemeye devam etti ve farkında olmadan yeni arama botuna da kapalı kaldı.
Pratik öneri: robots.txt'i bir kez yazıp unutmayın. Çeyrekte bir listeyi gözden geçirin ve beyanı değil gerçeği ölçün — kuralınız doğru olsa bile güvenlik duvarınız aynı fikirde olmayabilir.
Beyan listesi yeterli değil
Bu listeyi robots.txt'inize eklemek işin yalnızca yarısıdır. Diğer yarısı, her botun gerçekten erişip erişemediğini ölçmektir: güvenlik duvarınız, robots.txt'inizde ne yazdığından habersiz biçimde bu botları geri çeviriyor olabilir.
Markaların yapay zekâ destekli arama sistemlerindeki görünürlüğünü ölçer ve düzeltir. Ölçüm metodolojisi ham sunucu yanıtına ve tekrarlı çalıştırmaya dayanır; her bulgu kaydedilmiş bir sunucu yanıtına bağlanır.
Sık sorulanlar
Google-Extended bir tarayıcı mı?
Hayır. Google-Extended bir robots.txt denetim belirtecidir, ayrı bir tarayıcı değil. İçeriği Googlebot çeker; Google-Extended yalnızca bu içeriğin Gemini ve AI Overviews yanıtlarında kullanılıp kullanılmayacağını belirler. Bu belirteçle gerçek istek atmak anlamsızdır.
Hangi botları engellemeliyim?
Görünür olmak istiyorsanız arama yüzlü botların hiçbirini: OAI-SearchBot, Claude-SearchBot, PerplexityBot ve kullanıcı tetikli ajanlar bugünkü görünürlüğünüzü doğrudan belirler. Eğitim botlarını engellemek meşru bir tercihtir ama uzun vadeli bilinirliği azaltır.
Bir botu engellemek Google sıralamamı etkiler mi?
Google-Extended’i yasaklamak normal Google arama sıralamanızı etkilemez; yalnızca AI Overviews ve Gemini yanıtlarında kullanımı engeller. Googlebot’u engellemek ise sıralamanızı doğrudan etkiler; ikisi farklı belirteçlerdir ve karıştırılmamalıdır.