Savunulabilir AI görünürlük ölçümü nasıl kurulur
Savunulabilir ölçüm 5 şeyi sabitler: soru listesi, çalıştırma sayısı, model sürümü, bölge ve kayıt biçimi. Biri değişirse karşılaştırma bozulur.
Savunulabilir bir AI görünürlük ölçümü 5 şeyi sabitler: soru listesi, çalıştırma sayısı, model adı ve sürümü, bölge ve kayıt biçimi. Bunlardan biri ölçümler arasında değişirse karşılaştırma bozulur ve elinizdeki sayı bir şey söylemez.
Bu yazı, o beş sabiti nasıl kuracağınızı anlatıyor.
Neden metodoloji gerekiyor
Bir markanın yapay zekâ cevaplarında görünüp görünmediğini ölçmenin en yaygın yolu şu: soruyu sor, ekran görüntüsü al, rapora koy. Bu yöntem yanlıştır çünkü tekrar edilemez.
Modeller deterministik değildir. Aynı soru beş kez sorulduğunda beş farklı cevap gelebilir ve bunların üçünde markanız geçip ikisinde geçmeyebilir. Tek ekran görüntüsü, o beş çalıştırmadan hangisine denk geldiğinizi söylemez. Ayrıntısı tek çalıştırma veri değildir yazısında.
Sabit 1: soru listesi
Ölçümün temeli soru listesidir ve en sık burada hata yapılır.
Sorular gerçek olmalı. Anahtar kelime listesinden türetilmiş "en iyi X firması" kalıbındaki yapay sorular, kullanıcıların gerçekten sorduğu şeyi temsil etmez. Gerçek kaynaklar:
- Satış ve destek yazışmalarında tekrarlayan sorular
- Arama konsolundaki soru biçimli sorgular
- Teklif formundan gelen serbest metin
- Sektör forumlarında sorulan sorular
Niyet çeşitliliği olmalı. Yalnızca marka adı içeren sorular ölçümü kolay ama değersiz kılar; model markayı zaten adıyla sorulduğunda tanır. Asıl soru, markasız kategori sorularında geçip geçmediğiniz.
Dört niyet türünü dengeleyin:
| Niyet | Örnek | Ne ölçer |
|---|---|---|
| Kategori | "AI görünürlüğü ölçen firmalar" | Kategoriye ait mi |
| Problem | "AI botları siteme erişemiyor" | Çözüm sağlayıcı mı |
| Karşılaştırma | "X mi Y mi" | Alternatif olarak anılıyor mu |
| Marka | "Kaynak Ol nedir" | Varlık tanınıyor mu |
15–30 soru çoğu marka için yeterli. Liste bir kez kurulduktan sonra değiştirilmez — değiştirilirse önceki ölçümle karşılaştırılamaz.
Sabit 2: çalıştırma sayısı
En az 3, ciddi denetimde 5.
Üç çalıştırma, "hiç görünmüyor" ile "bazen görünüyor" arasındaki farkı ayırmaya yeter. Beş çalıştırma yüzdelik ifadeyi anlamlı kılar: 5’te 3 ile 5’te 4 arasında konuşulabilir bir fark vardır.
Çalıştırmalar ayrı oturumlarda yapılmalı. Aynı oturumda arka arkaya sormak, modelin önceki cevabından etkilenmesine yol açar ve bağımsız örnek üretmez.
Sabit 3: model adı ve sürümü
Her kayıtta hangi model, hangi sürüm ve hangi arayüz kullanıldığı yazılmalı.
Bunun sebebi basit: sağlayıcılar model sürümlerini haber vermeden güncelliyor. Mart ayındaki ölçümle Haziran ayındaki ölçüm arasındaki fark, sizin yaptığınız iyileştirmeden değil model değişiminden kaynaklanıyor olabilir. Sürüm kaydedilmemişse bunu ayırt etmenin yolu yoktur.
Ayrıca API ile arayüz aynı sonucu vermez. Arayüz farklı sistem talimatları, farklı araç erişimi ve kişiselleştirme taşıyabilir. Hangisini kullandığınız kayıtta bulunmalı.
Sabit 4: bölge ve dil
Aynı soru Türkçe ve İngilizce sorulduğunda farklı kaynaklar seçilir. Aynı soru farklı bölgelerden sorulduğunda arama katmanı farklı sonuç döndürebilir.
Kayıtta dil ve bölge bulunmalı; ölçümler arasında ikisi de sabit kalmalı.
Sabit 5: kayıt biçimi
Her çalıştırma için kaydedilmesi gerekenler:
- Soru metni (birebir)
- Tarih ve saat
- Model adı ve sürümü
- Arayüz mü API mi
- Dil ve bölge
- Marka geçti mi (evet/hayır)
- Geçtiyse nasıl: kaynak listesinde mi, cevap metninde mi
- Rakipler geçti mi, hangileri
Son iki madde raporun değerini belirler. "Göründünüz" ile "cevabın içinde adınız geçti ve kaynak olarak bağlandınız" farklı sonuçlardır.
Raporlama: frekans, izlenim değil
Ölçümün çıktısı tek bir cümleyle ifade edilebilmeli:
"Kategori sorularının 20’sinde, 5’er çalıştırmayla yapılan ölçümde marka ortalama %35 oranında göründü. Aynı ölçümde en yakın rakip %60 oranında göründü."
Bu cümle tekrar edilebilir. "Genellikle görünüyorsunuz" cümlesi tekrar edilemez ve bir sonraki ölçümle karşılaştırılamaz.
Rakip kıyasının nasıl kurulacağı rakip kıyası nasıl kurulur yazısında; ses payı metriği ise ses payı ve rakip kıyası yazısında ele alınıyor.
Ölçümden önce: erişim kontrolü
Bütün bu kurulum, model sitenize erişebiliyorsa anlamlı. Erişemiyorsa ölçtüğünüz şey içeriğinizin kalitesi değil, güvenlik duvarınızın davranışı olur.
114 Türk sitesini ölçtüğümüz çalışmada ölçülebilen 90 sitenin %32’si en az bir AI tarayıcısını engelliyordu. Ölçüme başlamadan önce bot erişim kontrolünü çalıştırmak, boşa ölçüm yapmayı engeller.
Sık yapılan dört hata
Soru listesini ölçüm ortasında değiştirmek. Karşılaştırılabilirliği bitirir. Yeni soru eklemek isterseniz ayrı bir liste olarak takip edin.
Marka adıyla sorulan sorulara ağırlık vermek. Model markayı adıyla sorulduğunda zaten tanır; bu ölçüm iyimser bir yanılsama üretir.
Tek sağlayıcıda ölçmek. ChatGPT, Perplexity, Gemini ve Copilot farklı kaynak seçim mantıkları kullanır. Tek sağlayıcı, tek pencereden bakmaktır.
Ölçümü iyileştirmeden hemen sonra tekrarlamak. Arama tarafı günler içinde yansır ama eğitim tarafı aylar sürer. Bir hafta sonra ölçüp "değişmedi" demek, yanlış sonuca varmaktır.
Özet
Savunulabilir ölçüm, sonucu değil yöntemi sabitler: 15–30 gerçek soru, en az 3 çalıştırma, kaydedilmiş model sürümü, sabit dil ve bölge, frekans olarak raporlama. Bu beş sabit yerindeyse iki ölçüm karşılaştırılabilir; biri eksikse elinizdeki sayı bir izlenimdir.
Markaların yapay zekâ destekli arama sistemlerindeki görünürlüğünü ölçer ve düzeltir. Ölçüm metodolojisi ham sunucu yanıtına ve tekrarlı çalıştırmaya dayanır; her bulgu kaydedilmiş bir sunucu yanıtına bağlanır.
Sık sorulanlar
Kaç soru ölçülmeli?
Kategoriyi temsil eden 15–30 soru çoğu marka için yeterlidir. Önemli olan sayı değil, soruların gerçekten sorulan sorular olması; anahtar kelime listesinden türetilmiş yapay sorular ölçümü bozar.
Neden birden fazla çalıştırma gerekiyor?
Dil modelleri deterministik değildir; aynı soru farklı çalıştırmalarda farklı cevap verebilir. Tek çalıştırma bu yüzden veri değil gürültüdür. En az 3, ciddi denetimde 5 çalıştırma gerekir.
Hangi metrik raporlanmalı?
Frekans. "Beş çalıştırmanın üçünde göründünüz" ifadesi ölçülebilir ve tekrar edilebilir. "Genellikle görünüyorsunuz" ifadesi ölçüm değil izlenimdir.
Ölçüm ne sıklıkla tekrarlanmalı?
Ayda bir yeterli çoğu marka için. Model sürümleri ve arama katmanları haftalar içinde değişebildiği için daha seyrek ölçüm değişimin sebebini ayırt etmeyi zorlaştırır.