Tek çalıştırma veri değildir
Dil modelleri deterministik değil. Bir soruyu bir kez sorup sonucu rapor etmek, zar atıp sonucu istatistik diye sunmaktır. Savunulabilir ölçüm frekansla çalışır.
Bir markanın yapay zekâ cevaplarında görünüp görünmediğini ölçmenin en yaygın yolu şu: soruyu sor, ekran görüntüsü al, rapora koy. Bu yöntem yanlıştır ve neden yanlış olduğu teknik bir ayrıntı değil, ölçümün temeli.
Aynı soru, farklı cevaplar
Dil modelleri deterministik değildir. Aynı istem, aynı model ve aynı ayarlarla beş kez çalıştırıldığında beş farklı yanıt üretebilir. Sebep örnekleme: model bir sonraki kelimeyi olasılık dağılımından seçer ve bu seçim her seferinde aynı olmak zorunda değildir.
Web araması devredeyken belirsizlik artar: arama sonuçları da değişkendir, sıralama değişir, bazı kaynaklar bazen getirilir bazen getirilmez.
Pratik sonuç şu: "markanız ChatGPT'de görünmüyor" cümlesi tek bir çalıştırmaya dayanıyorsa bilgi değil, gürültüdür.
Frekans olarak raporlamak
Doğru ifade şöyle kurulur:
"en iyi HDPE boru üreticileri" sorgusunda marka, 5 çalıştırmanın 3'ünde göründü — %60.
Bu cümle üç şeyi birden yapar: ölçümü tekrarlanabilir kılar, belirsizliği gizlemek yerine sayıya çevirir ve iyileştirmeyi ölçülebilir hale getirir. %60'tan %80'e çıkmak somut bir kazançtır; "görünüyor"dan "daha çok görünüyor"a geçmek değildir.
Ölçümün yanına yazılması gerekenler
Bir görünürlük bulgusu şunlar olmadan geçersizdir:
| Alan | Neden |
|---|---|
| Model adı ve sürümü | Sürüm değişince veri kıyaslanamaz hale gelir |
| Tarih | Sonuçların raf ömrü var; tarihsiz bulgu geçersiz |
| Bölge | Yanlış bölge yanlış cevap verir |
| Dil | Aynı sorunun farklı dildeki karşılığı farklı sonuç verir |
| Web araması açık mı | Aramalı ve aramasız yanıtlar farklı sistemlerdir |
| Çalıştırma numarası | Frekansın paydası |
Sorgu seti rastgele seçilemez
Ölçümün kalitesini belirleyen ikinci şey, hangi soruların sorulduğudur. İki kural:
Marka adını kategori sorularına koymayın. "Bayraktar Attorneys nasıl bir firma?" sorusu görünürlük ölçmez — cevapta markanın geçmesi kaçınılmazdır. Görünürlük, markanın adı geçmeyen sorularda ölçülür: "Niğde'de HDPE boru üreticileri hangileri?"
Kullanıcının yazacağı gibi yazın. "hdpe boru üretici" bir anahtar kelimedir, kimse asistana böyle sormaz. "en iyi hdpe boru üreticisi hangisi" gerçek bir sorudur.
Çeviri sorgu gerçek arama davranışını yansıtmaz
Çok dilli ölçümde sık yapılan hata, Türkçe sorgu setini makine çevirisinden geçirip İngilizce ya da Arapça sürüm üretmek. Bu yanlıştır: insanlar farklı dillerde farklı şeyler sorar, farklı kelimeler kullanır, farklı varsayımlarla yaklaşır.
Her dil için sorgu seti yeniden yazılır, çevrilmez.
Ölçüm ile yorum ayrılır
Son kural, raporun kendisiyle ilgili. Ölçülen şey ile ölçümden çıkarılan sonuç aynı cümlede durmamalı:
- Ölçüm: "Marka 40 sorgunun 6'sında, ortalama %35 frekansla göründü."
- Yorum: "Bu, kategori otoritesinin zayıf olduğuna işaret ediyor olabilir."
İkincisi bir tahmindir ve öyle etiketlenmelidir. Bir denetim raporunda bu ayrım kaybolduğunda, okuyan kişi neyin ölçüldüğünü neyin tahmin edildiğini ayırt edemez — ve haklı olarak tamamına güvenmez.
Kaç çalıştırma yeterli
Üç çalıştırma, "hiç görünmüyor" ile "bazen görünüyor" arasındaki farkı ayırt etmeye yeter — ve bu fark stratejik olarak en önemli olanıdır. Hiç görünmeyen bir marka için sorun genellikle yapısaldır (teknik engel, varlık belirsizliği); bazen görünen bir marka için sorun rekabetçidir.
Beş çalıştırma yüzdelik ifadeyi anlamlı kılar. %60 ile %80 arasındaki farkı üç çalıştırmayla ölçemezsiniz; üçte iki ile üçte üç arasında ara değer yoktur.
Daha fazlası çoğu durumda maliyeti karşılamaz. Yedi ya da on çalıştırma kararı değiştirmiyorsa, o bütçeyi daha fazla sorguya harcamak daha iyidir: yirmi sorgu × beş çalıştırma, on sorgu × on çalıştırmadan daha çok şey söyler.
Sorgu seti taksonomisi
Kaç sorgu kadar önemlisi, hangi tipte olduklarıdır. Tam bir denetimde dağılım kabaca şöyle olur:
| Tip | Pay | Amaç | Örnek kalıp |
|---|---|---|---|
| Kategori / çözüm | ~%40 | Asıl görünürlük savaşı | "en iyi {kategori} firmaları" |
| Problem / eğitim | ~%20 | Huninin üstü | "{problem} nasıl çözülür" |
| Karşılaştırma | ~%13 | Rakip karşısında konum | "{marka} mı {rakip} mi" |
| Marka doğruluk | ~%12 | Hata avı | "{marka} nedir", "{marka} fiyatları" |
| Ticari | ~%10 | Satın alma anı | "{kategori} fiyat" |
| Yerel | değişken | Coğrafi, varsa | "{şehir} {hizmet}" |
Kategori sorguları en kalabalık gruptur çünkü görünürlük orada kazanılır ya da kaybedilir. Marka sorguları görünürlük ölçmez — orada zaten görünürsünüz — ama doğruluk ölçer ve ticari olarak en değerli bulgular oradan çıkar. Ölçülen içeriğin pasaj düzeyinde alıntılanabilir olması bu bulguların kalitesini doğrudan etkiler.
Konum ağırlıklandırma
Bir yanıtta geçmek ile önerilmek aynı şey değildir. Ham frekans bu farkı gizler, bu yüzden her geçiş konumuna göre ağırlıklandırılır:
| Konum | Ağırlık | Ne demek |
|---|---|---|
| Öneri | 1.0 | "X firmasını değerlendirebilirsiniz" |
| İlk cümle | 0.9 | Cevabın açılışında geçiyor |
| Liste içi | 0.6 | Sıralanan seçeneklerden biri |
| Yan cümle | 0.3 | Bağlamda anılıyor |
| Sadece kaynak | 0.2 | Metinde yok, kaynak listesinde var |
Ayrıca olumsuz geçiş ayrı işaretlenir. "X'ten kaçının" bir görünürlük değil, bir risktir ve rapora görünürlük olarak değil risk olarak girer. Bu ayrımı yapmayan bir ölçüm, kötü bir bahsi başarı sayar.
Toplama protokolü
Her çalıştırmada uyulması gereken kurallar:
- Temiz oturum. Kişiselleştirme, hafıza ve geçmiş kapalı. Kirli oturum sonucu bozar
ve tekrarlanabilirliği yok eder.
- Bölge sabit. Hedef pazarın bölgesinden istek atılır. Yanlış bölge yanlış cevap verir.
- Önbellek yok. Aynı sorgunun farklı çalıştırmaları birbirinden bağımsız olmalı;
önbelleğe alınırsa ölçülen şey değil önbellek ölçülür.
- Ham yanıt saklanır. Rapordaki her iddia ham kayda kadar izlenebilmeli.
- Hata sessizce atlanmaz. Başarısız çağrı
HATAolarak kaydedilir ve yeniden
denenir; eksik veri raporda açıkça belirtilir.
Şeffaflık maddesi
Rapora aynen konması gereken bir cümle var:
API üzerinden alınan yanıtlar ile tüketici arayüzündeki yanıtlar birebir aynı olmayabilir. Ölçüm, kullanılan model sürümü ve tarih bağlamında geçerlidir.
Bu cümleyi yazmak ölçümü küçültmez, ciddileştirir. Ve ileride gelecek "ama ben deneyince farklı çıktı" itirazını baştan kapatır — çünkü itiraz haklıdır ve önceden kabul edilmiştir.
Neden kimse böyle ölçmüyor
Çünkü pahalı. Kırk sorgu × beş çalıştırma × dört platform, 800 API çağrısı demek. Tek çalıştırma yapan bir araç yirmi kat ucuza mal olur ve ekran görüntüsü de aynı derecede ikna edici görünür.
Aradaki fark, birinin tekrarlanabilir olmasıdır.
Markaların yapay zekâ destekli arama sistemlerindeki görünürlüğünü ölçer ve düzeltir. Ölçüm metodolojisi ham sunucu yanıtına ve tekrarlı çalıştırmaya dayanır; her bulgu kaydedilmiş bir sunucu yanıtına bağlanır.
Sık sorulanlar
Kaç çalıştırma yeterli?
En az üç; ciddi bir denetimde beş. Üç çalıştırma "hiç görünmüyor" ile "bazen görünüyor" arasındaki farkı ayırt etmeye yeter. Beş çalıştırma yüzdelik ifadeyi anlamlı kılar.
API yanıtları ile ChatGPT arayüzündeki yanıtlar aynı mı?
Birebir aynı olmayabilir. Arayüz farklı sistem talimatları, farklı araç erişimi ve kişiselleştirme taşıyabilir. Bu yüzden her ölçümün model adı, sürümü, tarihi ve bölgesi kaydedilmeli ve rapora yazılmalıdır.