İçeriğe atla
KaynakOl

Tek çalıştırma veri değildir

Dil modelleri deterministik değil. Bir soruyu bir kez sorup sonucu rapor etmek, zar atıp sonucu istatistik diye sunmaktır. Savunulabilir ölçüm frekansla çalışır.

Mustafa Gezer 5 dk okuma

Bir markanın yapay zekâ cevaplarında görünüp görünmediğini ölçmenin en yaygın yolu şu: soruyu sor, ekran görüntüsü al, rapora koy. Bu yöntem yanlıştır ve neden yanlış olduğu teknik bir ayrıntı değil, ölçümün temeli.

Aynı soru, farklı cevaplar

Dil modelleri deterministik değildir. Aynı istem, aynı model ve aynı ayarlarla beş kez çalıştırıldığında beş farklı yanıt üretebilir. Sebep örnekleme: model bir sonraki kelimeyi olasılık dağılımından seçer ve bu seçim her seferinde aynı olmak zorunda değildir.

Web araması devredeyken belirsizlik artar: arama sonuçları da değişkendir, sıralama değişir, bazı kaynaklar bazen getirilir bazen getirilmez.

Pratik sonuç şu: "markanız ChatGPT'de görünmüyor" cümlesi tek bir çalıştırmaya dayanıyorsa bilgi değil, gürültüdür.

"en iyi {kategori} firmaları" — aynı soru, beş çalıştırma 1. çalıştırma 2. çalıştırma 3. çalıştırma 4. çalıştırma 5. çalıştırma Sonuç: 3 / 5 çalıştırmada göründü — %60 görünürlük Tek çalıştırma yapsaydınız: %0 ya da %100. İkisi de yanlış.
Dil modelleri deterministik değildir. Tek çalıştırma "görünüyor" ya da "görünmüyor" der; ikisi de doğru değildir. Anlamlı olan frekanstır.

Frekans olarak raporlamak

Doğru ifade şöyle kurulur:

"en iyi HDPE boru üreticileri" sorgusunda marka, 5 çalıştırmanın 3'ünde göründü — %60.

Bu cümle üç şeyi birden yapar: ölçümü tekrarlanabilir kılar, belirsizliği gizlemek yerine sayıya çevirir ve iyileştirmeyi ölçülebilir hale getirir. %60'tan %80'e çıkmak somut bir kazançtır; "görünüyor"dan "daha çok görünüyor"a geçmek değildir.

Ölçümün yanına yazılması gerekenler

Bir görünürlük bulgusu şunlar olmadan geçersizdir:

AlanNeden
Model adı ve sürümüSürüm değişince veri kıyaslanamaz hale gelir
TarihSonuçların raf ömrü var; tarihsiz bulgu geçersiz
BölgeYanlış bölge yanlış cevap verir
DilAynı sorunun farklı dildeki karşılığı farklı sonuç verir
Web araması açık mıAramalı ve aramasız yanıtlar farklı sistemlerdir
Çalıştırma numarasıFrekansın paydası

Sorgu seti rastgele seçilemez

Ölçümün kalitesini belirleyen ikinci şey, hangi soruların sorulduğudur. İki kural:

Marka adını kategori sorularına koymayın. "Bayraktar Attorneys nasıl bir firma?" sorusu görünürlük ölçmez — cevapta markanın geçmesi kaçınılmazdır. Görünürlük, markanın adı geçmeyen sorularda ölçülür: "Niğde'de HDPE boru üreticileri hangileri?"

Kullanıcının yazacağı gibi yazın. "hdpe boru üretici" bir anahtar kelimedir, kimse asistana böyle sormaz. "en iyi hdpe boru üreticisi hangisi" gerçek bir sorudur.

Çeviri sorgu gerçek arama davranışını yansıtmaz

Çok dilli ölçümde sık yapılan hata, Türkçe sorgu setini makine çevirisinden geçirip İngilizce ya da Arapça sürüm üretmek. Bu yanlıştır: insanlar farklı dillerde farklı şeyler sorar, farklı kelimeler kullanır, farklı varsayımlarla yaklaşır.

Her dil için sorgu seti yeniden yazılır, çevrilmez.

Ölçüm ile yorum ayrılır

Son kural, raporun kendisiyle ilgili. Ölçülen şey ile ölçümden çıkarılan sonuç aynı cümlede durmamalı:

  • Ölçüm: "Marka 40 sorgunun 6'sında, ortalama %35 frekansla göründü."
  • Yorum: "Bu, kategori otoritesinin zayıf olduğuna işaret ediyor olabilir."

İkincisi bir tahmindir ve öyle etiketlenmelidir. Bir denetim raporunda bu ayrım kaybolduğunda, okuyan kişi neyin ölçüldüğünü neyin tahmin edildiğini ayırt edemez — ve haklı olarak tamamına güvenmez.

Kaç çalıştırma yeterli

Üç çalıştırma, "hiç görünmüyor" ile "bazen görünüyor" arasındaki farkı ayırt etmeye yeter — ve bu fark stratejik olarak en önemli olanıdır. Hiç görünmeyen bir marka için sorun genellikle yapısaldır (teknik engel, varlık belirsizliği); bazen görünen bir marka için sorun rekabetçidir.

Beş çalıştırma yüzdelik ifadeyi anlamlı kılar. %60 ile %80 arasındaki farkı üç çalıştırmayla ölçemezsiniz; üçte iki ile üçte üç arasında ara değer yoktur.

Daha fazlası çoğu durumda maliyeti karşılamaz. Yedi ya da on çalıştırma kararı değiştirmiyorsa, o bütçeyi daha fazla sorguya harcamak daha iyidir: yirmi sorgu × beş çalıştırma, on sorgu × on çalıştırmadan daha çok şey söyler.

Sorgu seti taksonomisi

Kaç sorgu kadar önemlisi, hangi tipte olduklarıdır. Tam bir denetimde dağılım kabaca şöyle olur:

TipPayAmaçÖrnek kalıp
Kategori / çözüm~%40Asıl görünürlük savaşı"en iyi {kategori} firmaları"
Problem / eğitim~%20Huninin üstü"{problem} nasıl çözülür"
Karşılaştırma~%13Rakip karşısında konum"{marka} mı {rakip} mi"
Marka doğruluk~%12Hata avı"{marka} nedir", "{marka} fiyatları"
Ticari~%10Satın alma anı"{kategori} fiyat"
YereldeğişkenCoğrafi, varsa"{şehir} {hizmet}"

Kategori sorguları en kalabalık gruptur çünkü görünürlük orada kazanılır ya da kaybedilir. Marka sorguları görünürlük ölçmez — orada zaten görünürsünüz — ama doğruluk ölçer ve ticari olarak en değerli bulgular oradan çıkar. Ölçülen içeriğin pasaj düzeyinde alıntılanabilir olması bu bulguların kalitesini doğrudan etkiler.

Konum ağırlıklandırma

Bir yanıtta geçmek ile önerilmek aynı şey değildir. Ham frekans bu farkı gizler, bu yüzden her geçiş konumuna göre ağırlıklandırılır:

KonumAğırlıkNe demek
Öneri1.0"X firmasını değerlendirebilirsiniz"
İlk cümle0.9Cevabın açılışında geçiyor
Liste içi0.6Sıralanan seçeneklerden biri
Yan cümle0.3Bağlamda anılıyor
Sadece kaynak0.2Metinde yok, kaynak listesinde var

Ayrıca olumsuz geçiş ayrı işaretlenir. "X'ten kaçının" bir görünürlük değil, bir risktir ve rapora görünürlük olarak değil risk olarak girer. Bu ayrımı yapmayan bir ölçüm, kötü bir bahsi başarı sayar.

Toplama protokolü

Her çalıştırmada uyulması gereken kurallar:

  • Temiz oturum. Kişiselleştirme, hafıza ve geçmiş kapalı. Kirli oturum sonucu bozar

ve tekrarlanabilirliği yok eder.

  • Bölge sabit. Hedef pazarın bölgesinden istek atılır. Yanlış bölge yanlış cevap verir.
  • Önbellek yok. Aynı sorgunun farklı çalıştırmaları birbirinden bağımsız olmalı;

önbelleğe alınırsa ölçülen şey değil önbellek ölçülür.

  • Ham yanıt saklanır. Rapordaki her iddia ham kayda kadar izlenebilmeli.
  • Hata sessizce atlanmaz. Başarısız çağrı HATA olarak kaydedilir ve yeniden

denenir; eksik veri raporda açıkça belirtilir.

Şeffaflık maddesi

Rapora aynen konması gereken bir cümle var:

API üzerinden alınan yanıtlar ile tüketici arayüzündeki yanıtlar birebir aynı olmayabilir. Ölçüm, kullanılan model sürümü ve tarih bağlamında geçerlidir.

Bu cümleyi yazmak ölçümü küçültmez, ciddileştirir. Ve ileride gelecek "ama ben deneyince farklı çıktı" itirazını baştan kapatır — çünkü itiraz haklıdır ve önceden kabul edilmiştir.

Neden kimse böyle ölçmüyor

Çünkü pahalı. Kırk sorgu × beş çalıştırma × dört platform, 800 API çağrısı demek. Tek çalıştırma yapan bir araç yirmi kat ucuza mal olur ve ekran görüntüsü de aynı derecede ikna edici görünür.

Aradaki fark, birinin tekrarlanabilir olmasıdır.

Mustafa GezerSEO ve AI görünürlük denetçisi

Markaların yapay zekâ destekli arama sistemlerindeki görünürlüğünü ölçer ve düzeltir. Ölçüm metodolojisi ham sunucu yanıtına ve tekrarlı çalıştırmaya dayanır; her bulgu kaydedilmiş bir sunucu yanıtına bağlanır.

Sık sorulanlar

Kaç çalıştırma yeterli?

En az üç; ciddi bir denetimde beş. Üç çalıştırma "hiç görünmüyor" ile "bazen görünüyor" arasındaki farkı ayırt etmeye yeter. Beş çalıştırma yüzdelik ifadeyi anlamlı kılar.

API yanıtları ile ChatGPT arayüzündeki yanıtlar aynı mı?

Birebir aynı olmayabilir. Arayüz farklı sistem talimatları, farklı araç erişimi ve kişiselleştirme taşıyabilir. Bu yüzden her ölçümün model adı, sürümü, tarihi ve bölgesi kaydedilmeli ve rapora yazılmalıdır.

Ölçerek başlayın

Bu yazıda anlatılanın sitenizde geçerli olup olmadığını tahmin etmeyin — ölçün. Hızlı Site Taraması ücretsiz ve ~15 saniye sürüyor.

WhatsApp