PromptFront logosu PromptFront

· 9 dk okuma · Yazar: PromptFront Ekibi

Yapay Zekâ Görünürlüğü Nasıl Ölçülür? Ölçüm Rehberi

Yapay zekâ görünürlüğü, markasız ve gerçek müşteri diline yakın bir sorgu setinin ChatGPT, Gemini, Claude ve Perplexity üzerinde temiz oturumlarda düzenli olarak koşulmasıyla ölçülür. Her koşumda anılma oranı, öneri sırası, kaynak gösterimi ve cevap doğruluğu kaydedilir; sonuçlar tekrar sayısıyla ortalanır ve zaman içinde karşılaştırılır.

Yapay zekâ görünürlüğü ölçümü tam olarak neyi ölçer?

Ölçüm, bir markanın üretken yapay zekâ cevaplarında görünme sıklığını, görünme konumunu ve hakkında verilen bilginin doğruluğunu ölçer. Klasik SEO’da birim sıralamadır: sayfanız belirli bir anahtar kelimede kaçıncı sırada çıkıyor? Yapay zekâ cevabında sıralama listesi yoktur; genellikle 2-3 öneri slotu ve bunları destekleyen birkaç kaynak bağlantısı vardır. Dolayısıyla ölçülen şey “kaçıncı sıradayım” değil, “bu cevabın içinde var mıyım, nasıl anlatılıyorum” sorusudur. İki disiplinin farkını ayrıntılı karşılaştıran GEO ile SEO arasındaki farklar rehberi bu ayrımı daha geniş ele alır.

Sağlıklı bir ölçüm üç soruya sayısal cevap verir:

  1. Var mıyım? Sektörünüzdeki tipik sorularda marka adınız cevabın içinde geçiyor mu?
  2. Nerede duruyorum? Geçiyorsa kaçıncı öneri olarak ve hangi rakiplerle birlikte?
  3. Doğru mu anlatılıyorum? Verilen hizmet, konum, fiyat aralığı ve iletişim bilgileri gerçekle uyuşuyor mu?

Üçüncü soru genellikle atlanır ama en kritik olanıdır: cevapta görünmek, yanlış bilgiyle görünüyorsanız zarar verir. Modelin uydurma bilgi üretmesi olgusu için halüsinasyon tanımına bakabilirsiniz.

Sorgu seti nasıl tasarlanır?

Sorgu seti, gerçek müşterinin yazacağı cümlelerden oluşan, marka adı içermeyen ve satın alma niyetinin farklı aşamalarını kapsayan bir listedir. Ölçümün kalitesi doğrudan bu listenin kalitesine bağlıdır; kötü tasarlanmış bir set, sonuçları sistematik olarak yanıltır.

Üç temel kural vardır:

  1. Marka adı geçmesin. “PromptFront nedir?” sorusu ölçüm değildir; modele cevabı siz söylemiş olursunuz. Ölçüm, markanızı bilmeyen birinin sorduğu soruda ortaya çıkıp çıkmadığınızı test eder.
  2. Gerçek müşteri dili kullanılsın. Kullanıcılar “implant tedavisi hizmet sağlayıcısı” yazmaz; “İstanbul’da implant için hangi kliniğe gitmeliyim” yazar. Sorgu setini müşteri temsilcilerinizin telefon notlarından, arama konsolu verilerinden ve gerçek e-postalardan çıkarmak, masa başında üretmekten çok daha isabetlidir.
  3. Niyet katmanları dengeli olsun. Yalnızca “en iyi X” tipi sorgular ölçerseniz, huninin üst kısmını göremezsiniz.
Sorgu tipiÖrnekNeyi ölçer
Bilgi amaçlı“Saç ekimi sonrası iyileşme kaç gün sürer?”Uzmanlık algısı, kaynak gösterilme ihtimali
Karşılaştırma“DHI ve FUE arasındaki fark nedir?”İçerik derinliği, tablo/yapı kalitesi
Öneri / seçim“Ankara’da boşanma davası için avukat önerir misin?”Doğrudan anılma ve öneri sırası
Yerel niyet“Kadıköy’de hafta sonu açık diş kliniği”Konum verisi ve entity tutarlılığı
Doğrulama“Bu klinik gerçekten X hizmeti veriyor mu?”Cevap doğruluğu, bilgi tutarlılığı

Pratikte 30-50 sorguluk bir set, hem yönetilebilir hem de anlamlı bir tablo verir. Set bir kez sabitlendikten sonra değiştirilmemelidir; sorguları değiştirirseniz zaman serisi karşılaştırılabilirliğini kaybeder. Yeni sorgular eklemek gerekirse, bunları ayrı bir “genişletme seti” olarak izleyin.

Temiz oturum ne demek ve nasıl kurulur?

Temiz oturum, modelin cevabını sizin geçmiş davranışınızın değil yalnızca sorgunun belirlediği koşum ortamıdır. Kendi markanızı günlerce aynı hesapta sorguladıysanız, aldığınız cevap tipik bir müşterinin göreceği cevap değildir. Bu, ölçümde en sık yapılan hatadır.

Temiz oturum kontrol listesi:

  1. Geçici / yeni sohbet açın. Her sorgu kendi oturumunda koşulmalı; önceki sorgu bağlamı sonrakini etkilememeli.
  2. Hafıza ve kişiselleştirmeyi kapatın. Platformların “memory”, “custom instructions” veya kişiselleştirme ayarları kapalı olmalı.
  3. Hesap etkisini azaltın. Mümkünse ölçüm için ayrı bir hesap kullanın; şirket hesabınızda yaptığınız yüzlerce marka araması sonuçları çarpıtır.
  4. Dil ve konumu sabitleyin. Türkçe sorgu, Türkiye konumu. VPN veya farklı dil ayarları sonuç setini değiştirir.
  5. Model sürümünü kaydedin. Aynı platformun farklı modelleri farklı cevap verir; hangi model ve hangi tarihte koşulduğu kayda girmeli.
  6. Web erişimi ayarını sabitleyin. Modelin canlı arama yapıp yapmadığı sonucu kökten değiştirir; her koşumda aynı modda çalışın.

Perplexity gibi kaynak göstererek çalışan sistemlerde bağlantıların nasıl seçildiğini anlamak için Perplexity’de kaynak olarak gösterilmek rehberi ve platformun kendi dokümantasyonu (docs.perplexity.ai) yararlı bir başlangıçtır.

Hangi metrikler kaydedilir?

Kaydedilmesi gereken çekirdek metrikler dörttür: anılma oranı, öneri sırası, kaynak gösterimi ve cevap doğruluğu. Bunların üzerine rekabet payı ve platform kapsamı gibi türev metrikler eklenebilir.

MetrikTanımNasıl hesaplanırÖlçek
Anılma oranıMarkanın cevapta geçtiği koşumların payıAnılan koşum ÷ toplam koşum0-100%
Öneri sırasıCevaptaki liste içinde kaçıncı sırada geçtiğiKoşumlardaki sıraların ortalaması1, 2, 3…
Kaynak gösterimiCevabın altında site bağlantısının verilmesiBağlantı verilen koşum ÷ anılan koşum0-100%
Cevap doğruluğuVerilen bilginin gerçekle uyumuDoğru / kısmen doğru / yanlış etiketi3’lü skala
Rekabet payıAynı cevapta geçen markalar içindeki payınızSizin anılmanız ÷ toplam marka anılması0-100%
Platform kapsamıKaç platformda görünür olduğunuzGörünülen platform sayısı ÷ izlenen platform0-100%

Kaynak gösterimi ile anılmayı ayırmak önemlidir: model sizi metin içinde önerip hiç bağlantı vermeyebilir ya da tam tersine adınızı anmadan sitenizi kaynak olarak gösterebilir. Bu ikisi farklı çalışmalarla iyileştirilir; kaynak gösterimi kavramı için citation tanımına bakın. Bağlantı verilme oranını artırmanın teknik tarafında llms.txt hazırlığı ve yapılandırılmış veri işaretlemesi (schema.org) belirleyici rol oynar.

Aynı sorgu neden her seferinde farklı cevap veriyor?

Üretken modeller olasılıksal çalıştığı için aynı sorgu aynı gün bile farklı cevaplar üretebilir. Bu bir arıza değil, sistemin doğasıdır ve ölçüm metodolojisinin en zorlu tarafıdır. Varyansın başlıca kaynakları şunlardır: modelin örnekleme davranışı, canlı arama yapan sistemlerde o an çekilen kaynakların değişmesi, model sürümü güncellemeleri ve oturum bağlamı.

Varyansı yönetmenin yolu onu ortadan kaldırmaya çalışmak değil, tekrar sayısıyla ortalamaktır:

  1. Her sorguyu her platformda en az 3, tercihen 5 kez ayrı oturumlarda koşun.
  2. Sonucu tek koşum olarak değil, tekrarların ortalaması olarak kaydedin.
  3. İki ölçüm dönemi arasındaki farkı yorumlarken bir anlamlılık eşiği belirleyin; küçük dalgalanmaları gürültü kabul edin, yönü ancak birkaç dönem üst üste aynı yöne gittiğinde trend sayın.
  4. Model sürümü değiştiyse bunu kayda not düşün ve o dönemi öncekiyle doğrudan kıyaslamayın.

Tek bir koşumda markanızı görmemek “görünmüyorum” demek değildir; beş koşumun beşinde de görmemek anlamlı bir sinyaldir. Ölçüm raporlarında tek ekran görüntüsü paylaşmak bu nedenle metodolojik olarak zayıftır.

Ölçüm ne sıklıkla tekrarlanmalı?

İzleme sıklığı çalışmanın aşamasına göre değişir. Sürekli ölçüm hem gereksiz maliyet yaratır hem de gürültüyü trend sanmaya yol açar.

AşamaÖnerilen sıklıkAmaç
Temel ölçüm (baseline)Çalışma başlamadan bir kez, tam setBaşlangıç noktasını sabitlemek
Aktif optimizasyon2 haftada bir, tam setYapılan değişikliklerin etkisini görmek
Sürdürme dönemiAyda bir, tam setKaymayı ve rakip hareketini yakalamak
Kritik sorgularHaftalık, 5-10 sorguluk alt setYüksek niyetli sorgularda hızlı uyarı
Olağandışı durumModel güncellemesi veya site değişikliği sonrasıKopuşu erken tespit etmek

2026 itibarıyla platformlar model sürümlerini sık güncellediği için, büyük bir model güncellemesinden sonra ek bir koşum yapmak yerinde olur. PromptFront’un yapay zekâ görünürlük analizi hizmetinde temel ölçüm 7 günlük teslim süresi içinde raporlanır; kendi ekibinizle yürütmek isterseniz aşağıdaki şablon aynı işi görür.

Basit bir ölçüm şablonu nasıl görünür?

En sade şablon, her satırı bir sorgu + bir platform + bir koşum olan düz bir tablodur. Bu yapı, elektronik tabloda pivotlanarak tüm metriklere dönüştürülebilir.

TarihPlatformModel/sürümSorguAnıldı mıSıraKaynak verildi miDoğrulukBirlikte anılan markalarNot
2026-08-01ChatGPT(kayıt)“Kadıköy’de implant yapan diş kliniği”Evet2HayırDoğruKlinik B, Klinik CWeb erişimi açık
2026-08-01Perplexity(kayıt)“Kadıköy’de implant yapan diş kliniği”Evet1EvetKısmenKlinik BÇalışma saati yanlış
2026-08-01Gemini(kayıt)“Kadıköy’de implant yapan diş kliniği”HayırHayırKlinik B, Klinik D

Bu tablodan çıkan hesaplar basittir:

  • Anılma oranı = “Evet” sayısı ÷ toplam satır sayısı
  • Ortalama öneri sırası = anılan satırların sıra ortalaması
  • Kaynak gösterim oranı = “Kaynak verildi: Evet” ÷ anılan satır sayısı
  • Rakip haritası = “birlikte anılan markalar” sütununun frekans dökümü

Son sütundaki not alanı küçümsenmemelidir: yanlış çalışma saati, kapanmış şube, eski fiyat gibi bulgular çoğu zaman en hızlı düzeltilebilen ve en somut kazanç getiren maddelerdir. Bu tür veri tutarsızlıklarının kaynağı genellikle web genelindeki bilgi dağınıklığıdır; GEO nedir rehberindeki veri katmanı bölümü konuya giriş sağlar. Kendi sitenizde hızlı bir ilk bakış için görünürlük testi sayfasını da kullanabilirsiniz.

Sık sorulan sorular

Ölçüm için özel bir araç şart mı?

Hayır. Başlangıç için elektronik tablo ve manuel koşum yeterlidir; hatta manuel koşum, cevabın tonunu ve bağlamını görmenizi sağladığı için ilk dönemde daha öğreticidir. Sorgu sayısı ve platform sayısı arttıkça, tekrar koşumlarını otomatikleştirmek zaman kazandırır. Otomasyon kurarken platformların API dokümantasyonlarına (platform.openai.com/docs, docs.anthropic.com) ve kullanım koşullarına uymak gerekir.

API üzerinden ölçüm, sohbet arayüzü ölçümüyle aynı sonucu verir mi?

Hayır, çoğu zaman vermez. Sohbet arayüzleri kişiselleştirme, hafıza, canlı arama ve ürün katmanındaki ek yönlendirmelerle çalışır; API ise daha çıplak bir modele erişim sunar. İkisi farklı şeyleri ölçer: API tutarlılık ve tekrarlanabilirlik açısından üstündür, arayüz ise gerçek kullanıcının gördüğü cevaba daha yakındır. En sağlıklısı hangisini kullandığınızı raporda açıkça belirtmek ve dönemler arasında değiştirmemektir.

Kaç platform izlemek gerekir?

Hedef kitlenizin kullandığı platformlar belirleyicidir; genel bir başlangıç seti ChatGPT, Gemini, Claude ve Perplexity’dir. Dördü farklı davranır: bazıları canlı arama ağırlıklı çalışıp kaynak gösterirken, bazıları eğitim verisi ve dahili bilgi ağırlıklı cevap üretir. Bu nedenle tek platformdaki iyi sonuç genel görünürlük anlamına gelmez.

Ölçüm sonuçları ne zaman değişmeye başlar?

Değişimin hızı, kaynağına göre değişir. Site üzerindeki yapısal ve içerik düzenlemeleri canlı arama yapan sistemlerde görece hızlı yansıyabilir; modelin dahili bilgisine dayanan cevaplarda ise değişim çok daha yavaştır çünkü model eğitim döngülerine bağlıdır. Bu yüzden ilk dönemlerde kaynak gösterim oranı, anılma oranından önce hareket etmeye eğilimlidir.

Rakip ölçümü nasıl yapılır?

Kendi markanız için tuttuğunuz aynı tabloda “birlikte anılan markalar” sütununu doldurmanız yeterlidir. Dönem sonunda bu sütunun frekans dökümü, sektörünüzde yapay zekâ cevaplarına en sık giren oyuncuların listesini verir. Ek sorgu koşmaya gerek kalmadan rekabet haritası çıkar; ayrıca sizin görünmediğiniz sorgularda kimin göründüğü, içerik boşluklarınızı doğrudan işaret eder.

Yerel işletmeler için ölçüm farklı mı yürütülür?

Temel metodoloji aynıdır, ancak sorgu setine konum ifadeleri ve “yakınımda”, “hafta sonu açık”, “acil” gibi yerel niyet kalıpları eklenir. Yerel sorgularda cevap doğruluğu metriği ayrıca önem kazanır, çünkü adres, telefon ve çalışma saati hatalarının doğrudan maliyeti vardır. Sektöre özgü örnek sorgu setleri için diş klinikleri sayfası gibi sektör sayfalarındaki listeler başlangıç noktası olarak kullanılabilir.

Markanız yapay zekâ cevaplarında var mı?

2 dakikada öğrenin. Ücretsiz görünürlük testi ile markanızın ChatGPT, Gemini, Claude ve Perplexity cevaplarındaki durumunu görün.