"Her dedektör farklı sonuç veriyor" — hangisine inanmalı?
Aynı metni birden fazla yapay zeka dedektörüne yapıştırdığınızda sonuçların neden bu kadar değiştiğini ve böyle bir durumda neye göre karar vermeniz gerektiğini yanıtlıyoruz.
Soru
Aynı metni üç ayrı yere yapıştırdım; %12, %58 ve %94 çıktı. Bu kadar farklı olabilir mi? Hangisine inanacağım?
Kısa cevap
Üçü de "olduğu gibi inanılacak" türden sayılar değil. Ve bu ölçüde bir fark istisna değil, gayet olağan.
Neden bu kadar farklı
1. Ölçütler birbirinden farklı
Her araç, üslubun hangi yönüne ne kadar ağırlık vereceğini farklı belirler. Aynı metne baksalar da vurguları farklı olduğu için sonuçlar ayrışır. Bu, sıcaklık ölçmekten çok "bu metin ne kadar pürüzsüz" sorusunu herkesin kendi cetveliyle puanlamasına benzer.
2. Öğrendikleri metinler farklı
Ağırlıklı olarak İngilizce üzerine kurulmuş bir aracı başka bir dile uyguladığınızda sonuç dengesizleşir. Türkçenin ek yapısı ve cümle kuruluşu farklıdır; İngilizce için ayarlanmış sinyaller olduğu gibi taşınmaz.
3. Metin uzunluğuna duyarlı
Metin kısaldıkça sapma büyür. Üç beş cümleyle istatistik çıkaracak dayanak olmaz. Aynı metnin baş tarafını ve son tarafını ayrı yapıştırdığınızda farklı puan çıkmasının nedeni budur.
4. Sonuç bir olasılık değil
En sık yanlış anlaşılan nokta. "%94", "AI'nın yazmış olma ihtimali %94" demek değildir. Daha çok sinyalin şiddetine yakın bir değerdir ve o değeri hangi ölçeğe oturtacağı da araçtan araca değişir. Baştan itibaren birbiriyle karşılaştırılabilir sayılar değildir.
Peki neye bakmalı
Sayıların ortalamasını almaya çalışmayın. Bunun yerine birden fazla aracın ortak olarak işaretlediği bölümlere bakın.
Üç araç da aynı paragrafı işaret ettiyse, o paragraf gerçekten düz okunuyor demektir. Puanlar farklı olsa bile nerenin takıldığına dair yargı çoğu zaman örtüşür.
Sonra o paragrafı açıp şunu sorun.
Burada benim yorumum ya da somut bir olgu var mı?
Bu, puandan çok daha kullanışlı bir bilgidir.
Savunma belgesi olarak kullanmayın
Şüphe altında kalındığında düşük puan veren aracın sonucunu götürmek yaygın bir refleks ama neredeyse hiç işe yaramaz. Karşı taraf da sonuçların birbirini tutmadığını bilir; üstelik birkaç araçta denemiş olmanız izlenimi bozabilir.
Savunma puanla değil süreçle yapılır: taslak, sürüm geçmişi, kaynaklar. Ayrıntılı yöntemi Yapay zeka kullanmakla suçlandığınızda yazısında derledik.
Araç seçerken bir ölçüt arıyorsanız
Puanın doğruluğuna göre seçmek zordur, çünkü doğrulama imkânı yoktur. Bunun yerine şunlara bakmak daha gerçekçi:
- Cümle bazında işaretliyor mu (yalnızca toplam puan veren araçların faydası azdır)
- Yazdığınız dil gözetilerek tasarlanmış mı
- Sonucu kesin hüküm gibi ifade etmiyor mu ("AI tarafından yazılmıştır" diye kestirip atan araçlara temkinli yaklaşmak iyi olur)
- Yapıştırdığınız metni nasıl işlediğini açıklıyor mu
Yapay zeka dedektörü cümle bazlı işaretleme sunar ve sonucu referans amaçlı bir AI olasılığı olarak belirtir. Sonucun nasıl okunacağına dair açıklamalar SSS sayfasında da var.
Son olarak
Hiçbir araç yazarı tespit edemez. Puan farklarına takılmak yerine işaretlenen bölümü açıp okuma alışkanlığı metni gerçekten iyileştirir.
Puanı hedef almanın neden zararlı olduğunu Puanı düşürmek hedefe dönüşünce metin bozulur yazısında ele aldık.