Blog
Baca 3 minit

"Setiap Alat Beri Keputusan Berlainan" — Yang Mana Patut Dipercayai?

Kenapa teks yang sama boleh memberi keputusan yang jauh berbeza pada beberapa alat semakan AI, dan apa yang patut dijadikan asas penilaian apabila ia berlaku.


Soalan

Saya masukkan teks yang sama ke tiga tempat dan dapat 12%, 58% dan 94%. Boleh jadi sebeza itu? Yang mana satu patut saya percaya?

Jawapan ringkas

Ketiga-tiganya bukan jenis angka yang patut "dipercayai bulat-bulat". Dan jurang sebesar itu bukan kes luar biasa, ia perkara biasa.

Kenapa boleh sebeza itu

1. Ukurannya memang berbeza

Setiap alat menetapkan sendiri aspek gaya bahasa mana yang diberi berat dan berapa banyak. Teks yang sama dibaca dengan penekanan berlainan, jadi keputusannya bercabang. Ia bukan seperti mengukur suhu — ia lebih dekat kepada memberi markah "sejauh mana teks ini licin" mengikut pembaris masing-masing.

2. Teks yang dijadikan asas berbeza

Alat yang dibina dengan bahasa Inggeris sebagai patokan menjadi goyah apabila digunakan pada teks Bahasa Melayu. Sistem imbuhan dan susunan ayat Bahasa Melayu tidak berpindah begitu sahaja daripada ukuran bahasa lain.

3. Ia sensitif kepada panjang teks

Makin pendek teks, makin besar jurangnya. Dengan tiga empat ayat sahaja, asas untuk membuat kiraan terlalu nipis. Sebab itulah bahagian awal dan bahagian akhir teks yang sama pun boleh memberi skor berlainan.

4. Keputusannya bukan kebarangkalian statistik

Inilah bahagian yang paling kerap disalah faham. "94%" tidak bermaksud "94% kemungkinan AI yang menulisnya". Ia lebih dekat kepada kekuatan isyarat, dan setiap alat meletakkan nilai itu pada skala yang berlainan. Sejak awal lagi ia bukan angka yang boleh dibandingkan antara satu sama lain.

Jadi apa yang patut dilihat

Jangan cuba mengira purata angka-angka itu. Sebaliknya lihat bahagian yang ditanda sama oleh beberapa alat.

Kalau ketiga-tiga alat menuding perenggan yang sama, maknanya perenggan itu memang dibaca secara rata. Skornya berbeza, tetapi penilaian tentang di mana masalahnya selalu bertindih.

Kemudian buka perenggan itu dan tanya begini.

Adakah di sini ada pertimbangan saya atau fakta yang khusus?

Itu maklumat yang jauh lebih berguna daripada skor.

Jangan gunakannya sebagai bahan pembelaan

Ada yang membawa keputusan daripada alat yang memberi skor rendah apabila mereka disyaki, tetapi ia hampir tiada kesan. Pihak sebelah sana pun tahu keputusan setiap alat berlainan, dan hakikat bahawa anda telah mencuba beberapa alat boleh meninggalkan kesan yang buruk.

Penjelasan dibuat dengan proses, bukan dengan skor. Draf awal, sejarah versi, bahan rujukan. Caranya disusun dalam dituduh guna AI untuk menulis.

Kalau mahu satu asas untuk memilih alat

Memilih berdasarkan ketepatan skor itu sukar, sebab tiada cara untuk mengesahkannya. Yang lebih praktikal ialah melihat perkara berikut.

  • Adakah ia menanda pada peringkat ayat (alat yang hanya memberi satu angka keseluruhan kurang berguna)
  • Adakah ia dibina dengan mengambil kira bahasa yang anda tampal
  • Adakah ia mengelak daripada bercakap secara muktamad (alat yang mengumumkan "ditulis oleh AI" patut dilayan dengan hati-hati)
  • Adakah ia menjelaskan cara teks yang anda masukkan dikendalikan

Pengesan AI memberikan penandaan peringkat ayat dan menyatakan keputusannya sebagai skor kebarangkalian AI untuk rujukan. Penerangan tentang cara membaca keputusan ada dalam FAQ.

Akhir sekali

Tiada alat yang boleh menentukan siapa penulis sesebuah teks. Berbanding risau tentang jurang skor, tabiat membuka bahagian yang ditanda itulah yang benar-benar memperbaiki tulisan anda.

Kenapa menjadikan skor sebagai matlamat itu merugikan, dibincangkan dalam kalau menurunkan skor jadi matlamat, tulisan anda yang rosak.

Adakah ini ditulis oleh AI?

Tampal sebarang teks dan dapatkan skor kebarangkalian AI dengan analisis setiap ayat. Berfungsi dengan ChatGPT, Claude, Gemini dan banyak lagi.

Semak percuma

Artikel berkaitan