"แต่ละเครื่องให้ผลไม่เหมือนกันเลย" — ควรเชื่อตัวไหน
ทำไมข้อความเดียวกันเมื่อเอาไปตรวจกับเครื่องตรวจจับ AI หลายตัวจึงได้ผลต่างกันมาก และในกรณีแบบนั้นควรใช้อะไรเป็นเกณฑ์ตัดสิน
คำถาม
เอาข้อความเดียวกันไปตรวจสามที่ ได้ 12% 58% และ 94% ต่างกันได้ขนาดนี้เลยเหรอ ควรเชื่อตัวไหนดี
คำตอบสั้น ๆ
ทั้งสามตัวไม่ใช่ตัวเลขที่จะ "เชื่อตามนั้น" ได้ และความต่างระดับนี้ไม่ใช่กรณียกเว้น แต่เป็นเรื่องปกติ
ทำไมถึงต่างกันขนาดนี้
1. เกณฑ์ไม่เหมือนกัน
แต่ละเครื่องมือให้น้ำหนักกับแง่มุมของสำนวนต่างกัน พออ่านข้อความเดียวกันแต่เน้นคนละจุด ผลจึงแยกทาง มันไม่เหมือนการวัดอุณหภูมิ แต่ใกล้เคียงกับการให้คะแนนว่า "ข้อความนี้ลื่นแค่ไหน" ด้วยไม้บรรทัดของใครของมันมากกว่า
2. ข้อมูลที่ใช้ฝึกไม่เหมือนกัน
เครื่องมือที่สร้างบนพื้นฐานภาษาอังกฤษเป็นหลัก พอเอามาใช้กับภาษาไทยผลจะไม่นิ่ง ภาษาไทยไม่เว้นวรรคระหว่างคำ การตัดคำและการตัดประโยคจึงต่างออกไป สิ่งที่ออกแบบมาสำหรับอีกภาษาจึงย้ายมาใช้ตรง ๆ ไม่ได้
3. ไวต่อความยาวของข้อความ
ยิ่งข้อความสั้น ผลยิ่งเหวี่ยง ถ้ามีแค่สามสี่ประโยคก็ไม่มีฐานพอจะคิดค่าทางสถิติ นี่คือเหตุผลที่เอาครึ่งแรกกับครึ่งหลังของงานเดียวกันไปตรวจแยกกันแล้วได้คะแนนคนละอย่าง
4. ผลลัพธ์ไม่ใช่ความน่าจะเป็น
จุดที่ถูกเข้าใจผิดบ่อยที่สุด "94%" ไม่ได้แปลว่า "มีโอกาส 94% ที่ AI เขียน" มันใกล้เคียงกับความแรงของสัญญาณมากกว่า และแต่ละเครื่องมือยังวางค่านั้นบนสเกลที่ไม่เหมือนกันอีก ตั้งแต่ต้นมันจึงไม่ใช่ตัวเลขที่เอามาเทียบกันได้
แล้วควรดูอะไร
อย่าพยายามหาค่าเฉลี่ยของตัวเลข ให้ดูช่วงที่หลายเครื่องมือไฮไลต์ตรงกันแทน
ถ้าทั้งสามตัวชี้ไปที่ย่อหน้าเดียวกัน แปลว่าย่อหน้านั้นอ่านแล้วเรียบจริง คะแนนอาจต่างกัน แต่การชี้ว่าตรงไหนติดมักซ้อนทับกัน
แล้วเปิดย่อหน้านั้นขึ้นมาถามว่า
ตรงนี้มีความคิดของเราหรือข้อเท็จจริงที่เจาะจงอยู่ไหม
ข้อมูลนี้ใช้ได้จริงกว่าคะแนนมาก
อย่าใช้เป็นหลักฐานชี้แจง
เวลาถูกตั้งข้อสงสัย บางคนเอาผลจากเครื่องมือที่ให้คะแนนต่ำไปยื่น ซึ่งแทบไม่ได้ผล อีกฝ่ายก็รู้ว่าผลออกมาไม่เหมือนกัน แถมการที่ไล่ตรวจมาหลายเจ้าอาจทำให้ภาพลักษณ์แย่ลงด้วยซ้ำ
การชี้แจงทำด้วยกระบวนการ ไม่ใช่คะแนน ร่างแรก ประวัติเวอร์ชัน เอกสารอ้างอิง วิธีโดยละเอียดเขียนไว้ที่ถูกกล่าวหาว่าใช้ AI เขียน
ถ้าจะเลือกเครื่องมือ
เลือกด้วยความแม่นยำของคะแนนนั้นยาก เพราะไม่มีวิธีตรวจสอบ ให้ดูสิ่งเหล่านี้แทนจะได้ผลกว่า
- มีการไฮไลต์รายประโยคไหม (ตัวที่ให้แค่คะแนนรวมใช้ประโยชน์ได้น้อย)
- ออกแบบมาโดยคำนึงถึงภาษาไทยหรือไม่
- ไม่พูดผลลัพธ์แบบฟันธงใช่ไหม (ตัวที่ประกาศว่า "AI เขียนข้อความนี้" ควรระวัง)
- บอกไหมว่าจัดการกับข้อความที่ผู้ใช้วางเข้าไปอย่างไร
เครื่องตรวจจับ AIให้การไฮไลต์รายประโยค และแสดงผลเป็นคะแนนความน่าจะเป็น AI ไว้อ้างอิง คำอธิบายเรื่องการอ่านผลรวบรวมไว้ที่คำถามที่พบบ่อยด้วย
ปิดท้าย
ไม่มีเครื่องมือไหนระบุตัวผู้เขียนได้ แทนที่จะกังวลกับส่วนต่างของคะแนน นิสัยเปิดดูช่วงที่ถูกไฮไลต์ช่วยให้งานเขียนดีขึ้นจริงกว่า
ส่วนเหตุผลว่าทำไมการตั้งคะแนนเป็นเป้าถึงขาดทุน เขียนไว้ที่พอตั้งเป้าที่การกดคะแนนให้ต่ำ งานเขียนจะพัง