"Mỗi công cụ kiểm tra AI cho một kết quả khác nhau" — nên tin bên nào
Vì sao cùng một bài đưa vào nhiều công cụ kiểm tra AI lại ra kết quả chênh nhau rất xa, và khi đó bạn nên lấy gì làm căn cứ để phán đoán.
Câu hỏi
Tôi đưa cùng một bài vào ba nơi và nhận được 12%, 58%, 94%. Chênh nhau tới mức này được sao? Tôi nên tin bên nào?
Trả lời ngắn
Cả ba đều không phải loại con số để "tin nguyên như vậy". Và mức chênh lệch này không phải ngoại lệ mà là chuyện thường gặp.
Vì sao lại khác nhau đến thế
1. Mỗi bên có tiêu chí riêng
Mỗi công cụ đặt trọng số khác nhau cho từng khía cạnh của lối viết. Cùng nhìn một bài nhưng chỗ nhấn khác nhau nên kết quả tách ra. Việc này không giống đo nhiệt độ mà gần với chuyện mỗi bên lấy thước của mình để chấm "bài này trơn tru đến đâu".
2. Dữ liệu học khác nhau
Công cụ làm ra chủ yếu cho tiếng Anh mà đem áp lên tiếng Việt thì kết quả rất chập chờn. Tiếng Việt có trật tự từ, hệ thống hư từ và cách nối câu riêng, không thể bê nguyên si sang.
3. Rất nhạy với độ dài bài
Bài càng ngắn thì chênh lệch càng lớn. Chỉ có ba bốn câu thì không đủ căn cứ để tính thống kê. Đó cũng là lý do tách nửa đầu và nửa sau của cùng một bài ra thì điểm lại khác nhau.
4. Kết quả không phải là xác suất theo nghĩa toán học
Đây là chỗ hay bị hiểu nhầm nhất. "94%" không có nghĩa "xác suất AI viết là 94%". Nó gần với cường độ của tín hiệu, và mỗi công cụ lại đặt giá trị đó lên một vạch chia khác nhau. Ngay từ đầu chúng đã không phải những con số so sánh được với nhau.
Vậy nên nhìn vào cái gì
Đừng cố lấy trung bình các con số. Thay vào đó, hãy nhìn những đoạn mà nhiều công cụ cùng đánh dấu.
Nếu cả ba công cụ đều chỉ vào cùng một đoạn thì nghĩa là đoạn đó thật sự đọc lên rất phẳng. Điểm thì khác nhau nhưng phán đoán về chỗ nào bị dính thì thường trùng nhau.
Rồi mở đoạn đó ra và tự hỏi thế này.
Ở đây đã có nhận định của mình hay dữ kiện cụ thể chưa?
Đây là thông tin thực dụng hơn điểm số rất nhiều.
Đừng dùng làm tài liệu giải trình
Có người khi bị nghi thì mang kết quả của công cụ cho điểm thấp đi trình, nhưng cách này gần như vô ích. Bên kia cũng biết kết quả mỗi nơi một kiểu, và ngược lại việc bạn đã chạy thử qua nhiều công cụ có thể tạo ấn tượng xấu.
Giải trình bằng quá trình chứ không phải bằng điểm. Bản nháp, lịch sử phiên bản, tài liệu tham khảo. Cách làm chi tiết nằm ở Bị nghi dùng AI để viết.
Nếu cần một chuẩn để chọn công cụ
Chọn theo độ chính xác của điểm là chuyện khó, vì không có cách nào kiểm chứng. Thay vào đó, nhìn những thứ sau thì thực chất hơn.
- Có đánh dấu theo từng câu không (công cụ chỉ đưa mỗi điểm tổng thì ít dùng được)
- Có được làm ra với tiếng Việt trong đầu không
- Có tránh diễn đạt kết quả theo lối khẳng định chắc nịch không (công cụ tuyên bố thẳng "văn bản do AI viết" là loại nên dè chừng)
- Có nói rõ họ xử lý văn bản bạn dán vào như thế nào không
Công cụ kiểm tra AI đánh dấu theo từng câu và ghi kết quả dưới dạng xác suất AI mang tính tham khảo. Phần giải thích cách đọc kết quả nằm ở mục hỏi đáp.
Cuối cùng
Không công cụ nào xác định được ai là người viết. Thay vì bận tâm chênh lệch điểm số, thói quen mở ra xem những đoạn được đánh dấu mới thật sự làm bài viết tốt lên.
Vì sao lấy điểm làm mục tiêu lại thiệt thì tôi đã bàn ở Lấy việc hạ xác suất AI làm mục tiêu thì bài viết sẽ hỏng.