「ツールごとに結果が違います」— どれを信じればいいのか
同じ文章を複数のAIチェッカーに入れると結果が大きく変わる理由と、そんなときに何を基準に判断すればよいかをお答えします。
質問
同じ文章を三つのツールに入れてみたところ、12%、58%、94%と出ました。ここまで違うことがあるのでしょうか。どれを信じればいいですか。
短い答え
三つとも「そのまま信じる」性質の数字ではありません。 そしてこの程度のばらつきは例外ではなく、よくあることです。
なぜここまで違うのか
1. 基準がそれぞれ違う
各ツールは、文体のどの側面にどれだけ重みを置くかを別々に決めています。同じ文章を見ても強調点が違うので、結果が分かれます。気温を測っているのではなく、「この文章はどれくらい滑らかか」をそれぞれの物差しで採点しているのに近いのです。
2. 学習した文章が違う
英語中心に作られたツールを日本語に当てはめると、結果が不安定になります。日本語は文末表現の体系も文の構造も異なるため、そのまま移ってはきません。
3. 文章の長さに敏感
短い文章ほどばらつきが大きくなります。 文が三つ四つしかなければ、統計を取る根拠が足りません。同じ文章の前半と後半を別々に入れてもスコアが変わるのは、このためです。
4. 結果は確率ではない
いちばん誤解されやすい点です。「94%」は「AIが書いた確率が94%」という意味ではありません。信号の強さに近い値で、しかもその値をどんな目盛りに載せるかもツールごとに違います。そもそも互いに比べられる数字ではないのです。
では何を見ればいいのか
数字を平均しようとしないでください。代わりに、複数のツールが共通して表示した箇所を見てください。
三つのツールが同じ段落を指したなら、その段落は実際に平板に読めるということです。スコアは違っても、どこが引っかかるかについての判断は重なることが多いのです。
そしてその段落を開いて、こう問いかけてください。
ここに自分の判断や具体的な事実があるか?
これはスコアよりもずっと実用的な情報です。
説明の材料には使わないでください
疑われたときに、低いスコアが出たツールの結果を持っていく方がいますが、ほとんど効果がありません。相手も結果がばらばらだと知っていますし、むしろいくつもツールを回したという事実が印象を悪くしかねません。
説明はスコアではなく過程で行います。初稿、変更履歴、参考資料。詳しい方法はAIで書いたのではと疑われたときにまとめました。
ツールを選ぶ基準があるとすれば
スコアの正確さで選ぶのは困難です。検証する手立てがないからです。代わりに次の点を見るほうが実質的です。
- 文単位で表示してくれるか(総合点しか出さないツールは使い道が少ないです)
- その言語を前提に作られているか
- 結果を断定的に表現していないか(「AIが作成」と言い切るツールには注意したほうがよいです)
- 入力した文章をどう扱うのかを明示しているか
AI判定ツールは文単位の表示を提供し、結果を参考のためのAI作成の疑いとして示しています。結果の読み方についての説明はよくある質問にもまとめてあります。
最後に
どんなツールも書き手を特定することはできません。スコアの差を気にするよりも、表示された箇所を開いてみる習慣のほうが、実際に文章を良くしてくれます。
スコアを目標にするとなぜ損なのかは疑いスコアを下げることが目的になると、文章は壊れるで扱いました。