"Cada detector de IA me dá um resultado diferente" — em qual acreditar
Por que o mesmo texto recebe pontuações tão diferentes em cada ferramenta de detecção de IA, e o que usar como critério quando isso acontece.
Pergunta
Coloquei o mesmo texto em três lugares e deu 12%, 58% e 94%. Pode variar tanto assim? Em qual eu acredito?
Resposta curta
Nenhum dos três é um número para "acreditar" literalmente. E uma variação desse tamanho não é exceção, é comum.
Por que a diferença é tão grande
1. Os critérios não são os mesmos
Cada ferramenta decide qual aspecto do estilo pesa mais. Olhando o mesmo texto com ênfases diferentes, os resultados se separam. Não é como medir temperatura: é mais parecido com cada um dar uma nota para "o quanto esse texto é liso", com a própria régua.
2. Os textos de treino são diferentes
Uma ferramenta construída quase só com inglês fica instável quando aplicada ao português. A estrutura das frases, a flexão verbal e a ordem das palavras não se transportam direto de uma língua para a outra.
3. A sensibilidade ao tamanho do texto é alta
Quanto mais curto o texto, maior a variação. Com três ou quatro frases falta base para qualquer estatística. É por isso que colar o começo e o fim do mesmo texto separadamente dá pontuações diferentes.
4. O resultado não é uma probabilidade
Este é o ponto mais mal compreendido. "94%" não quer dizer "94% de chance de ter sido escrito por IA". É um valor mais próximo da intensidade do sinal, e cada ferramenta coloca esse valor numa escala própria. São números que, de saída, não dá para comparar entre si.
Então o que olhar
Não tente tirar uma média. Olhe, em vez disso, os trechos que várias ferramentas marcaram em comum.
Se as três apontaram o mesmo parágrafo, é porque aquele parágrafo realmente lê de forma plana. As pontuações divergem, mas a avaliação sobre onde está o problema costuma coincidir.
E aí abra esse parágrafo e faça esta pergunta:
Tem alguma análise minha ou algum fato concreto aqui?
Essa informação é muito mais prática do que a pontuação.
Não use como material de defesa
Quando se é questionado, existe o impulso de levar o resultado da ferramenta que deu a nota mais baixa. Quase não funciona. Do outro lado também se sabe que os resultados variam e, pior, o fato de você ter rodado várias ferramentas pode causar má impressão.
A defesa se faz com processo, não com pontuação: rascunho, histórico de versões, material de referência. O método detalhado está em Acusado de usar IA.
Se você quiser um critério para escolher a ferramenta
Escolher pela precisão da pontuação é difícil, porque não há como verificar. O que funciona é olhar isto:
- Ele marca frase a frase? (uma ferramenta que só dá o total geral serve para pouco)
- Ele foi construído levando o seu idioma em conta?
- Ele evita afirmar categoricamente? (desconfie de ferramentas que cravam "escrito por IA")
- Ele explica o que faz com o texto que você cola?
O detector de IA marca frase a frase e apresenta o resultado como uma probabilidade de IA de referência. As explicações sobre como ler o resultado também estão reunidas no FAQ.
Para fechar
Nenhuma ferramenta identifica quem escreveu. Em vez de se preocupar com a diferença entre as pontuações, o hábito de abrir os trechos marcados é o que realmente melhora o texto.
Por que transformar a pontuação em objetivo sai caro está em Quando baixar a pontuação vira o objetivo, o texto se estraga.