"Elke AI-detector geeft een andere uitslag" — welke moet ik geloven?
Waarom dezelfde tekst bij verschillende AI-detectoren totaal andere scores oplevert, en waar je in dat geval wél op kunt afgaan.
Vraag
Ik heb dezelfde tekst bij drie tools ingevoerd en kreeg 12%, 58% en 94%. Kan het verschil zo groot zijn? Welke moet ik geloven?
Kort antwoord
Geen van de drie is een getal dat je letterlijk moet geloven. En zo'n spreiding is geen uitzondering maar heel gewoon.
Waarom ze zo uiteenlopen
1. Ze hanteren verschillende maatstaven
Elke tool bepaalt zelf hoe zwaar welk stijlkenmerk meetelt. Bij dezelfde tekst ligt het accent dus anders, en lopen de uitkomsten uiteen. Het is niet als het meten van een temperatuur; het lijkt meer op ieder met een eigen meetlat beoordelen hoe glad een tekst loopt.
2. Ze zijn op verschillende teksten gebouwd
Een tool die vooral op Engels is afgestemd, geeft op Nederlands onstabiele uitkomsten. Het Nederlands heeft een eigen zinsbouw — werkwoorden achteraan, samenstellingen, een bijzinvolgorde die nergens anders zo ligt — en dat laat zich niet zomaar overzetten.
3. Ze zijn gevoelig voor lengte
Hoe korter de tekst, hoe groter de spreiding. Met drie of vier zinnen is er te weinig basis om iets statistisch te zeggen. Daarom krijg je andere scores als je de eerste en de tweede helft van dezelfde tekst apart invoert.
4. De uitslag is geen kans
Het meest misverstane punt. "94%" betekent niet "94% kans dat AI dit schreef". Het ligt dichter bij de sterkte van een signaal, en elke tool legt die sterkte op een eigen schaal. Het zijn van meet af aan geen onderling vergelijkbare getallen.
Waar je dan wel op let
Ga niet middelen. Kijk in plaats daarvan naar de passages die meerdere tools alle drie markeren.
Wijzen ze alle drie dezelfde alinea aan, dan leest die alinea werkelijk vlak. De scores lopen uiteen, maar over de vraag wáár het opvalt, zijn ze het vaak wel eens.
Sla die alinea open en stel één vraag.
Staat hier mijn eigen oordeel of een concreet feit?
Dat is veel bruikbaarder informatie dan een cijfer.
Gebruik het niet als verweer
Wie onder verdenking staat, komt soms aanzetten met de uitslag van de tool die het laagst uitkwam. Dat werkt vrijwel niet. De ander weet ook dat de resultaten uiteenlopen, en het feit dat je meerdere tools hebt geprobeerd kan juist een verkeerde indruk wekken.
Verweer voer je niet met een score maar met je proces: eerste versie, versiegeschiedenis, bronmateriaal. Hoe dat gaat, staat in Onterecht beschuldigd van AI-gebruik.
Als je toch een tool moet kiezen
Op nauwkeurigheid kiezen is lastig, want je kunt het niet controleren. Deze punten zijn praktischer.
- Krijg je markering per zin? (een tool die alleen een totaal geeft, is weinig waard)
- Is hij op de taal afgestemd die je invoert?
- Formuleert hij de uitslag niet stellig? (wees voorzichtig bij een tool die verklaart "geschreven door AI")
- Is duidelijk wat er met je ingevoerde tekst gebeurt?
De AI-detector geeft markering per zin en presenteert het resultaat als AI-waarschijnlijkheid ter indicatie. Uitleg over het lezen van de uitslag staat ook bij de FAQ.
Tot slot
Geen enkele tool kan een auteur aanwijzen. In plaats van te malen over het verschil tussen scores, levert de gewoonte om de gemarkeerde passages open te slaan werkelijk een betere tekst op.
Waarom het cijfer als doel je duur komt te staan, staat in Jagen op een lage AI-score maakt je tekst kapot.