Benchmark
Hoe vaak onze AI-detector het fout heeft over een mens
Elke AI-detector geeft een zelfverzekerd percentage. Geen enkele vertelt je hoe vaak dat percentage fout zit bij iemand die het werk zelf schreef. Dat tweede getal telt als jij de beschuldigde student bent, dus dat is het getal dat wij publiceren, voor de talen waarin we het gemeten hebben.
Laatst gemeten: 24 augustus 2026. Elk getal hieronder komt uit een script in onze repository dat opnieuw kan worden uitgevoerd op dezelfde gelabelde corpora.
Geen van deze percentages is in het Nederlands gemeten.
De getallen op deze pagina zijn gemeten op Engelse en Duitse teksten en blijven aan die talen gebonden: ze in het Nederlands opschrijven maakt ze niet Nederlands. Een Nederlandse tekst wordt alleen op de structuur van de tekst beoordeeld (de schrijfstijl wordt getoond maar telt niet mee), en voorlopig: we hebben nog geen corpus van Nederlandse scripties die aantoonbaar door mensen geschreven zijn, dus we kunnen je niet zeggen hoe vaak we fout zitten bij een Nederlandse tekst, en zolang dat zo is geeft de detector in het Nederlands nooit een rood oordeel. Dat zeggen we liever dan een Engels getal voor het jouwe te laten doorgaan.
Gemeten fout-positieve percentages
Hoe vaak een academische tekst die aantoonbaar door een mens geschreven is ons sterkste oordeel krijgt. Nauwkeurigheid is niet één getal: ze verandert met de taal en de lengte van het document, dus we rapporteren vier profielen in plaats van een gemiddelde dat de zwakke zou verbergen. Elk percentage is een 95%-bovengrens en niet het waargenomen aantal: de grens is wat we mogen beweren, en het is altijd de slechtste van de twee. De drempels in deze tabellen staan op onze interne meetschalen; de getoonde score is dezelfde informatie op een vaste as, met oranje vanaf 20 en rood vanaf 50.
| Profiel | Sterkste oordeel | Fout-positieven | Waargenomen | Gemeten op |
|---|---|---|---|---|
| Engels · meer dan 400 woorden | Duidelijke AI-kenmerken | hooguit 3,13 % | 2 van 199 | 199 EN-documenten uit de validatiehelft (gecombineerde schaal, w_style=0,5) |
| Duits · meer dan 400 woorden | Duidelijke AI-kenmerken | hooguit 1,63 % | 10 van 1.035 | 1.035 Duitse scripties uit de validatiehelft (gecombineerde schaal, w_style=0,5) |
| Engels · minder dan 400 woorden | Duidelijke AI-kenmerken | niet gepubliceerd | - | geen relevante menselijke populatie beschikbaar |
| Duits · minder dan 400 woorden | het oordeel «duidelijke AI-kenmerken» wordt nooit gegeven | - | - | - |
Een korte Duitse tekst krijgt nooit het oordeel «duidelijke AI-kenmerken», en met het huidige bewijs zal dat ook niet gebeuren.
Bij kort Duits kost geen enkele drempel die streng genoeg is om AI betrouwbaar te herkennen minder dan ongeveer 7 valse beschuldigingen op 100. Eén onschuldige student op de vijftien is geen ruil die we accepteren, dus het korte Duitse profiel stopt bij «enkele AI-kenmerken». Dat is een gemeten grens, geen functie die nog gebouwd moet worden.
De zwakkere oordelen, die meer ruis bevatten
De meeste lezers zien het sterkste oordeel nooit. Ze zien een van deze, en de foutpercentages hier zijn degene die hen echt aangaan. De onderste Engelse oranje band bevat verreweg de meeste ruis.
| Profiel | Oordeel | Drempel | Fout-positieven | Waargenomen |
|---|---|---|---|---|
| Engels · meer dan 400 woorden | Enkele AI-kenmerken | ≥ 96 | hooguit 5,86 % | 6 van 199 |
| Engels · meer dan 400 woorden | Enkele AI-kenmerken (onderste oranje band) | ≥ 91 | hooguit 8,37 % | 10 van 199 |
| Duits · meer dan 400 woorden | Enkele AI-kenmerken | ≥ 88 | hooguit 4,02 % | 31 van 1.035 |
| Duits · meer dan 400 woorden | Enkele AI-kenmerken (onderste oranje band) | ≥ 85 | hooguit 6,18 % | 51 van 1.035 |
Wat deze getallen niet zijn
- Nul waargenomen is geen nul. Geen van beide lange profielen gaf bij de strengste drempel ook maar één fout-positief in de ruwe structuurcorpora. We publiceren toch de 95%-bovengrens voor die steekproefomvang, want «0%» schrijven zou precies de overmoed zijn waartegen deze pagina bestaat.
- Het Engelse corpus is van het verkeerde genre. Die documenten zijn tijdschriftartikelen: geredigeerd, professioneel, door teams geschreven. Een studentenscriptie is niets van dat alles. Het percentage is eerlijk gemeten op waarop het zegt gemeten te zijn, en de Engelse drempels blijven waar ze staan tot er genoeg scripties van studenten met Engels als tweede taal zijn om ze te verschuiven.
- Korte tekst heeft geen gepubliceerd percentage. Het korte profiel gaat over een venster van een paar honderd woorden, en geen menselijk corpus dat we hebben komt uit dat venster. De percentages die hier stonden zijn op 21 augustus 2026 weggehaald in plaats van te blijven staan, want een plausibel getal zonder populatie erachter blijft een ongefundeerde bewering.
- De AI-corpora zijn klein: ongeveer twintig documenten per taal, uit twee modelfamilies. Een model dat we niet getest hebben kan zich anders gedragen.
- Het Nederlands is niet gekalibreerd. Een Nederlandse tekst krijgt een oordeel dat alleen op de structuur van de tekst is gebaseerd, voorlopig, zonder enige nauwkeurigheidsclaim, en krijgt nooit een rood oordeel.
Waarop we gemeten hebben
Elk menselijk document hieronder is gepubliceerd voordat ChatGPT bestond, dus het auteurschap is geen kwestie van inschatting.
Scripties van Duitse studenten, 2010-2021
n = 866
Hele documenten, in de taal en het genre die we in het Duits bedienen, menselijk per definitie omdat ze van vóór ChatGPT zijn. Op dit corpus liggen de Duitse drempels vast.
scripts/fetch-thesis-negatives.mjs
Validatiehelft van de combinatie: scripties van Duitse studenten, 2008-2021, hele documenten
n = 1.035
De achtergehouden helft van echte Duitse scripties (MOnAMi, Hochschule Mittweida, 2008-2021), beoordeeld door BEIDE helften van de controle: hele documenten, nooit gebruikt om het Duitse model te trainen. De gecombineerde Duitse drempels zijn erop gesneden. Het zijn geen teksten uit de tijd van onze klanten: een gepolijste scriptie uit 2026 is een populatie die niemand gemeten heeft, en dat voorbehoud hoort bij het getal.
scripts/calibrate-components.mjs
Open-access-artikelen, van vóór 2022
n = 1.412
Volledig academisch proza. Tijdschriftartikelen zijn geredigeerd en door teams geschreven, dus geen studententeksten: daarom worden de Engelse drempels er niet op verschoven.
scripts/fetch-longform-corpus.mjs
Validatiehelft van de combinatie: artikelen + arXiv, fragmenten van 1.500 woorden
n = 199
De achtergehouden helft van Engelse documenten (arXiv en open-access-artikelen van vóór 2022), beoordeeld door BEIDE helften van de controle. De gecombineerde drempels zijn erop gesneden. Tijdschriftproza, geen studententekst: dat zeggen we omdat dat voorbehoud bij het getal hoort.
scripts/calibrate-components.mjs
arXiv-samenvattingen, van vóór 2022
n = 236
Korte Engelse teksten. Bewaard voor het AUC-werk; we publiceren er geen fout-positief percentage uit, omdat een kort oordeelvenster niet is wat een corpus van samenvattingen meet.
scripts/fetch-human-corpus.mjs
Duitse academische samenvattingen, van vóór 2022
n = 60
OpenAlex, gefilterd op Duitse functiewoorden omdat het taalveld onbetrouwbaar is. Het ligt ten grondslag aan de beslissing om het oordeel «duidelijke AI-kenmerken» bij kort Duits helemaal niet te geven.
scripts/fetch-german-corpus.mjs
We hebben ooit bijna een detector gepubliceerd die slechter was dan een muntworp
In een vroege versie gaf de meting op 236 arXiv-samenvattingen van vóór 2022 een AUC van 0.184. Een muntworp is 0,50. De detector rangschikte door een machine geschreven tekst als menselijker dan tekst van mensen; de uitkomst omdraaien had hem beter gemaakt. En al die tijd gaf hij zelfverzekerde percentages.
De oorzaak was een familie van indicatoren voor lexicale rijkdom (Yules K, MTLD, de Zipf-exponent, hapax legomena), allemaal omgekeerd en met sterke effecten. Ze beoordelen dicht menselijk academisch proza als machinaal en lexicaal gevarieerd machinaal proza als menselijk. Het is hetzelfde mechanisme achter het gepubliceerde resultaat dat detectoren het merendeel van de schrijvers met Engels als tweede taal ten onrechte markeren.
Vandaag wegen die indicatoren nul. Ze worden nog berekend en als aanwijzing getoond, maar ze bewegen de score niet. We publiceren dit omdat het het sterkste argument is dat we hebben om te meten: de fout was onzichtbaar in de uitkomst en duidelijk in het corpus, en een detector die deze test nooit deed, weet niet of hij hetzelfde probleem heeft.
Wat geen enkele detector kan
Geen enkele AI-detector, ook deze niet, is een bewijs van auteurschap. Deze instrumenten meten statistische eigenschappen van tekst, en formeel, gestructureerd of in een tweede taal geschreven menselijk werk deelt er veel van. Een score is een reden om een vraag te stellen, nooit om een conclusie te trekken.
Controleer je tekst
De eerste 1.500 woorden zijn gratis, zonder account. In het Nederlands is het oordeel gebaseerd op de structuur van de tekst en laat het je de zinnen zien die meewegen; deze pagina vertelt je wat er gemeten is en wat niet.
Start de gratis AI-detectorOnderzoekers en journalisten: de corpora, de evaluatiecode en de kalibratie-instrumenten staan allemaal in de repository achter deze site. Wil je een getal op deze pagina reproduceren of betwisten, mail dan naar contact@thesisdraft.com en we helpen je.