Benchmark

Hoe vaak onze AI-detector het fout heeft over een mens

Elke AI-detector geeft een zelfverzekerd percentage. Geen enkele vertelt je hoe vaak dat percentage fout zit bij iemand die het werk zelf schreef. Dat tweede getal telt als jij de beschuldigde student bent, dus dat is het getal dat wij publiceren, voor de talen waarin we het gemeten hebben.

Laatst gemeten: 24 augustus 2026. Elk getal hieronder komt uit een script in onze repository dat opnieuw kan worden uitgevoerd op dezelfde gelabelde corpora.

Geen van deze percentages is in het Nederlands gemeten.

De getallen op deze pagina zijn gemeten op Engelse en Duitse teksten en blijven aan die talen gebonden: ze in het Nederlands opschrijven maakt ze niet Nederlands. Een Nederlandse tekst wordt alleen op de structuur van de tekst beoordeeld (de schrijfstijl wordt getoond maar telt niet mee), en voorlopig: we hebben nog geen corpus van Nederlandse scripties die aantoonbaar door mensen geschreven zijn, dus we kunnen je niet zeggen hoe vaak we fout zitten bij een Nederlandse tekst, en zolang dat zo is geeft de detector in het Nederlands nooit een rood oordeel. Dat zeggen we liever dan een Engels getal voor het jouwe te laten doorgaan.

Gemeten fout-positieve percentages

Hoe vaak een academische tekst die aantoonbaar door een mens geschreven is ons sterkste oordeel krijgt. Nauwkeurigheid is niet één getal: ze verandert met de taal en de lengte van het document, dus we rapporteren vier profielen in plaats van een gemiddelde dat de zwakke zou verbergen. Elk percentage is een 95%-bovengrens en niet het waargenomen aantal: de grens is wat we mogen beweren, en het is altijd de slechtste van de twee. De drempels in deze tabellen staan op onze interne meetschalen; de getoonde score is dezelfde informatie op een vaste as, met oranje vanaf 20 en rood vanaf 50.

ProfielSterkste oordeelFout-positievenWaargenomenGemeten op
Engels · meer dan 400 woordenDuidelijke AI-kenmerkenhooguit 3,13 %2 van 199199 EN-documenten uit de validatiehelft (gecombineerde schaal, w_style=0,5)
Duits · meer dan 400 woordenDuidelijke AI-kenmerkenhooguit 1,63 %10 van 1.0351.035 Duitse scripties uit de validatiehelft (gecombineerde schaal, w_style=0,5)
Engels · minder dan 400 woordenDuidelijke AI-kenmerkenniet gepubliceerd-geen relevante menselijke populatie beschikbaar
Duits · minder dan 400 woordenhet oordeel «duidelijke AI-kenmerken» wordt nooit gegeven---

Een korte Duitse tekst krijgt nooit het oordeel «duidelijke AI-kenmerken», en met het huidige bewijs zal dat ook niet gebeuren.

Bij kort Duits kost geen enkele drempel die streng genoeg is om AI betrouwbaar te herkennen minder dan ongeveer 7 valse beschuldigingen op 100. Eén onschuldige student op de vijftien is geen ruil die we accepteren, dus het korte Duitse profiel stopt bij «enkele AI-kenmerken». Dat is een gemeten grens, geen functie die nog gebouwd moet worden.

De zwakkere oordelen, die meer ruis bevatten

De meeste lezers zien het sterkste oordeel nooit. Ze zien een van deze, en de foutpercentages hier zijn degene die hen echt aangaan. De onderste Engelse oranje band bevat verreweg de meeste ruis.

ProfielOordeelDrempelFout-positievenWaargenomen
Engels · meer dan 400 woordenEnkele AI-kenmerken≥ 96hooguit 5,86 %6 van 199
Engels · meer dan 400 woordenEnkele AI-kenmerken (onderste oranje band)≥ 91hooguit 8,37 %10 van 199
Duits · meer dan 400 woordenEnkele AI-kenmerken≥ 88hooguit 4,02 %31 van 1.035
Duits · meer dan 400 woordenEnkele AI-kenmerken (onderste oranje band)≥ 85hooguit 6,18 %51 van 1.035

Wat deze getallen niet zijn

Waarop we gemeten hebben

Elk menselijk document hieronder is gepubliceerd voordat ChatGPT bestond, dus het auteurschap is geen kwestie van inschatting.

Scripties van Duitse studenten, 2010-2021

n = 866

Hele documenten, in de taal en het genre die we in het Duits bedienen, menselijk per definitie omdat ze van vóór ChatGPT zijn. Op dit corpus liggen de Duitse drempels vast.

scripts/fetch-thesis-negatives.mjs

Validatiehelft van de combinatie: scripties van Duitse studenten, 2008-2021, hele documenten

n = 1.035

De achtergehouden helft van echte Duitse scripties (MOnAMi, Hochschule Mittweida, 2008-2021), beoordeeld door BEIDE helften van de controle: hele documenten, nooit gebruikt om het Duitse model te trainen. De gecombineerde Duitse drempels zijn erop gesneden. Het zijn geen teksten uit de tijd van onze klanten: een gepolijste scriptie uit 2026 is een populatie die niemand gemeten heeft, en dat voorbehoud hoort bij het getal.

scripts/calibrate-components.mjs

Open-access-artikelen, van vóór 2022

n = 1.412

Volledig academisch proza. Tijdschriftartikelen zijn geredigeerd en door teams geschreven, dus geen studententeksten: daarom worden de Engelse drempels er niet op verschoven.

scripts/fetch-longform-corpus.mjs

Validatiehelft van de combinatie: artikelen + arXiv, fragmenten van 1.500 woorden

n = 199

De achtergehouden helft van Engelse documenten (arXiv en open-access-artikelen van vóór 2022), beoordeeld door BEIDE helften van de controle. De gecombineerde drempels zijn erop gesneden. Tijdschriftproza, geen studententekst: dat zeggen we omdat dat voorbehoud bij het getal hoort.

scripts/calibrate-components.mjs

arXiv-samenvattingen, van vóór 2022

n = 236

Korte Engelse teksten. Bewaard voor het AUC-werk; we publiceren er geen fout-positief percentage uit, omdat een kort oordeelvenster niet is wat een corpus van samenvattingen meet.

scripts/fetch-human-corpus.mjs

Duitse academische samenvattingen, van vóór 2022

n = 60

OpenAlex, gefilterd op Duitse functiewoorden omdat het taalveld onbetrouwbaar is. Het ligt ten grondslag aan de beslissing om het oordeel «duidelijke AI-kenmerken» bij kort Duits helemaal niet te geven.

scripts/fetch-german-corpus.mjs

We hebben ooit bijna een detector gepubliceerd die slechter was dan een muntworp

In een vroege versie gaf de meting op 236 arXiv-samenvattingen van vóór 2022 een AUC van 0.184. Een muntworp is 0,50. De detector rangschikte door een machine geschreven tekst als menselijker dan tekst van mensen; de uitkomst omdraaien had hem beter gemaakt. En al die tijd gaf hij zelfverzekerde percentages.

De oorzaak was een familie van indicatoren voor lexicale rijkdom (Yules K, MTLD, de Zipf-exponent, hapax legomena), allemaal omgekeerd en met sterke effecten. Ze beoordelen dicht menselijk academisch proza als machinaal en lexicaal gevarieerd machinaal proza als menselijk. Het is hetzelfde mechanisme achter het gepubliceerde resultaat dat detectoren het merendeel van de schrijvers met Engels als tweede taal ten onrechte markeren.

Vandaag wegen die indicatoren nul. Ze worden nog berekend en als aanwijzing getoond, maar ze bewegen de score niet. We publiceren dit omdat het het sterkste argument is dat we hebben om te meten: de fout was onzichtbaar in de uitkomst en duidelijk in het corpus, en een detector die deze test nooit deed, weet niet of hij hetzelfde probleem heeft.

Wat geen enkele detector kan

Geen enkele AI-detector, ook deze niet, is een bewijs van auteurschap. Deze instrumenten meten statistische eigenschappen van tekst, en formeel, gestructureerd of in een tweede taal geschreven menselijk werk deelt er veel van. Een score is een reden om een vraag te stellen, nooit om een conclusie te trekken.

Controleer je tekst

De eerste 1.500 woorden zijn gratis, zonder account. In het Nederlands is het oordeel gebaseerd op de structuur van de tekst en laat het je de zinnen zien die meewegen; deze pagina vertelt je wat er gemeten is en wat niet.

Start de gratis AI-detector

Onderzoekers en journalisten: de corpora, de evaluatiecode en de kalibratie-instrumenten staan allemaal in de repository achter deze site. Wil je een getal op deze pagina reproduceren of betwisten, mail dan naar contact@thesisdraft.com en we helpen je.