Benchmark
Hvor ofte vores AI detector tager fejl af et menneske
Enhver AI-detektor giver en selvsikker procentsats. Ingen fortæller dig, hvor ofte den procentsats tager fejl af en, der selv skrev sit arbejde. Det andet tal er det, der betyder noget, hvis du er den studerende, der bliver anklaget, så det er det, vi offentliggør, for de sprog, hvor vi har målt det.
Sidst målt: 24. august 2026. Hvert tal nedenfor kommer fra et script i vores repository, som kan køres igen på de samme mærkede korpusser.
Ingen af disse andele er målt på dansk.
Tallene på denne side er målt på engelske og tyske tekster, og de hører til de sprog: at skrive dem på dansk gør dem ikke danske. En dansk tekst vurderes kun ud fra tekstens struktur (skrivestilen vises, men tæller ikke), og foreløbigt: vi har endnu intet korpus af danske opgaver, der med sikkerhed er skrevet af mennesker, så vi kan ikke sige, hvor ofte vi tager fejl af en dansk tekst, og så længe det er sådan, giver detektoren aldrig en rød vurdering på dansk. Vi siger det hellere end at udgive et engelsk tal for dit.
Målte andele af falske positiver
Hvor ofte en akademisk tekst, der med sikkerhed er skrevet af et menneske, får vores stærkeste vurdering. Præcision er ikke ét tal: den ændrer sig med sproget og dokumentets længde, så vi angiver fire profiler i stedet for et gennemsnit, der ville skjule de svage. Hver andel er en øvre grænse på 95 % og ikke det observerede antal: grænsen er det, vi har ret til at påstå, og den er altid den dårligste af de to. Tærsklerne i tabellerne ligger på vores interne måleskalaer; den viste score er den samme information på en fast akse, med rav fra 20 og rød fra 50.
| Profil | Stærkeste vurdering | Falske positiver | Observeret | Målt på |
|---|---|---|---|---|
| Engelsk · over 400 ord | Tydelige AI-spor | højst 3,13 % | 2 af 199 | 199 EN-dokumenter i valideringshalvdelen (kombineret skala, w_style=0,5) |
| Tysk · over 400 ord | Tydelige AI-spor | højst 1,63 % | 10 af 1.035 | 1.035 tyske opgaver i valideringshalvdelen (kombineret skala, w_style=0,5) |
| Engelsk · under 400 ord | Tydelige AI-spor | ikke offentliggjort | - | ingen relevant menneskelig population til rådighed |
| Tysk · under 400 ord | vurderingen «tydelige AI-spor» gives aldrig | - | - | - |
En kort tysk tekst får aldrig vurderingen «tydelige AI-spor», og med det nuværende grundlag kommer den ikke til det.
For kort tysk tekst koster enhver tærskel, der er streng nok til at genkende AI pålideligt, omkring 7 falske anklager pr. 100. Én uskyldig studerende ud af femten er ikke en byttehandel, vi accepterer, så den korte tyske profil stopper ved «nogle AI-spor». Det er en målt grænse, ikke en funktion, der mangler at blive bygget.
De svagere vurderinger, som er mere støjfyldte
De fleste læsere ser aldrig den stærkeste vurdering. De ser en af disse, og fejlraterne her er dem, der faktisk gælder for dem. Det nederste engelske ravfarvede bånd er langt det mest støjfyldte.
| Profil | Vurdering | Tærskel | Falske positiver | Observeret |
|---|---|---|---|---|
| Engelsk · over 400 ord | Nogle AI-spor | ≥ 96 | højst 5,86 % | 6 af 199 |
| Engelsk · over 400 ord | Nogle AI-spor (nederste ravfarvede bånd) | ≥ 91 | højst 8,37 % | 10 af 199 |
| Tysk · over 400 ord | Nogle AI-spor | ≥ 88 | højst 4,02 % | 31 af 1.035 |
| Tysk · over 400 ord | Nogle AI-spor (nederste ravfarvede bånd) | ≥ 85 | højst 6,18 % | 51 af 1.035 |
Hvad disse tal ikke er
- Nul observeret er ikke nul. Ingen af de to lange profiler gav en eneste falsk positiv ved den strengeste tærskel i de rå strukturkorpusser. Vi offentliggør alligevel den øvre grænse på 95 % for den stikprøvestørrelse, fordi at skrive «0 %» ville være netop den oversikkerhed, denne side er til for at modvirke.
- Det engelske korpus er af den forkerte genre. De dokumenter er tidsskriftsartikler: redigerede, professionelle, skrevet af grupper. En studenteropgave er intet af det. Andelen er ærligt målt på det, den siger, den er målt på, og de engelske tærskler bliver, hvor de er, indtil der er nok studenteropgaver på engelsk som andetsprog til at begrunde en flytning.
- Kort tekst har ingen offentliggjort andel. Den korte profil gælder et vindue på nogle hundrede ord, og intet menneskeligt korpus, vi har, kommer fra det vindue. Andelene, der stod her, blev fjernet den 21. august 2026 i stedet for at blive stående, fordi et plausibelt tal uden en population bag stadig er en ubegrundet påstand.
- AI-korpusserne er små: omkring tyve dokumenter pr. sprog, fra to modelfamilier. En model, vi ikke har testet, kan opføre sig anderledes.
- Dansk er ikke kalibreret. En dansk tekst får en vurdering, der kun bygger på tekstens struktur, foreløbig, uden nogen påstand om præcision, og får aldrig en rød vurdering.
Hvad vi målte på
Hvert menneskeligt dokument nedenfor blev offentliggjort, før ChatGPT fandtes, så spørgsmålet om, hvem der skrev det, er ikke et skøn.
Tyske studenteropgaver, 2010-2021
n = 866
Hele dokumenter, på det sprog og i den genre, vi betjener på tysk, menneskelige per definition, fordi de er ældre end ChatGPT. Det er det korpus, de tyske tærskler er sat på.
scripts/fetch-thesis-negatives.mjs
Valideringshalvdelen for kombinationen: tyske studenteropgaver, 2008-2021, hele dokumenter
n = 1.035
Den tilbageholdte halvdel af rigtige tyske opgaver (MOnAMi, Hochschule Mittweida, 2008-2021), vurderet af BEGGE halvdele af analysen: hele dokumenter, aldrig brugt til at træne den tyske model. De kombinerede tyske tærskler er skåret på den. Det er ikke tekster fra vores kunders tid: en finpudset opgave fra 2026 er en population, ingen har målt, og det forbehold er en del af tallet.
scripts/calibrate-components.mjs
Open access-artikler, før 2022
n = 1.412
Fuld akademisk prosa. Tidsskriftsartikler er redigerede og skrevet af grupper, altså ikke studentertekst: derfor flyttes de engelske tærskler ikke ud fra dem.
scripts/fetch-longform-corpus.mjs
Valideringshalvdelen for kombinationen: artikler + arXiv, uddrag på 1.500 ord
n = 199
Den tilbageholdte halvdel af engelske dokumenter (arXiv og open access-artikler fra før 2022), vurderet af BEGGE halvdele af analysen. De kombinerede tærskler er skåret på den. Tidsskriftsprosa, ikke studentertekst: vi siger det, fordi det forbehold er en del af tallet.
scripts/calibrate-components.mjs
arXiv-abstracts, før 2022
n = 236
Korte tekster på engelsk. Gemt til arbejdet med AUC; vi offentliggør ingen andel af falske positiver for dem, fordi et kort vurderingsvindue ikke er det, et abstract-korpus måler.
scripts/fetch-human-corpus.mjs
Tyske akademiske abstracts, før 2022
n = 60
OpenAlex, filtreret på tyske funktionsord, fordi sprogfeltet er upålideligt. Det ligger bag beslutningen om slet ikke at give vurderingen «tydelige AI-spor» for kort tysk tekst.
scripts/fetch-german-corpus.mjs
Vi offentliggjorde engang næsten en detektor, der var dårligere end at slå plat eller krone
I en tidlig version gav målingen på 236 arXiv-abstracts fra før 2022 en AUC på 0.184. Plat eller krone giver 0,50. Detektoren vurderede maskinskrevet tekst som mere menneskelig end tekst skrevet af mennesker; at vende resultatet om ville have gjort den bedre. Og hele tiden havde den givet selvsikre procentsatser.
Årsagen var en familie af mål for ordrigdom (Yules K, MTLD, Zipf-eksponenten, hapax legomena), alle i den forkerte retning og med stærke effekter. De vurderer tæt menneskelig akademisk prosa som maskinel og leksikalsk varieret maskinprosa som menneskelig. Det er den samme mekanisme bag det offentliggjorte resultat om, at detektorer fejlagtigt markerer et flertal af dem, der skriver på engelsk som andetsprog.
I dag vejer de mål nul. De bliver stadig beregnet og vist som spor, men de flytter ikke scoren. Vi offentliggør det, fordi det er det stærkeste argument, vi har for at måle: fejlen var usynlig i resultatet og tydelig i korpusset, og en detektor, der aldrig har lavet denne test, ved ikke, om den har samme problem.
Hvad ingen detektor kan
Ingen AI-detektor, heller ikke denne, er et bevis på, hvem der har skrevet en tekst. Værktøjerne måler statistiske egenskaber i teksten, og formel, struktureret menneskelig tekst eller tekst på et andetsprog deler mange af dem. En score er en grund til at stille et spørgsmål, aldrig til at drage en konklusion.
Tjek din tekst
Gratis, uden konto. På dansk bygger vurderingen på tekstens struktur og viser dig, hvilke sætninger der vejer; denne side fortæller, hvad der er målt, og hvad der ikke er.
Start den gratis AI detectorForskere og journalister: korpusserne, evalueringskoden og kalibreringsværktøjerne ligger alle i repositoryet bag dette website. Hvis du vil genskabe eller udfordre et tal på denne side, så skriv til contact@thesisdraft.com, så hjælper vi dig.