Benchmark

Hvor ofte vores AI detector tager fejl af et menneske

Enhver AI-detektor giver en selvsikker procentsats. Ingen fortæller dig, hvor ofte den procentsats tager fejl af en, der selv skrev sit arbejde. Det andet tal er det, der betyder noget, hvis du er den studerende, der bliver anklaget, så det er det, vi offentliggør, for de sprog, hvor vi har målt det.

Sidst målt: 24. august 2026. Hvert tal nedenfor kommer fra et script i vores repository, som kan køres igen på de samme mærkede korpusser.

Ingen af disse andele er målt på dansk.

Tallene på denne side er målt på engelske og tyske tekster, og de hører til de sprog: at skrive dem på dansk gør dem ikke danske. En dansk tekst vurderes kun ud fra tekstens struktur (skrivestilen vises, men tæller ikke), og foreløbigt: vi har endnu intet korpus af danske opgaver, der med sikkerhed er skrevet af mennesker, så vi kan ikke sige, hvor ofte vi tager fejl af en dansk tekst, og så længe det er sådan, giver detektoren aldrig en rød vurdering på dansk. Vi siger det hellere end at udgive et engelsk tal for dit.

Målte andele af falske positiver

Hvor ofte en akademisk tekst, der med sikkerhed er skrevet af et menneske, får vores stærkeste vurdering. Præcision er ikke ét tal: den ændrer sig med sproget og dokumentets længde, så vi angiver fire profiler i stedet for et gennemsnit, der ville skjule de svage. Hver andel er en øvre grænse på 95 % og ikke det observerede antal: grænsen er det, vi har ret til at påstå, og den er altid den dårligste af de to. Tærsklerne i tabellerne ligger på vores interne måleskalaer; den viste score er den samme information på en fast akse, med rav fra 20 og rød fra 50.

ProfilStærkeste vurderingFalske positiverObserveretMålt på
Engelsk · over 400 ordTydelige AI-sporhøjst 3,13 %2 af 199199 EN-dokumenter i valideringshalvdelen (kombineret skala, w_style=0,5)
Tysk · over 400 ordTydelige AI-sporhøjst 1,63 %10 af 1.0351.035 tyske opgaver i valideringshalvdelen (kombineret skala, w_style=0,5)
Engelsk · under 400 ordTydelige AI-sporikke offentliggjort-ingen relevant menneskelig population til rådighed
Tysk · under 400 ordvurderingen «tydelige AI-spor» gives aldrig---

En kort tysk tekst får aldrig vurderingen «tydelige AI-spor», og med det nuværende grundlag kommer den ikke til det.

For kort tysk tekst koster enhver tærskel, der er streng nok til at genkende AI pålideligt, omkring 7 falske anklager pr. 100. Én uskyldig studerende ud af femten er ikke en byttehandel, vi accepterer, så den korte tyske profil stopper ved «nogle AI-spor». Det er en målt grænse, ikke en funktion, der mangler at blive bygget.

De svagere vurderinger, som er mere støjfyldte

De fleste læsere ser aldrig den stærkeste vurdering. De ser en af disse, og fejlraterne her er dem, der faktisk gælder for dem. Det nederste engelske ravfarvede bånd er langt det mest støjfyldte.

ProfilVurderingTærskelFalske positiverObserveret
Engelsk · over 400 ordNogle AI-spor≥ 96højst 5,86 %6 af 199
Engelsk · over 400 ordNogle AI-spor (nederste ravfarvede bånd)≥ 91højst 8,37 %10 af 199
Tysk · over 400 ordNogle AI-spor≥ 88højst 4,02 %31 af 1.035
Tysk · over 400 ordNogle AI-spor (nederste ravfarvede bånd)≥ 85højst 6,18 %51 af 1.035

Hvad disse tal ikke er

Hvad vi målte på

Hvert menneskeligt dokument nedenfor blev offentliggjort, før ChatGPT fandtes, så spørgsmålet om, hvem der skrev det, er ikke et skøn.

Tyske studenteropgaver, 2010-2021

n = 866

Hele dokumenter, på det sprog og i den genre, vi betjener på tysk, menneskelige per definition, fordi de er ældre end ChatGPT. Det er det korpus, de tyske tærskler er sat på.

scripts/fetch-thesis-negatives.mjs

Valideringshalvdelen for kombinationen: tyske studenteropgaver, 2008-2021, hele dokumenter

n = 1.035

Den tilbageholdte halvdel af rigtige tyske opgaver (MOnAMi, Hochschule Mittweida, 2008-2021), vurderet af BEGGE halvdele af analysen: hele dokumenter, aldrig brugt til at træne den tyske model. De kombinerede tyske tærskler er skåret på den. Det er ikke tekster fra vores kunders tid: en finpudset opgave fra 2026 er en population, ingen har målt, og det forbehold er en del af tallet.

scripts/calibrate-components.mjs

Open access-artikler, før 2022

n = 1.412

Fuld akademisk prosa. Tidsskriftsartikler er redigerede og skrevet af grupper, altså ikke studentertekst: derfor flyttes de engelske tærskler ikke ud fra dem.

scripts/fetch-longform-corpus.mjs

Valideringshalvdelen for kombinationen: artikler + arXiv, uddrag på 1.500 ord

n = 199

Den tilbageholdte halvdel af engelske dokumenter (arXiv og open access-artikler fra før 2022), vurderet af BEGGE halvdele af analysen. De kombinerede tærskler er skåret på den. Tidsskriftsprosa, ikke studentertekst: vi siger det, fordi det forbehold er en del af tallet.

scripts/calibrate-components.mjs

arXiv-abstracts, før 2022

n = 236

Korte tekster på engelsk. Gemt til arbejdet med AUC; vi offentliggør ingen andel af falske positiver for dem, fordi et kort vurderingsvindue ikke er det, et abstract-korpus måler.

scripts/fetch-human-corpus.mjs

Tyske akademiske abstracts, før 2022

n = 60

OpenAlex, filtreret på tyske funktionsord, fordi sprogfeltet er upålideligt. Det ligger bag beslutningen om slet ikke at give vurderingen «tydelige AI-spor» for kort tysk tekst.

scripts/fetch-german-corpus.mjs

Vi offentliggjorde engang næsten en detektor, der var dårligere end at slå plat eller krone

I en tidlig version gav målingen på 236 arXiv-abstracts fra før 2022 en AUC på 0.184. Plat eller krone giver 0,50. Detektoren vurderede maskinskrevet tekst som mere menneskelig end tekst skrevet af mennesker; at vende resultatet om ville have gjort den bedre. Og hele tiden havde den givet selvsikre procentsatser.

Årsagen var en familie af mål for ordrigdom (Yules K, MTLD, Zipf-eksponenten, hapax legomena), alle i den forkerte retning og med stærke effekter. De vurderer tæt menneskelig akademisk prosa som maskinel og leksikalsk varieret maskinprosa som menneskelig. Det er den samme mekanisme bag det offentliggjorte resultat om, at detektorer fejlagtigt markerer et flertal af dem, der skriver på engelsk som andetsprog.

I dag vejer de mål nul. De bliver stadig beregnet og vist som spor, men de flytter ikke scoren. Vi offentliggør det, fordi det er det stærkeste argument, vi har for at måle: fejlen var usynlig i resultatet og tydelig i korpusset, og en detektor, der aldrig har lavet denne test, ved ikke, om den har samme problem.

Hvad ingen detektor kan

Ingen AI-detektor, heller ikke denne, er et bevis på, hvem der har skrevet en tekst. Værktøjerne måler statistiske egenskaber i teksten, og formel, struktureret menneskelig tekst eller tekst på et andetsprog deler mange af dem. En score er en grund til at stille et spørgsmål, aldrig til at drage en konklusion.

Tjek din tekst

Gratis, uden konto. På dansk bygger vurderingen på tekstens struktur og viser dig, hvilke sætninger der vejer; denne side fortæller, hvad der er målt, og hvad der ikke er.

Start den gratis AI detector

Forskere og journalister: korpusserne, evalueringskoden og kalibreringsværktøjerne ligger alle i repositoryet bag dette website. Hvis du vil genskabe eller udfordre et tal på denne side, så skriv til contact@thesisdraft.com, så hjælper vi dig.