Benchmark

Hvor ofte AI-detektoren vår tar feil om et menneske

Enhver AI-detektor gir en selvsikker prosentsats. Ingen forteller deg hvor ofte den prosentsatsen tar feil om noen som skrev arbeidet sitt selv. Det andre tallet er det som teller hvis du er studenten som blir anklaget, så det er det vi publiserer, for språkene der vi har målt det.

Sist målt: 24. august 2026. Hvert tall nedenfor kommer fra et skript i repositoryet vårt som kan kjøres på nytt på de samme merkede korpusene.

Ingen av disse andelene er målt på norsk.

Tallene på denne siden er målt på engelske og tyske tekster, og de hører til de språkene: å skrive dem på norsk gjør dem ikke norske. En norsk tekst vurderes bare ut fra tekstens struktur (skrivestilen vises, men teller ikke), og foreløpig: vi har ennå ikke noe korpus av norske oppgaver som med sikkerhet er skrevet av mennesker, så vi kan ikke si hvor ofte vi tar feil om en norsk tekst, og så lenge det er slik, gir detektoren aldri en rød vurdering på norsk. Vi sier det heller enn å gi et engelsk tall ut for ditt.

Målte andeler falske positiver

Hvor ofte en akademisk tekst som med sikkerhet er skrevet av et menneske, får vår sterkeste vurdering. Treffsikkerhet er ikke ett tall: den endrer seg med språket og dokumentets lengde, så vi oppgir fire profiler i stedet for et gjennomsnitt som ville skjult de svake. Hver andel er en øvre grense på 95 % og ikke det observerte antallet: grensen er det vi har rett til å påstå, og den er alltid den dårligste av de to. Tersklene i tabellene ligger på de interne måleskalaene våre; poengsummen som vises, er den samme informasjonen på en fast akse, med ravgult fra 20 og rødt fra 50.

ProfilSterkeste vurderingFalske positiverObservertMålt på
Engelsk · over 400 ordTydelige AI-sporhøyst 3,13 %2 av 199199 EN-dokumenter i valideringshalvdelen (kombinert skala, w_style=0,5)
Tysk · over 400 ordTydelige AI-sporhøyst 1,63 %10 av 1 0351 035 tyske oppgaver i valideringshalvdelen (kombinert skala, w_style=0,5)
Engelsk · under 400 ordTydelige AI-sporikke publisert-ingen relevant menneskelig populasjon tilgjengelig
Tysk · under 400 ordvurderingen «tydelige AI-spor» gis aldri---

En kort tysk tekst får aldri vurderingen «tydelige AI-spor», og med dagens grunnlag kommer den ikke til å få det.

For kort tysk tekst koster enhver terskel som er streng nok til å kjenne igjen AI pålitelig, rundt 7 falske anklager per 100. Én uskyldig student av femten er ikke et bytte vi godtar, så den korte tyske profilen stopper ved «noen AI-spor». Det er en målt grense, ikke en funksjon som gjenstår å bygge.

De svakere vurderingene, som er mer støyete

De fleste lesere ser aldri den sterkeste vurderingen. De ser en av disse, og feilratene her er de som faktisk gjelder dem. Det nedre engelske ravgule båndet er det klart mest støyete.

ProfilVurderingTerskelFalske positiverObservert
Engelsk · over 400 ordNoen AI-spor≥ 96høyst 5,86 %6 av 199
Engelsk · over 400 ordNoen AI-spor (nedre ravgule bånd)≥ 91høyst 8,37 %10 av 199
Tysk · over 400 ordNoen AI-spor≥ 88høyst 4,02 %31 av 1 035
Tysk · over 400 ordNoen AI-spor (nedre ravgule bånd)≥ 85høyst 6,18 %51 av 1 035

Hva disse tallene ikke er

Hva vi målte på

Hvert menneskelige dokument nedenfor ble publisert før ChatGPT fantes, så spørsmålet om hvem som skrev det, er ikke et skjønn.

Tyske studentoppgaver, 2010-2021

n = 866

Hele dokumenter, på språket og i sjangeren vi betjener på tysk, menneskelige per definisjon fordi de er eldre enn ChatGPT. Det er korpuset de tyske tersklene er satt på.

scripts/fetch-thesis-negatives.mjs

Valideringshalvdelen for kombinasjonen: tyske studentoppgaver, 2008-2021, hele dokumenter

n = 1 035

Den tilbakeholdte halvdelen av ekte tyske oppgaver (MOnAMi, Hochschule Mittweida, 2008-2021), vurdert av BEGGE halvdelene av analysen: hele dokumenter, aldri brukt til å trene den tyske modellen. De kombinerte tyske tersklene er skåret på den. Det er ikke tekster fra kundenes tid: en polert oppgave fra 2026 er en populasjon ingen har målt, og det forbeholdet er en del av tallet.

scripts/calibrate-components.mjs

Open access-artikler, før 2022

n = 1 412

Fullstendig akademisk prosa. Tidsskriftartikler er redigerte og skrevet av grupper, altså ikke studenttekst: derfor flyttes ikke de engelske tersklene ut fra dem.

scripts/fetch-longform-corpus.mjs

Valideringshalvdelen for kombinasjonen: artikler + arXiv, utdrag på 1 500 ord

n = 199

Den tilbakeholdte halvdelen av engelske dokumenter (arXiv og open access-artikler fra før 2022), vurdert av BEGGE halvdelene av analysen. De kombinerte tersklene er skåret på den. Tidsskriftprosa, ikke studenttekst: vi sier det fordi det forbeholdet er en del av tallet.

scripts/calibrate-components.mjs

arXiv-sammendrag, før 2022

n = 236

Korte tekster på engelsk. Tatt vare på for arbeidet med AUC; vi publiserer ingen andel falske positiver for dem, fordi et kort vurderingsvindu ikke er det et sammendragskorpus måler.

scripts/fetch-human-corpus.mjs

Tyske akademiske sammendrag, før 2022

n = 60

OpenAlex, filtrert på tyske funksjonsord fordi språkfeltet er upålitelig. Det ligger bak beslutningen om ikke å gi vurderingen «tydelige AI-spor» i det hele tatt for kort tysk tekst.

scripts/fetch-german-corpus.mjs

En gang publiserte vi nesten en detektor som var dårligere enn å kaste mynt

I en tidlig versjon ga målingen på 236 arXiv-sammendrag fra før 2022 en AUC på 0.184. Å kaste mynt gir 0,50. Detektoren vurderte maskinskrevet tekst som mer menneskelig enn tekst skrevet av mennesker; å snu resultatet ville gjort den bedre. Og hele tiden hadde den gitt selvsikre prosentsatser.

Årsaken var en familie av mål på ordrikdom (Yules K, MTLD, Zipf-eksponenten, hapax legomena), alle i feil retning og med sterke effekter. De vurderer tett menneskelig akademisk prosa som maskinell og leksikalsk variert maskinprosa som menneskelig. Det er den samme mekanismen som ligger bak det publiserte resultatet om at detektorer feilaktig flagger et flertall av dem som skriver på engelsk som andrespråk.

I dag veier de målene null. De blir fortsatt beregnet og vist som spor, men de flytter ikke poengsummen. Vi publiserer det fordi det er det sterkeste argumentet vi har for å måle: feilen var usynlig i resultatet og tydelig i korpuset, og en detektor som aldri har tatt denne testen, vet ikke om den har det samme problemet.

Hva ingen detektor kan gjøre

Ingen AI-detektor, heller ikke denne, er et bevis på hvem som har skrevet en tekst. Verktøyene måler statistiske egenskaper ved teksten, og formell, strukturert menneskelig tekst eller tekst på et andrespråk deler mange av dem. En poengsum er en grunn til å stille et spørsmål, aldri til å trekke en konklusjon.

Sjekk teksten din

Gratis, uten konto. På norsk bygger vurderingen på tekstens struktur og viser deg hvilke setninger som veier; denne siden forteller hva som er målt og hva som ikke er det.

Start den gratis AI-detektoren

Forskere og journalister: korpusene, evalueringskoden og kalibreringsverktøyene ligger alle i repositoryet bak dette nettstedet. Hvis du vil gjenskape eller utfordre et tall på denne siden, skriv til contact@thesisdraft.com, så hjelper vi deg.