Benchmark
Hvor ofte AI-detektoren vår tar feil om et menneske
Enhver AI-detektor gir en selvsikker prosentsats. Ingen forteller deg hvor ofte den prosentsatsen tar feil om noen som skrev arbeidet sitt selv. Det andre tallet er det som teller hvis du er studenten som blir anklaget, så det er det vi publiserer, for språkene der vi har målt det.
Sist målt: 24. august 2026. Hvert tall nedenfor kommer fra et skript i repositoryet vårt som kan kjøres på nytt på de samme merkede korpusene.
Ingen av disse andelene er målt på norsk.
Tallene på denne siden er målt på engelske og tyske tekster, og de hører til de språkene: å skrive dem på norsk gjør dem ikke norske. En norsk tekst vurderes bare ut fra tekstens struktur (skrivestilen vises, men teller ikke), og foreløpig: vi har ennå ikke noe korpus av norske oppgaver som med sikkerhet er skrevet av mennesker, så vi kan ikke si hvor ofte vi tar feil om en norsk tekst, og så lenge det er slik, gir detektoren aldri en rød vurdering på norsk. Vi sier det heller enn å gi et engelsk tall ut for ditt.
Målte andeler falske positiver
Hvor ofte en akademisk tekst som med sikkerhet er skrevet av et menneske, får vår sterkeste vurdering. Treffsikkerhet er ikke ett tall: den endrer seg med språket og dokumentets lengde, så vi oppgir fire profiler i stedet for et gjennomsnitt som ville skjult de svake. Hver andel er en øvre grense på 95 % og ikke det observerte antallet: grensen er det vi har rett til å påstå, og den er alltid den dårligste av de to. Tersklene i tabellene ligger på de interne måleskalaene våre; poengsummen som vises, er den samme informasjonen på en fast akse, med ravgult fra 20 og rødt fra 50.
| Profil | Sterkeste vurdering | Falske positiver | Observert | Målt på |
|---|---|---|---|---|
| Engelsk · over 400 ord | Tydelige AI-spor | høyst 3,13 % | 2 av 199 | 199 EN-dokumenter i valideringshalvdelen (kombinert skala, w_style=0,5) |
| Tysk · over 400 ord | Tydelige AI-spor | høyst 1,63 % | 10 av 1 035 | 1 035 tyske oppgaver i valideringshalvdelen (kombinert skala, w_style=0,5) |
| Engelsk · under 400 ord | Tydelige AI-spor | ikke publisert | - | ingen relevant menneskelig populasjon tilgjengelig |
| Tysk · under 400 ord | vurderingen «tydelige AI-spor» gis aldri | - | - | - |
En kort tysk tekst får aldri vurderingen «tydelige AI-spor», og med dagens grunnlag kommer den ikke til å få det.
For kort tysk tekst koster enhver terskel som er streng nok til å kjenne igjen AI pålitelig, rundt 7 falske anklager per 100. Én uskyldig student av femten er ikke et bytte vi godtar, så den korte tyske profilen stopper ved «noen AI-spor». Det er en målt grense, ikke en funksjon som gjenstår å bygge.
De svakere vurderingene, som er mer støyete
De fleste lesere ser aldri den sterkeste vurderingen. De ser en av disse, og feilratene her er de som faktisk gjelder dem. Det nedre engelske ravgule båndet er det klart mest støyete.
| Profil | Vurdering | Terskel | Falske positiver | Observert |
|---|---|---|---|---|
| Engelsk · over 400 ord | Noen AI-spor | ≥ 96 | høyst 5,86 % | 6 av 199 |
| Engelsk · over 400 ord | Noen AI-spor (nedre ravgule bånd) | ≥ 91 | høyst 8,37 % | 10 av 199 |
| Tysk · over 400 ord | Noen AI-spor | ≥ 88 | høyst 4,02 % | 31 av 1 035 |
| Tysk · over 400 ord | Noen AI-spor (nedre ravgule bånd) | ≥ 85 | høyst 6,18 % | 51 av 1 035 |
Hva disse tallene ikke er
- Null observert er ikke null. Ingen av de to lange profilene ga en eneste falsk positiv ved den strengeste terskelen i de rå strukturkorpusene. Vi publiserer likevel den øvre grensen på 95 % for den utvalgsstørrelsen, fordi å skrive «0 %» ville vært nettopp den overdrevne sikkerheten denne siden finnes for å motvirke.
- Det engelske korpuset er av feil sjanger. De dokumentene er tidsskriftartikler: redigerte, profesjonelle, skrevet av grupper. En studentoppgave er ingenting av det. Andelen er ærlig målt på det den sier den er målt på, og de engelske tersklene blir liggende til det finnes nok studentoppgaver på engelsk som andrespråk til å begrunne en flytting.
- Kort tekst har ingen publisert andel. Den korte profilen gjelder et vindu på noen hundre ord, og ingen menneskelige korpus vi har, kommer fra det vinduet. Andelene som stod her, ble fjernet 21. august 2026 i stedet for å bli stående, fordi et plausibelt tall uten en populasjon bak fortsatt er en ubegrunnet påstand.
- AI-korpusene er små: rundt tjue dokumenter per språk, fra to modellfamilier. En modell vi ikke har testet, kan oppføre seg annerledes.
- Norsk er ikke kalibrert. En norsk tekst får en vurdering som bare bygger på tekstens struktur, foreløpig, uten noen påstand om treffsikkerhet, og får aldri en rød vurdering.
Hva vi målte på
Hvert menneskelige dokument nedenfor ble publisert før ChatGPT fantes, så spørsmålet om hvem som skrev det, er ikke et skjønn.
Tyske studentoppgaver, 2010-2021
n = 866
Hele dokumenter, på språket og i sjangeren vi betjener på tysk, menneskelige per definisjon fordi de er eldre enn ChatGPT. Det er korpuset de tyske tersklene er satt på.
scripts/fetch-thesis-negatives.mjs
Valideringshalvdelen for kombinasjonen: tyske studentoppgaver, 2008-2021, hele dokumenter
n = 1 035
Den tilbakeholdte halvdelen av ekte tyske oppgaver (MOnAMi, Hochschule Mittweida, 2008-2021), vurdert av BEGGE halvdelene av analysen: hele dokumenter, aldri brukt til å trene den tyske modellen. De kombinerte tyske tersklene er skåret på den. Det er ikke tekster fra kundenes tid: en polert oppgave fra 2026 er en populasjon ingen har målt, og det forbeholdet er en del av tallet.
scripts/calibrate-components.mjs
Open access-artikler, før 2022
n = 1 412
Fullstendig akademisk prosa. Tidsskriftartikler er redigerte og skrevet av grupper, altså ikke studenttekst: derfor flyttes ikke de engelske tersklene ut fra dem.
scripts/fetch-longform-corpus.mjs
Valideringshalvdelen for kombinasjonen: artikler + arXiv, utdrag på 1 500 ord
n = 199
Den tilbakeholdte halvdelen av engelske dokumenter (arXiv og open access-artikler fra før 2022), vurdert av BEGGE halvdelene av analysen. De kombinerte tersklene er skåret på den. Tidsskriftprosa, ikke studenttekst: vi sier det fordi det forbeholdet er en del av tallet.
scripts/calibrate-components.mjs
arXiv-sammendrag, før 2022
n = 236
Korte tekster på engelsk. Tatt vare på for arbeidet med AUC; vi publiserer ingen andel falske positiver for dem, fordi et kort vurderingsvindu ikke er det et sammendragskorpus måler.
scripts/fetch-human-corpus.mjs
Tyske akademiske sammendrag, før 2022
n = 60
OpenAlex, filtrert på tyske funksjonsord fordi språkfeltet er upålitelig. Det ligger bak beslutningen om ikke å gi vurderingen «tydelige AI-spor» i det hele tatt for kort tysk tekst.
scripts/fetch-german-corpus.mjs
En gang publiserte vi nesten en detektor som var dårligere enn å kaste mynt
I en tidlig versjon ga målingen på 236 arXiv-sammendrag fra før 2022 en AUC på 0.184. Å kaste mynt gir 0,50. Detektoren vurderte maskinskrevet tekst som mer menneskelig enn tekst skrevet av mennesker; å snu resultatet ville gjort den bedre. Og hele tiden hadde den gitt selvsikre prosentsatser.
Årsaken var en familie av mål på ordrikdom (Yules K, MTLD, Zipf-eksponenten, hapax legomena), alle i feil retning og med sterke effekter. De vurderer tett menneskelig akademisk prosa som maskinell og leksikalsk variert maskinprosa som menneskelig. Det er den samme mekanismen som ligger bak det publiserte resultatet om at detektorer feilaktig flagger et flertall av dem som skriver på engelsk som andrespråk.
I dag veier de målene null. De blir fortsatt beregnet og vist som spor, men de flytter ikke poengsummen. Vi publiserer det fordi det er det sterkeste argumentet vi har for å måle: feilen var usynlig i resultatet og tydelig i korpuset, og en detektor som aldri har tatt denne testen, vet ikke om den har det samme problemet.
Hva ingen detektor kan gjøre
Ingen AI-detektor, heller ikke denne, er et bevis på hvem som har skrevet en tekst. Verktøyene måler statistiske egenskaper ved teksten, og formell, strukturert menneskelig tekst eller tekst på et andrespråk deler mange av dem. En poengsum er en grunn til å stille et spørsmål, aldri til å trekke en konklusjon.
Sjekk teksten din
Gratis, uten konto. På norsk bygger vurderingen på tekstens struktur og viser deg hvilke setninger som veier; denne siden forteller hva som er målt og hva som ikke er det.
Start den gratis AI-detektorenForskere og journalister: korpusene, evalueringskoden og kalibreringsverktøyene ligger alle i repositoryet bak dette nettstedet. Hvis du vil gjenskape eller utfordre et tall på denne siden, skriv til contact@thesisdraft.com, så hjelper vi deg.