Benchmark

Hur ofta vår AI-kontroll har fel om en människa

Varje AI-detektor ger en självsäker procentsats. Ingen talar om hur ofta den procentsatsen har fel om någon som skrev sitt arbete själv. Det andra talet är det som räknas om du är studenten som anklagas, så det är det vi publicerar, för de språk där vi har mätt det.

Senast mätt: 24 augusti 2026. Varje siffra nedan kommer från ett skript i vårt repository som kan köras om på samma märkta korpusar.

Ingen av de här andelarna har mätts på svenska.

Siffrorna på den här sidan mättes på engelska och tyska texter, och de hör till de språken: att skriva dem på svenska gör dem inte svenska. En svensk text bedöms bara utifrån textens struktur (skrivstilen visas men räknas inte), och preliminärt: vi har ännu ingen korpus av svenska uppsatser som säkert är skrivna av människor, så vi kan inte säga hur ofta vi har fel om en svensk text, och så länge det är så ger kontrollen aldrig ett rött utlåtande på svenska. Vi säger hellre det än utger en engelsk siffra för din.

Uppmätta andelar falska positiva

Hur ofta en akademisk text som säkert är skriven av en människa får vårt starkaste utlåtande. Träffsäkerhet är inte en enda siffra: den ändras med språket och dokumentets längd, så vi redovisar fyra profiler i stället för ett genomsnitt som skulle dölja de svaga. Varje andel är en övre gräns på 95 % och inte det observerade antalet: gränsen är vad vi har rätt att påstå, och den är alltid den sämre av de två. Tröskelvärdena i tabellerna ligger på våra interna mätskalor; poängen som visas är samma information på en fast axel, med bärnsten från 20 och rött från 50.

ProfilStarkaste utlåtandeFalska positivaObserveradeMätt på
Engelska · över 400 ordTydliga AI-spårhögst 3,13 %2 av 199199 EN-dokument i valideringshalvan (kombinerad skala, w_style=0,5)
Tyska · över 400 ordTydliga AI-spårhögst 1,63 %10 av 1 0351 035 tyska uppsatser i valideringshalvan (kombinerad skala, w_style=0,5)
Engelska · under 400 ordTydliga AI-spårej publicerad-ingen relevant mänsklig population tillgänglig
Tyska · under 400 ordutlåtandet «tydliga AI-spår» ges aldrig---

En kort tysk text får aldrig utlåtandet «tydliga AI-spår», och med nuvarande underlag kommer den inte att få det.

För kort tysk text kostar varje tröskel som är sträng nog att känna igen AI på ett tillförlitligt sätt omkring 7 falska anklagelser på 100. En oskyldig student av femton är inget byte vi accepterar, så den korta tyska profilen stannar vid «vissa AI-spår». Det är en uppmätt gräns, inte en funktion som återstår att bygga.

De svagare utlåtandena, som är brusigare

De flesta läsare ser aldrig det starkaste utlåtandet. De ser något av dessa, och felfrekvenserna här är de som faktiskt gäller dem. Det nedre engelska bärnstensbandet är det överlägset brusigaste.

ProfilUtlåtandeTröskelFalska positivaObserverade
Engelska · över 400 ordVissa AI-spår≥ 96högst 5,86 %6 av 199
Engelska · över 400 ordVissa AI-spår (nedre bärnstensbandet)≥ 91högst 8,37 %10 av 199
Tyska · över 400 ordVissa AI-spår≥ 88högst 4,02 %31 av 1 035
Tyska · över 400 ordVissa AI-spår (nedre bärnstensbandet)≥ 85högst 6,18 %51 av 1 035

Vad de här siffrorna inte är

Vad vi mätte på

Varje mänskligt dokument nedan publicerades innan ChatGPT fanns, så frågan om vem som skrev det är ingen bedömningsfråga.

Tyska studentuppsatser, 2010-2021

n = 866

Hela dokument, på det språk och i den genre vi betjänar på tyska, mänskliga per definition eftersom de är äldre än ChatGPT. Det är korpusen de tyska tröskelvärdena är satta på.

scripts/fetch-thesis-negatives.mjs

Valideringshalvan för kombinationen: tyska studentuppsatser, 2008-2021, hela dokument

n = 1 035

Den undanhållna halvan av riktiga tyska uppsatser (MOnAMi, Hochschule Mittweida, 2008-2021), bedömd av BÅDA halvorna av analysen: hela dokument, aldrig använda för att träna den tyska modellen. De kombinerade tyska tröskelvärdena är skurna på den. Det är inte texter från våra kunders tid: en finslipad uppsats från 2026 är en population ingen har mätt, och den reservationen är en del av siffran.

scripts/calibrate-components.mjs

Open access-artiklar, före 2022

n = 1 412

Fullständig akademisk prosa. Tidskriftsartiklar är redigerade och skrivna av grupper, alltså inte studenttext: därför flyttas de engelska tröskelvärdena inte utifrån dem.

scripts/fetch-longform-corpus.mjs

Valideringshalvan för kombinationen: artiklar + arXiv, utdrag på 1 500 ord

n = 199

Den undanhållna halvan av engelska dokument (arXiv och open access-artiklar från före 2022), bedömd av BÅDA halvorna av analysen. De kombinerade tröskelvärdena är skurna på den. Tidskriftsprosa, inte studenttext: vi säger det eftersom den reservationen är en del av siffran.

scripts/calibrate-components.mjs

arXiv-abstracts, före 2022

n = 236

Korta texter på engelska. Sparade för arbetet med AUC; vi publicerar ingen andel falska positiva för dem, eftersom ett kort utlåtandefönster inte är vad en abstractkorpus mäter.

scripts/fetch-human-corpus.mjs

Tyska akademiska abstracts, före 2022

n = 60

OpenAlex, filtrerat på tyska funktionsord eftersom språkfältet är opålitligt. Det ligger bakom beslutet att inte alls ge utlåtandet «tydliga AI-spår» för kort tysk text.

scripts/fetch-german-corpus.mjs

En gång publicerade vi nästan en detektor som var sämre än att singla slant

I en tidig version gav mätningen på 236 arXiv-abstracts från före 2022 en AUC på 0.184. Att singla slant ger 0,50. Detektorn bedömde maskinskriven text som mer mänsklig än text skriven av människor; att vända på resultatet hade gjort den bättre. Och hela tiden hade den gett självsäkra procentsatser.

Orsaken var en familj av mått på ordrikedom (Yules K, MTLD, Zipf-exponenten, hapax legomena), alla åt fel håll och med starka effekter. De bedömer tät mänsklig akademisk prosa som maskinell och lexikalt varierad maskinprosa som mänsklig. Det är samma mekanism som ligger bakom det publicerade resultatet att detektorer felaktigt flaggar en majoritet av dem som skriver på engelska som andraspråk.

I dag väger de måtten noll. De räknas fortfarande ut och visas som ledtrådar, men de flyttar inte poängen. Vi publicerar det eftersom det är det starkaste argument vi har för att mäta: felet var osynligt i resultatet och uppenbart i korpusen, och en detektor som aldrig har gjort det här testet vet inte om den har samma problem.

Vad ingen detektor kan göra

Ingen AI-detektor, inte heller den här, är ett bevis på vem som skrivit en text. Verktygen mäter statistiska egenskaper i texten, och formell, strukturerad mänsklig text eller text på ett andraspråk delar många av dem. En poäng är ett skäl att ställa en fråga, aldrig att dra en slutsats.

Kontrollera din text

Gratis, utan konto. På svenska bygger utlåtandet på textens struktur och visar dig vilka meningar som väger in; den här sidan säger vad som är mätt och vad som inte är det.

Starta den gratis AI-kontrollen

Forskare och journalister: korpusarna, utvärderingskoden och kalibreringsverktygen finns alla i repositoryt bakom den här webbplatsen. Om du vill återskapa eller ifrågasätta en siffra på den här sidan, skriv till contact@thesisdraft.com så hjälper vi dig.