Primerjalna meritev

Kako pogosto se naš AI detektor zmoti pri človeku

Vsak AI detektor vrne samozavesten odstotek. Noben vam ne pove, kako pogosto se ta odstotek zmoti pri nekom, ki je svoje delo napisal sam. Prav ta druga številka šteje, če ste vi obtoženi študent, zato jo objavljamo, za jezike, v katerih smo jo izmerili.

Nazadnje izmerjeno: 24. avgust 2026. Vsaka spodnja številka izvira iz skripte v našem repozitoriju, ki jo je mogoče znova zagnati na istih označenih korpusih.

Noben od teh deležev ni bil izmerjen v slovenščini.

Številke na tej strani so bile izmerjene na angleških in nemških besedilih in ostajajo vezane na ta jezika: zapis v slovenščini iz njih ne naredi slovenskih številk. Slovensko besedilo se ocenjuje samo po strukturi besedila (slog pisanja je prikazan, vendar ne šteje), in to začasno: še nimamo korpusa slovenskih nalog, ki so jih dokazano napisali ljudje, zato vam ne moremo povedati, kako pogosto se pri slovenskem besedilu zmotimo, in dokler bo tako, detektor v slovenščini nikoli ne da rdeče ocene. Raje vam to povemo, kot da bi angleško številko predstavili kot vašo.

Izmerjeni deleži lažno pozitivnih rezultatov

Kako pogosto dobi znanstveno besedilo, ki ga je dokazano napisal človek, našo najmočnejšo oceno. Natančnost ni ena številka: spreminja se z jezikom in dolžino dokumenta, zato poročamo o štirih profilih namesto o povprečju, ki bi skrilo šibke. Vsak delež je zgornja meja 95-odstotnega intervala, ne opaženo število: meja je tisto, kar smemo trditi, in je vedno slabša od obeh. Pragovi v teh tabelah so na naših notranjih merilnih lestvicah; prikazana ocena je ista informacija na fiksni osi, z jantarno od 20 in rdečo od 50.

ProfilNajmočnejša ocenaLažno pozitivniOpaženoIzmerjeno na
Angleščina · nad 400 besedIzrazite sledi UInajveč 3,13 %2 od 199Dokumenti EN iz validacijske polovice (kombinirana lestvica, w_style=0,5): 199
Nemščina · nad 400 besedIzrazite sledi UInajveč 1,63 %10 od 1035Nemška dela iz validacijske polovice (kombinirana lestvica, w_style=0,5): 1035
Angleščina · pod 400 besedIzrazite sledi UIni objavljeno-nimamo ustrezne človeške populacije
Nemščina · pod 400 besedocena »izrazite sledi UI« se nikoli ne izda---

Kratko nemško besedilo nikoli ne dobi ocene »izrazite sledi UI« in je z današnjimi dokazi tudi ne bo.

Pri kratki nemščini noben prag, ki je dovolj strog za zanesljivo prepoznavanje UI, ne stane manj kot približno 7 lažnih obtožb na 100. En nedolžen študent od petnajstih ni kupčija, ki jo sprejmemo, zato se kratki nemški profil ustavi pri »nekaj sledeh UI«. To je izmerjena meja, ne funkcija, ki je še v gradnji.

Šibkejše ocene, ki so bolj šumne

Večina bralcev najmočnejše ocene nikoli ne vidi. Vidi eno od teh, in deleži napak tukaj so tisti, ki jih zares zadevajo. Spodnji angleški jantarni pas je daleč najbolj šumen.

ProfilOcenaPragLažno pozitivniOpaženo
Angleščina · nad 400 besedNekaj sledi UI≥ 96največ 5,86 %6 od 199
Angleščina · nad 400 besedNekaj sledi UI (spodnji jantarni pas)≥ 91največ 8,37 %10 od 199
Nemščina · nad 400 besedNekaj sledi UI≥ 88največ 4,02 %31 od 1035
Nemščina · nad 400 besedNekaj sledi UI (spodnji jantarni pas)≥ 85največ 6,18 %51 od 1035

Kaj te številke niso

Na čem smo merili

Vsak spodnji človeški dokument je bil objavljen, preden je ChatGPT obstajal, zato njegovo avtorstvo ni stvar presoje.

Zaključna dela nemških študentov, 2010-2021

n = 866

Celotni dokumenti, v jeziku in žanru, ki ga v nemščini pokrivamo, človeški že po zasnovi, ker so starejši od ChatGPT. Na tem korpusu so nastavljeni nemški pragovi.

scripts/fetch-thesis-negatives.mjs

Validacijska polovica kombinacije: zaključna dela nemških študentov, 2008-2021, celotni dokumenti

n = 1035

Odložena polovica resničnih nemških zaključnih del (MOnAMi, Hochschule Mittweida, 2008-2021), ki sta jo ocenili OBE polovici analize: celotni dokumenti, nikoli uporabljeni za učenje nemškega modela. Kombinirani nemški pragovi so določeni na njej. To niso besedila iz časa naših strank: izpiljena naloga iz leta 2026 je populacija, ki je ni izmeril nihče, in ta pridržek je del številke.

scripts/calibrate-components.mjs

Članki v odprtem dostopu, pred letom 2022

n = 1412

Celotna znanstvena proza. Članke v revijah urejajo in pišejo ekipe, zato to ni študentsko pisanje: zaradi tega angleških pragov po njih ne premikamo.

scripts/fetch-longform-corpus.mjs

Validacijska polovica kombinacije: članki + arXiv, izseki po 1.500 besed

n = 199

Odložena polovica angleških dokumentov (arXiv in članki v odprtem dostopu pred letom 2022), ki sta jo ocenili OBE polovici analize. Kombinirani pragovi so določeni na njej. Revijalna proza, ne študentsko pisanje: to povemo, ker je ta pridržek del številke.

scripts/calibrate-components.mjs

Povzetki arXiv, pred letom 2022

n = 236

Kratka angleška besedila. Ohranjena za delo na AUC; iz njih ne objavljamo deleža lažno pozitivnih rezultatov, ker kratko okno ocene ni tisto, kar meri korpus povzetkov.

scripts/fetch-human-corpus.mjs

Nemški znanstveni povzetki, pred letom 2022

n = 60

OpenAlex, filtriran po nemških funkcijskih besedah, ker je polje jezika nezanesljivo. Na njem temelji odločitev, da pri kratki nemščini ocene »izrazite sledi UI« sploh ne izdamo.

scripts/fetch-german-corpus.mjs

Nekoč smo skoraj objavili detektor, slabši od meta kovanca

V eni od zgodnjih različic je meritev na povzetkih arXiv pred letom 2022 (236) dala AUC 0.184. Met kovanca ima 0,50. Detektor je strojno napisano besedilo uvrščal kot bolj človeško od besedila, ki so ga napisali ljudje; obrnjen rezultat bi ga izboljšal. In ves čas je vračal samozavestne odstotke.

Vzrok je bila družina kazalnikov leksikalne bogatosti (Yulov K, MTLD, Zipfov eksponent, hapax legomena), vsi obrnjeni in z močnim učinkom. Gosto človeško znanstveno prozo ocenijo kot strojno, leksikalno raznoliko strojno prozo pa kot človeško. Gre za isti mehanizem kot za objavljeno ugotovitvijo, da detektorji napačno označijo večino ljudi, ki pišejo v angleščini kot drugem jeziku.

Danes imajo ti kazalniki težo nič. Še vedno se izračunajo in prikažejo kot namigi, vendar oceno ne premaknejo. Objavljamo to, ker je to naš najmočnejši argument za merjenje: napaka je bila iz rezultata nevidna in iz korpusa očitna, detektor, ki tega testa ni nikoli opravil, pa ne ve, ali nima iste težave.

Česa noben detektor ne zmore

Noben AI detektor, vključno s tem, ni dokaz avtorstva. Ta orodja merijo statistične lastnosti besedila, formalno, strukturirano ali v drugem jeziku napisano človeško besedilo pa mnoge od njih deli. Ocena je razlog za vprašanje, nikoli razlog za sklep.

Preverite svoje besedilo

Prvih 1500 besed je brezplačnih, brez računa. V slovenščini ocena temelji na strukturi besedila in vam pokaže stavke, ki nanjo vplivajo; ta stran vam pove, kaj je izmerjeno in kaj ne.

Zaženi brezplačni AI detektor

Raziskovalci in novinarji: korpusi, koda za vrednotenje in orodja za kalibracijo so v repozitoriju za to spletno stranjo. Če želite katero od številk na tej strani ponoviti ali izpodbijati, pišite na contact@thesisdraft.com in pomagali vam bomo.