Primerjalna meritev
Kako pogosto se naš AI detektor zmoti pri človeku
Vsak AI detektor vrne samozavesten odstotek. Noben vam ne pove, kako pogosto se ta odstotek zmoti pri nekom, ki je svoje delo napisal sam. Prav ta druga številka šteje, če ste vi obtoženi študent, zato jo objavljamo, za jezike, v katerih smo jo izmerili.
Nazadnje izmerjeno: 24. avgust 2026. Vsaka spodnja številka izvira iz skripte v našem repozitoriju, ki jo je mogoče znova zagnati na istih označenih korpusih.
Noben od teh deležev ni bil izmerjen v slovenščini.
Številke na tej strani so bile izmerjene na angleških in nemških besedilih in ostajajo vezane na ta jezika: zapis v slovenščini iz njih ne naredi slovenskih številk. Slovensko besedilo se ocenjuje samo po strukturi besedila (slog pisanja je prikazan, vendar ne šteje), in to začasno: še nimamo korpusa slovenskih nalog, ki so jih dokazano napisali ljudje, zato vam ne moremo povedati, kako pogosto se pri slovenskem besedilu zmotimo, in dokler bo tako, detektor v slovenščini nikoli ne da rdeče ocene. Raje vam to povemo, kot da bi angleško številko predstavili kot vašo.
Izmerjeni deleži lažno pozitivnih rezultatov
Kako pogosto dobi znanstveno besedilo, ki ga je dokazano napisal človek, našo najmočnejšo oceno. Natančnost ni ena številka: spreminja se z jezikom in dolžino dokumenta, zato poročamo o štirih profilih namesto o povprečju, ki bi skrilo šibke. Vsak delež je zgornja meja 95-odstotnega intervala, ne opaženo število: meja je tisto, kar smemo trditi, in je vedno slabša od obeh. Pragovi v teh tabelah so na naših notranjih merilnih lestvicah; prikazana ocena je ista informacija na fiksni osi, z jantarno od 20 in rdečo od 50.
| Profil | Najmočnejša ocena | Lažno pozitivni | Opaženo | Izmerjeno na |
|---|---|---|---|---|
| Angleščina · nad 400 besed | Izrazite sledi UI | največ 3,13 % | 2 od 199 | Dokumenti EN iz validacijske polovice (kombinirana lestvica, w_style=0,5): 199 |
| Nemščina · nad 400 besed | Izrazite sledi UI | največ 1,63 % | 10 od 1035 | Nemška dela iz validacijske polovice (kombinirana lestvica, w_style=0,5): 1035 |
| Angleščina · pod 400 besed | Izrazite sledi UI | ni objavljeno | - | nimamo ustrezne človeške populacije |
| Nemščina · pod 400 besed | ocena »izrazite sledi UI« se nikoli ne izda | - | - | - |
Kratko nemško besedilo nikoli ne dobi ocene »izrazite sledi UI« in je z današnjimi dokazi tudi ne bo.
Pri kratki nemščini noben prag, ki je dovolj strog za zanesljivo prepoznavanje UI, ne stane manj kot približno 7 lažnih obtožb na 100. En nedolžen študent od petnajstih ni kupčija, ki jo sprejmemo, zato se kratki nemški profil ustavi pri »nekaj sledeh UI«. To je izmerjena meja, ne funkcija, ki je še v gradnji.
Šibkejše ocene, ki so bolj šumne
Večina bralcev najmočnejše ocene nikoli ne vidi. Vidi eno od teh, in deleži napak tukaj so tisti, ki jih zares zadevajo. Spodnji angleški jantarni pas je daleč najbolj šumen.
| Profil | Ocena | Prag | Lažno pozitivni | Opaženo |
|---|---|---|---|---|
| Angleščina · nad 400 besed | Nekaj sledi UI | ≥ 96 | največ 5,86 % | 6 od 199 |
| Angleščina · nad 400 besed | Nekaj sledi UI (spodnji jantarni pas) | ≥ 91 | največ 8,37 % | 10 od 199 |
| Nemščina · nad 400 besed | Nekaj sledi UI | ≥ 88 | največ 4,02 % | 31 od 1035 |
| Nemščina · nad 400 besed | Nekaj sledi UI (spodnji jantarni pas) | ≥ 85 | največ 6,18 % | 51 od 1035 |
Kaj te številke niso
- Opažena ničla ni ničla. Noben od dolgih profilov pri najstrožjem pragu v surovih strukturnih korpusih ni dal niti enega lažno pozitivnega rezultata. Kljub temu objavljamo zgornjo mejo 95-odstotnega intervala za to velikost vzorca, ker bi zapis »0 %« bil prav tista pretirana samozavest, proti kateri obstaja ta stran.
- Angleški korpus je napačnega žanra. Ti dokumenti so revijalni članki: urejeni, profesionalni, napisani v ekipah. Študentska naloga ni nič od tega. Delež je pošteno izmerjen na tem, na čemer pravi, da je izmerjen, angleški pragovi pa ostanejo, kjer so, dokler ne bo dovolj študentskih nalog v angleščini kot drugem jeziku, da bi upravičile njihov premik.
- Kratko besedilo nima objavljenega deleža. Kratki profil zadeva okno nekaj sto besed in noben človeški korpus, ki ga imamo, ne izvira iz takega okna. Deleže, ki so bili tu, smo 21. avgusta 2026 odstranili, namesto da bi jih pustili, ker je verjetna številka brez populacije za njo še vedno neutemeljena trditev.
- Korpusi UI so majhni: približno dvajset dokumentov na jezik, iz dveh družin modelov. Model, ki ga nismo testirali, se lahko obnaša drugače.
- Slovenščina ni kalibrirana. Slovensko besedilo dobi oceno, ki temelji samo na strukturi besedila, začasno, brez kakršne koli trditve o natančnosti, in nikoli ne dobi rdeče ocene.
Na čem smo merili
Vsak spodnji človeški dokument je bil objavljen, preden je ChatGPT obstajal, zato njegovo avtorstvo ni stvar presoje.
Zaključna dela nemških študentov, 2010-2021
n = 866
Celotni dokumenti, v jeziku in žanru, ki ga v nemščini pokrivamo, človeški že po zasnovi, ker so starejši od ChatGPT. Na tem korpusu so nastavljeni nemški pragovi.
scripts/fetch-thesis-negatives.mjs
Validacijska polovica kombinacije: zaključna dela nemških študentov, 2008-2021, celotni dokumenti
n = 1035
Odložena polovica resničnih nemških zaključnih del (MOnAMi, Hochschule Mittweida, 2008-2021), ki sta jo ocenili OBE polovici analize: celotni dokumenti, nikoli uporabljeni za učenje nemškega modela. Kombinirani nemški pragovi so določeni na njej. To niso besedila iz časa naših strank: izpiljena naloga iz leta 2026 je populacija, ki je ni izmeril nihče, in ta pridržek je del številke.
scripts/calibrate-components.mjs
Članki v odprtem dostopu, pred letom 2022
n = 1412
Celotna znanstvena proza. Članke v revijah urejajo in pišejo ekipe, zato to ni študentsko pisanje: zaradi tega angleških pragov po njih ne premikamo.
scripts/fetch-longform-corpus.mjs
Validacijska polovica kombinacije: članki + arXiv, izseki po 1.500 besed
n = 199
Odložena polovica angleških dokumentov (arXiv in članki v odprtem dostopu pred letom 2022), ki sta jo ocenili OBE polovici analize. Kombinirani pragovi so določeni na njej. Revijalna proza, ne študentsko pisanje: to povemo, ker je ta pridržek del številke.
scripts/calibrate-components.mjs
Povzetki arXiv, pred letom 2022
n = 236
Kratka angleška besedila. Ohranjena za delo na AUC; iz njih ne objavljamo deleža lažno pozitivnih rezultatov, ker kratko okno ocene ni tisto, kar meri korpus povzetkov.
scripts/fetch-human-corpus.mjs
Nemški znanstveni povzetki, pred letom 2022
n = 60
OpenAlex, filtriran po nemških funkcijskih besedah, ker je polje jezika nezanesljivo. Na njem temelji odločitev, da pri kratki nemščini ocene »izrazite sledi UI« sploh ne izdamo.
scripts/fetch-german-corpus.mjs
Nekoč smo skoraj objavili detektor, slabši od meta kovanca
V eni od zgodnjih različic je meritev na povzetkih arXiv pred letom 2022 (236) dala AUC 0.184. Met kovanca ima 0,50. Detektor je strojno napisano besedilo uvrščal kot bolj človeško od besedila, ki so ga napisali ljudje; obrnjen rezultat bi ga izboljšal. In ves čas je vračal samozavestne odstotke.
Vzrok je bila družina kazalnikov leksikalne bogatosti (Yulov K, MTLD, Zipfov eksponent, hapax legomena), vsi obrnjeni in z močnim učinkom. Gosto človeško znanstveno prozo ocenijo kot strojno, leksikalno raznoliko strojno prozo pa kot človeško. Gre za isti mehanizem kot za objavljeno ugotovitvijo, da detektorji napačno označijo večino ljudi, ki pišejo v angleščini kot drugem jeziku.
Danes imajo ti kazalniki težo nič. Še vedno se izračunajo in prikažejo kot namigi, vendar oceno ne premaknejo. Objavljamo to, ker je to naš najmočnejši argument za merjenje: napaka je bila iz rezultata nevidna in iz korpusa očitna, detektor, ki tega testa ni nikoli opravil, pa ne ve, ali nima iste težave.
Česa noben detektor ne zmore
Noben AI detektor, vključno s tem, ni dokaz avtorstva. Ta orodja merijo statistične lastnosti besedila, formalno, strukturirano ali v drugem jeziku napisano človeško besedilo pa mnoge od njih deli. Ocena je razlog za vprašanje, nikoli razlog za sklep.
Preverite svoje besedilo
Prvih 1500 besed je brezplačnih, brez računa. V slovenščini ocena temelji na strukturi besedila in vam pokaže stavke, ki nanjo vplivajo; ta stran vam pove, kaj je izmerjeno in kaj ne.
Zaženi brezplačni AI detektorRaziskovalci in novinarji: korpusi, koda za vrednotenje in orodja za kalibracijo so v repozitoriju za to spletno stranjo. Če želite katero od številk na tej strani ponoviti ali izpodbijati, pišite na contact@thesisdraft.com in pomagali vam bomo.