Mjerenje

Koliko često naš AI detektor griješi o čovjeku

Svaki AI detektor daje samouvjeren postotak. Nijedan ti ne kaže koliko često taj postotak griješi o nekome tko je svoj rad napisao sam. Taj drugi broj je onaj koji je važan ako je optužba usmjerena na tebe, pa ga zato objavljujemo, za jezike na kojima smo ga izmjerili.

Posljednje mjerenje: 24. kolovoza 2026.. Svaki broj u nastavku dolazi iz skripte u našem repozitoriju koja se može ponovno pokrenuti na istim označenim korpusima.

Nijedna od ovih stopa nije izmjerena na hrvatskom.

Brojevi na ovoj stranici izmjereni su na engleskim i njemačkim tekstovima i ostaju vezani uz te jezike: to što su napisani na hrvatskom ne čini ih hrvatskima. Hrvatski tekst ocjenjuje se samo prema strukturi teksta (stil pisanja je prikazan, ali se ne računa), privremeno: još nemamo korpus hrvatskih radova za koje sigurno znamo da su ih napisali ljudi, pa ti ne možemo reći koliko često griješimo na hrvatskom tekstu, i dok je tako detektor na hrvatskom nikad ne daje crvenu ocjenu. Radije ti to kažemo nego da ti engleski broj predstavimo kao tvoj.

Izmjerene stope lažno pozitivnih rezultata

Koliko često akademski tekst za koji sigurno znamo da ga je napisao čovjek dobije našu najjaču ocjenu. Točnost nije jedan broj: mijenja se s jezikom i duljinom dokumenta, pa navodimo četiri profila umjesto prosjeka koji bi sakrio one slabe. Svaka stopa je gornja granica od 95 %, a ne opaženi broj: granica je ono što imamo pravo tvrditi, i uvijek je lošija od dviju vrijednosti. Pragovi u ovim tablicama nalaze se na našim internim mjernim ljestvicama; prikazani rezultat ista je informacija na fiksnoj osi, s jantarnom od 20 i crvenom od 50.

ProfilNajjača ocjenaLažno pozitivniOpaženoIzmjereno na
Engleski · više od 400 riječiJasni AI tragovinajviše 3,13 %2 od 199199 EN dokumenata validacijske polovice (kombinirana ljestvica, w_style=0,5)
Njemački · više od 400 riječiJasni AI tragovinajviše 1,63 %10 od 1.0351.035 njemačkih radova validacijske polovice (kombinirana ljestvica, w_style=0,5)
Engleski · manje od 400 riječiJasni AI tragovinije objavljeno-nemamo relevantnu ljudsku populaciju
Njemački · manje od 400 riječiocjena «jasni AI tragovi» nikad se ne izdaje---

Kratki njemački tekst nikad ne dobiva ocjenu «jasni AI tragovi», i s današnjim dokazima neće je dobiti.

Na kratkom njemačkom tekstu nijedan prag dovoljno strog da pouzdano prepozna AI ne košta manje od otprilike 7 lažnih optužbi na 100. Jedan nedužan student od petnaest nije razmjena koju prihvaćamo, pa se kratki njemački profil zaustavlja na «neki AI tragovi». To je izmjereno ograničenje, a ne funkcija koju tek treba izgraditi.

Slabije ocjene, koje su bučnije

Većina čitatelja nikad ne vidi najjaču ocjenu. Vide jednu od ovih, a ovdje su stope pogreške one koje ih se stvarno tiču. Niži engleski jantarni raspon daleko je najbučniji.

ProfilOcjenaPragLažno pozitivniOpaženo
Engleski · više od 400 riječiNeki AI tragovi≥ 96najviše 5,86 %6 od 199
Engleski · više od 400 riječiNeki AI tragovi (niži jantarni raspon)≥ 91najviše 8,37 %10 od 199
Njemački · više od 400 riječiNeki AI tragovi≥ 88najviše 4,02 %31 od 1.035
Njemački · više od 400 riječiNeki AI tragovi (niži jantarni raspon)≥ 85najviše 6,18 %51 od 1.035

Što ovi brojevi nisu

Na čemu smo mjerili

Svaki ljudski dokument u nastavku objavljen je prije nego što je ChatGPT postojao, pa njegovo autorstvo nije stvar procjene.

Njemački studentski radovi, 2010.-2021.

n = 866

Cijeli dokumenti, na jeziku i u žanru koji opslužujemo na njemačkom, ljudski po konstrukciji jer prethode ChatGPT-u. Na tom su korpusu postavljeni njemački pragovi.

scripts/fetch-thesis-negatives.mjs

Validacijska polovica kombinacije: njemački studentski radovi, 2008.-2021., cijeli dokumenti

n = 1.035

Izdvojena polovica stvarnih njemačkih radova (MOnAMi, Hochschule Mittweida, 2008.-2021.), ocijenjena s OBJE polovice provjere: cijeli dokumenti, nikad korišteni za treniranje njemačkog modela. Na njoj su odrezani kombinirani njemački pragovi. To nisu tekstovi iz vremena naših korisnika: dotjeran rad iz 2026. populacija je koju nitko nije izmjerio, i ta je napomena dio broja.

scripts/calibrate-components.mjs

Članci otvorenog pristupa, prije 2022.

n = 1.412

Potpuna akademska proza. Članci u časopisima uređeni su i pisani u timovima, pa nisu studentsko pisanje: zato se engleski pragovi ne pomiču prema njima.

scripts/fetch-longform-corpus.mjs

Validacijska polovica kombinacije: članci + arXiv, isječci od 1.500 riječi

n = 199

Izdvojena polovica engleskih dokumenata (arXiv i članci otvorenog pristupa prije 2022.), ocijenjena s OBJE polovice provjere. Na njoj su odrezani kombinirani pragovi. Proza iz časopisa, ne studentsko pisanje: kažemo to jer je ta napomena dio broja.

scripts/calibrate-components.mjs

arXiv sažeci, prije 2022.

n = 236

Kratki tekstovi na engleskom. Čuvaju se za rad na AUC-u; ne objavljujemo nikakvu stopu lažno pozitivnih rezultata iz njih, jer kratki prozor ocjene nije ono što mjeri korpus sažetaka.

scripts/fetch-human-corpus.mjs

Njemački akademski sažeci, prije 2022.

n = 60

OpenAlex, filtriran po njemačkim funkcionalnim riječima jer je polje jezika nepouzdano. Na njemu se temelji odluka da se na kratkom njemačkom tekstu ocjena «jasni AI tragovi» uopće ne izdaje.

scripts/fetch-german-corpus.mjs

Jednom smo umalo objavili detektor lošiji od bacanja novčića

U ranoj verziji mjerenje na 236 arXiv sažetaka prije 2022. dalo je AUC od 0.184. Bacanje novčića vrijedi 0,50. Detektor je tekst koji je napisao stroj ocjenjivao ljudskijim od teksta koji su napisali ljudi; okretanje njegova rezultata bi ga poboljšalo. A cijelo je vrijeme davao samouvjerene postotke.

Uzrok je bila skupina pokazatelja leksičkog bogatstva (Yuleov K, MTLD, Zipfov eksponent, hapax legomena), svi obrnuti i s jakim učinkom. Gustu ljudsku akademsku prozu ocjenjuju strojnom, a leksički raznoliku strojnu prozu ljudskom. To je isti mehanizam iza objavljenog nalaza da detektori pogrešno označavaju većinu onih koji pišu na engleskom kao drugom jeziku.

Danas ti pokazatelji imaju težinu nula. Još se izračunavaju i prikazuju kao naznake, ali ne pomiču rezultat. Objavljujemo to jer je to najjači argument koji imamo za mjerenje: greška je bila nevidljiva iz rezultata i očita iz korpusa, a detektor koji nikad nije prošao ovaj test ne zna ima li isti problem.

Što nijedan detektor ne može

Nijedan AI detektor, uključujući ovaj, nije dokaz autorstva. Ti alati mjere statistička svojstva teksta, a formalno, strukturirano ili na drugom jeziku napisano ljudsko pisanje dijeli mnoga od njih. Rezultat je razlog za pitanje, nikad za zaključak.

Provjeri svoj tekst

Prvih 1.500 riječi je besplatno, bez računa. Na hrvatskom se ocjena temelji na strukturi teksta i pokazuje ti rečenice koje utječu na nju; ova ti stranica kaže što je izmjereno, a što nije.

Pokreni besplatni AI detektor

Istraživači i novinari: korpusi, kod za vrednovanje i alati za kalibraciju nalaze se u repozitoriju iza ove stranice. Ako želiš ponoviti ili osporiti neki broj s ove stranice, piši na contact@thesisdraft.com i pomoći ćemo ti.