Mjerenje
Koliko često naš AI detektor griješi o čovjeku
Svaki AI detektor daje samouvjeren postotak. Nijedan ti ne kaže koliko često taj postotak griješi o nekome tko je svoj rad napisao sam. Taj drugi broj je onaj koji je važan ako je optužba usmjerena na tebe, pa ga zato objavljujemo, za jezike na kojima smo ga izmjerili.
Posljednje mjerenje: 24. kolovoza 2026.. Svaki broj u nastavku dolazi iz skripte u našem repozitoriju koja se može ponovno pokrenuti na istim označenim korpusima.
Nijedna od ovih stopa nije izmjerena na hrvatskom.
Brojevi na ovoj stranici izmjereni su na engleskim i njemačkim tekstovima i ostaju vezani uz te jezike: to što su napisani na hrvatskom ne čini ih hrvatskima. Hrvatski tekst ocjenjuje se samo prema strukturi teksta (stil pisanja je prikazan, ali se ne računa), privremeno: još nemamo korpus hrvatskih radova za koje sigurno znamo da su ih napisali ljudi, pa ti ne možemo reći koliko često griješimo na hrvatskom tekstu, i dok je tako detektor na hrvatskom nikad ne daje crvenu ocjenu. Radije ti to kažemo nego da ti engleski broj predstavimo kao tvoj.
Izmjerene stope lažno pozitivnih rezultata
Koliko često akademski tekst za koji sigurno znamo da ga je napisao čovjek dobije našu najjaču ocjenu. Točnost nije jedan broj: mijenja se s jezikom i duljinom dokumenta, pa navodimo četiri profila umjesto prosjeka koji bi sakrio one slabe. Svaka stopa je gornja granica od 95 %, a ne opaženi broj: granica je ono što imamo pravo tvrditi, i uvijek je lošija od dviju vrijednosti. Pragovi u ovim tablicama nalaze se na našim internim mjernim ljestvicama; prikazani rezultat ista je informacija na fiksnoj osi, s jantarnom od 20 i crvenom od 50.
| Profil | Najjača ocjena | Lažno pozitivni | Opaženo | Izmjereno na |
|---|---|---|---|---|
| Engleski · više od 400 riječi | Jasni AI tragovi | najviše 3,13 % | 2 od 199 | 199 EN dokumenata validacijske polovice (kombinirana ljestvica, w_style=0,5) |
| Njemački · više od 400 riječi | Jasni AI tragovi | najviše 1,63 % | 10 od 1.035 | 1.035 njemačkih radova validacijske polovice (kombinirana ljestvica, w_style=0,5) |
| Engleski · manje od 400 riječi | Jasni AI tragovi | nije objavljeno | - | nemamo relevantnu ljudsku populaciju |
| Njemački · manje od 400 riječi | ocjena «jasni AI tragovi» nikad se ne izdaje | - | - | - |
Kratki njemački tekst nikad ne dobiva ocjenu «jasni AI tragovi», i s današnjim dokazima neće je dobiti.
Na kratkom njemačkom tekstu nijedan prag dovoljno strog da pouzdano prepozna AI ne košta manje od otprilike 7 lažnih optužbi na 100. Jedan nedužan student od petnaest nije razmjena koju prihvaćamo, pa se kratki njemački profil zaustavlja na «neki AI tragovi». To je izmjereno ograničenje, a ne funkcija koju tek treba izgraditi.
Slabije ocjene, koje su bučnije
Većina čitatelja nikad ne vidi najjaču ocjenu. Vide jednu od ovih, a ovdje su stope pogreške one koje ih se stvarno tiču. Niži engleski jantarni raspon daleko je najbučniji.
| Profil | Ocjena | Prag | Lažno pozitivni | Opaženo |
|---|---|---|---|---|
| Engleski · više od 400 riječi | Neki AI tragovi | ≥ 96 | najviše 5,86 % | 6 od 199 |
| Engleski · više od 400 riječi | Neki AI tragovi (niži jantarni raspon) | ≥ 91 | najviše 8,37 % | 10 od 199 |
| Njemački · više od 400 riječi | Neki AI tragovi | ≥ 88 | najviše 4,02 % | 31 od 1.035 |
| Njemački · više od 400 riječi | Neki AI tragovi (niži jantarni raspon) | ≥ 85 | najviše 6,18 % | 51 od 1.035 |
Što ovi brojevi nisu
- Nula opaženih nije nula. Nijedan od dvaju dugih profila nije dao nijedan lažno pozitivan rezultat na najstrožem pragu u sirovim korpusima strukture. Ipak objavljujemo gornju granicu od 95 % za tu veličinu uzorka, jer bi pisati «0 %» bilo upravo ono pretjerano samopouzdanje protiv kojeg ova stranica postoji.
- Engleski korpus je pogrešnog žanra. Ti su dokumenti članci iz časopisa: uređeni, profesionalni, pisani u timovima. Studentski rad nije ništa od toga. Stopa je pošteno izmjerena na onome na čemu kaže da je izmjerena, a engleski pragovi ostaju gdje jesu dok ne bude dovoljno studentskih radova na engleskom kao drugom jeziku da se njihovo pomicanje opravda.
- Kratki tekst nema objavljenu stopu. Kratki profil odnosi se na prozor od nekoliko stotina riječi, a nijedan ljudski korpus koji imamo ne potječe iz tog prozora. Stope koje su ovdje stajale uklonjene su 21. kolovoza 2026. umjesto da ostanu, jer uvjerljiv broj bez populacije iza sebe ostaje neutemeljena tvrdnja.
- AI korpusi su mali: dvadesetak dokumenata po jeziku, iz dviju obitelji modela. Model koji nismo testirali može se ponašati drukčije.
- Hrvatski nije kalibriran. Hrvatski tekst dobiva ocjenu koja se temelji samo na strukturi teksta, privremenu, bez ikakve tvrdnje o točnosti, i nikad ne dobiva crvenu ocjenu.
Na čemu smo mjerili
Svaki ljudski dokument u nastavku objavljen je prije nego što je ChatGPT postojao, pa njegovo autorstvo nije stvar procjene.
Njemački studentski radovi, 2010.-2021.
n = 866
Cijeli dokumenti, na jeziku i u žanru koji opslužujemo na njemačkom, ljudski po konstrukciji jer prethode ChatGPT-u. Na tom su korpusu postavljeni njemački pragovi.
scripts/fetch-thesis-negatives.mjs
Validacijska polovica kombinacije: njemački studentski radovi, 2008.-2021., cijeli dokumenti
n = 1.035
Izdvojena polovica stvarnih njemačkih radova (MOnAMi, Hochschule Mittweida, 2008.-2021.), ocijenjena s OBJE polovice provjere: cijeli dokumenti, nikad korišteni za treniranje njemačkog modela. Na njoj su odrezani kombinirani njemački pragovi. To nisu tekstovi iz vremena naših korisnika: dotjeran rad iz 2026. populacija je koju nitko nije izmjerio, i ta je napomena dio broja.
scripts/calibrate-components.mjs
Članci otvorenog pristupa, prije 2022.
n = 1.412
Potpuna akademska proza. Članci u časopisima uređeni su i pisani u timovima, pa nisu studentsko pisanje: zato se engleski pragovi ne pomiču prema njima.
scripts/fetch-longform-corpus.mjs
Validacijska polovica kombinacije: članci + arXiv, isječci od 1.500 riječi
n = 199
Izdvojena polovica engleskih dokumenata (arXiv i članci otvorenog pristupa prije 2022.), ocijenjena s OBJE polovice provjere. Na njoj su odrezani kombinirani pragovi. Proza iz časopisa, ne studentsko pisanje: kažemo to jer je ta napomena dio broja.
scripts/calibrate-components.mjs
arXiv sažeci, prije 2022.
n = 236
Kratki tekstovi na engleskom. Čuvaju se za rad na AUC-u; ne objavljujemo nikakvu stopu lažno pozitivnih rezultata iz njih, jer kratki prozor ocjene nije ono što mjeri korpus sažetaka.
scripts/fetch-human-corpus.mjs
Njemački akademski sažeci, prije 2022.
n = 60
OpenAlex, filtriran po njemačkim funkcionalnim riječima jer je polje jezika nepouzdano. Na njemu se temelji odluka da se na kratkom njemačkom tekstu ocjena «jasni AI tragovi» uopće ne izdaje.
scripts/fetch-german-corpus.mjs
Jednom smo umalo objavili detektor lošiji od bacanja novčića
U ranoj verziji mjerenje na 236 arXiv sažetaka prije 2022. dalo je AUC od 0.184. Bacanje novčića vrijedi 0,50. Detektor je tekst koji je napisao stroj ocjenjivao ljudskijim od teksta koji su napisali ljudi; okretanje njegova rezultata bi ga poboljšalo. A cijelo je vrijeme davao samouvjerene postotke.
Uzrok je bila skupina pokazatelja leksičkog bogatstva (Yuleov K, MTLD, Zipfov eksponent, hapax legomena), svi obrnuti i s jakim učinkom. Gustu ljudsku akademsku prozu ocjenjuju strojnom, a leksički raznoliku strojnu prozu ljudskom. To je isti mehanizam iza objavljenog nalaza da detektori pogrešno označavaju većinu onih koji pišu na engleskom kao drugom jeziku.
Danas ti pokazatelji imaju težinu nula. Još se izračunavaju i prikazuju kao naznake, ali ne pomiču rezultat. Objavljujemo to jer je to najjači argument koji imamo za mjerenje: greška je bila nevidljiva iz rezultata i očita iz korpusa, a detektor koji nikad nije prošao ovaj test ne zna ima li isti problem.
Što nijedan detektor ne može
Nijedan AI detektor, uključujući ovaj, nije dokaz autorstva. Ti alati mjere statistička svojstva teksta, a formalno, strukturirano ili na drugom jeziku napisano ljudsko pisanje dijeli mnoga od njih. Rezultat je razlog za pitanje, nikad za zaključak.
Provjeri svoj tekst
Prvih 1.500 riječi je besplatno, bez računa. Na hrvatskom se ocjena temelji na strukturi teksta i pokazuje ti rečenice koje utječu na nju; ova ti stranica kaže što je izmjereno, a što nije.
Pokreni besplatni AI detektorIstraživači i novinari: korpusi, kod za vrednovanje i alati za kalibraciju nalaze se u repozitoriju iza ove stranice. Ako želiš ponoviti ili osporiti neki broj s ove stranice, piši na contact@thesisdraft.com i pomoći ćemo ti.