Merenje

Koliko često naš AI detektor greši o čoveku

Svaki AI detektor daje samouveren procenat. Nijedan ti ne kaže koliko često taj procenat greši o nekome ko je svoj rad napisao sam. Taj drugi broj je onaj koji je važan ako je optužba usmerena na tebe, pa ga zato objavljujemo, za jezike na kojima smo ga izmerili.

Poslednje merenje: 24. avgust 2026.. Svaki broj u nastavku potiče iz skripte u našem repozitorijumu koja može ponovo da se pokrene na istim označenim korpusima.

Nijedna od ovih stopa nije izmerena na srpskom.

Brojevi na ovoj stranici izmereni su na engleskim i nemačkim tekstovima i ostaju vezani za te jezike: to što su napisani na srpskom ne čini ih srpskim. Srpski tekst se ocenjuje samo prema strukturi teksta (stil pisanja je prikazan, ali se ne računa), privremeno: još nemamo korpus srpskih radova za koje sigurno znamo da su ih napisali ljudi, pa ti ne možemo reći koliko često grešimo na srpskom tekstu, i dok je tako detektor na srpskom nikad ne daje crvenu ocenu. Radije ti to kažemo nego da ti engleski broj predstavimo kao tvoj.

Izmerene stope lažno pozitivnih rezultata

Koliko često akademski tekst za koji sigurno znamo da ga je napisao čovek dobije našu najjaču ocenu. Tačnost nije jedan broj: menja se sa jezikom i dužinom dokumenta, pa navodimo četiri profila umesto proseka koji bi sakrio one slabe. Svaka stopa je gornja granica od 95 %, a ne opaženi broj: granica je ono što imamo pravo da tvrdimo, i uvek je lošija od dve vrednosti. Pragovi u ovim tabelama nalaze se na našim internim mernim skalama; prikazani rezultat je ista informacija na fiksnoj osi, sa žutom od 20 i crvenom od 50.

ProfilNajjača ocenaLažno pozitivniOpaženoIzmereno na
Engleski · više od 400 rečiJasni AI tragovinajviše 3,13 %2 od 199199 EN dokumenata validacione polovine (kombinovana skala, w_style=0,5)
Nemački · više od 400 rečiJasni AI tragovinajviše 1,63 %10 od 1.0351.035 nemačkih radova validacione polovine (kombinovana skala, w_style=0,5)
Engleski · manje od 400 rečiJasni AI tragovinije objavljeno-nemamo relevantnu ljudsku populaciju
Nemački · manje od 400 rečiocena «jasni AI tragovi» se nikad ne izdaje---

Kratak nemački tekst nikad ne dobija ocenu «jasni AI tragovi», i sa današnjim dokazima neće je dobiti.

Na kratkom nemačkom tekstu nijedan prag dovoljno strog da pouzdano prepozna AI ne košta manje od otprilike 7 lažnih optužbi na 100. Jedan nevin student od petnaest nije razmena koju prihvatamo, pa se kratki nemački profil zaustavlja na «neki AI tragovi». To je izmereno ograničenje, a ne funkcija koju tek treba napraviti.

Slabije ocene, koje su bučnije

Većina čitalaca nikad ne vidi najjaču ocenu. Vide jednu od ovih, a ovde su stope greške one koje ih se stvarno tiču. Niži engleski žuti opseg je daleko najbučniji.

ProfilOcenaPragLažno pozitivniOpaženo
Engleski · više od 400 rečiNeki AI tragovi≥ 96najviše 5,86 %6 od 199
Engleski · više od 400 rečiNeki AI tragovi (niži žuti opseg)≥ 91najviše 8,37 %10 od 199
Nemački · više od 400 rečiNeki AI tragovi≥ 88najviše 4,02 %31 od 1.035
Nemački · više od 400 rečiNeki AI tragovi (niži žuti opseg)≥ 85najviše 6,18 %51 od 1.035

Šta ovi brojevi nisu

Na čemu smo merili

Svaki ljudski dokument u nastavku objavljen je pre nego što je ChatGPT postojao, pa njegovo autorstvo nije stvar procene.

Nemački studentski radovi, 2010-2021

n = 866

Celi dokumenti, na jeziku i u žanru koji opslužujemo na nemačkom, ljudski po konstrukciji jer prethode ChatGPT-u. Na tom korpusu su postavljeni nemački pragovi.

scripts/fetch-thesis-negatives.mjs

Validaciona polovina kombinacije: nemački studentski radovi, 2008-2021, celi dokumenti

n = 1.035

Izdvojena polovina stvarnih nemačkih radova (MOnAMi, Hochschule Mittweida, 2008-2021), ocenjena sa OBE polovine provere: celi dokumenti, nikad korišćeni za treniranje nemačkog modela. Na njoj su presečeni kombinovani nemački pragovi. To nisu tekstovi iz vremena naših korisnika: doteran rad iz 2026. je populacija koju niko nije izmerio, i ta napomena je deo broja.

scripts/calibrate-components.mjs

Članci otvorenog pristupa, pre 2022

n = 1.412

Potpuna akademska proza. Članci u časopisima su uređeni i pisani u timovima, pa nisu studentsko pisanje: zato se engleski pragovi ne pomeraju prema njima.

scripts/fetch-longform-corpus.mjs

Validaciona polovina kombinacije: članci + arXiv, isečci od 1.500 reči

n = 199

Izdvojena polovina engleskih dokumenata (arXiv i članci otvorenog pristupa pre 2022), ocenjena sa OBE polovine provere. Na njoj su presečeni kombinovani pragovi. Proza iz časopisa, ne studentsko pisanje: kažemo to jer je ta napomena deo broja.

scripts/calibrate-components.mjs

arXiv apstrakti, pre 2022

n = 236

Kratki tekstovi na engleskom. Čuvaju se za rad na AUC-u; ne objavljujemo nikakvu stopu lažno pozitivnih rezultata iz njih, jer kratak prozor ocene nije ono što meri korpus apstrakata.

scripts/fetch-human-corpus.mjs

Nemački akademski apstrakti, pre 2022

n = 60

OpenAlex, filtriran po nemačkim funkcionalnim rečima jer je polje jezika nepouzdano. Na njemu se zasniva odluka da se na kratkom nemačkom tekstu ocena «jasni AI tragovi» uopšte ne izdaje.

scripts/fetch-german-corpus.mjs

Jednom smo umalo objavili detektor lošiji od bacanja novčića

U ranoj verziji merenje na 236 arXiv apstrakata pre 2022 dalo je AUC od 0.184. Bacanje novčića vredi 0,50. Detektor je tekst koji je napisala mašina ocenjivao kao ljudskiji od teksta koji su napisali ljudi; obrtanje njegovog rezultata bi ga poboljšalo. A sve vreme je davao samouverene procente.

Uzrok je bila grupa pokazatelja leksičkog bogatstva (Yuleov K, MTLD, Zipfov eksponent, hapax legomena), svi obrnuti i sa jakim efektom. Gustu ljudsku akademsku prozu ocenjuju kao mašinsku, a leksički raznovrsnu mašinsku prozu kao ljudsku. To je isti mehanizam iza objavljenog nalaza da detektori pogrešno označavaju većinu onih koji pišu na engleskom kao drugom jeziku.

Danas ti pokazatelji imaju težinu nula. I dalje se izračunavaju i prikazuju kao nagoveštaji, ali ne pomeraju rezultat. Objavljujemo to jer je to najjači argument koji imamo za merenje: greška je bila nevidljiva iz rezultata i očigledna iz korpusa, a detektor koji nikad nije prošao ovaj test ne zna da li ima isti problem.

Šta nijedan detektor ne može

Nijedan AI detektor, uključujući ovaj, nije dokaz autorstva. Ti alati mere statistička svojstva teksta, a formalno, strukturirano ili na drugom jeziku napisano ljudsko pisanje deli mnoga od njih. Rezultat je razlog za pitanje, nikad za zaključak.

Proveri svoj tekst

Prvih 1.500 reči je besplatno, bez naloga. Na srpskom se ocena zasniva na strukturi teksta i pokazuje ti rečenice koje utiču na nju; ova stranica ti kaže šta je izmereno, a šta nije.

Pokreni besplatni AI detektor

Istraživači i novinari: korpusi, kod za vrednovanje i alati za kalibraciju nalaze se u repozitorijumu iza ovog sajta. Ako želiš da ponoviš ili osporiš neki broj sa ove stranice, piši na contact@thesisdraft.com i pomoći ćemo ti.