Benchmark

Ako často sa náš AI detektor mýli pri človeku

Každý AI detektor vracia sebaisté percento. Žiadny ti nepovie, ako často sa toto percento mýli pri niekom, kto svoju prácu napísal sám. Práve toto druhé číslo je dôležité, ak si študent, ktorý je obvinený, a preto ho zverejňujeme, pre jazyky, v ktorých sme ho zmerali.

Naposledy zmerané: 24. augusta 2026. Každé číslo nižšie pochádza zo skriptu v našom repozitári, ktorý sa dá znova spustiť na rovnakých označených korpusoch.

Žiadna z týchto mier nebola zmeraná v slovenčine.

Čísla na tejto stránke boli zmerané na anglických a nemeckých textoch a zostávajú viazané na tieto jazyky: napísať ich po slovensky z nich neurobí slovenské čísla. Slovenský text sa hodnotí iba podľa štruktúry textu (štýl písania sa zobrazuje, ale nezapočítava), a to predbežne: zatiaľ nemáme korpus slovenských prác, ktoré preukázateľne napísali ľudia, takže ti nemôžeme povedať, ako často sa pri slovenskom texte mýlime, a kým to tak bude, detektor v slovenčine nikdy nedá červený verdikt. Radšej ti to povieme, než aby sme anglické číslo vydávali za tvoje.

Zmerané miery falošne pozitívnych výsledkov

Ako často dostane akademický text, ktorý preukázateľne napísal človek, náš najsilnejší verdikt. Presnosť nie je jedno číslo: mení sa s jazykom a s dĺžkou dokumentu, preto uvádzame štyri profily namiesto priemeru, ktorý by skryl tie slabé. Každá miera je horná hranica 95 % intervalu, nie pozorovaný počet: hranica je to, čo smieme tvrdiť, a je vždy horšia z oboch. Prahy v týchto tabuľkách sú na našich interných škálach; zobrazené skóre je rovnaká informácia na pevnej osi, s oranžovou od 20 a červenou od 50.

ProfilNajsilnejší verdiktFalošne pozitívnePozorovanéZmerané na
Angličtina · nad 400 slovVýrazné stopy AInajviac 3,13 %2 z 199199 dokumentov EN z validačnej polovice (kombinovaná škála, w_style=0,5)
Nemčina · nad 400 slovVýrazné stopy AInajviac 1,63 %10 z 1 0351 035 nemeckých prác z validačnej polovice (kombinovaná škála, w_style=0,5)
Angličtina · pod 400 slovVýrazné stopy AInezverejnené-nemáme k dispozícii žiadnu relevantnú ľudskú populáciu
Nemčina · pod 400 slovverdikt „výrazné stopy AI“ sa nikdy nevydáva---

Krátky nemecký text nikdy nedostane verdikt „výrazné stopy AI“ a so súčasnými dôkazmi ho ani nedostane.

Pri krátkej nemčine nestojí žiadny prah dosť prísny na spoľahlivé rozpoznanie AI menej než zhruba 7 falošných obvinení zo 100. Jeden nevinný študent z pätnástich nie je obchod, ktorý prijímame, preto sa krátky nemecký profil zastaví pri „niektorých stopách AI“. Je to zmeraná hranica, nie funkcia, ktorá sa ešte len stavia.

Slabšie verdikty, ktoré sú hlučnejšie

Väčšina čitateľov najsilnejší verdikt nikdy neuvidí. Uvidí jeden z týchto, a miery chýb tu sú tie, ktoré sa ich naozaj týkajú. Nižšie anglické oranžové pásmo je zďaleka najhlučnejšie.

ProfilVerdiktPrahFalošne pozitívnePozorované
Angličtina · nad 400 slovNiektoré stopy AI≥ 96najviac 5,86 %6 z 199
Angličtina · nad 400 slovNiektoré stopy AI (nižšie oranžové pásmo)≥ 91najviac 8,37 %10 z 199
Nemčina · nad 400 slovNiektoré stopy AI≥ 88najviac 4,02 %31 z 1 035
Nemčina · nad 400 slovNiektoré stopy AI (nižšie oranžové pásmo)≥ 85najviac 6,18 %51 z 1 035

Čím tieto čísla nie sú

Na čom sme merali

Každý ľudský dokument nižšie bol zverejnený skôr, než existoval ChatGPT, takže jeho autorstvo nie je otázkou úsudku.

Záverečné práce nemeckých študentov, 2010-2021

n = 866

Celé dokumenty, v jazyku a žánri, ktorý v nemčine obsluhujeme, ľudské už zo svojej podstaty, pretože predchádzajú ChatGPT. Na tomto korpuse sú nastavené nemecké prahy.

scripts/fetch-thesis-negatives.mjs

Validačná polovica kombinácie: záverečné práce nemeckých študentov, 2008-2021, celé dokumenty

n = 1 035

Odložená polovica skutočných nemeckých záverečných prác (MOnAMi, Hochschule Mittweida, 2008-2021), hodnotená OBOMA polovicami analýzy: celé dokumenty, nikdy nepoužité na tréning nemeckého modelu. Kombinované nemecké prahy sú stanovené na nej. Nejde o texty z obdobia našich zákazníkov: vyladená práca z roku 2026 je populácia, ktorú nikto nezmeral, a táto výhrada je súčasťou čísla.

scripts/calibrate-components.mjs

Články v otvorenom prístupe, pred rokom 2022

n = 1 412

Úplná akademická próza. Články v časopisoch sú redigované a písané tímami, takže nejde o študentské písanie: preto sa anglické prahy podľa nich neposúvajú.

scripts/fetch-longform-corpus.mjs

Validačná polovica kombinácie: články + arXiv, výňatky s 1 500 slovami

n = 199

Odložená polovica anglických dokumentov (arXiv a články v otvorenom prístupe pred rokom 2022), hodnotená OBOMA polovicami analýzy. Kombinované prahy sú stanovené na nej. Časopisecká próza, nie študentské písanie: hovoríme to, pretože táto výhrada je súčasťou čísla.

scripts/calibrate-components.mjs

Abstrakty arXiv, pred rokom 2022

n = 236

Krátke anglické texty. Ponechané pre prácu na AUC; nezverejňujeme z nich žiadnu mieru falošne pozitívnych výsledkov, pretože krátke okno verdiktu nie je to, čo korpus abstraktov meria.

scripts/fetch-human-corpus.mjs

Nemecké akademické abstrakty, pred rokom 2022

n = 60

OpenAlex, filtrovaný podľa nemeckých funkčných slov, pretože pole jazyka je nespoľahlivé. Na ňom stojí rozhodnutie nevydávať pri krátkej nemčine verdikt „výrazné stopy AI“ vôbec.

scripts/fetch-german-corpus.mjs

Raz sme takmer zverejnili detektor horší než hod mincou

V jednej ranej verzii dalo meranie na 236 abstraktoch arXiv pred rokom 2022 AUC 0.184. Hod mincou má 0,50. Detektor radil text napísaný strojom ako ľudskejší než text napísaný ľuďmi; obrátenie jeho výsledku by ho zlepšilo. A celý čas vracal sebaisté percentá.

Príčinou bola rodina ukazovateľov lexikálneho bohatstva (Yuleovo K, MTLD, Zipfov exponent, hapax legomena), všetky obrátene a so silným účinkom. Hustú ľudskú akademickú prózu hodnotia ako strojovú a lexikálne pestrú strojovú prózu ako ľudskú. Je to rovnaký mechanizmus ako za zverejneným zistením, že detektory mylne označujú väčšinu ľudí, ktorí píšu po anglicky ako v druhom jazyku.

Dnes majú tieto ukazovatele váhu nula. Stále sa počítajú a zobrazujú ako vodítka, ale skóre nehýbu. Zverejňujeme to, pretože je to najsilnejší argument, ktorý pre meranie máme: chyba bola z výsledku neviditeľná a z korpusu zrejmá, a detektor, ktorý týmto testom nikdy neprešiel, nevie, či nemá rovnaký problém.

Čo žiadny detektor nedokáže

Žiadny AI detektor, vrátane tohto, nie je dôkazom autorstva. Tieto nástroje merajú štatistické vlastnosti textu a formálne, štruktúrované alebo v druhom jazyku písané ľudské texty mnohé z nich zdieľajú. Skóre je dôvod položiť otázku, nikdy dôvod vyvodiť záver.

Skontroluj svoj text

Prvých 1 500 slov je zadarmo, bez účtu. V slovenčine vychádza verdikt zo štruktúry textu a ukáže ti vety, ktoré ho ovplyvňujú; táto stránka ti hovorí, čo je zmerané a čo nie.

Spustiť AI detektor zadarmo

Výskumníci a novinári: korpusy, hodnotiaci kód aj kalibračné nástroje sú v repozitári za týmto webom. Ak chceš niektoré číslo z tejto stránky zopakovať alebo spochybniť, napíš na contact@thesisdraft.com a pomôžeme ti.