Benchmark

Jak často se náš AI detektor mýlí u člověka

Každý AI detektor vrací sebejisté procento. Žádný vám neřekne, jak často se toto procento mýlí u někoho, kdo svou práci napsal sám. Právě toto druhé číslo je důležité, pokud jste student, který je obviněn, a proto ho zveřejňujeme, pro jazyky, ve kterých jsme ho změřili.

Naposledy změřeno: 24. srpna 2026. Každé číslo níže pochází ze skriptu v našem repozitáři, který lze znovu spustit na stejných označených korpusech.

Žádná z těchto měr nebyla změřena v češtině.

Čísla na této stránce byla změřena na anglických a německých textech a zůstávají vázaná na tyto jazyky: napsat je česky z nich neudělá česká čísla. Český text se hodnotí pouze podle struktury textu (styl psaní se zobrazuje, ale nezapočítává), a to předběžně: zatím nemáme korpus českých prací, které prokazatelně napsali lidé, takže vám nemůžeme říct, jak často se u českého textu mýlíme, a dokud to tak bude, detektor v češtině nikdy nedá červený verdikt. Raději vám to řekneme, než abychom anglické číslo vydávali za vaše.

Změřené míry falešně pozitivních výsledků

Jak často dostane akademický text, který prokazatelně napsal člověk, náš nejsilnější verdikt. Přesnost není jedno číslo: mění se s jazykem a s délkou dokumentu, proto uvádíme čtyři profily místo průměru, který by skryl ty slabé. Každá míra je horní mez 95% intervalu, ne pozorovaný počet: mez je to, co smíme tvrdit, a je vždy horší z obou. Prahy v těchto tabulkách jsou na našich interních škálách; zobrazené skóre je stejná informace na pevné ose, s oranžovou od 20 a červenou od 50.

ProfilNejsilnější verdiktFalešně pozitivníPozorovánoZměřeno na
Angličtina · nad 400 slovVýrazné stopy AInejvýše 3,13 %2 z 199199 dokumentů EN z validační poloviny (kombinovaná škála, w_style=0,5)
Němčina · nad 400 slovVýrazné stopy AInejvýše 1,63 %10 z 1 0351 035 německých prací z validační poloviny (kombinovaná škála, w_style=0,5)
Angličtina · pod 400 slovVýrazné stopy AInezveřejněno-nemáme k dispozici žádnou relevantní lidskou populaci
Němčina · pod 400 slovverdikt „výrazné stopy AI“ se nikdy nevydává---

Krátký německý text nikdy nedostane verdikt „výrazné stopy AI“ a se současnými důkazy ho ani nedostane.

U krátké němčiny nestojí žádný práh dost přísný na spolehlivé rozpoznání AI méně než zhruba 7 falešných obvinění ze 100. Jeden nevinný student z patnácti není obchod, který přijímáme, proto se krátký německý profil zastaví na „některých stopách AI“. Je to změřená hranice, ne funkce, která se teprve staví.

Slabší verdikty, které jsou hlučnější

Většina čtenářů nejsilnější verdikt nikdy neuvidí. Uvidí jeden z těchto, a míry chyb zde jsou ty, které se jich skutečně týkají. Nižší anglické oranžové pásmo je zdaleka nejhlučnější.

ProfilVerdiktPráhFalešně pozitivníPozorováno
Angličtina · nad 400 slovNěkteré stopy AI≥ 96nejvýše 5,86 %6 z 199
Angličtina · nad 400 slovNěkteré stopy AI (nižší oranžové pásmo)≥ 91nejvýše 8,37 %10 z 199
Němčina · nad 400 slovNěkteré stopy AI≥ 88nejvýše 4,02 %31 z 1 035
Němčina · nad 400 slovNěkteré stopy AI (nižší oranžové pásmo)≥ 85nejvýše 6,18 %51 z 1 035

Čím tato čísla nejsou

Na čem jsme měřili

Každý lidský dokument níže byl zveřejněn dříve, než existoval ChatGPT, takže jeho autorství není otázkou úsudku.

Závěrečné práce německých studentů, 2010-2021

n = 866

Celé dokumenty, v jazyce a žánru, který v němčině obsluhujeme, lidské už ze své podstaty, protože předcházejí ChatGPT. Na tomto korpusu jsou nastaveny německé prahy.

scripts/fetch-thesis-negatives.mjs

Validační polovina kombinace: závěrečné práce německých studentů, 2008-2021, celé dokumenty

n = 1 035

Odložená polovina skutečných německých závěrečných prací (MOnAMi, Hochschule Mittweida, 2008-2021), hodnocená OBĚMA polovinami analýzy: celé dokumenty, nikdy nepoužité k tréninku německého modelu. Kombinované německé prahy jsou stanoveny na ní. Nejde o texty z doby našich zákazníků: vyladěná práce z roku 2026 je populace, kterou nikdo nezměřil, a tato výhrada je součástí čísla.

scripts/calibrate-components.mjs

Články v otevřeném přístupu, před rokem 2022

n = 1 412

Úplná akademická próza. Články v časopisech jsou redigované a psané týmy, takže nejde o studentské psaní: proto se anglické prahy podle nich neposouvají.

scripts/fetch-longform-corpus.mjs

Validační polovina kombinace: články + arXiv, výňatky o 1 500 slovech

n = 199

Odložená polovina anglických dokumentů (arXiv a články v otevřeném přístupu před rokem 2022), hodnocená OBĚMA polovinami analýzy. Kombinované prahy jsou stanoveny na ní. Časopisecká próza, ne studentské psaní: říkáme to, protože tato výhrada je součástí čísla.

scripts/calibrate-components.mjs

Abstrakty arXiv, před rokem 2022

n = 236

Krátké anglické texty. Ponechané pro práci na AUC; nezveřejňujeme z nich žádnou míru falešně pozitivních výsledků, protože krátké okno verdiktu není to, co korpus abstraktů měří.

scripts/fetch-human-corpus.mjs

Německé akademické abstrakty, před rokem 2022

n = 60

OpenAlex, filtrovaný podle německých funkčních slov, protože pole jazyka je nespolehlivé. Na něm stojí rozhodnutí nevydávat u krátké němčiny verdikt „výrazné stopy AI“ vůbec.

scripts/fetch-german-corpus.mjs

Jednou jsme málem zveřejnili detektor horší než hod mincí

V jedné rané verzi dalo měření na 236 abstraktech arXiv před rokem 2022 AUC 0.184. Hod mincí má 0,50. Detektor řadil text napsaný strojem jako lidštější než text napsaný lidmi; obrácení jeho výsledku by ho zlepšilo. A celou dobu vracel sebejistá procenta.

Příčinou byla rodina ukazatelů lexikálního bohatství (Yuleovo K, MTLD, Zipfův exponent, hapax legomena), všechny obráceně a se silným účinkem. Hustou lidskou akademickou prózu hodnotí jako strojovou a lexikálně pestrou strojovou prózu jako lidskou. Je to stejný mechanismus jako za zveřejněným zjištěním, že detektory mylně označují většinu lidí, kteří píší anglicky jako druhým jazykem.

Dnes mají tyto ukazatele váhu nula. Stále se počítají a zobrazují jako vodítka, ale skóre nehýbou. Zveřejňujeme to, protože je to nejsilnější argument, který pro měření máme: vada byla z výsledku neviditelná a z korpusu zřejmá, a detektor, který tímto testem nikdy neprošel, neví, jestli nemá stejný problém.

Co žádný detektor nedokáže

Žádný AI detektor, včetně tohoto, není důkazem autorství. Tyto nástroje měří statistické vlastnosti textu a formální, strukturované nebo ve druhém jazyce psané lidské texty mnohé z nich sdílejí. Skóre je důvod položit otázku, nikdy důvod vyvodit závěr.

Zkontrolujte svůj text

Prvních 1 500 slov je zdarma, bez účtu. V češtině vychází verdikt ze struktury textu a ukáže vám věty, které ho ovlivňují; tato stránka vám říká, co je změřené a co ne.

Spustit AI detektor zdarma

Výzkumníci a novináři: korpusy, hodnoticí kód i kalibrační nástroje jsou v repozitáři za tímto webem. Pokud chcete některé číslo z této stránky zopakovat nebo zpochybnit, napište na contact@thesisdraft.com a pomůžeme vám.