Mērījumi

Cik bieži mūsu AI detektors kļūdās par cilvēku

Katrs AI detektors sniedz pārliecinošu procentu. Neviens tev nepasaka, cik bieži šis procents kļūdās par cilvēku, kurš savu darbu uzrakstīja pats. Šis otrais skaitlis ir tas, kas ir svarīgs, ja apsūdzētais students esi tu, tāpēc mēs publicējam tieši to, tām valodām, kurās to esam izmērījuši.

Pēdējo reizi mērīts: 2026. gada 24. augusts. Katrs zemāk redzamais skaitlis nāk no skripta mūsu repozitorijā, ko var palaist vēlreiz uz tiem pašiem marķētajiem korpusiem.

Neviens no šiem biežumiem nav izmērīts latviešu valodā.

Šīs lapas skaitļi ir izmērīti uz angļu un vācu tekstiem un paliek piesaistīti šīm valodām: uzrakstīti latviski, tie nekļūst latviski. Latviešu teksts tiek vērtēts tikai pēc teksta struktūras (rakstības stils tiek parādīts, bet netiek ieskaitīts), provizoriski: mums vēl nav noteikti cilvēku rakstītu latviešu noslēguma darbu korpusa, tāpēc nevaram pateikt, cik bieži kļūdāmies par latviešu tekstu, un, kamēr tā ir, detektors latviešu valodā nekad nedod sarkanu vērtējumu. Labāk pasakām to tieši, nekā pasniedzam angļu skaitli kā tavu.

Izmērītie viltus pozitīvo rezultātu biežumi

Cik bieži noteikti cilvēka rakstīts akadēmisks teksts saņem mūsu stiprāko vērtējumu. Precizitāte nav viens skaitlis: tā mainās atkarībā no valodas un dokumenta garuma, tāpēc mēs norādām četrus profilus, nevis vidējo, kas paslēptu vājākos. Katrs biežums ir 95% augšējā robeža, nevis novērotais skaits: robeža ir tas, ko mums ir tiesības apgalvot, un tā vienmēr ir sliktākā no abām. Šo tabulu sliekšņi ir mūsu iekšējās mērījumu skalās; parādītais rezultāts ir tā pati informācija uz fiksētas ass, dzintara krāsa no 20, sarkanā no 50.

ProfilsStiprākais vērtējumsViltus pozitīvieNovērotsIzmērīts uz
Angļu valoda · vairāk nekā 400 vārdiIzteiktas AI pazīmesne vairāk kā 3,13 %2 no 199Validācijas puses EN dokumenti: 199 (kombinētā skala, w_style=0,5)
Vācu valoda · vairāk nekā 400 vārdiIzteiktas AI pazīmesne vairāk kā 1,63 %10 no 1035Validācijas puses vācu noslēguma darbi: 1035 (kombinētā skala, w_style=0,5)
Angļu valoda · mazāk nekā 400 vārdiIzteiktas AI pazīmesnetiek publicēts-atbilstošas cilvēku populācijas mums nav
Vācu valoda · mazāk nekā 400 vārdivērtējums «izteiktas AI pazīmes» nekad netiek dots---

Īss vācu teksts nekad nesaņem vērtējumu «izteiktas AI pazīmes», un ar pašreizējiem pierādījumiem arī nesaņems.

Īsam vācu tekstam neviens pietiekami stingrs slieksnis, kas uzticami atpazītu AI, nemaksā mazāk par aptuveni 7 nepatiesām apsūdzībām no 100. Viens nevainīgs students no piecpadsmit nav darījums, kuram piekrītam, tāpēc īsais vācu profils apstājas pie «dažas AI pazīmes». Tā ir izmērīta robeža, nevis vēl neuzbūvēta funkcija.

Vājākie vērtējumi, kas ir trokšņaināki

Lielākā daļa lasītāju nekad neredz stiprāko vērtējumu. Viņi redz kādu no šiem, un tieši šeit norādītie kļūdu biežumi viņus patiešām skar. Angļu zemākā dzintara josla ir ievērojami trokšņainākā.

ProfilsVērtējumsSlieksnisViltus pozitīvieNovērots
Angļu valoda · vairāk nekā 400 vārdiDažas AI pazīmes≥ 96ne vairāk kā 5,86 %6 no 199
Angļu valoda · vairāk nekā 400 vārdiDažas AI pazīmes (zemākā dzintara josla)≥ 91ne vairāk kā 8,37 %10 no 199
Vācu valoda · vairāk nekā 400 vārdiDažas AI pazīmes≥ 88ne vairāk kā 4,02 %31 no 1035
Vācu valoda · vairāk nekā 400 vārdiDažas AI pazīmes (zemākā dzintara josla)≥ 85ne vairāk kā 6,18 %51 no 1035

Kas šie skaitļi nav

Uz kā mēs mērījām

Katrs zemāk minētais cilvēka dokuments tika publicēts, pirms ChatGPT pastāvēja, tāpēc tā autorība nav vērtējuma jautājums.

Vācu studentu noslēguma darbi, 2010-2021

n = 866

Veseli dokumenti tajā valodā un žanrā, ko apkalpojam vāciski, cilvēku rakstīti jau pēc konstrukcijas, jo tie ir vecāki par ChatGPT. Uz šī korpusa ir noteikti vācu sliekšņi.

scripts/fetch-thesis-negatives.mjs

Kombinācijas validācijas puse: vācu studentu noslēguma darbi, 2008-2021, veseli dokumenti

n = 1035

Atliktā īsto vācu noslēguma darbu puse (MOnAMi, Hochschule Mittweida, 2008-2021), novērtēta ar ABĀM analīzes pusēm: veseli dokumenti, kas nekad nav izmantoti vācu modeļa apmācībai. Kombinētie vācu sliekšņi ir noteikti uz tās. Tie nav mūsu klientu laikmeta teksti: nopulēts 2026. gada noslēguma darbs ir populācija, ko neviens nav izmērījis, un šī atruna ir daļa no skaitļa.

scripts/calibrate-components.mjs

Atvērtās piekļuves raksti, pirms 2022. gada

n = 1412

Pilnvērtīga akadēmiskā proza. Žurnālu raksti ir rediģēti un grupu rakstīti, tāpēc tā nav studentu rakstība: tāpēc angļu sliekšņi uz tiem netiek pārvietoti.

scripts/fetch-longform-corpus.mjs

Kombinācijas validācijas puse: raksti + arXiv, 1500 vārdu fragmenti

n = 199

Atliktā angļu dokumentu puse (arXiv un atvērtās piekļuves raksti pirms 2022. gada), novērtēta ar ABĀM analīzes pusēm. Kombinētie sliekšņi ir noteikti uz tās. Žurnālu proza, nevis studentu rakstība: mēs to sakām, jo šī atruna ir daļa no skaitļa.

scripts/calibrate-components.mjs

arXiv kopsavilkumi, pirms 2022. gada

n = 236

Īsi angļu teksti. Saglabāti AUC darbam; mēs no tiem nepublicējam nevienu viltus pozitīvo rezultātu biežumu, jo īss vērtējuma logs nav tas, ko mēra kopsavilkumu korpuss.

scripts/fetch-human-corpus.mjs

Vācu zinātniskie kopsavilkumi, pirms 2022. gada

n = 60

OpenAlex, filtrēts pēc vācu funkcionālajiem vārdiem, jo valodas lauks ir neuzticams. Uz tā balstās lēmums vispār nedot īsam vācu tekstam vērtējumu «izteiktas AI pazīmes».

scripts/fetch-german-corpus.mjs

Reiz mēs gandrīz publicējām detektoru, kas bija sliktāks par monētas mešanu

Vienā agrīnā versijā mērījums uz arXiv kopsavilkumiem pirms 2022. gada (236) deva AUC 0.184. Monētas mešana ir 0,50. Detektors mašīnas rakstītu tekstu uzskatīja par cilvēciskāku nekā cilvēku rakstīto; tā rezultāta apgriešana būtu to uzlabojusi. Un visu šo laiku tas sniedza pārliecinošus procentus.

Cēlonis bija leksiskās bagātības rādītāju saime (Jula K, MTLD, Cipfa eksponente, hapax legomena), visi pretējā virzienā un ar spēcīgu ietekmi. Tie blīvu cilvēku akadēmisko prozu vērtē kā mehānisku un leksiski daudzveidīgu mašīnas prozu kā cilvēcisku. Tas ir tas pats mehānisms, kas ir aiz publicētā rezultāta, ka detektori kļūdaini atzīmē lielāko daļu to, kuri raksta angļu valodā kā otrajā valodā.

Šodien šo rādītāju svars ir nulle. Tie joprojām tiek aprēķināti un parādīti kā norādes, bet tie nemaina rezultātu. Mēs to publicējam, jo tas ir mūsu spēcīgākais arguments par labu mērīšanai: kļūda bija neredzama no rezultāta un acīmredzama no korpusa, un detektors, kas nekad nav veicis šo testu, nezina, vai tam ir tā pati problēma.

Ko nevar izdarīt neviens detektors

Neviens AI detektors, ieskaitot šo, nav autorības pierādījums. Šie rīki mēra teksta statistiskās īpašības, un formāls, strukturēts vai otrajā valodā rakstīts cilvēku teksts daudzas no tām dala. Rezultāts ir iemesls uzdot jautājumu, nekad izdarīt secinājumu.

Pārbaudi savu tekstu

Bez maksas, bez konta. Latviešu valodā vērtējums balstās uz teksta struktūru un parāda tev teikumus, kas ietekmē rezultātu; šī lapa pasaka, kas ir izmērīts un kas ne.

Palaist bezmaksas AI detektoru

Pētnieki un žurnālisti: korpusi, novērtēšanas kods un kalibrēšanas rīki ir repozitorijā, uz kura balstās šī vietne. Ja vēlies atkārtot vai apstrīdēt kādu šīs lapas skaitli, raksti uz contact@thesisdraft.com, un mēs palīdzēsim.