Mērījumi
Cik bieži mūsu AI detektors kļūdās par cilvēku
Katrs AI detektors sniedz pārliecinošu procentu. Neviens tev nepasaka, cik bieži šis procents kļūdās par cilvēku, kurš savu darbu uzrakstīja pats. Šis otrais skaitlis ir tas, kas ir svarīgs, ja apsūdzētais students esi tu, tāpēc mēs publicējam tieši to, tām valodām, kurās to esam izmērījuši.
Pēdējo reizi mērīts: 2026. gada 24. augusts. Katrs zemāk redzamais skaitlis nāk no skripta mūsu repozitorijā, ko var palaist vēlreiz uz tiem pašiem marķētajiem korpusiem.
Neviens no šiem biežumiem nav izmērīts latviešu valodā.
Šīs lapas skaitļi ir izmērīti uz angļu un vācu tekstiem un paliek piesaistīti šīm valodām: uzrakstīti latviski, tie nekļūst latviski. Latviešu teksts tiek vērtēts tikai pēc teksta struktūras (rakstības stils tiek parādīts, bet netiek ieskaitīts), provizoriski: mums vēl nav noteikti cilvēku rakstītu latviešu noslēguma darbu korpusa, tāpēc nevaram pateikt, cik bieži kļūdāmies par latviešu tekstu, un, kamēr tā ir, detektors latviešu valodā nekad nedod sarkanu vērtējumu. Labāk pasakām to tieši, nekā pasniedzam angļu skaitli kā tavu.
Izmērītie viltus pozitīvo rezultātu biežumi
Cik bieži noteikti cilvēka rakstīts akadēmisks teksts saņem mūsu stiprāko vērtējumu. Precizitāte nav viens skaitlis: tā mainās atkarībā no valodas un dokumenta garuma, tāpēc mēs norādām četrus profilus, nevis vidējo, kas paslēptu vājākos. Katrs biežums ir 95% augšējā robeža, nevis novērotais skaits: robeža ir tas, ko mums ir tiesības apgalvot, un tā vienmēr ir sliktākā no abām. Šo tabulu sliekšņi ir mūsu iekšējās mērījumu skalās; parādītais rezultāts ir tā pati informācija uz fiksētas ass, dzintara krāsa no 20, sarkanā no 50.
| Profils | Stiprākais vērtējums | Viltus pozitīvie | Novērots | Izmērīts uz |
|---|---|---|---|---|
| Angļu valoda · vairāk nekā 400 vārdi | Izteiktas AI pazīmes | ne vairāk kā 3,13 % | 2 no 199 | Validācijas puses EN dokumenti: 199 (kombinētā skala, w_style=0,5) |
| Vācu valoda · vairāk nekā 400 vārdi | Izteiktas AI pazīmes | ne vairāk kā 1,63 % | 10 no 1035 | Validācijas puses vācu noslēguma darbi: 1035 (kombinētā skala, w_style=0,5) |
| Angļu valoda · mazāk nekā 400 vārdi | Izteiktas AI pazīmes | netiek publicēts | - | atbilstošas cilvēku populācijas mums nav |
| Vācu valoda · mazāk nekā 400 vārdi | vērtējums «izteiktas AI pazīmes» nekad netiek dots | - | - | - |
Īss vācu teksts nekad nesaņem vērtējumu «izteiktas AI pazīmes», un ar pašreizējiem pierādījumiem arī nesaņems.
Īsam vācu tekstam neviens pietiekami stingrs slieksnis, kas uzticami atpazītu AI, nemaksā mazāk par aptuveni 7 nepatiesām apsūdzībām no 100. Viens nevainīgs students no piecpadsmit nav darījums, kuram piekrītam, tāpēc īsais vācu profils apstājas pie «dažas AI pazīmes». Tā ir izmērīta robeža, nevis vēl neuzbūvēta funkcija.
Vājākie vērtējumi, kas ir trokšņaināki
Lielākā daļa lasītāju nekad neredz stiprāko vērtējumu. Viņi redz kādu no šiem, un tieši šeit norādītie kļūdu biežumi viņus patiešām skar. Angļu zemākā dzintara josla ir ievērojami trokšņainākā.
| Profils | Vērtējums | Slieksnis | Viltus pozitīvie | Novērots |
|---|---|---|---|---|
| Angļu valoda · vairāk nekā 400 vārdi | Dažas AI pazīmes | ≥ 96 | ne vairāk kā 5,86 % | 6 no 199 |
| Angļu valoda · vairāk nekā 400 vārdi | Dažas AI pazīmes (zemākā dzintara josla) | ≥ 91 | ne vairāk kā 8,37 % | 10 no 199 |
| Vācu valoda · vairāk nekā 400 vārdi | Dažas AI pazīmes | ≥ 88 | ne vairāk kā 4,02 % | 31 no 1035 |
| Vācu valoda · vairāk nekā 400 vārdi | Dažas AI pazīmes (zemākā dzintara josla) | ≥ 85 | ne vairāk kā 6,18 % | 51 no 1035 |
Kas šie skaitļi nav
- Novērota nulle nav nulle. Neviens no garajiem profiliem neapstrādātajos struktūras korpusos pie stingrākā sliekšņa nedeva nevienu viltus pozitīvu rezultātu. Mēs tomēr publicējam šāda izlases lieluma 95% augšējo robežu, jo rakstīt «0%» būtu tieši tā pārlieku lielā pārliecība, pret kuru šī lapa pastāv.
- Angļu korpuss ir nepareiza žanra. Šie dokumenti ir žurnālu raksti: rediģēti, profesionāli, grupu rakstīti. Studenta noslēguma darbs nav nekas no tā. Biežums ir godīgi izmērīts uz tā, uz kā tas apgalvo esam izmērīts, un angļu sliekšņi paliek savā vietā, līdz mums būs pietiekami daudz angļu valodā kā otrajā valodā rakstītu studentu darbu, lai pamatotu to pārvietošanu.
- Īsam tekstam nav publicēta biežuma. Īsais profils attiecas uz dažu simtu vārdu logu, un neviens mūsu rīcībā esošais cilvēku korpuss nenāk no šī loga. Iepriekš šeit redzamie biežumi tika noņemti 2026. gada 21. augustā, nevis atstāti, jo ticams skaitlis bez populācijas aiz tā joprojām ir nepamatots apgalvojums.
- AI korpusi ir mazi: ap divdesmit dokumentiem katrai valodai, no divām modeļu saimēm. Modelis, ko neesam testējuši, var uzvesties citādi.
- Latviešu valoda nav kalibrēta. Latviešu teksts saņem vērtējumu, kas balstās tikai uz teksta struktūru, ir provizorisks, bez jebkāda precizitātes apgalvojuma, un nekad nesaņem sarkanu vērtējumu.
Uz kā mēs mērījām
Katrs zemāk minētais cilvēka dokuments tika publicēts, pirms ChatGPT pastāvēja, tāpēc tā autorība nav vērtējuma jautājums.
Vācu studentu noslēguma darbi, 2010-2021
n = 866
Veseli dokumenti tajā valodā un žanrā, ko apkalpojam vāciski, cilvēku rakstīti jau pēc konstrukcijas, jo tie ir vecāki par ChatGPT. Uz šī korpusa ir noteikti vācu sliekšņi.
scripts/fetch-thesis-negatives.mjs
Kombinācijas validācijas puse: vācu studentu noslēguma darbi, 2008-2021, veseli dokumenti
n = 1035
Atliktā īsto vācu noslēguma darbu puse (MOnAMi, Hochschule Mittweida, 2008-2021), novērtēta ar ABĀM analīzes pusēm: veseli dokumenti, kas nekad nav izmantoti vācu modeļa apmācībai. Kombinētie vācu sliekšņi ir noteikti uz tās. Tie nav mūsu klientu laikmeta teksti: nopulēts 2026. gada noslēguma darbs ir populācija, ko neviens nav izmērījis, un šī atruna ir daļa no skaitļa.
scripts/calibrate-components.mjs
Atvērtās piekļuves raksti, pirms 2022. gada
n = 1412
Pilnvērtīga akadēmiskā proza. Žurnālu raksti ir rediģēti un grupu rakstīti, tāpēc tā nav studentu rakstība: tāpēc angļu sliekšņi uz tiem netiek pārvietoti.
scripts/fetch-longform-corpus.mjs
Kombinācijas validācijas puse: raksti + arXiv, 1500 vārdu fragmenti
n = 199
Atliktā angļu dokumentu puse (arXiv un atvērtās piekļuves raksti pirms 2022. gada), novērtēta ar ABĀM analīzes pusēm. Kombinētie sliekšņi ir noteikti uz tās. Žurnālu proza, nevis studentu rakstība: mēs to sakām, jo šī atruna ir daļa no skaitļa.
scripts/calibrate-components.mjs
arXiv kopsavilkumi, pirms 2022. gada
n = 236
Īsi angļu teksti. Saglabāti AUC darbam; mēs no tiem nepublicējam nevienu viltus pozitīvo rezultātu biežumu, jo īss vērtējuma logs nav tas, ko mēra kopsavilkumu korpuss.
scripts/fetch-human-corpus.mjs
Vācu zinātniskie kopsavilkumi, pirms 2022. gada
n = 60
OpenAlex, filtrēts pēc vācu funkcionālajiem vārdiem, jo valodas lauks ir neuzticams. Uz tā balstās lēmums vispār nedot īsam vācu tekstam vērtējumu «izteiktas AI pazīmes».
scripts/fetch-german-corpus.mjs
Reiz mēs gandrīz publicējām detektoru, kas bija sliktāks par monētas mešanu
Vienā agrīnā versijā mērījums uz arXiv kopsavilkumiem pirms 2022. gada (236) deva AUC 0.184. Monētas mešana ir 0,50. Detektors mašīnas rakstītu tekstu uzskatīja par cilvēciskāku nekā cilvēku rakstīto; tā rezultāta apgriešana būtu to uzlabojusi. Un visu šo laiku tas sniedza pārliecinošus procentus.
Cēlonis bija leksiskās bagātības rādītāju saime (Jula K, MTLD, Cipfa eksponente, hapax legomena), visi pretējā virzienā un ar spēcīgu ietekmi. Tie blīvu cilvēku akadēmisko prozu vērtē kā mehānisku un leksiski daudzveidīgu mašīnas prozu kā cilvēcisku. Tas ir tas pats mehānisms, kas ir aiz publicētā rezultāta, ka detektori kļūdaini atzīmē lielāko daļu to, kuri raksta angļu valodā kā otrajā valodā.
Šodien šo rādītāju svars ir nulle. Tie joprojām tiek aprēķināti un parādīti kā norādes, bet tie nemaina rezultātu. Mēs to publicējam, jo tas ir mūsu spēcīgākais arguments par labu mērīšanai: kļūda bija neredzama no rezultāta un acīmredzama no korpusa, un detektors, kas nekad nav veicis šo testu, nezina, vai tam ir tā pati problēma.
Ko nevar izdarīt neviens detektors
Neviens AI detektors, ieskaitot šo, nav autorības pierādījums. Šie rīki mēra teksta statistiskās īpašības, un formāls, strukturēts vai otrajā valodā rakstīts cilvēku teksts daudzas no tām dala. Rezultāts ir iemesls uzdot jautājumu, nekad izdarīt secinājumu.
Pārbaudi savu tekstu
Bez maksas, bez konta. Latviešu valodā vērtējums balstās uz teksta struktūru un parāda tev teikumus, kas ietekmē rezultātu; šī lapa pasaka, kas ir izmērīts un kas ne.
Palaist bezmaksas AI detektoruPētnieki un žurnālisti: korpusi, novērtēšanas kods un kalibrēšanas rīki ir repozitorijā, uz kura balstās šī vietne. Ja vēlies atkārtot vai apstrīdēt kādu šīs lapas skaitli, raksti uz contact@thesisdraft.com, un mēs palīdzēsim.