Võrdlusmõõtmine
Kui sageli meie AI detector inimese puhul eksib
Iga AI detector annab enesekindla protsendi. Keegi ei ütle sulle, kui sageli see protsent eksib selle inimese puhul, kes kirjutas oma töö ise. See teine number on see, mis loeb, kui sina oled süüdistatud tudeng, seega avaldame just selle, nende keelte jaoks, milles oleme seda mõõtnud.
Viimati mõõdetud: 24. august 2026. Iga allolev number pärineb meie repositooriumi skriptist, mida saab samadel märgendatud korpustel uuesti käivitada.
Ühtegi neist määradest pole eesti keeles mõõdetud.
Selle lehe numbrid mõõdeti inglis- ja saksakeelsetel tekstidel ning jäävad nende keelte külge: eesti keeles kirjutamine ei tee neist eestikeelseid. Eestikeelset teksti hinnatakse ainult teksti struktuuri põhjal (kirjutamisstiili näidatakse, kuid see ei loe), esialgselt: meil pole veel kindlasti inimeste kirjutatud eestikeelsete lõputööde korpust, seega ei oska me öelda, kui sageli me eestikeelse teksti puhul eksime, ja seni ei anna detektor eesti keeles kunagi punast hinnangut. Ütleme selle pigem otse, kui esitame ingliskeelse numbri sinu omana.
Mõõdetud valepositiivsete määrad
Kui sageli saab kindlasti inimese kirjutatud akadeemiline tekst meie tugevaima hinnangu. Täpsus pole üks number: see muutub keele ja dokumendi pikkusega, seega esitame neli profiili keskmise asemel, mis peidaks nõrgemad. Iga määr on 95% ülempiir, mitte vaadeldud arv: ülempiir on see, mida meil on õigus väita, ja see on alati kahest halvem. Nende tabelite piirväärtused on meie sisemistel mõõteskaaladel; näidatav skoor on sama teave fikseeritud teljel, merevaigukollane alates 20-st ja punane alates 50-st.
| Profiil | Tugevaim hinnang | Valepositiivsed | Vaadeldud | Mõõdetud |
|---|---|---|---|---|
| Inglise keel · üle 400 sõna | Selged AI jäljed | kõige rohkem 3,13 % | 2 / 199 | 199 valideerimispoole EN dokumenti (kombineeritud skaala, w_style=0,5) |
| Saksa keel · üle 400 sõna | Selged AI jäljed | kõige rohkem 1,63 % | 10 / 1035 | 1035 valideerimispoole saksa lõputööd (kombineeritud skaala, w_style=0,5) |
| Inglise keel · alla 400 sõna | Selged AI jäljed | ei avaldata | - | asjakohast inimpopulatsiooni pole meil käes |
| Saksa keel · alla 400 sõna | hinnangut «selged AI jäljed» ei anta kunagi | - | - | - |
Lühike saksakeelne tekst ei saa kunagi hinnangut «selged AI jäljed», ja praeguste tõendite põhjal ei saagi.
Lühikese saksa teksti puhul ei maksa ükski piisavalt range piirväärtus, mis AI-d usaldusväärselt ära tunneks, vähem kui umbes 7 valesüüdistust 100 kohta. Üks süütu tudeng viieteistkümnest pole vahetuskaup, millega nõustume, seega peatub lühike saksa profiil hinnangul «mõned AI jäljed». See on mõõdetud piir, mitte veel ehitamata funktsioon.
Nõrgemad hinnangud, mis on mürarikkamad
Enamik lugejaid ei näe kunagi tugevaimat hinnangut. Nad näevad üht neist, ja just siinsed veamäärad puudutavad neid tegelikult. Ingliskeelne madalam merevaigukollane vahemik on kaugelt kõige mürarikkam.
| Profiil | Hinnang | Piirväärtus | Valepositiivsed | Vaadeldud |
|---|---|---|---|---|
| Inglise keel · üle 400 sõna | Mõned AI jäljed | ≥ 96 | kõige rohkem 5,86 % | 6 / 199 |
| Inglise keel · üle 400 sõna | Mõned AI jäljed (madalam merevaigukollane vahemik) | ≥ 91 | kõige rohkem 8,37 % | 10 / 199 |
| Saksa keel · üle 400 sõna | Mõned AI jäljed | ≥ 88 | kõige rohkem 4,02 % | 31 / 1035 |
| Saksa keel · üle 400 sõna | Mõned AI jäljed (madalam merevaigukollane vahemik) | ≥ 85 | kõige rohkem 6,18 % | 51 / 1035 |
Mida need numbrid ei ole
- Vaadeldud null pole null. Kumbki pikk profiil ei andnud toorestes struktuurikorpustes rangeimal piirväärtusel ühtegi valepositiivset. Avaldame siiski selle valimimahu 95% ülempiiri, sest «0%» kirjutamine oleks just see liigne enesekindlus, mille vastu see leht on olemas.
- Ingliskeelne korpus on vale žanriga. Need dokumendid on ajakirjaartiklid: toimetatud, professionaalsed, rühmade kirjutatud. Tudengi lõputöö pole midagi sellist. Määr on ausalt mõõdetud sellel, millel see väidab end mõõdetud olevat, ja ingliskeelsed piirväärtused jäävad paigale, kuni meil on piisavalt teise keelena inglise keeles kirjutatud tudengite lõputöid, et nende liigutamist põhjendada.
- Lühikesel tekstil pole avaldatud määra. Lühike profiil puudutab mõnesajasõnalist akent, ja ükski meie käes olev inimkorpus ei pärine sellest aknast. Siin varem olnud määrad eemaldati 21. augustil 2026, selle asemel et neid alles jätta, sest usutav number ilma populatsioonita selle taga on ikkagi alusetu väide.
- AI korpused on väikesed: paarkümmend dokumenti keele kohta, kahest mudeliperekonnast. Mudel, mida me pole testinud, võib käituda teisiti.
- Eesti keel pole kalibreeritud. Eestikeelne tekst saab hinnangu, mis põhineb ainult teksti struktuuril, on esialgne, ilma igasuguse täpsusväiteta, ega saa kunagi punast hinnangut.
Millel me mõõtsime
Iga allolev inimdokument avaldati enne ChatGPT olemasolu, seega pole selle autorsus hinnangu küsimus.
Saksa tudengite lõputööd, 2010-2021
n = 866
Terved dokumendid keeles ja žanris, mida teenindame saksa keeles, inimeste kirjutatud juba ülesehituselt, sest need on vanemad kui ChatGPT. Sellel korpusel on saksa piirväärtused paika pandud.
scripts/fetch-thesis-negatives.mjs
Kombinatsiooni valideerimispool: saksa tudengite lõputööd, 2008-2021, terved dokumendid
n = 1035
Kõrvale pandud pool päris saksa lõputöödest (MOnAMi, Hochschule Mittweida, 2008-2021), mida hindasid analüüsi MÕLEMAD pooled: terved dokumendid, mida pole kunagi saksa mudeli treenimiseks kasutatud. Kombineeritud saksa piirväärtused on lõigatud sellel. Need pole meie klientide ajastu tekstid: lihvitud 2026. aasta lõputöö on populatsioon, mida keegi pole mõõtnud, ja see hoiatus kuulub numbri juurde.
scripts/calibrate-components.mjs
Avatud juurdepääsuga artiklid, enne 2022. aastat
n = 1412
Terviklik akadeemiline proosa. Ajakirjaartiklid on toimetatud ja rühmade kirjutatud, seega pole need tudengite kirjutis: seepärast ei liigutata ingliskeelseid piirväärtusi nende põhjal.
scripts/fetch-longform-corpus.mjs
Kombinatsiooni valideerimispool: artiklid + arXiv, 1500-sõnalised väljavõtted
n = 199
Kõrvale pandud pool ingliskeelsetest dokumentidest (arXiv ja enne 2022. aastat avaldatud avatud juurdepääsuga artiklid), mida hindasid analüüsi MÕLEMAD pooled. Kombineeritud piirväärtused on lõigatud sellel. Ajakirjaproosa, mitte tudengite kirjutis: ütleme seda, sest see hoiatus kuulub numbri juurde.
scripts/calibrate-components.mjs
arXivi kokkuvõtted, enne 2022. aastat
n = 236
Lühikesed ingliskeelsed tekstid. Hoitud AUC-töö jaoks; me ei avalda nende põhjal ühtegi valepositiivsete määra, sest lühike hinnanguaken pole see, mida kokkuvõtete korpus mõõdab.
scripts/fetch-human-corpus.mjs
Saksakeelsed teaduslikud kokkuvõtted, enne 2022. aastat
n = 60
OpenAlex, filtreeritud saksa funktsioonisõnade järgi, sest keeleväli on ebausaldusväärne. Sellel põhineb otsus mitte anda lühikesele saksa tekstile üldse hinnangut «selged AI jäljed».
scripts/fetch-german-corpus.mjs
Kord avaldasime peaaegu detektori, mis oli halvem kui mündiviske
Ühes varases versioonis andis mõõtmine 236 enne 2022. aastat avaldatud arXivi kokkuvõttel AUC väärtuse 0.184. Mündiviske väärtus on 0,50. Detektor pidas masina kirjutatud teksti inimlikumaks kui inimeste kirjutatut; selle tulemuse ümberpööramine oleks seda parandanud. Ja kogu selle aja andis see enesekindlaid protsente.
Põhjus oli sõnavararikkuse näitajate perekond (Yule'i K, MTLD, Zipfi astendaja, hapax legomena), kõik vastupidises suunas ja tugeva mõjuga. Need hindavad tihedat inimeste akadeemilist proosat masinlikuks ja leksikaalselt mitmekesist masinproosat inimlikuks. See on sama mehhanism, mis on avaldatud tulemuse taga, mille järgi detektorid märgivad ekslikult enamiku inglise keelt teise keelena kirjutajatest.
Täna on nende näitajate kaal null. Neid arvutatakse ja näidatakse ikka vihjetena, kuid need ei liiguta skoori. Avaldame selle, sest see on tugevaim argument mõõtmise kasuks: viga oli tulemusest nähtamatu ja korpusest ilmne, ning detektor, mis pole seda testi kunagi teinud, ei tea, kas tal on sama probleem.
Mida ükski detektor teha ei saa
Ükski AI detector, ka see, pole autorsuse tõend. Need tööriistad mõõdavad teksti statistilisi omadusi, ja formaalne, struktureeritud või teises keeles kirjutatud inimtekst jagab paljusid neist. Skoor on põhjus küsimuse esitamiseks, mitte kunagi järelduse tegemiseks.
Analüüsi oma teksti
Tasuta, ilma kontota. Eesti keeles põhineb hinnang teksti struktuuril ja näitab sulle laused, mis kaaluvad; see leht ütleb, mis on mõõdetud ja mis mitte.
Käivita tasuta AI detectorTeadlased ja ajakirjanikud: korpused, hindamiskood ja kalibreerimistööriistad on kõik selle saidi taga olevas repositooriumis. Kui soovid mõnda selle lehe numbrit korrata või vaidlustada, kirjuta aadressile contact@thesisdraft.com ja me aitame.