Võrdlusmõõtmine

Kui sageli meie AI detector inimese puhul eksib

Iga AI detector annab enesekindla protsendi. Keegi ei ütle sulle, kui sageli see protsent eksib selle inimese puhul, kes kirjutas oma töö ise. See teine number on see, mis loeb, kui sina oled süüdistatud tudeng, seega avaldame just selle, nende keelte jaoks, milles oleme seda mõõtnud.

Viimati mõõdetud: 24. august 2026. Iga allolev number pärineb meie repositooriumi skriptist, mida saab samadel märgendatud korpustel uuesti käivitada.

Ühtegi neist määradest pole eesti keeles mõõdetud.

Selle lehe numbrid mõõdeti inglis- ja saksakeelsetel tekstidel ning jäävad nende keelte külge: eesti keeles kirjutamine ei tee neist eestikeelseid. Eestikeelset teksti hinnatakse ainult teksti struktuuri põhjal (kirjutamisstiili näidatakse, kuid see ei loe), esialgselt: meil pole veel kindlasti inimeste kirjutatud eestikeelsete lõputööde korpust, seega ei oska me öelda, kui sageli me eestikeelse teksti puhul eksime, ja seni ei anna detektor eesti keeles kunagi punast hinnangut. Ütleme selle pigem otse, kui esitame ingliskeelse numbri sinu omana.

Mõõdetud valepositiivsete määrad

Kui sageli saab kindlasti inimese kirjutatud akadeemiline tekst meie tugevaima hinnangu. Täpsus pole üks number: see muutub keele ja dokumendi pikkusega, seega esitame neli profiili keskmise asemel, mis peidaks nõrgemad. Iga määr on 95% ülempiir, mitte vaadeldud arv: ülempiir on see, mida meil on õigus väita, ja see on alati kahest halvem. Nende tabelite piirväärtused on meie sisemistel mõõteskaaladel; näidatav skoor on sama teave fikseeritud teljel, merevaigukollane alates 20-st ja punane alates 50-st.

ProfiilTugevaim hinnangValepositiivsedVaadeldudMõõdetud
Inglise keel · üle 400 sõnaSelged AI jäljedkõige rohkem 3,13 %2 / 199199 valideerimispoole EN dokumenti (kombineeritud skaala, w_style=0,5)
Saksa keel · üle 400 sõnaSelged AI jäljedkõige rohkem 1,63 %10 / 10351035 valideerimispoole saksa lõputööd (kombineeritud skaala, w_style=0,5)
Inglise keel · alla 400 sõnaSelged AI jäljedei avaldata-asjakohast inimpopulatsiooni pole meil käes
Saksa keel · alla 400 sõnahinnangut «selged AI jäljed» ei anta kunagi---

Lühike saksakeelne tekst ei saa kunagi hinnangut «selged AI jäljed», ja praeguste tõendite põhjal ei saagi.

Lühikese saksa teksti puhul ei maksa ükski piisavalt range piirväärtus, mis AI-d usaldusväärselt ära tunneks, vähem kui umbes 7 valesüüdistust 100 kohta. Üks süütu tudeng viieteistkümnest pole vahetuskaup, millega nõustume, seega peatub lühike saksa profiil hinnangul «mõned AI jäljed». See on mõõdetud piir, mitte veel ehitamata funktsioon.

Nõrgemad hinnangud, mis on mürarikkamad

Enamik lugejaid ei näe kunagi tugevaimat hinnangut. Nad näevad üht neist, ja just siinsed veamäärad puudutavad neid tegelikult. Ingliskeelne madalam merevaigukollane vahemik on kaugelt kõige mürarikkam.

ProfiilHinnangPiirväärtusValepositiivsedVaadeldud
Inglise keel · üle 400 sõnaMõned AI jäljed≥ 96kõige rohkem 5,86 %6 / 199
Inglise keel · üle 400 sõnaMõned AI jäljed (madalam merevaigukollane vahemik)≥ 91kõige rohkem 8,37 %10 / 199
Saksa keel · üle 400 sõnaMõned AI jäljed≥ 88kõige rohkem 4,02 %31 / 1035
Saksa keel · üle 400 sõnaMõned AI jäljed (madalam merevaigukollane vahemik)≥ 85kõige rohkem 6,18 %51 / 1035

Mida need numbrid ei ole

Millel me mõõtsime

Iga allolev inimdokument avaldati enne ChatGPT olemasolu, seega pole selle autorsus hinnangu küsimus.

Saksa tudengite lõputööd, 2010-2021

n = 866

Terved dokumendid keeles ja žanris, mida teenindame saksa keeles, inimeste kirjutatud juba ülesehituselt, sest need on vanemad kui ChatGPT. Sellel korpusel on saksa piirväärtused paika pandud.

scripts/fetch-thesis-negatives.mjs

Kombinatsiooni valideerimispool: saksa tudengite lõputööd, 2008-2021, terved dokumendid

n = 1035

Kõrvale pandud pool päris saksa lõputöödest (MOnAMi, Hochschule Mittweida, 2008-2021), mida hindasid analüüsi MÕLEMAD pooled: terved dokumendid, mida pole kunagi saksa mudeli treenimiseks kasutatud. Kombineeritud saksa piirväärtused on lõigatud sellel. Need pole meie klientide ajastu tekstid: lihvitud 2026. aasta lõputöö on populatsioon, mida keegi pole mõõtnud, ja see hoiatus kuulub numbri juurde.

scripts/calibrate-components.mjs

Avatud juurdepääsuga artiklid, enne 2022. aastat

n = 1412

Terviklik akadeemiline proosa. Ajakirjaartiklid on toimetatud ja rühmade kirjutatud, seega pole need tudengite kirjutis: seepärast ei liigutata ingliskeelseid piirväärtusi nende põhjal.

scripts/fetch-longform-corpus.mjs

Kombinatsiooni valideerimispool: artiklid + arXiv, 1500-sõnalised väljavõtted

n = 199

Kõrvale pandud pool ingliskeelsetest dokumentidest (arXiv ja enne 2022. aastat avaldatud avatud juurdepääsuga artiklid), mida hindasid analüüsi MÕLEMAD pooled. Kombineeritud piirväärtused on lõigatud sellel. Ajakirjaproosa, mitte tudengite kirjutis: ütleme seda, sest see hoiatus kuulub numbri juurde.

scripts/calibrate-components.mjs

arXivi kokkuvõtted, enne 2022. aastat

n = 236

Lühikesed ingliskeelsed tekstid. Hoitud AUC-töö jaoks; me ei avalda nende põhjal ühtegi valepositiivsete määra, sest lühike hinnanguaken pole see, mida kokkuvõtete korpus mõõdab.

scripts/fetch-human-corpus.mjs

Saksakeelsed teaduslikud kokkuvõtted, enne 2022. aastat

n = 60

OpenAlex, filtreeritud saksa funktsioonisõnade järgi, sest keeleväli on ebausaldusväärne. Sellel põhineb otsus mitte anda lühikesele saksa tekstile üldse hinnangut «selged AI jäljed».

scripts/fetch-german-corpus.mjs

Kord avaldasime peaaegu detektori, mis oli halvem kui mündiviske

Ühes varases versioonis andis mõõtmine 236 enne 2022. aastat avaldatud arXivi kokkuvõttel AUC väärtuse 0.184. Mündiviske väärtus on 0,50. Detektor pidas masina kirjutatud teksti inimlikumaks kui inimeste kirjutatut; selle tulemuse ümberpööramine oleks seda parandanud. Ja kogu selle aja andis see enesekindlaid protsente.

Põhjus oli sõnavararikkuse näitajate perekond (Yule'i K, MTLD, Zipfi astendaja, hapax legomena), kõik vastupidises suunas ja tugeva mõjuga. Need hindavad tihedat inimeste akadeemilist proosat masinlikuks ja leksikaalselt mitmekesist masinproosat inimlikuks. See on sama mehhanism, mis on avaldatud tulemuse taga, mille järgi detektorid märgivad ekslikult enamiku inglise keelt teise keelena kirjutajatest.

Täna on nende näitajate kaal null. Neid arvutatakse ja näidatakse ikka vihjetena, kuid need ei liiguta skoori. Avaldame selle, sest see on tugevaim argument mõõtmise kasuks: viga oli tulemusest nähtamatu ja korpusest ilmne, ning detektor, mis pole seda testi kunagi teinud, ei tea, kas tal on sama probleem.

Mida ükski detektor teha ei saa

Ükski AI detector, ka see, pole autorsuse tõend. Need tööriistad mõõdavad teksti statistilisi omadusi, ja formaalne, struktureeritud või teises keeles kirjutatud inimtekst jagab paljusid neist. Skoor on põhjus küsimuse esitamiseks, mitte kunagi järelduse tegemiseks.

Analüüsi oma teksti

Tasuta, ilma kontota. Eesti keeles põhineb hinnang teksti struktuuril ja näitab sulle laused, mis kaaluvad; see leht ütleb, mis on mõõdetud ja mis mitte.

Käivita tasuta AI detector

Teadlased ja ajakirjanikud: korpused, hindamiskood ja kalibreerimistööriistad on kõik selle saidi taga olevas repositooriumis. Kui soovid mõnda selle lehe numbrit korrata või vaidlustada, kirjuta aadressile contact@thesisdraft.com ja me aitame.