Matavimas

Kaip dažnai mūsų AI detektorius klysta dėl žmogaus

Kiekvienas AI detektorius pateikia užtikrintą procentą. Niekas jums nesako, kaip dažnai tas procentas klysta dėl žmogaus, kuris savo darbą parašė pats. Tas antrasis skaičius svarbus, jei kaltinamas studentas esate jūs, todėl jį ir skelbiame, toms kalboms, kuriomis jį išmatavome.

Paskutinį kartą matuota: 2026 m. rugpjūčio 24 d.. Kiekvienas toliau pateiktas skaičius gautas iš mūsų saugyklos scenarijaus, kurį galima paleisti iš naujo su tais pačiais pažymėtais tekstynais.

Nė vienas iš šių dažnių neišmatuotas lietuvių kalba.

Šio puslapio skaičiai išmatuoti angliškais ir vokiškais tekstais ir lieka susieti su tomis kalbomis: parašyti lietuviškai jie netampa lietuviški. Lietuviškas tekstas vertinamas tik pagal teksto struktūrą (rašymo stilius rodomas, bet neįskaičiuojamas), preliminariai: dar neturime tikrai žmonių parašytų lietuviškų baigiamųjų darbų tekstyno, todėl negalime pasakyti, kaip dažnai klystame dėl lietuviško teksto, ir kol taip yra, detektorius lietuvių kalba niekada nepateikia raudono vertinimo. Verčiau pasakome tai tiesiai, nei pateikiame anglišką skaičių kaip jūsų.

Išmatuoti klaidingai teigiamų rezultatų dažniai

Kaip dažnai tikrai žmogaus parašytas akademinis tekstas gauna mūsų stipriausią vertinimą. Tikslumas nėra vienas skaičius: jis kinta pagal kalbą ir dokumento ilgį, todėl pateikiame keturis profilius, o ne vidurkį, kuris paslėptų silpnesniuosius. Kiekvienas dažnis yra 95 % viršutinė riba, ne stebėtas skaičius: riba yra tai, ką turime teisę teigti, ir ji visada yra blogesnė iš dviejų. Šių lentelių ribos yra mūsų vidinėse matavimo skalėse; rodomas balas yra ta pati informacija fiksuotoje ašyje, gintarinė nuo 20, raudona nuo 50.

ProfilisStipriausias vertinimasKlaidingai teigiamiStebėtaIšmatuota
Anglų k. · daugiau nei 400 žodžiųRyškūs DI pėdsakaine daugiau kaip 3,13 %2 iš 199Validavimo pusės EN dokumentai: 199 (sujungta skalė, w_style=0,5)
Vokiečių k. · daugiau nei 400 žodžiųRyškūs DI pėdsakaine daugiau kaip 1,63 %10 iš 1 035Validavimo pusės vokiečių baigiamieji darbai: 1 035 (sujungta skalė, w_style=0,5)
Anglų k. · mažiau nei 400 žodžiųRyškūs DI pėdsakaineskelbiama-tinkamos žmonių populiacijos neturime
Vokiečių k. · mažiau nei 400 žodžiųvertinimas „ryškūs DI pėdsakai“ niekada nepateikiamas---

Trumpas vokiškas tekstas niekada negauna vertinimo „ryškūs DI pėdsakai“, ir pagal dabartinius įrodymus negaus.

Trumpam vokiškam tekstui jokia pakankamai griežta riba, kuri patikimai atpažintų DI, nekainuoja mažiau nei maždaug 7 klaidingi kaltinimai iš 100. Vienas nekaltas studentas iš penkiolikos nėra mainai, kuriems pritariame, todėl trumpas vokiečių profilis sustoja ties „kai kurie DI pėdsakai“. Tai išmatuota riba, ne dar nesukurta funkcija.

Silpnesni vertinimai, kurie yra triukšmingesni

Dauguma skaitytojų niekada nemato stipriausio vertinimo. Jie mato vieną iš šių, ir būtent čia pateikti klaidų dažniai jiems iš tikrųjų svarbūs. Angliška žemesnė gintarinė juosta yra gerokai triukšmingiausia.

ProfilisVertinimasRibaKlaidingai teigiamiStebėta
Anglų k. · daugiau nei 400 žodžiųKai kurie DI pėdsakai≥ 96ne daugiau kaip 5,86 %6 iš 199
Anglų k. · daugiau nei 400 žodžiųKai kurie DI pėdsakai (žemesnė gintarinė juosta)≥ 91ne daugiau kaip 8,37 %10 iš 199
Vokiečių k. · daugiau nei 400 žodžiųKai kurie DI pėdsakai≥ 88ne daugiau kaip 4,02 %31 iš 1 035
Vokiečių k. · daugiau nei 400 žodžiųKai kurie DI pėdsakai (žemesnė gintarinė juosta)≥ 85ne daugiau kaip 6,18 %51 iš 1 035

Kas šie skaičiai nėra

Ką matavome

Kiekvienas toliau nurodytas žmonių dokumentas paskelbtas dar prieš atsirandant ChatGPT, todėl jo autorystė nėra vertinimo klausimas.

Vokiečių studentų baigiamieji darbai, 2010-2021

n = 866

Visi dokumentai ta kalba ir to žanro, kurį aptarnaujame vokiečių kalba, žmonių parašyti jau pagal sudarymą, nes jie senesni už ChatGPT. Šiame tekstyne nustatytos vokiečių kalbos ribos.

scripts/fetch-thesis-negatives.mjs

Derinio validavimo pusė: vokiečių studentų baigiamieji darbai, 2008-2021, visi dokumentai

n = 1 035

Atidėta tikrų vokiečių baigiamųjų darbų pusė (MOnAMi, Hochschule Mittweida, 2008-2021), įvertinta ABIEM analizės pusėmis: visi dokumentai, niekada nenaudoti vokiečių modeliui mokyti. Sujungtos vokiečių ribos nukirptos joje. Tai ne mūsų klientų laikotarpio tekstai: nušlifuotas 2026 m. baigiamasis darbas yra populiacija, kurios niekas neišmatavo, ir ši išlyga yra skaičiaus dalis.

scripts/calibrate-components.mjs

Atvirosios prieigos straipsniai, iki 2022 m.

n = 1 412

Pilna akademinė proza. Žurnalų straipsniai redaguoti ir parašyti grupių, todėl tai ne studentų rašymas: dėl to anglų kalbos ribos pagal juos nekeičiamos.

scripts/fetch-longform-corpus.mjs

Derinio validavimo pusė: straipsniai + arXiv, 1 500 žodžių ištraukos

n = 199

Atidėta angliškų dokumentų pusė (arXiv ir atvirosios prieigos straipsniai iki 2022 m.), įvertinta ABIEM analizės pusėmis. Sujungtos ribos nukirptos joje. Žurnalų proza, ne studentų rašymas: sakome tai, nes ši išlyga yra skaičiaus dalis.

scripts/calibrate-components.mjs

arXiv santraukos, iki 2022 m.

n = 236

Trumpi angliški tekstai. Laikomi AUC darbui; pagal juos neskelbiame jokio klaidingai teigiamų rezultatų dažnio, nes trumpas vertinimo langas nėra tai, ką matuoja santraukų tekstynas.

scripts/fetch-human-corpus.mjs

Vokiškos mokslinės santraukos, iki 2022 m.

n = 60

OpenAlex, filtruota pagal vokiečių funkcinius žodžius, nes kalbos laukas nepatikimas. Juo grindžiamas sprendimas trumpam vokiškam tekstui apskritai nepateikti vertinimo „ryškūs DI pėdsakai“.

scripts/fetch-german-corpus.mjs

Kartą vos nepaskelbėme detektoriaus, prastesnio už monetos metimą

Vienoje ankstyvoje versijoje matavimas su arXiv santraukomis iki 2022 m. (236) davė AUC 0.184. Monetos metimas yra 0,50. Detektorius mašinos parašytą tekstą laikė žmogiškesniu nei žmonių parašytą; apvertus jo rezultatą, jis būtų pagerėjęs. Ir visą tą laiką jis pateikdavo užtikrintus procentus.

Priežastis buvo leksinio turtingumo rodiklių šeima (Yule K, MTLD, Zipfo rodiklis, hapax legomena), visi priešinga kryptimi ir su stipriu poveikiu. Jie tankią žmonių akademinę prozą vertina kaip mechanišką, o leksiškai įvairią mašinos prozą kaip žmogišką. Tai tas pats mechanizmas, kuris slypi už paskelbto rezultato, kad detektoriai klaidingai pažymi daugumą anglų kalba kaip antrąja rašančiųjų.

Šiandien šių rodiklių svoris yra nulis. Jie vis dar skaičiuojami ir rodomi kaip užuominos, bet nekeičia balo. Skelbiame tai, nes tai stipriausias mūsų argumentas už matavimą: klaida buvo nematoma iš rezultato ir akivaizdi iš tekstyno, o detektorius, kuris niekada neatliko šio testo, nežino, ar turi tą pačią problemą.

Ko negali padaryti joks detektorius

Joks AI detektorius, įskaitant šį, nėra autorystės įrodymas. Šie įrankiai matuoja statistines teksto savybes, ir formalus, struktūruotas ar antrąja kalba parašytas žmonių tekstas turi daug jų. Balas yra priežastis užduoti klausimą, niekada ne padaryti išvadą.

Patikrinkite savo tekstą

Nemokamai, be paskyros. Lietuvių kalba vertinimas grindžiamas teksto struktūra ir parodo sakinius, kurie lemia rezultatą; šis puslapis sako, kas išmatuota ir kas ne.

Paleisti nemokamą AI detektorių

Tyrėjai ir žurnalistai: tekstynai, vertinimo kodas ir kalibravimo įrankiai yra saugykloje, kuria grindžiama ši svetainė. Jei norite atkartoti ar ginčyti kurį nors šio puslapio skaičių, rašykite contact@thesisdraft.com ir padėsime.