Benchmark

Milyen gyakran téved az AI-ellenőrzőnk egy ember szövegén

Minden AI-detektor magabiztos százalékot ad vissza. Egyik sem mondja meg, milyen gyakran téved ez a százalék valakinél, aki a munkáját maga írta. Ez a második szám számít, ha te vagy a megvádolt hallgató, ezért ezt tesszük közzé, azokon a nyelveken, amelyeken megmértük.

Utolsó mérés: 2026. augusztus 24.. Az alábbi minden szám egy olyan szkriptből származik a tárolónkban, amely ugyanazokon a címkézett korpuszokon újra lefuttatható.

Ezen arányok egyikét sem mértük magyarul.

Az oldalon lévő számokat angol és német szövegeken mértük, és ezekhez a nyelvekhez kötődnek: attól, hogy magyarul írjuk le őket, nem lesznek magyar számok. Egy magyar szöveget csak a szöveg szerkezete alapján értékelünk (az írásstílus megjelenik, de nem számít bele), ideiglenesen: még nincs korpuszunk bizonyosan emberek által írt magyar dolgozatokból, így nem tudjuk megmondani, milyen gyakran tévedünk egy magyar szövegen, és amíg ez így van, a detektor magyarul soha nem ad piros ítéletet. Inkább megmondjuk, mint hogy egy angol számot a tiédként adjunk el.

Megmért álpozitív arányok

Milyen gyakran kapja meg a legerősebb ítéletünket egy olyan tudományos szöveg, amelyet bizonyosan ember írt. A pontosság nem egyetlen szám: a nyelvvel és a dokumentum hosszával változik, ezért négy profilt közlünk egy átlag helyett, amely elrejtené a gyengéket. Minden arány egy 95%-os felső határ, nem a megfigyelt szám: a határ az, amit állítani jogunk van, és mindig a kettő közül a rosszabb. A táblázatok küszöbei a belső mérési skáláinkon vannak; a megjelenített pontszám ugyanez az információ egy rögzített tengelyen, 20-tól borostyán, 50-től piros.

ProfilLegerősebb ítéletÁlpozitívMegfigyeltMérve ezen
Angol · 400 szó felettErős MI-nyomoklegfeljebb 3,13 %2/199199 angol dokumentum a validációs félből (kombinált skála, w_style=0,5)
Német · 400 szó felettErős MI-nyomoklegfeljebb 1,63 %10/10351035 német dolgozat a validációs félből (kombinált skála, w_style=0,5)
Angol · 400 szó alattErős MI-nyomoknincs közzétéve-nincs releváns emberi populáció a birtokunkban
Német · 400 szó alattaz „erős MI-nyomok” ítélet soha nem születik meg---

Egy rövid német szöveg soha nem kapja meg az „erős MI-nyomok” ítéletet, és a jelenlegi bizonyítékok alapján nem is fogja.

Rövid német szövegen egyetlen küszöb sem elég szigorú ahhoz, hogy megbízhatóan felismerje az MI-t, és közben kevesebbe kerüljön nagyjából 7 hamis vádnál 100-ból. Tizenöt ártatlan hallgatóból egy nem olyan alku, amelyet elfogadunk, ezért a rövid német profil a „néhány MI-nyom” szinten megáll. Ez megmért korlát, nem még megépítendő funkció.

A gyengébb ítéletek, amelyek zajosabbak

A legtöbb olvasó soha nem látja a legerősebb ítéletet. Ezek egyikét látja, és az itteni hibaarányok azok, amelyek valóban rá vonatkoznak. Az alsó angol borostyán sáv messze a legzajosabb.

ProfilÍtéletKüszöbÁlpozitívMegfigyelt
Angol · 400 szó felettNéhány MI-nyom≥ 96legfeljebb 5,86 %6/199
Angol · 400 szó felettNéhány MI-nyom (alsó borostyán sáv)≥ 91legfeljebb 8,37 %10/199
Német · 400 szó felettNéhány MI-nyom≥ 88legfeljebb 4,02 %31/1035
Német · 400 szó felettNéhány MI-nyom (alsó borostyán sáv)≥ 85legfeljebb 6,18 %51/1035

Amik ezek a számok nem

Min mértünk

Az alábbi minden emberi dokumentum azelőtt jelent meg, hogy a ChatGPT létezett volna, így a szerzősége nem ítélet kérdése.

Német hallgatók szakdolgozatai, 2010-2021

n = 866

Teljes dokumentumok, azon a nyelven és abban a műfajban, amelyet németül kiszolgálunk, eleve emberi szövegek, mert megelőzik a ChatGPT-t. Ezen a korpuszon vannak beállítva a német küszöbök.

scripts/fetch-thesis-negatives.mjs

A kombináció validációs fele: német hallgatók szakdolgozatai, 2008-2021, teljes dokumentumok

n = 1035

Valódi német szakdolgozatok félretett fele (MOnAMi, Hochschule Mittweida, 2008-2021), amelyet az elemzés MINDKÉT fele értékelt: teljes dokumentumok, amelyeket soha nem használtunk a német modell tanítására. A kombinált német küszöbök ezen vannak meghúzva. Nem az ügyfeleink korából származó szövegek: egy 2026-os, kicsiszolt dolgozat olyan populáció, amelyet senki sem mért meg, és ez a fenntartás a szám része.

scripts/calibrate-components.mjs

Nyílt hozzáférésű cikkek, 2022 előtt

n = 1412

Teljes tudományos próza. A folyóiratcikkeket szerkesztik és csapatok írják, tehát nem hallgatói írások: ezért nem toljuk el ezek alapján az angol küszöböket.

scripts/fetch-longform-corpus.mjs

A kombináció validációs fele: cikkek + arXiv, 1500 szavas kivonatok

n = 199

Angol dokumentumok félretett fele (arXiv és 2022 előtti nyílt hozzáférésű cikkek), amelyet az elemzés MINDKÉT fele értékelt. A kombinált küszöbök ezen vannak meghúzva. Folyóiratpróza, nem hallgatói írás: azért mondjuk el, mert ez a fenntartás a szám része.

scripts/calibrate-components.mjs

arXiv-absztraktok, 2022 előtt

n = 236

Rövid angol szövegek. Az AUC-munkához megtartva; nem teszünk közzé belőlük álpozitív arányt, mert egy rövid ítéleti ablak nem az, amit egy absztraktkorpusz mér.

scripts/fetch-human-corpus.mjs

Német tudományos absztraktok, 2022 előtt

n = 60

OpenAlex, német funkciószavak alapján szűrve, mert a nyelvmező megbízhatatlan. Ezen alapul a döntés, hogy rövid német szövegre egyáltalán ne születhessen „erős MI-nyomok” ítélet.

scripts/fetch-german-corpus.mjs

Egyszer majdnem közzétettünk egy pénzfeldobásnál rosszabb detektort

Egy korai változatban a mérés 236 darab 2022 előtti arXiv-absztrakton ezt az AUC-t adta: 0.184. A pénzfeldobás 0,50. A detektor a gép által írt szöveget emberibbnek sorolta be, mint az emberek által írtat; az eredménye megfordítása javított volna rajta. És közben végig magabiztos százalékokat adott vissza.

Az ok a lexikai gazdagság mutatóinak egy családja volt (Yule-féle K, MTLD, Zipf-kitevő, hapax legomena), mind fordítva és erős hatással. A sűrű emberi tudományos prózát gépiesnek, a lexikailag változatos gépi prózát emberinek értékelik. Ugyanez a mechanizmus áll a közzétett eredmény mögött, amely szerint a detektorok tévesen jelölik meg a második nyelvként angolul írók többségét.

Ma ezeknek a mutatóknak nulla a súlyuk. Továbbra is kiszámítjuk és támpontként megjelenítjük őket, de nem mozdítják a pontszámot. Azért tesszük közzé, mert ez a legerősebb érvünk a mérés mellett: a hiba az eredményből láthatatlan, a korpuszból nyilvánvaló volt, és egy detektor, amely soha nem ment át ezen a teszten, nem tudja, nincs-e ugyanez a problémája.

Amire egyetlen detektor sem képes

Egyetlen AI-detektor, ezt is beleértve, sem a szerzőség bizonyítéka. Ezek az eszközök a szöveg statisztikai tulajdonságait mérik, és a formális, strukturált vagy második nyelven írt emberi szöveg ezek közül sokban osztozik. A pontszám ok egy kérdés feltételére, soha nem ok egy következtetés levonására.

Ellenőrizd a szövegedet

Az első 1500 szó ingyenes, fiók nélkül. Magyarul az ítélet a szöveg szerkezetén alapul, és megmutatja a mondatokat, amelyek befolyásolják; ez az oldal megmondja, mi van megmérve és mi nem.

Ingyenes AI-ellenőrzés indítása

Kutatók és újságírók: a korpuszok, az értékelő kód és a kalibrációs eszközök mind az oldal mögötti tárolóban vannak. Ha meg akarod ismételni vagy vitatni akarod az oldal valamelyik számát, írj a contact@thesisdraft.com címre, és segítünk.