Benchmark
Milyen gyakran téved az AI-ellenőrzőnk egy ember szövegén
Minden AI-detektor magabiztos százalékot ad vissza. Egyik sem mondja meg, milyen gyakran téved ez a százalék valakinél, aki a munkáját maga írta. Ez a második szám számít, ha te vagy a megvádolt hallgató, ezért ezt tesszük közzé, azokon a nyelveken, amelyeken megmértük.
Utolsó mérés: 2026. augusztus 24.. Az alábbi minden szám egy olyan szkriptből származik a tárolónkban, amely ugyanazokon a címkézett korpuszokon újra lefuttatható.
Ezen arányok egyikét sem mértük magyarul.
Az oldalon lévő számokat angol és német szövegeken mértük, és ezekhez a nyelvekhez kötődnek: attól, hogy magyarul írjuk le őket, nem lesznek magyar számok. Egy magyar szöveget csak a szöveg szerkezete alapján értékelünk (az írásstílus megjelenik, de nem számít bele), ideiglenesen: még nincs korpuszunk bizonyosan emberek által írt magyar dolgozatokból, így nem tudjuk megmondani, milyen gyakran tévedünk egy magyar szövegen, és amíg ez így van, a detektor magyarul soha nem ad piros ítéletet. Inkább megmondjuk, mint hogy egy angol számot a tiédként adjunk el.
Megmért álpozitív arányok
Milyen gyakran kapja meg a legerősebb ítéletünket egy olyan tudományos szöveg, amelyet bizonyosan ember írt. A pontosság nem egyetlen szám: a nyelvvel és a dokumentum hosszával változik, ezért négy profilt közlünk egy átlag helyett, amely elrejtené a gyengéket. Minden arány egy 95%-os felső határ, nem a megfigyelt szám: a határ az, amit állítani jogunk van, és mindig a kettő közül a rosszabb. A táblázatok küszöbei a belső mérési skáláinkon vannak; a megjelenített pontszám ugyanez az információ egy rögzített tengelyen, 20-tól borostyán, 50-től piros.
| Profil | Legerősebb ítélet | Álpozitív | Megfigyelt | Mérve ezen |
|---|---|---|---|---|
| Angol · 400 szó felett | Erős MI-nyomok | legfeljebb 3,13 % | 2/199 | 199 angol dokumentum a validációs félből (kombinált skála, w_style=0,5) |
| Német · 400 szó felett | Erős MI-nyomok | legfeljebb 1,63 % | 10/1035 | 1035 német dolgozat a validációs félből (kombinált skála, w_style=0,5) |
| Angol · 400 szó alatt | Erős MI-nyomok | nincs közzétéve | - | nincs releváns emberi populáció a birtokunkban |
| Német · 400 szó alatt | az „erős MI-nyomok” ítélet soha nem születik meg | - | - | - |
Egy rövid német szöveg soha nem kapja meg az „erős MI-nyomok” ítéletet, és a jelenlegi bizonyítékok alapján nem is fogja.
Rövid német szövegen egyetlen küszöb sem elég szigorú ahhoz, hogy megbízhatóan felismerje az MI-t, és közben kevesebbe kerüljön nagyjából 7 hamis vádnál 100-ból. Tizenöt ártatlan hallgatóból egy nem olyan alku, amelyet elfogadunk, ezért a rövid német profil a „néhány MI-nyom” szinten megáll. Ez megmért korlát, nem még megépítendő funkció.
A gyengébb ítéletek, amelyek zajosabbak
A legtöbb olvasó soha nem látja a legerősebb ítéletet. Ezek egyikét látja, és az itteni hibaarányok azok, amelyek valóban rá vonatkoznak. Az alsó angol borostyán sáv messze a legzajosabb.
| Profil | Ítélet | Küszöb | Álpozitív | Megfigyelt |
|---|---|---|---|---|
| Angol · 400 szó felett | Néhány MI-nyom | ≥ 96 | legfeljebb 5,86 % | 6/199 |
| Angol · 400 szó felett | Néhány MI-nyom (alsó borostyán sáv) | ≥ 91 | legfeljebb 8,37 % | 10/199 |
| Német · 400 szó felett | Néhány MI-nyom | ≥ 88 | legfeljebb 4,02 % | 31/1035 |
| Német · 400 szó felett | Néhány MI-nyom (alsó borostyán sáv) | ≥ 85 | legfeljebb 6,18 % | 51/1035 |
Amik ezek a számok nem
- A megfigyelt nulla nem nulla. Egyik hosszú profil sem adott egyetlen álpozitív eredményt sem a legszigorúbb küszöbön a nyers szerkezeti korpuszokban. Mégis közzétesszük az adott mintamérethez tartozó 95%-os felső határt, mert „0%”-ot írni pontosan az a túlzott magabiztosság lenne, amely ellen ez az oldal létezik.
- Az angol korpusz rossz műfajú. Azok a dokumentumok folyóiratcikkek: szerkesztettek, professzionálisak, csapatok írják őket. Egy hallgatói dolgozat egyik sem. Az arány becsületesen azon van mérve, amin állítja, és az angol küszöbök ott maradnak, ahol vannak, amíg nem lesz elég második nyelvként angolul írt hallgatói dolgozat az eltolásuk igazolására.
- A rövid szövegnek nincs közzétett aránya. A rövid profil néhány száz szavas ablakra vonatkozik, és egyetlen nálunk lévő emberi korpusz sem ilyen ablakból származik. Az itt korábban szereplő arányokat 2026. augusztus 21-én eltávolítottuk ahelyett, hogy meghagytuk volna, mert egy hihető szám populáció nélkül továbbra is megalapozatlan állítás.
- Az MI-korpuszok kicsik: nyelvenként nagyjából húsz dokumentum, két modellcsaládból. Egy általunk nem tesztelt modell másképp viselkedhet.
- A magyar nincs kalibrálva. Egy magyar szöveg csak a szöveg szerkezetén alapuló, ideiglenes ítéletet kap, pontossági állítás nélkül, és soha nem kap piros ítéletet.
Min mértünk
Az alábbi minden emberi dokumentum azelőtt jelent meg, hogy a ChatGPT létezett volna, így a szerzősége nem ítélet kérdése.
Német hallgatók szakdolgozatai, 2010-2021
n = 866
Teljes dokumentumok, azon a nyelven és abban a műfajban, amelyet németül kiszolgálunk, eleve emberi szövegek, mert megelőzik a ChatGPT-t. Ezen a korpuszon vannak beállítva a német küszöbök.
scripts/fetch-thesis-negatives.mjs
A kombináció validációs fele: német hallgatók szakdolgozatai, 2008-2021, teljes dokumentumok
n = 1035
Valódi német szakdolgozatok félretett fele (MOnAMi, Hochschule Mittweida, 2008-2021), amelyet az elemzés MINDKÉT fele értékelt: teljes dokumentumok, amelyeket soha nem használtunk a német modell tanítására. A kombinált német küszöbök ezen vannak meghúzva. Nem az ügyfeleink korából származó szövegek: egy 2026-os, kicsiszolt dolgozat olyan populáció, amelyet senki sem mért meg, és ez a fenntartás a szám része.
scripts/calibrate-components.mjs
Nyílt hozzáférésű cikkek, 2022 előtt
n = 1412
Teljes tudományos próza. A folyóiratcikkeket szerkesztik és csapatok írják, tehát nem hallgatói írások: ezért nem toljuk el ezek alapján az angol küszöböket.
scripts/fetch-longform-corpus.mjs
A kombináció validációs fele: cikkek + arXiv, 1500 szavas kivonatok
n = 199
Angol dokumentumok félretett fele (arXiv és 2022 előtti nyílt hozzáférésű cikkek), amelyet az elemzés MINDKÉT fele értékelt. A kombinált küszöbök ezen vannak meghúzva. Folyóiratpróza, nem hallgatói írás: azért mondjuk el, mert ez a fenntartás a szám része.
scripts/calibrate-components.mjs
arXiv-absztraktok, 2022 előtt
n = 236
Rövid angol szövegek. Az AUC-munkához megtartva; nem teszünk közzé belőlük álpozitív arányt, mert egy rövid ítéleti ablak nem az, amit egy absztraktkorpusz mér.
scripts/fetch-human-corpus.mjs
Német tudományos absztraktok, 2022 előtt
n = 60
OpenAlex, német funkciószavak alapján szűrve, mert a nyelvmező megbízhatatlan. Ezen alapul a döntés, hogy rövid német szövegre egyáltalán ne születhessen „erős MI-nyomok” ítélet.
scripts/fetch-german-corpus.mjs
Egyszer majdnem közzétettünk egy pénzfeldobásnál rosszabb detektort
Egy korai változatban a mérés 236 darab 2022 előtti arXiv-absztrakton ezt az AUC-t adta: 0.184. A pénzfeldobás 0,50. A detektor a gép által írt szöveget emberibbnek sorolta be, mint az emberek által írtat; az eredménye megfordítása javított volna rajta. És közben végig magabiztos százalékokat adott vissza.
Az ok a lexikai gazdagság mutatóinak egy családja volt (Yule-féle K, MTLD, Zipf-kitevő, hapax legomena), mind fordítva és erős hatással. A sűrű emberi tudományos prózát gépiesnek, a lexikailag változatos gépi prózát emberinek értékelik. Ugyanez a mechanizmus áll a közzétett eredmény mögött, amely szerint a detektorok tévesen jelölik meg a második nyelvként angolul írók többségét.
Ma ezeknek a mutatóknak nulla a súlyuk. Továbbra is kiszámítjuk és támpontként megjelenítjük őket, de nem mozdítják a pontszámot. Azért tesszük közzé, mert ez a legerősebb érvünk a mérés mellett: a hiba az eredményből láthatatlan, a korpuszból nyilvánvaló volt, és egy detektor, amely soha nem ment át ezen a teszten, nem tudja, nincs-e ugyanez a problémája.
Amire egyetlen detektor sem képes
Egyetlen AI-detektor, ezt is beleértve, sem a szerzőség bizonyítéka. Ezek az eszközök a szöveg statisztikai tulajdonságait mérik, és a formális, strukturált vagy második nyelven írt emberi szöveg ezek közül sokban osztozik. A pontszám ok egy kérdés feltételére, soha nem ok egy következtetés levonására.
Ellenőrizd a szövegedet
Az első 1500 szó ingyenes, fiók nélkül. Magyarul az ítélet a szöveg szerkezetén alapul, és megmutatja a mondatokat, amelyek befolyásolják; ez az oldal megmondja, mi van megmérve és mi nem.
Ingyenes AI-ellenőrzés indításaKutatók és újságírók: a korpuszok, az értékelő kód és a kalibrációs eszközök mind az oldal mögötti tárolóban vannak. Ha meg akarod ismételni vagy vitatni akarod az oldal valamelyik számát, írj a contact@thesisdraft.com címre, és segítünk.