Benchmark

Cât de des greșește detectorul nostru AI în privința unui om

Orice detector AI îți dă un procent sigur pe el. Niciunul nu îți spune cât de des acel procent greșește în privința cuiva care și-a scris singur lucrarea. Al doilea număr este cel care contează dacă tu ești studentul acuzat, așa că pe acela îl publicăm, pentru limbile în care l-am măsurat.

Ultima măsurare: 24 august 2026. Fiecare cifră de mai jos provine dintr-un script din depozitul nostru care poate fi rulat din nou pe aceleași corpusuri etichetate.

Niciuna dintre aceste rate nu a fost măsurată în română.

Cifrele de pe această pagină au fost măsurate pe texte în engleză și germană și rămân legate de acele limbi: scrise în română, nu devin românești. Un text în română este evaluat doar după structura textului (stilul de scriere este afișat, dar nu contează), în mod provizoriu: încă nu avem un corpus de lucrări românești scrise sigur de oameni, așa că nu îți putem spune cât de des greșim pe un text în română, iar cât timp e așa detectorul nu dă niciodată un verdict roșu în română. Preferăm să îți spunem asta decât să îți prezentăm un număr englezesc drept al tău.

Rate de fals pozitive măsurate

Cât de des un text academic scris sigur de un om primește verdictul nostru cel mai puternic. Precizia nu este un singur număr: se schimbă cu limba și cu lungimea documentului, așa că raportăm patru profiluri în loc de o medie care le-ar ascunde pe cele slabe. Fiecare rată este o limită superioară de 95% și nu numărul observat: limita este ce avem dreptul să afirmăm, și este mereu cea mai proastă dintre cele două. Pragurile din aceste tabele sunt pe scalele noastre interne de măsurare; scorul afișat este aceeași informație pe o axă fixă, cu chihlimbar de la 20 și roșu de la 50.

ProfilCel mai puternic verdictFals pozitiveObservateMăsurat pe
Engleză · peste 400 de cuvinteAmprente clare de IAcel mult 3,13 %2 din 199199 de documente EN din jumătatea de validare (scară combinată, w_style=0,5)
Germană · peste 400 de cuvinteAmprente clare de IAcel mult 1,63 %10 din 1.0351.035 de lucrări germane din jumătatea de validare (scară combinată, w_style=0,5)
Engleză · sub 400 de cuvinteAmprente clare de IAnepublicat-nicio populație umană relevantă disponibilă
Germană · sub 400 de cuvinteverdictul «amprente clare de IA» nu este emis niciodată---

Un text german scurt nu primește niciodată verdictul «amprente clare de IA», și cu dovezile de acum nici nu îl va primi.

Pe germana scurtă, niciun prag destul de strict ca să recunoască fiabil AI nu costă mai puțin de aproximativ 7 acuzații false din 100. Un student nevinovat din cincisprezece nu este un compromis pe care îl acceptăm, așa că profilul german scurt se oprește la «câteva amprente de IA». Este o limită măsurată, nu o funcție încă neconstruită.

Verdictele mai slabe, care sunt mai zgomotoase

Majoritatea cititorilor nu văd niciodată verdictul cel mai puternic. Văd unul dintre acestea, iar ratele de eroare de aici sunt cele care îi privesc cu adevărat. Banda chihlimbar inferioară în engleză este de departe cea mai zgomotoasă.

ProfilVerdictPragFals pozitiveObservate
Engleză · peste 400 de cuvinteCâteva amprente de IA≥ 96cel mult 5,86 %6 din 199
Engleză · peste 400 de cuvinteCâteva amprente de IA (banda chihlimbar inferioară)≥ 91cel mult 8,37 %10 din 199
Germană · peste 400 de cuvinteCâteva amprente de IA≥ 88cel mult 4,02 %31 din 1.035
Germană · peste 400 de cuvinteCâteva amprente de IA (banda chihlimbar inferioară)≥ 85cel mult 6,18 %51 din 1.035

Ce nu sunt aceste numere

Pe ce am măsurat

Fiecare document uman de mai jos a fost publicat înainte să existe ChatGPT, așa că paternitatea lui nu este o chestiune de apreciere.

Lucrări de studenți germani, 2010-2021

n = 866

Documente complete, în limba și genul pe care le servim în germană, umane prin construcție pentru că sunt dinainte de ChatGPT. Pe acest corpus sunt fixate pragurile germane.

scripts/fetch-thesis-negatives.mjs

Jumătatea de validare a combinației: lucrări de studenți germani, 2008-2021, documente complete

n = 1.035

Jumătatea păstrată deoparte dintr-un set de lucrări germane reale (MOnAMi, Hochschule Mittweida, 2008-2021), evaluată de AMBELE jumătăți ale analizei: documente complete, nefolosite niciodată la antrenarea modelului german. Pragurile germane combinate sunt tăiate pe ea. Nu sunt texte din perioada clienților noștri: o lucrare finisată din 2026 este o populație pe care n-a măsurat-o nimeni, iar această rezervă face parte din număr.

scripts/calibrate-components.mjs

Articole cu acces deschis, dinainte de 2022

n = 1.412

Proză academică completă. Articolele de revistă sunt redactate și scrise în echipă, deci nu sunt scris de student: de aceea pragurile englezești nu sunt mutate pe baza lor.

scripts/fetch-longform-corpus.mjs

Jumătatea de validare a combinației: articole + arXiv, extrase de 1.500 de cuvinte

n = 199

Jumătatea păstrată deoparte din documente englezești (arXiv și articole cu acces deschis dinainte de 2022), evaluată de AMBELE jumătăți ale analizei. Pragurile combinate sunt tăiate pe ea. Proză de revistă, nu scris de student: o spunem pentru că această rezervă face parte din număr.

scripts/calibrate-components.mjs

Rezumate arXiv, dinainte de 2022

n = 236

Texte scurte în engleză. Păstrate pentru munca pe AUC; nu publicăm din ele nicio rată de fals pozitive, pentru că o fereastră scurtă de verdict nu este ce măsoară un corpus de rezumate.

scripts/fetch-human-corpus.mjs

Rezumate academice germane, dinainte de 2022

n = 60

OpenAlex, filtrat după cuvintele funcționale germane pentru că câmpul de limbă nu e de încredere. Stă la baza deciziei de a nu emite deloc verdictul «amprente clare de IA» pe germana scurtă.

scripts/fetch-german-corpus.mjs

Odată aproape că am publicat un detector mai slab decât aruncarea unei monede

Într-o primă versiune, măsurarea pe 236 de rezumate arXiv dinainte de 2022 a dat un AUC de 0.184. Aruncarea unei monede valorează 0,50. Detectorul clasa textul scris de mașină drept mai uman decât cel scris de oameni; inversarea rezultatului l-ar fi îmbunătățit. Și în tot acest timp a dat procente sigure pe ele.

Cauza era o familie de indicatori de bogăție lexicală (K-ul lui Yule, MTLD, exponentul Zipf, hapax legomena), toți inversați și cu efecte puternice. Ei evaluează proza academică umană densă ca mecanică și proza mecanică variată lexical ca umană. Este același mecanism din spatele rezultatului publicat potrivit căruia detectoarele semnalează greșit majoritatea celor care scriu în engleză ca a doua limbă.

Astăzi acești indicatori au pondere zero. Sunt în continuare calculați și afișați ca indicii, dar nu mișcă scorul. Publicăm asta pentru că este cel mai puternic argument pe care îl avem pentru măsurare: defectul era invizibil din rezultat și evident din corpus, iar un detector care n-a făcut niciodată acest test nu știe dacă are aceeași problemă.

Ce nu poate face niciun detector

Niciun detector AI, inclusiv acesta, nu este o dovadă de paternitate. Aceste instrumente măsoară proprietăți statistice ale textului, iar scrisul uman formal, structurat sau într-o a doua limbă are multe dintre ele. Un scor este un motiv să pui o întrebare, niciodată să tragi o concluzie.

Analizează-ți textul

Primele 1.500 de cuvinte sunt gratuite, fără cont. În română verdictul se bazează pe structura textului și îți arată propozițiile care contează; această pagină îți spune ce este măsurat și ce nu.

Pornește detectorul AI gratuit

Cercetători și jurnaliști: corpusurile, codul de evaluare și instrumentele de calibrare sunt toate în depozitul din spatele acestui site. Dacă vrei să reproduci sau să contești o cifră de pe această pagină, scrie la contact@thesisdraft.com și te ajutăm.