Benchmark
Cât de des greșește detectorul nostru AI în privința unui om
Orice detector AI îți dă un procent sigur pe el. Niciunul nu îți spune cât de des acel procent greșește în privința cuiva care și-a scris singur lucrarea. Al doilea număr este cel care contează dacă tu ești studentul acuzat, așa că pe acela îl publicăm, pentru limbile în care l-am măsurat.
Ultima măsurare: 24 august 2026. Fiecare cifră de mai jos provine dintr-un script din depozitul nostru care poate fi rulat din nou pe aceleași corpusuri etichetate.
Niciuna dintre aceste rate nu a fost măsurată în română.
Cifrele de pe această pagină au fost măsurate pe texte în engleză și germană și rămân legate de acele limbi: scrise în română, nu devin românești. Un text în română este evaluat doar după structura textului (stilul de scriere este afișat, dar nu contează), în mod provizoriu: încă nu avem un corpus de lucrări românești scrise sigur de oameni, așa că nu îți putem spune cât de des greșim pe un text în română, iar cât timp e așa detectorul nu dă niciodată un verdict roșu în română. Preferăm să îți spunem asta decât să îți prezentăm un număr englezesc drept al tău.
Rate de fals pozitive măsurate
Cât de des un text academic scris sigur de un om primește verdictul nostru cel mai puternic. Precizia nu este un singur număr: se schimbă cu limba și cu lungimea documentului, așa că raportăm patru profiluri în loc de o medie care le-ar ascunde pe cele slabe. Fiecare rată este o limită superioară de 95% și nu numărul observat: limita este ce avem dreptul să afirmăm, și este mereu cea mai proastă dintre cele două. Pragurile din aceste tabele sunt pe scalele noastre interne de măsurare; scorul afișat este aceeași informație pe o axă fixă, cu chihlimbar de la 20 și roșu de la 50.
| Profil | Cel mai puternic verdict | Fals pozitive | Observate | Măsurat pe |
|---|---|---|---|---|
| Engleză · peste 400 de cuvinte | Amprente clare de IA | cel mult 3,13 % | 2 din 199 | 199 de documente EN din jumătatea de validare (scară combinată, w_style=0,5) |
| Germană · peste 400 de cuvinte | Amprente clare de IA | cel mult 1,63 % | 10 din 1.035 | 1.035 de lucrări germane din jumătatea de validare (scară combinată, w_style=0,5) |
| Engleză · sub 400 de cuvinte | Amprente clare de IA | nepublicat | - | nicio populație umană relevantă disponibilă |
| Germană · sub 400 de cuvinte | verdictul «amprente clare de IA» nu este emis niciodată | - | - | - |
Un text german scurt nu primește niciodată verdictul «amprente clare de IA», și cu dovezile de acum nici nu îl va primi.
Pe germana scurtă, niciun prag destul de strict ca să recunoască fiabil AI nu costă mai puțin de aproximativ 7 acuzații false din 100. Un student nevinovat din cincisprezece nu este un compromis pe care îl acceptăm, așa că profilul german scurt se oprește la «câteva amprente de IA». Este o limită măsurată, nu o funcție încă neconstruită.
Verdictele mai slabe, care sunt mai zgomotoase
Majoritatea cititorilor nu văd niciodată verdictul cel mai puternic. Văd unul dintre acestea, iar ratele de eroare de aici sunt cele care îi privesc cu adevărat. Banda chihlimbar inferioară în engleză este de departe cea mai zgomotoasă.
| Profil | Verdict | Prag | Fals pozitive | Observate |
|---|---|---|---|---|
| Engleză · peste 400 de cuvinte | Câteva amprente de IA | ≥ 96 | cel mult 5,86 % | 6 din 199 |
| Engleză · peste 400 de cuvinte | Câteva amprente de IA (banda chihlimbar inferioară) | ≥ 91 | cel mult 8,37 % | 10 din 199 |
| Germană · peste 400 de cuvinte | Câteva amprente de IA | ≥ 88 | cel mult 4,02 % | 31 din 1.035 |
| Germană · peste 400 de cuvinte | Câteva amprente de IA (banda chihlimbar inferioară) | ≥ 85 | cel mult 6,18 % | 51 din 1.035 |
Ce nu sunt aceste numere
- Zero observat nu înseamnă zero. Niciunul dintre cele două profiluri lungi nu a produs vreun fals pozitiv la pragul cel mai strict în corpusurile brute de structură. Publicăm totuși limita superioară de 95% pentru acea mărime de eșantion, pentru că a scrie «0%» ar fi exact excesul de încredere împotriva căruia există această pagină.
- Corpusul englez este din genul greșit. Acele documente sunt articole de revistă: redactate, profesioniste, scrise în echipă. O lucrare de student nu este nimic din toate acestea. Rata este măsurată cinstit pe ce spune că e măsurată, iar pragurile englezești rămân unde sunt până când vor exista destule lucrări de studenți scrise în engleză ca a doua limbă ca să justifice mutarea lor.
- Textul scurt nu are nicio rată publicată. Profilul scurt privește o fereastră de câteva sute de cuvinte, iar niciun corpus uman de care dispunem nu provine din acea fereastră. Ratele care apăreau aici au fost scoase pe 21 august 2026 în loc să fie lăsate, pentru că un număr plauzibil fără o populație în spate rămâne o afirmație nefondată.
- Corpusurile de AI sunt mici: în jur de douăzeci de documente pe limbă, din două familii de modele. Un model pe care nu l-am testat se poate comporta altfel.
- Româna nu este calibrată. Un text în română primește un verdict bazat doar pe structura textului, provizoriu, fără nicio afirmație de precizie, și nu primește niciodată un verdict roșu.
Pe ce am măsurat
Fiecare document uman de mai jos a fost publicat înainte să existe ChatGPT, așa că paternitatea lui nu este o chestiune de apreciere.
Lucrări de studenți germani, 2010-2021
n = 866
Documente complete, în limba și genul pe care le servim în germană, umane prin construcție pentru că sunt dinainte de ChatGPT. Pe acest corpus sunt fixate pragurile germane.
scripts/fetch-thesis-negatives.mjs
Jumătatea de validare a combinației: lucrări de studenți germani, 2008-2021, documente complete
n = 1.035
Jumătatea păstrată deoparte dintr-un set de lucrări germane reale (MOnAMi, Hochschule Mittweida, 2008-2021), evaluată de AMBELE jumătăți ale analizei: documente complete, nefolosite niciodată la antrenarea modelului german. Pragurile germane combinate sunt tăiate pe ea. Nu sunt texte din perioada clienților noștri: o lucrare finisată din 2026 este o populație pe care n-a măsurat-o nimeni, iar această rezervă face parte din număr.
scripts/calibrate-components.mjs
Articole cu acces deschis, dinainte de 2022
n = 1.412
Proză academică completă. Articolele de revistă sunt redactate și scrise în echipă, deci nu sunt scris de student: de aceea pragurile englezești nu sunt mutate pe baza lor.
scripts/fetch-longform-corpus.mjs
Jumătatea de validare a combinației: articole + arXiv, extrase de 1.500 de cuvinte
n = 199
Jumătatea păstrată deoparte din documente englezești (arXiv și articole cu acces deschis dinainte de 2022), evaluată de AMBELE jumătăți ale analizei. Pragurile combinate sunt tăiate pe ea. Proză de revistă, nu scris de student: o spunem pentru că această rezervă face parte din număr.
scripts/calibrate-components.mjs
Rezumate arXiv, dinainte de 2022
n = 236
Texte scurte în engleză. Păstrate pentru munca pe AUC; nu publicăm din ele nicio rată de fals pozitive, pentru că o fereastră scurtă de verdict nu este ce măsoară un corpus de rezumate.
scripts/fetch-human-corpus.mjs
Rezumate academice germane, dinainte de 2022
n = 60
OpenAlex, filtrat după cuvintele funcționale germane pentru că câmpul de limbă nu e de încredere. Stă la baza deciziei de a nu emite deloc verdictul «amprente clare de IA» pe germana scurtă.
scripts/fetch-german-corpus.mjs
Odată aproape că am publicat un detector mai slab decât aruncarea unei monede
Într-o primă versiune, măsurarea pe 236 de rezumate arXiv dinainte de 2022 a dat un AUC de 0.184. Aruncarea unei monede valorează 0,50. Detectorul clasa textul scris de mașină drept mai uman decât cel scris de oameni; inversarea rezultatului l-ar fi îmbunătățit. Și în tot acest timp a dat procente sigure pe ele.
Cauza era o familie de indicatori de bogăție lexicală (K-ul lui Yule, MTLD, exponentul Zipf, hapax legomena), toți inversați și cu efecte puternice. Ei evaluează proza academică umană densă ca mecanică și proza mecanică variată lexical ca umană. Este același mecanism din spatele rezultatului publicat potrivit căruia detectoarele semnalează greșit majoritatea celor care scriu în engleză ca a doua limbă.
Astăzi acești indicatori au pondere zero. Sunt în continuare calculați și afișați ca indicii, dar nu mișcă scorul. Publicăm asta pentru că este cel mai puternic argument pe care îl avem pentru măsurare: defectul era invizibil din rezultat și evident din corpus, iar un detector care n-a făcut niciodată acest test nu știe dacă are aceeași problemă.
Ce nu poate face niciun detector
Niciun detector AI, inclusiv acesta, nu este o dovadă de paternitate. Aceste instrumente măsoară proprietăți statistice ale textului, iar scrisul uman formal, structurat sau într-o a doua limbă are multe dintre ele. Un scor este un motiv să pui o întrebare, niciodată să tragi o concluzie.
Analizează-ți textul
Primele 1.500 de cuvinte sunt gratuite, fără cont. În română verdictul se bazează pe structura textului și îți arată propozițiile care contează; această pagină îți spune ce este măsurat și ce nu.
Pornește detectorul AI gratuitCercetători și jurnaliști: corpusurile, codul de evaluare și instrumentele de calibrare sunt toate în depozitul din spatele acestui site. Dacă vrei să reproduci sau să contești o cifră de pe această pagină, scrie la contact@thesisdraft.com și te ajutăm.