Benchmark

Quanto spesso il nostro rilevatore AI sbaglia su una persona

Ogni rilevatore AI restituisce una percentuale sicura di sé. Nessuno ti dice quanto spesso quella percentuale sbaglia su chi ha scritto da sé il proprio lavoro. Questo secondo numero è quello che conta se sei lo studente accusato, quindi è quello che pubblichiamo, per le lingue in cui lo abbiamo misurato.

Ultima misurazione: 24 agosto 2026. Ogni cifra qui sotto viene da uno script nel nostro repository che si può rieseguire sugli stessi corpus etichettati.

Nessuno di questi tassi è stato misurato in italiano.

I numeri di questa pagina sono stati misurati su testi inglesi e tedeschi, e restano legati a quelle lingue: scriverli in italiano non li rende italiani. Un testo italiano viene valutato sulla sola struttura del testo (lo stile di scrittura è mostrato ma non conta), in modo provvisorio: non abbiamo ancora un corpus di tesi italiane sicuramente scritte da persone, quindi non possiamo dirti quanto spesso sbagliamo su un testo italiano, e finché sarà così il rilevatore non dà mai un verdetto rosso in italiano. Preferiamo dirtelo che spacciare un numero inglese per il tuo.

Tassi di falsi positivi misurati

La frequenza con cui un testo accademico scritto sicuramente da una persona riceve il nostro verdetto più forte. La precisione non è un numero solo: cambia con la lingua e con la lunghezza del documento, quindi riportiamo quattro profili invece di una media che nasconderebbe quelli deboli. Ogni tasso è un limite superiore al 95% e non il conteggio osservato: il limite è ciò che abbiamo il diritto di affermare, ed è sempre il peggiore dei due. Le soglie in queste tabelle sono sulle nostre scale di misura interne; il punteggio mostrato è la stessa informazione su un asse fisso, con l'ambra da 20 e il rosso da 50.

ProfiloVerdetto più forteFalsi positiviOsservatiMisurato su
Inglese · oltre 400 paroleImpronte di IA marcateal massimo 3,13 %2 su 199199 documenti EN della metà di validazione (scala combinata, w_style=0,5)
Tedesco · oltre 400 paroleImpronte di IA marcateal massimo 1,63 %10 su 10351035 tesi tedesche della metà di validazione (scala combinata, w_style=0,5)
Inglese · sotto 400 paroleImpronte di IA marcatenon pubblicato-nessuna popolazione umana pertinente a disposizione
Tedesco · sotto 400 parolenon viene mai emesso un verdetto «impronte di IA marcate»---

Un testo tedesco breve non riceve mai il verdetto «impronte di IA marcate», e con le prove attuali non lo riceverà.

Sul tedesco breve nessuna soglia abbastanza severa da riconoscere l'IA in modo affidabile costa meno di circa 7 false accuse su 100. Uno studente innocente su quindici non è uno scambio che accettiamo, quindi il profilo tedesco breve si ferma ad «alcune impronte di IA». È un limite misurato, non una funzione ancora da costruire.

I verdetti più deboli, che sono più rumorosi

La maggior parte dei lettori non vede mai il verdetto più forte. Vede uno di questi, e i tassi di errore qui sono quelli che lo riguardano davvero. La fascia ambra inferiore inglese è di gran lunga la più rumorosa.

ProfiloVerdettoSogliaFalsi positiviOsservati
Inglese · oltre 400 paroleAlcune impronte di IA≥ 96al massimo 5,86 %6 su 199
Inglese · oltre 400 paroleAlcune impronte di IA (fascia ambra inferiore)≥ 91al massimo 8,37 %10 su 199
Tedesco · oltre 400 paroleAlcune impronte di IA≥ 88al massimo 4,02 %31 su 1035
Tedesco · oltre 400 paroleAlcune impronte di IA (fascia ambra inferiore)≥ 85al massimo 6,18 %51 su 1035

Cosa questi numeri non sono

Su cosa abbiamo misurato

Ogni documento umano qui sotto è stato pubblicato prima che ChatGPT esistesse, quindi la sua paternità non è una questione di giudizio.

Tesi di studenti tedeschi, 2010-2021

n = 866

Documenti interi, nella lingua e nel genere che serviamo in tedesco, umani per costruzione perché precedono ChatGPT. È il corpus su cui sono fissate le soglie tedesche.

scripts/fetch-thesis-negatives.mjs

Metà di validazione della combinazione: tesi di studenti tedeschi, 2008-2021, documenti interi

n = 1035

La metà tenuta da parte di tesi tedesche reali (MOnAMi, Hochschule Mittweida, 2008-2021), valutata da ENTRAMBE le metà dell'analisi: documenti interi, mai usati per addestrare il modello tedesco. Le soglie tedesche combinate sono tagliate su di essa. Non sono testi dell'epoca dei nostri clienti: una tesi rifinita del 2026 è una popolazione che nessuno ha misurato, e questa avvertenza fa parte del numero.

scripts/calibrate-components.mjs

Articoli ad accesso aperto, prima del 2022

n = 1412

Prosa accademica completa. Gli articoli di rivista sono redatti e scritti da gruppi, quindi non sono scrittura studentesca: per questo le soglie inglesi non vengono spostate su di essi.

scripts/fetch-longform-corpus.mjs

Metà di validazione della combinazione: articoli + arXiv, estratti da 1.500 parole

n = 199

La metà tenuta da parte di documenti inglesi (arXiv e articoli ad accesso aperto anteriori al 2022), valutata da ENTRAMBE le metà dell'analisi. Le soglie combinate sono tagliate su di essa. Prosa di rivista, non scrittura studentesca: lo diciamo perché questa avvertenza fa parte del numero.

scripts/calibrate-components.mjs

Abstract arXiv, prima del 2022

n = 236

Testi brevi in inglese. Conservati per il lavoro sull'AUC; non ne pubblichiamo alcun tasso di falsi positivi, perché una finestra di verdetto breve non è ciò che misura un corpus di abstract.

scripts/fetch-human-corpus.mjs

Abstract accademici tedeschi, prima del 2022

n = 60

OpenAlex, filtrato sulle parole funzionali tedesche perché il campo lingua è inaffidabile. È alla base della decisione di non emettere affatto il verdetto «impronte di IA marcate» sul tedesco breve.

scripts/fetch-german-corpus.mjs

Una volta abbiamo quasi pubblicato un rilevatore peggiore del lancio di una moneta

In una prima versione, la misura su 236 abstract arXiv anteriori al 2022 ha dato un'AUC di 0.184. Il lancio di una moneta vale 0,50. Il rilevatore classificava il testo scritto da una macchina come più umano di quello scritto da persone; invertirne il risultato lo avrebbe migliorato. E per tutto il tempo aveva restituito percentuali sicure di sé.

La causa era una famiglia di indicatori di ricchezza lessicale (la K di Yule, MTLD, l'esponente di Zipf, gli hapax legomena), tutti al contrario e con effetti forti. Valutano la prosa accademica umana densa come meccanica e la prosa meccanica lessicalmente varia come umana. È lo stesso meccanismo dietro il risultato pubblicato secondo cui i rilevatori segnalano a torto la maggioranza di chi scrive in inglese come seconda lingua.

Oggi quegli indicatori pesano zero. Vengono ancora calcolati e mostrati come indizi, ma non spostano il punteggio. Lo pubblichiamo perché è l'argomento più forte che abbiamo per misurare: il difetto era invisibile dal risultato ed evidente dal corpus, e un rilevatore che non ha mai fatto questo test non sa se ha lo stesso problema.

Cosa nessun rilevatore può fare

Nessun rilevatore AI, compreso questo, è una prova di paternità. Questi strumenti misurano proprietà statistiche del testo, e la scrittura umana formale, strutturata o in una seconda lingua ne condivide molte. Un punteggio è un motivo per fare una domanda, mai per trarre una conclusione.

Analizza il tuo testo

Gratis, senza account. In italiano il verdetto si basa sulla struttura del testo e ti mostra le frasi che pesano; questa pagina ti dice cosa è misurato e cosa no.

Avvia il rilevatore AI gratuito

Ricercatori e giornalisti: i corpus, il codice di valutazione e gli strumenti di calibrazione sono tutti nel repository dietro questo sito. Se vuoi riprodurre o contestare una cifra di questa pagina, scrivi a contact@thesisdraft.com e ti aiuteremo.