Benchmark
Com que frequência o nosso detector de IA erra sobre uma pessoa
Todos os detectores de IA devolvem uma percentagem confiante. Nenhum te diz com que frequência essa percentagem erra sobre quem escreveu o próprio trabalho. Esse segundo número é o que importa se fores o estudante acusado, por isso é esse que publicamos, nas línguas em que o medimos.
Última medição: 24 de agosto de 2026. Cada número abaixo vem de um script no nosso repositório que pode ser executado de novo sobre os mesmos corpora etiquetados.
Nenhuma destas taxas foi medida em português.
Os números desta página foram medidos em textos ingleses e alemães, e continuam ligados a essas línguas: escrevê-los em português não os torna portugueses. Um texto português é avaliado apenas pela estrutura do texto (o estilo de escrita é mostrado mas não conta), de forma provisória: ainda não temos um corpus de teses portuguesas comprovadamente escritas por pessoas, por isso não te podemos dizer com que frequência erramos num texto português, e enquanto assim for o detector nunca dá um veredicto vermelho em português. Preferimos dizer-te isto a fazer passar um número inglês pelo teu.
Taxas de falsos positivos medidas
A frequência com que um texto académico escrito comprovadamente por uma pessoa recebe o nosso veredicto mais forte. A precisão não é um número único: muda com a língua e com o comprimento do documento, por isso indicamos quatro perfis em vez de uma média que esconderia os mais fracos. Cada taxa é um limite superior a 95% e não a contagem observada: o limite é o que temos direito a afirmar, e é sempre o pior dos dois. Os limiares destas tabelas estão nas nossas escalas internas de medição; a pontuação mostrada é a mesma informação num eixo fixo, com o âmbar a partir de 20 e o vermelho a partir de 50.
| Perfil | Veredicto mais forte | Falsos positivos | Observados | Medido em |
|---|---|---|---|---|
| Inglês · mais de 400 palavras | Marcas de IA evidentes | no máximo 3,13 % | 2 em 199 | 199 documentos EN da metade de validação (escala combinada, w_style=0,5) |
| Alemão · mais de 400 palavras | Marcas de IA evidentes | no máximo 1,63 % | 10 em 1035 | 1035 teses alemãs da metade de validação (escala combinada, w_style=0,5) |
| Inglês · menos de 400 palavras | Marcas de IA evidentes | não publicado | - | nenhuma população humana pertinente disponível |
| Alemão · menos de 400 palavras | nunca é emitido um veredicto «marcas de IA evidentes» | - | - | - |
Um texto alemão curto nunca recebe o veredicto «marcas de IA evidentes», e com as provas atuais não o vai receber.
Em alemão curto, nenhum limiar suficientemente rigoroso para reconhecer IA de forma fiável custa menos de cerca de 7 falsas acusações em 100. Um estudante inocente em cada quinze não é uma troca que aceitemos, por isso o perfil alemão curto fica por «algumas marcas de IA». É um limite medido, não uma funcionalidade por construir.
Os veredictos mais fracos, que são mais ruidosos
A maioria dos leitores nunca vê o veredicto mais forte. Vê um destes, e as taxas de erro aqui são as que realmente lhe dizem respeito. A faixa âmbar inferior inglesa é de longe a mais ruidosa.
| Perfil | Veredicto | Limiar | Falsos positivos | Observados |
|---|---|---|---|---|
| Inglês · mais de 400 palavras | Algumas marcas de IA | ≥ 96 | no máximo 5,86 % | 6 em 199 |
| Inglês · mais de 400 palavras | Algumas marcas de IA (faixa âmbar inferior) | ≥ 91 | no máximo 8,37 % | 10 em 199 |
| Alemão · mais de 400 palavras | Algumas marcas de IA | ≥ 88 | no máximo 4,02 % | 31 em 1035 |
| Alemão · mais de 400 palavras | Algumas marcas de IA (faixa âmbar inferior) | ≥ 85 | no máximo 6,18 % | 51 em 1035 |
O que estes números não são
- Zero observado não é zero. Nenhum dos dois perfis longos produziu um único falso positivo no limiar mais rigoroso nos corpora brutos de estrutura. Publicamos mesmo assim o limite superior a 95% para essa dimensão de amostra, porque escrever «0%» seria precisamente o excesso de confiança contra o qual esta página existe.
- O corpus inglês é do género errado. Esses documentos são artigos de revista: editados, profissionais, escritos por equipas. Uma tese de estudante não é nada disso. A taxa é medida honestamente sobre aquilo em que diz ser medida, e os limiares ingleses ficam onde estão até haver teses de estudantes em inglês como segunda língua suficientes para justificar movê-los.
- O texto curto não tem nenhuma taxa publicada. O perfil curto diz respeito a uma janela de poucas centenas de palavras, e nenhum corpus humano de que dispomos vem dessa janela. As taxas que apareciam aqui foram retiradas a 21 de agosto de 2026 em vez de as deixar ficar, porque um número plausível sem população por trás continua a ser uma afirmação infundada.
- Os corpora de IA são pequenos: cerca de vinte documentos por língua, de duas famílias de modelos. Um modelo que não testámos pode comportar-se de forma diferente.
- O português não está calibrado. Um texto português recebe um veredicto baseado apenas na estrutura do texto, provisório, sem qualquer afirmação de precisão, e nunca recebe um veredicto vermelho.
Em que medimos
Cada documento humano abaixo foi publicado antes de o ChatGPT existir, por isso a sua autoria não é uma questão de opinião.
Teses de estudantes alemães, 2010-2021
n = 866
Documentos completos, na língua e no género que servimos em alemão, humanos por construção porque são anteriores ao ChatGPT. É o corpus em que estão fixados os limiares alemães.
scripts/fetch-thesis-negatives.mjs
Metade de validação da combinação: teses de estudantes alemães, 2008-2021, documentos completos
n = 1035
A metade reservada de teses alemãs reais (MOnAMi, Hochschule Mittweida, 2008-2021), avaliada por AMBAS as metades da análise: documentos completos, nunca usados para treinar o modelo alemão. Os limiares alemães combinados são cortados nela. Não são textos da época dos nossos clientes: uma tese polida de 2026 é uma população que ninguém mediu, e esta ressalva faz parte do número.
scripts/calibrate-components.mjs
Artigos de acesso aberto, anteriores a 2022
n = 1412
Prosa académica completa. Os artigos de revista são editados e escritos por equipas, por isso não são escrita de estudantes: é por isso que os limiares ingleses não são movidos com base neles.
scripts/fetch-longform-corpus.mjs
Metade de validação da combinação: artigos + arXiv, excertos de 1.500 palavras
n = 199
A metade reservada de documentos ingleses (arXiv e artigos de acesso aberto anteriores a 2022), avaliada por AMBAS as metades da análise. Os limiares combinados são cortados nela. Prosa de revista, não escrita de estudantes: dizemo-lo porque esta ressalva faz parte do número.
scripts/calibrate-components.mjs
Resumos arXiv, anteriores a 2022
n = 236
Textos curtos em inglês. Mantidos para o trabalho de AUC; não publicamos nenhuma taxa de falsos positivos a partir deles, porque uma janela de veredicto curta não é o que um corpus de resumos mede.
scripts/fetch-human-corpus.mjs
Resumos académicos alemães, anteriores a 2022
n = 60
OpenAlex, filtrado pelas palavras funcionais alemãs porque o campo da língua não é fiável. Está na base da decisão de não emitir de todo o veredicto «marcas de IA evidentes» em alemão curto.
scripts/fetch-german-corpus.mjs
Uma vez quase publicámos um detector pior do que atirar uma moeda ao ar
Numa primeira versão, a medição em 236 resumos arXiv anteriores a 2022 deu uma AUC de 0.184. Atirar uma moeda ao ar vale 0,50. O detector classificava o texto escrito por uma máquina como mais humano do que o escrito por pessoas; inverter o resultado tê-lo-ia melhorado. E durante todo esse tempo devolveu percentagens confiantes.
A causa era uma família de indicadores de riqueza lexical (o K de Yule, MTLD, o expoente de Zipf, os hapax legomena), todos ao contrário e com efeitos fortes. Avaliam a prosa académica humana densa como mecânica e a prosa mecânica lexicalmente variada como humana. É o mesmo mecanismo por trás do resultado publicado segundo o qual os detectores assinalam por engano a maioria de quem escreve em inglês como segunda língua.
Hoje esses indicadores pesam zero. Continuam a ser calculados e mostrados como indícios, mas não mexem na pontuação. Publicamos isto porque é o argumento mais forte que temos para medir: o defeito era invisível no resultado e evidente no corpus, e um detector que nunca fez este teste não sabe se tem o mesmo problema.
O que nenhum detector consegue fazer
Nenhum detector de IA, incluindo este, é uma prova de autoria. Estas ferramentas medem propriedades estatísticas do texto, e a escrita humana formal, estruturada ou numa segunda língua partilha muitas delas. Uma pontuação é um motivo para fazer uma pergunta, nunca para tirar uma conclusão.
Analisa o teu texto
As primeiras 1500 palavras são grátis, sem conta. Em português o veredicto baseia-se na estrutura do texto e mostra-te as frases que pesam; esta página diz-te o que está medido e o que não está.
Iniciar o detector de IA gratuitoInvestigadores e jornalistas: os corpora, o código de avaliação e as ferramentas de calibração estão todos no repositório por trás deste site. Se quiseres reproduzir ou contestar um número desta página, escreve para contact@thesisdraft.com e ajudamos-te.