Benchmark

Com que frequência o nosso detector de IA erra sobre uma pessoa

Todos os detectores de IA devolvem uma percentagem confiante. Nenhum te diz com que frequência essa percentagem erra sobre quem escreveu o próprio trabalho. Esse segundo número é o que importa se fores o estudante acusado, por isso é esse que publicamos, nas línguas em que o medimos.

Última medição: 24 de agosto de 2026. Cada número abaixo vem de um script no nosso repositório que pode ser executado de novo sobre os mesmos corpora etiquetados.

Nenhuma destas taxas foi medida em português.

Os números desta página foram medidos em textos ingleses e alemães, e continuam ligados a essas línguas: escrevê-los em português não os torna portugueses. Um texto português é avaliado apenas pela estrutura do texto (o estilo de escrita é mostrado mas não conta), de forma provisória: ainda não temos um corpus de teses portuguesas comprovadamente escritas por pessoas, por isso não te podemos dizer com que frequência erramos num texto português, e enquanto assim for o detector nunca dá um veredicto vermelho em português. Preferimos dizer-te isto a fazer passar um número inglês pelo teu.

Taxas de falsos positivos medidas

A frequência com que um texto académico escrito comprovadamente por uma pessoa recebe o nosso veredicto mais forte. A precisão não é um número único: muda com a língua e com o comprimento do documento, por isso indicamos quatro perfis em vez de uma média que esconderia os mais fracos. Cada taxa é um limite superior a 95% e não a contagem observada: o limite é o que temos direito a afirmar, e é sempre o pior dos dois. Os limiares destas tabelas estão nas nossas escalas internas de medição; a pontuação mostrada é a mesma informação num eixo fixo, com o âmbar a partir de 20 e o vermelho a partir de 50.

PerfilVeredicto mais forteFalsos positivosObservadosMedido em
Inglês · mais de 400 palavrasMarcas de IA evidentesno máximo 3,13 %2 em 199199 documentos EN da metade de validação (escala combinada, w_style=0,5)
Alemão · mais de 400 palavrasMarcas de IA evidentesno máximo 1,63 %10 em 10351035 teses alemãs da metade de validação (escala combinada, w_style=0,5)
Inglês · menos de 400 palavrasMarcas de IA evidentesnão publicado-nenhuma população humana pertinente disponível
Alemão · menos de 400 palavrasnunca é emitido um veredicto «marcas de IA evidentes»---

Um texto alemão curto nunca recebe o veredicto «marcas de IA evidentes», e com as provas atuais não o vai receber.

Em alemão curto, nenhum limiar suficientemente rigoroso para reconhecer IA de forma fiável custa menos de cerca de 7 falsas acusações em 100. Um estudante inocente em cada quinze não é uma troca que aceitemos, por isso o perfil alemão curto fica por «algumas marcas de IA». É um limite medido, não uma funcionalidade por construir.

Os veredictos mais fracos, que são mais ruidosos

A maioria dos leitores nunca vê o veredicto mais forte. Vê um destes, e as taxas de erro aqui são as que realmente lhe dizem respeito. A faixa âmbar inferior inglesa é de longe a mais ruidosa.

PerfilVeredictoLimiarFalsos positivosObservados
Inglês · mais de 400 palavrasAlgumas marcas de IA≥ 96no máximo 5,86 %6 em 199
Inglês · mais de 400 palavrasAlgumas marcas de IA (faixa âmbar inferior)≥ 91no máximo 8,37 %10 em 199
Alemão · mais de 400 palavrasAlgumas marcas de IA≥ 88no máximo 4,02 %31 em 1035
Alemão · mais de 400 palavrasAlgumas marcas de IA (faixa âmbar inferior)≥ 85no máximo 6,18 %51 em 1035

O que estes números não são

Em que medimos

Cada documento humano abaixo foi publicado antes de o ChatGPT existir, por isso a sua autoria não é uma questão de opinião.

Teses de estudantes alemães, 2010-2021

n = 866

Documentos completos, na língua e no género que servimos em alemão, humanos por construção porque são anteriores ao ChatGPT. É o corpus em que estão fixados os limiares alemães.

scripts/fetch-thesis-negatives.mjs

Metade de validação da combinação: teses de estudantes alemães, 2008-2021, documentos completos

n = 1035

A metade reservada de teses alemãs reais (MOnAMi, Hochschule Mittweida, 2008-2021), avaliada por AMBAS as metades da análise: documentos completos, nunca usados para treinar o modelo alemão. Os limiares alemães combinados são cortados nela. Não são textos da época dos nossos clientes: uma tese polida de 2026 é uma população que ninguém mediu, e esta ressalva faz parte do número.

scripts/calibrate-components.mjs

Artigos de acesso aberto, anteriores a 2022

n = 1412

Prosa académica completa. Os artigos de revista são editados e escritos por equipas, por isso não são escrita de estudantes: é por isso que os limiares ingleses não são movidos com base neles.

scripts/fetch-longform-corpus.mjs

Metade de validação da combinação: artigos + arXiv, excertos de 1.500 palavras

n = 199

A metade reservada de documentos ingleses (arXiv e artigos de acesso aberto anteriores a 2022), avaliada por AMBAS as metades da análise. Os limiares combinados são cortados nela. Prosa de revista, não escrita de estudantes: dizemo-lo porque esta ressalva faz parte do número.

scripts/calibrate-components.mjs

Resumos arXiv, anteriores a 2022

n = 236

Textos curtos em inglês. Mantidos para o trabalho de AUC; não publicamos nenhuma taxa de falsos positivos a partir deles, porque uma janela de veredicto curta não é o que um corpus de resumos mede.

scripts/fetch-human-corpus.mjs

Resumos académicos alemães, anteriores a 2022

n = 60

OpenAlex, filtrado pelas palavras funcionais alemãs porque o campo da língua não é fiável. Está na base da decisão de não emitir de todo o veredicto «marcas de IA evidentes» em alemão curto.

scripts/fetch-german-corpus.mjs

Uma vez quase publicámos um detector pior do que atirar uma moeda ao ar

Numa primeira versão, a medição em 236 resumos arXiv anteriores a 2022 deu uma AUC de 0.184. Atirar uma moeda ao ar vale 0,50. O detector classificava o texto escrito por uma máquina como mais humano do que o escrito por pessoas; inverter o resultado tê-lo-ia melhorado. E durante todo esse tempo devolveu percentagens confiantes.

A causa era uma família de indicadores de riqueza lexical (o K de Yule, MTLD, o expoente de Zipf, os hapax legomena), todos ao contrário e com efeitos fortes. Avaliam a prosa académica humana densa como mecânica e a prosa mecânica lexicalmente variada como humana. É o mesmo mecanismo por trás do resultado publicado segundo o qual os detectores assinalam por engano a maioria de quem escreve em inglês como segunda língua.

Hoje esses indicadores pesam zero. Continuam a ser calculados e mostrados como indícios, mas não mexem na pontuação. Publicamos isto porque é o argumento mais forte que temos para medir: o defeito era invisível no resultado e evidente no corpus, e um detector que nunca fez este teste não sabe se tem o mesmo problema.

O que nenhum detector consegue fazer

Nenhum detector de IA, incluindo este, é uma prova de autoria. Estas ferramentas medem propriedades estatísticas do texto, e a escrita humana formal, estruturada ou numa segunda língua partilha muitas delas. Uma pontuação é um motivo para fazer uma pergunta, nunca para tirar uma conclusão.

Analisa o teu texto

As primeiras 1500 palavras são grátis, sem conta. Em português o veredicto baseia-se na estrutura do texto e mostra-te as frases que pesam; esta página diz-te o que está medido e o que não está.

Iniciar o detector de IA gratuito

Investigadores e jornalistas: os corpora, o código de avaliação e as ferramentas de calibração estão todos no repositório por trás deste site. Se quiseres reproduzir ou contestar um número desta página, escreve para contact@thesisdraft.com e ajudamos-te.