Mediciones

Con qué frecuencia nuestro detector se equivoca con un texto humano

Todos los detectores de IA devuelven un porcentaje rotundo. Ninguno te dice con qué frecuencia ese porcentaje se equivoca con alguien que escribió su trabajo por su cuenta. Ese segundo número es el que importa cuando el acusado eres tú — así que es el que publicamos.

Última medición el 24 de agosto de 2026. Cada cifra de abajo sale de un script del repositorio que puede volver a ejecutarse sobre los mismos corpus etiquetados.

Ninguna de estas tasas se ha medido en español.

Las cifras de esta página se midieron sobre corpus en inglés y en alemán, y siguen siendo suyas: escribirlas en español no las convierte en españolas. No tenemos un corpus de trabajos en español que sepamos que escribieron personas, así que no podemos decirte con qué frecuencia nos equivocamos con un texto en español — y mientras siga siendo así, el detector no emite ningún veredicto de alta probabilidad en español. Sí analiza tu texto en español y te responde en español; lo que falta es la medición. Preferimos decírtelo antes que hacer pasar una cifra inglesa por la tuya.

Tasas de falsos positivos medidas

La tasa a la que un texto académico que sabemos que escribió una persona recibe nuestro veredicto más fuerte. La precisión no es un solo número: cambia con la lengua y con la longitud del documento, así que informamos de cuatro perfiles en vez de una media que escondería los malos. Cada tasa es una cota superior al 95 % y no el recuento observado — la cota es lo que tenemos derecho a afirmar, y siempre es la peor de las dos. Los umbrales de estas tablas están en nuestras escalas internas de medición; la puntuación mostrada es la misma información en un eje de visualización fijo - el ámbar empieza en 20, el rojo en 50 - con cada umbral medido proyectado exactamente sobre esos anclajes.

PerfilVeredicto más fuerteFalsos positivosObservadoMedido sobre
Inglés · más de 400 palabrasAlta probabilidad de IAcomo máximo 3,13 %2 de 199199 documentos EN de la mitad de validación (escala combinada, w_style=0,5)
Alemán · más de 400 palabrasAlta probabilidad de IAcomo máximo 0,35 %0 de 866866 trabajos de estudiantes alemanes, 2010-2021
Inglés · menos de 400 palabrasAlta probabilidad de IAno publicadono se dispone de población humana pertinente
Alemán · menos de 400 palabrasno se emite ningún veredicto de alta probabilidad

Un texto alemán corto nunca recibe un veredicto de alta probabilidad, y con las pruebas actuales nunca lo recibirá.

En textos alemanes de menos de 400 palabras, ningún umbral lo bastante estricto para detectar IA de forma fiable cuesta menos de unas 7 acusaciones falsas por cada 100. Un estudiante inocente de cada quince no es un cambio que estemos dispuestos a aceptar, así que el perfil alemán corto se detiene en «probabilidad media». Es un límite medido, no una función que nos quede por construir.

Los veredictos más débiles, que tienen más ruido

La mayoría de los lectores nunca ve el veredicto más fuerte. Ve uno de estos, y las tasas de error de aquí son las que de verdad les van a aplicar. La banda inglesa de «probabilidad baja» es con diferencia la peor.

PerfilVeredictoUmbralFalsos positivosObservado
Inglés · más de 400 palabrasProbabilidad media≥ 96como máximo 5,86 %6 de 199
Inglés · más de 400 palabrasProbabilidad baja≥ 91como máximo 8,37 %10 de 199
Alemán · más de 400 palabrasProbabilidad media≥ 25como máximo 1,05 %4 de 866
Alemán · más de 400 palabrasProbabilidad baja≥ 22como máximo 1,81 %9 de 866

Lo que estos números no son

Sobre qué hemos medido

Todos los documentos humanos de abajo se publicaron antes de que existiera ChatGPT, así que su autoría no es cuestión de criterio.

Trabajos de estudiantes alemanes, 2010-2021

n = 866

Documentos enteros, en la lengua y el género que de verdad atendemos, humanos por construcción porque son anteriores a ChatGPT. Es el corpus sobre el que están fijados los umbrales alemanes.

scripts/fetch-thesis-negatives.mjs

Artículos de acceso abierto, anteriores a 2022

n = 1412

Prosa académica de extensión completa. Los artículos de revista están editados y escritos por equipos, así que no son escritura estudiantil — por eso los umbrales ingleses no se mueven con ellos.

scripts/fetch-longform-corpus.mjs

Mitad de validación de la mezcla: artículos + arXiv, fragmentos de 1.500 palabras

n = 199

La mitad reservada de 400 documentos en inglés (arXiv y artículos de acceso abierto anteriores a 2022), puntuados por AMBAS mitades de la comprobación. Los umbrales combinados se cortan sobre ella; sus tasas son las publicadas. Prosa de revistas, no escritura estudiantil: la población se nombra porque esa salvedad es parte de la cifra.

scripts/calibrate-components.mjs

Resúmenes de arXiv, anteriores a 2022

n = 236

Inglés de formato corto. Se conserva para el trabajo de AUC; de él no se publica ninguna tasa de falsos positivos, porque una ventana de veredicto de 300 a 400 palabras no es lo que mide un corpus de resúmenes.

scripts/fetch-human-corpus.mjs

Resúmenes académicos alemanes, anteriores a 2022

n = 60

OpenAlex, filtrado por palabras funcionales alemanas porque el campo de idioma no es fiable. Está detrás de la decisión de no emitir ningún veredicto de alta probabilidad en alemán corto.

scripts/fetch-german-corpus.mjs

Una vez publicamos un detector peor que lanzar una moneda

En una versión temprana, la medición contra 236 resúmenes de arXiv anteriores a 2022 dio un AUC de 0.184. Lanzar una moneda es 0,50. El detector ordenaba el texto escrito por una máquina como más humano que el escrito por una persona; invertir su salida lo habría mejorado. Y todo ese tiempo había estado devolviendo porcentajes rotundos.

La causa era una familia de indicadores de riqueza léxica — la K de Yule, el MTLD, el exponente de Zipf, los hápax — todos funcionando al revés y con tamaños de efecto grandes. Puntúan la prosa académica humana densa como mecánica y la prosa mecánica léxicamente variada como humana. Es el mismo mecanismo que hay detrás del hallazgo publicado de que los detectores marcan erróneamente a la mayoría de quienes escriben en inglés como segunda lengua.

Esos indicadores ahora tienen peso cero. Se siguen calculando y se siguen mostrando como evidencia; simplemente ya no mueven la puntuación. Lo publicamos porque es el argumento más fuerte que tenemos a favor de medir: el fallo era invisible desde la salida y evidente desde el corpus, y cualquier detector que nunca haya hecho esta prueba no sabe si tiene el mismo problema.

Lo que ningún detector puede hacer

Ningún detector de IA, este incluido, es prueba de autoría. Estas herramientas miden propiedades estadísticas del texto, y la escritura humana que es formal, estructurada o de alguien que no escribe en su lengua materna comparte muchas de esas propiedades. Una puntuación es una razón para hacer una pregunta, nunca para dar por cerrada una respuesta. Si se ha usado un detector contra tu trabajo, lo primero que hay que pedir es la tasa de error del detector que se usó — es esa cifra, y no el porcentaje, la que dice cuánto vale el resultado.

Comprueba tu propio trabajo con estos números

Las primeras 1500 palabras son gratis, sin cuenta. Detrás de cada veredicto hay una tasa de error medida, y es en esta página donde están todas publicadas.

Analizar gratis

Investigadores y periodistas: los corpus, el código de scoring y los bancos de calibración están todos en el repositorio que hay detrás de este sitio. Si quieres reproducir o rebatir cualquier cifra de aquí, escribe a contact@morphica.de y te ayudamos.