Mesures
À quelle fréquence notre détecteur se trompe sur un texte humain
Tous les détecteurs d'IA renvoient un pourcentage péremptoire. Aucun ne vous dit à quelle fréquence ce pourcentage se trompe sur quelqu'un qui a écrit son travail lui-même. C'est ce second chiffre qui compte quand c'est vous, l'étudiant accusé — alors c'est celui-là que nous publions.
Dernière mesure le 24 août 2026. Chaque chiffre ci-dessous provient d'un script du dépôt, qui peut être relancé sur les mêmes corpus étiquetés.
Aucun de ces taux n'a été mesuré en français.
Les chiffres de cette page ont été mesurés sur des corpus anglais et allemands, et ils y restent attachés : les écrire en français ne les rend pas français. Nous ne détenons pas de corpus de mémoires en français dont nous savons qu'ils ont été écrits par des personnes, donc nous ne pouvons pas vous dire à quelle fréquence nous nous trompons sur un texte français — et tant que ce sera le cas, le détecteur ne rend aucun verdict de forte probabilité en français. Il analyse bien votre texte en français et vous répond en français ; ce qui manque, c'est la mesure. Nous préférons vous le dire que de faire passer un chiffre anglais pour le vôtre.
Taux de faux positifs mesurés
Le taux auquel un texte académique dont on sait qu'il a été écrit par une personne reçoit notre verdict le plus fort. La précision n'est pas un chiffre unique : elle change avec la langue et avec la longueur du document, donc nous rapportons quatre profils plutôt qu'une moyenne qui masquerait les mauvais. Chaque taux est une borne supérieure à 95 % et non le nombre observé — la borne est ce que nous avons le droit d'affirmer, et elle est toujours la moins flatteuse des deux. Les seuils de ces tableaux sont exprimés sur nos échelles internes de mesure ; le score affiché est la même information sur un axe d’affichage fixe - l’ambre commence à 20, le rouge à 50 - chaque seuil mesuré étant projeté exactement sur ces ancres.
| Profil | Verdict le plus fort | Faux positifs | Observé | Mesuré sur |
|---|---|---|---|---|
| Anglais · plus de 400 mots | Forte probabilité d'IA | au plus 3,13 % | 2 sur 199 | 199 documents EN de la moitié de validation (échelle combinée, w_style=0,5) |
| Allemand · plus de 400 mots | Forte probabilité d'IA | au plus 0,35 % | 0 sur 866 | 866 mémoires d'étudiants allemands, 2010-2021 |
| Anglais · moins de 400 mots | Forte probabilité d'IA | non publié | — | aucune population humaine pertinente détenue |
| Allemand · moins de 400 mots | aucun verdict de forte probabilité n'est rendu | — | — | — |
Un texte allemand court ne reçoit jamais de verdict de forte probabilité, et n'en recevra jamais au vu des données actuelles.
Sur un texte allemand de moins de 400 mots, aucun seuil assez strict pour détecter l'IA de façon fiable ne coûte moins d'environ 7 accusations injustifiées sur 100. Un étudiant innocent sur quinze n'est pas un échange que nous acceptons, donc le profil allemand court s'arrête à « probabilité moyenne ». C'est une limite mesurée, pas une fonctionnalité qui resterait à construire.
Les verdicts plus faibles, qui sont plus bruités
La plupart des lecteurs ne voient jamais le verdict le plus fort. Ils en voient un de ceux-ci, et ce sont ces taux d'erreur qui s'appliqueront réellement à eux. La bande anglaise « faible probabilité » est de loin la pire du lot.
| Profil | Verdict | Seuil | Faux positifs | Observé |
|---|---|---|---|---|
| Anglais · plus de 400 mots | Probabilité moyenne | ≥ 96 | au plus 5,86 % | 6 sur 199 |
| Anglais · plus de 400 mots | Faible probabilité | ≥ 91 | au plus 8,37 % | 10 sur 199 |
| Allemand · plus de 400 mots | Probabilité moyenne | ≥ 25 | au plus 1,05 % | 4 sur 866 |
| Allemand · plus de 400 mots | Faible probabilité | ≥ 22 | au plus 1,81 % | 9 sur 866 |
Ce que ces chiffres ne sont pas
- Zéro observé n'est pas zéro. Aucun des deux profils longs n'a produit un seul faux positif au seuil le plus fort — 0 sur 1 412 articles anglais, 0 sur 866 mémoires allemands. Nous publions quand même 0,21 % et 0,35 %, parce que ce sont les bornes supérieures à 95 % pour ces tailles d'échantillon. Publier « 0 % » serait exactement la surenchère contre laquelle cette page existe.
- Le corpus anglais n'est pas du bon genre. Ces 1 412 documents sont des articles de revue : édités, professionnels, écrits par des équipes. Un mémoire d'étudiant n'est rien de tout cela. Le taux est honnêtement mesuré sur ce sur quoi il dit l'être, et les seuils anglais restent délibérément où ils sont tant qu'il n'existe pas assez de mémoires en anglais écrits par des non-natifs pour justifier de les déplacer. Nous en détenons 20.
- Le texte court n'a aucun taux publié. Le profil court régit une fenêtre de 300 à 400 mots, et aucun corpus humain que nous détenons n'est tiré de cette fenêtre. Les taux qui figuraient ici pour lui ont été retirés le 21 août 2026 plutôt que laissés en place, parce qu'un chiffre plausible sans population derrière reste une affirmation sans fondement.
- Les corpus d'IA sont petits — 20 à 25 documents par langue, issus de deux familles de modèles. Un modèle que nous n'avons pas testé peut se comporter autrement.
- Le français et l'espagnol ne sont pas calibrés. Ils renvoient un score et aucune affirmation de précision, et ils ne rendent jamais de verdict de forte probabilité.
Ce sur quoi nous avons mesuré
Chaque document humain ci-dessous a été publié avant l'existence de ChatGPT : sa paternité n'est donc pas une affaire d'appréciation.
Mémoires d'étudiants allemands, 2010-2021
n = 866
Des documents entiers, dans la langue et le genre que nous servons réellement, humains par construction puisqu'ils sont antérieurs à ChatGPT. C'est le corpus sur lequel les seuils allemands sont fixés.
scripts/fetch-thesis-negatives.mjs
Articles en libre accès, avant 2022
n = 1 412
De la prose académique de pleine longueur. Les articles de revue sont édités et écrits par des équipes : ce ne sont pas des textes d'étudiants — raison pour laquelle les seuils anglais ne sont pas déplacés dessus.
scripts/fetch-longform-corpus.mjs
Moitié de validation du mélange : articles + arXiv, extraits de 1 500 mots
n = 199
La moitié réservée de 400 documents anglais (arXiv et articles en libre accès antérieurs à 2022), notés par les DEUX moitiés de la vérification. Les seuils combinés y sont découpés ; ses taux sont ceux publiés. Prose de revues, pas d’écrits étudiants - la population est nommée parce que cette réserve fait partie du chiffre.
scripts/calibrate-components.mjs
Résumés arXiv, avant 2022
n = 236
De l'anglais en format court. Conservé pour le travail sur l'AUC ; aucun taux de faux positifs n'en est publié, parce qu'une fenêtre de verdict de 300 à 400 mots n'est pas ce que mesure un corpus de résumés.
scripts/fetch-human-corpus.mjs
Résumés académiques allemands, avant 2022
n = 60
OpenAlex, filtré sur les mots-outils allemands parce que le champ de langue n'est pas fiable. À l'origine de la décision de ne rendre aucun verdict de forte probabilité sur l'allemand court.
scripts/fetch-german-corpus.mjs
Nous avons un jour livré un détecteur pire qu'un tirage à pile ou face
Dans une version précoce, la mesure sur 236 résumés arXiv antérieurs à 2022 a donné une AUC de 0.184. Un tirage à pile ou face vaut 0,50. Le détecteur classait le texte écrit par une machine comme plus humain que le texte écrit par une personne ; inverser sa sortie l'aurait amélioré. Il avait renvoyé des pourcentages péremptoires tout du long.
La cause était une famille d'indicateurs de richesse lexicale — le K de Yule, le MTLD, l'exposant de Zipf, les hapax — tous inversés, avec de fortes tailles d'effet. Ils notent la prose académique humaine dense comme machinique et la prose machinique lexicalement variée comme humaine. C'est le même mécanisme derrière le résultat publié selon lequel les détecteurs signalent à tort une majorité de rédacteurs anglophones non natifs.
Ces indicateurs ont désormais un poids nul. Ils sont toujours calculés et toujours affichés comme éléments d'analyse ; ils ne font simplement plus bouger le score. Nous publions cela parce que c'est notre meilleur argument en faveur de la mesure : la défaillance était invisible depuis la sortie et évidente depuis le corpus, et tout détecteur qui n'a jamais fait ce test ignore s'il a le même problème.
Ce qu'aucun détecteur ne peut faire
Aucun détecteur d'IA, celui-ci compris, ne prouve la paternité d'un texte. Ces outils mesurent des propriétés statistiques, et une écriture humaine formelle, structurée ou produite par un locuteur non natif partage beaucoup de ces propriétés. Un score est une raison de poser une question, jamais une raison de conclure. Si un détecteur a été utilisé contre votre travail, la première chose à demander est le taux d'erreur du détecteur employé — c'est ce chiffre, et non le pourcentage, qui dit ce que le résultat vaut.
Analysez votre propre travail au regard de ces chiffres
Les 1 500 premiers mots sont gratuits, sans compte. Derrière chaque verdict il y a un taux d'erreur mesuré, et c'est sur cette page qu'ils sont tous publiés.
Lancer l'analyse gratuiteChercheurs et journalistes : les corpus, le code de scoring et les harnais de calibration sont tous dans le dépôt derrière ce site. Si vous voulez reproduire ou contester un chiffre présenté ici, écrivez à contact@morphica.de et nous vous aiderons.