Измерване
Колко често нашият AI детектор греши за човек
Всеки AI детектор дава уверен процент. Никой не ти казва колко често този процент греши за някой, който е написал работата си сам. Това второ число е важното, ако обвинението е срещу теб, затова го публикуваме, за езиците, на които сме го измерили.
Последно измерване: 24 август 2026 г.. Всяко число по-долу идва от скрипт в нашето хранилище, който може да бъде пуснат отново върху същите етикетирани корпуси.
Нито един от тези проценти не е измерен на български.
Числата на тази страница са измерени върху английски и немски текстове и остават свързани с тези езици: това, че са написани на български, не ги прави български. Български текст се оценява само по структурата на текста (стилът на писане е показан, но не се брои), предварително: още нямаме корпус от български дипломни работи, за които със сигурност знаем, че са написани от хора, затова не можем да ти кажем колко често грешим за български текст, и докато е така, детекторът никога не дава червена оценка на български. Предпочитаме да ти го кажем, вместо да представим английско число като твое.
Измерени проценти фалшиво положителни резултати
Колко често академичен текст, за който със сигурност знаем, че е написан от човек, получава най-силната ни оценка. Точността не е едно число: тя се мени с езика и дължината на документа, затова даваме четири профила вместо средна стойност, която би скрила слабите. Всеки процент е горна граница при 95 %, а не наблюдаваният брой: границата е това, което имаме право да твърдим, и винаги е по-лошата от двете стойности. Праговете в тези таблици са на вътрешните ни скали за измерване; показаният резултат е същата информация върху фиксирана ос, с кехлибарено от 20 и червено от 50.
| Профил | Най-силна оценка | Фалшиво положителни | Наблюдавани | Измерено върху |
|---|---|---|---|---|
| Английски · над 400 думи | Ясни следи от AI | най-много 3,13 % | 2 от 199 | 199 EN документа от валидационната половина (комбинирана скала, w_style=0,5) |
| Немски · над 400 думи | Ясни следи от AI | най-много 1,63 % | 10 от 1035 | 1035 немски дипломни работи от валидационната половина (комбинирана скала, w_style=0,5) |
| Английски · под 400 думи | Ясни следи от AI | не е публикувано | - | нямаме подходяща човешка популация |
| Немски · под 400 думи | оценката «ясни следи от AI» никога не се издава | - | - | - |
Кратък немски текст никога не получава оценката «ясни следи от AI» и при сегашните доказателства няма да я получи.
При кратък немски текст нито един праг, достатъчно строг, за да разпознава надеждно AI, не струва по-малко от около 7 фалшиви обвинения на 100. Един невинен студент от петнадесет не е размяна, която приемаме, затова краткият немски профил спира до «някои следи от AI». Това е измерено ограничение, а не функция, която тепърва ще се прави.
По-слабите оценки, които са по-шумни
Повечето читатели никога не виждат най-силната оценка. Виждат една от тези, и процентите грешки тук са тези, които наистина ги засягат. Долният английски кехлибарен диапазон е най-шумният с голяма разлика.
| Профил | Оценка | Праг | Фалшиво положителни | Наблюдавани |
|---|---|---|---|---|
| Английски · над 400 думи | Някои следи от AI | ≥ 96 | най-много 5,86 % | 6 от 199 |
| Английски · над 400 думи | Някои следи от AI (долният кехлибарен диапазон) | ≥ 91 | най-много 8,37 % | 10 от 199 |
| Немски · над 400 думи | Някои следи от AI | ≥ 88 | най-много 4,02 % | 31 от 1035 |
| Немски · над 400 думи | Някои следи от AI (долният кехлибарен диапазон) | ≥ 85 | най-много 6,18 % | 51 от 1035 |
Какво не са тези числа
- Нула наблюдавани не е нула. Нито един от двата дълги профила не даде нито един фалшиво положителен резултат при най-строгия праг в суровите корпуси на структурата. Въпреки това публикуваме горната граница при 95 % за този размер на извадката, защото да напишем «0 %» би било точно прекомерната увереност, срещу която съществува тази страница.
- Английският корпус е от грешен жанр. Тези документи са статии от списания: редактирани, професионални, написани от екипи. Студентската дипломна работа не е нищо от това. Процентът е честно измерен върху това, върху което казва, че е измерен, а английските прагове остават където са, докато не се съберат достатъчно студентски работи на английски като втори език, за да оправдаят преместването им.
- Краткият текст няма публикуван процент. Краткият профил засяга прозорец от няколкостотин думи, а нито един човешки корпус, с който разполагаме, не идва от този прозорец. Процентите, които стояха тук, бяха премахнати на 21 август 2026 г., вместо да останат, защото правдоподобно число без популация зад него остава неоснователно твърдение.
- Корпусите с AI са малки: около двадесет документа на език, от две семейства модели. Модел, който не сме тествали, може да се държи различно.
- Българският не е калибриран. Български текст получава оценка, основана само на структурата на текста, предварителна, без никакво твърдение за точност, и никога не получава червена оценка.
Върху какво измервахме
Всеки човешки документ по-долу е публикуван преди ChatGPT да съществува, така че авторството му не е въпрос на преценка.
Немски студентски дипломни работи, 2010-2021
n = 866
Цели документи, на езика и в жанра, които обслужваме на немски, човешки по конструкция, защото предхождат ChatGPT. Върху този корпус са определени немските прагове.
scripts/fetch-thesis-negatives.mjs
Валидационната половина на комбинацията: немски студентски дипломни работи, 2008-2021, цели документи
n = 1035
Отделената половина от реални немски дипломни работи (MOnAMi, Hochschule Mittweida, 2008-2021), оценена от ДВЕТЕ половини на проверката: цели документи, никога използвани за обучение на немския модел. Комбинираните немски прагове са определени върху нея. Това не са текстове от времето на нашите клиенти: изгладена дипломна работа от 2026 г. е популация, която никой не е измерил, и тази уговорка е част от числото.
scripts/calibrate-components.mjs
Статии с отворен достъп, преди 2022
n = 1412
Пълна академична проза. Статиите в списания са редактирани и написани от екипи, така че не са студентско писане: затова английските прагове не се преместват спрямо тях.
scripts/fetch-longform-corpus.mjs
Валидационната половина на комбинацията: статии + arXiv, откъси от 1500 думи
n = 199
Отделената половина от английски документи (arXiv и статии с отворен достъп отпреди 2022), оценена от ДВЕТЕ половини на проверката. Комбинираните прагове са определени върху нея. Проза от списания, не студентско писане: казваме го, защото тази уговорка е част от числото.
scripts/calibrate-components.mjs
Резюмета от arXiv, преди 2022
n = 236
Кратки текстове на английски. Пазят се за работата по AUC; не публикуваме процент фалшиво положителни резултати от тях, защото краткият прозорец на оценката не е това, което измерва корпус от резюмета.
scripts/fetch-human-corpus.mjs
Немски академични резюмета, преди 2022
n = 60
OpenAlex, филтриран по немски функционални думи, защото полето за език е ненадеждно. На него се основава решението оценката «ясни следи от AI» изобщо да не се издава за кратък немски текст.
scripts/fetch-german-corpus.mjs
Веднъж едва не публикувахме детектор, по-лош от хвърляне на монета
В ранна версия измерването върху 236 резюмета от arXiv отпреди 2022 даде AUC от 0.184. Хвърлянето на монета дава 0,50. Детекторът оценяваше текста, написан от машина, като по-човешки от текста, написан от хора; обръщането на резултата му би го подобрило. И през цялото време даваше уверени проценти.
Причината беше група показатели за лексикално богатство (K на Юл, MTLD, експонентата на Зипф, hapax legomena), всички обърнати и със силен ефект. Те оценяват плътната човешка академична проза като машинна, а лексикално разнообразната машинна проза като човешка. Това е същият механизъм зад публикуваната находка, че детекторите погрешно отбелязват повечето хора, които пишат на английски като втори език.
Днес тези показатели имат тегло нула. Все още се изчисляват и показват като податки, но не местят резултата. Публикуваме го, защото това е най-силният ни аргумент да измерваме: дефектът беше невидим от резултата и очевиден от корпуса, а детектор, който никога не е минал този тест, не знае дали има същия проблем.
Какво не може нито един детектор
Нито един AI детектор, включително този, не е доказателство за авторство. Тези инструменти измерват статистически свойства на текста, а формалното, структурирано или написано на втори език човешко писане споделя много от тях. Резултатът е повод за въпрос, никога за заключение.
Провери своя текст
Първите 1500 думи са безплатни, без акаунт. На български оценката се основава на структурата на текста и ти показва изреченията, които влияят; тази страница ти казва какво е измерено и какво не.
Пусни безплатния AI детекторИзследователи и журналисти: корпусите, кодът за оценяване и инструментите за калибриране са в хранилището зад този сайт. Ако искаш да повториш или оспориш число от тази страница, пиши на contact@thesisdraft.com и ще ти помогнем.