Измерване

Колко често нашият AI детектор греши за човек

Всеки AI детектор дава уверен процент. Никой не ти казва колко често този процент греши за някой, който е написал работата си сам. Това второ число е важното, ако обвинението е срещу теб, затова го публикуваме, за езиците, на които сме го измерили.

Последно измерване: 24 август 2026 г.. Всяко число по-долу идва от скрипт в нашето хранилище, който може да бъде пуснат отново върху същите етикетирани корпуси.

Нито един от тези проценти не е измерен на български.

Числата на тази страница са измерени върху английски и немски текстове и остават свързани с тези езици: това, че са написани на български, не ги прави български. Български текст се оценява само по структурата на текста (стилът на писане е показан, но не се брои), предварително: още нямаме корпус от български дипломни работи, за които със сигурност знаем, че са написани от хора, затова не можем да ти кажем колко често грешим за български текст, и докато е така, детекторът никога не дава червена оценка на български. Предпочитаме да ти го кажем, вместо да представим английско число като твое.

Измерени проценти фалшиво положителни резултати

Колко често академичен текст, за който със сигурност знаем, че е написан от човек, получава най-силната ни оценка. Точността не е едно число: тя се мени с езика и дължината на документа, затова даваме четири профила вместо средна стойност, която би скрила слабите. Всеки процент е горна граница при 95 %, а не наблюдаваният брой: границата е това, което имаме право да твърдим, и винаги е по-лошата от двете стойности. Праговете в тези таблици са на вътрешните ни скали за измерване; показаният резултат е същата информация върху фиксирана ос, с кехлибарено от 20 и червено от 50.

ПрофилНай-силна оценкаФалшиво положителниНаблюдаваниИзмерено върху
Английски · над 400 думиЯсни следи от AIнай-много 3,13 %2 от 199199 EN документа от валидационната половина (комбинирана скала, w_style=0,5)
Немски · над 400 думиЯсни следи от AIнай-много 1,63 %10 от 10351035 немски дипломни работи от валидационната половина (комбинирана скала, w_style=0,5)
Английски · под 400 думиЯсни следи от AIне е публикувано-нямаме подходяща човешка популация
Немски · под 400 думиоценката «ясни следи от AI» никога не се издава---

Кратък немски текст никога не получава оценката «ясни следи от AI» и при сегашните доказателства няма да я получи.

При кратък немски текст нито един праг, достатъчно строг, за да разпознава надеждно AI, не струва по-малко от около 7 фалшиви обвинения на 100. Един невинен студент от петнадесет не е размяна, която приемаме, затова краткият немски профил спира до «някои следи от AI». Това е измерено ограничение, а не функция, която тепърва ще се прави.

По-слабите оценки, които са по-шумни

Повечето читатели никога не виждат най-силната оценка. Виждат една от тези, и процентите грешки тук са тези, които наистина ги засягат. Долният английски кехлибарен диапазон е най-шумният с голяма разлика.

ПрофилОценкаПрагФалшиво положителниНаблюдавани
Английски · над 400 думиНякои следи от AI≥ 96най-много 5,86 %6 от 199
Английски · над 400 думиНякои следи от AI (долният кехлибарен диапазон)≥ 91най-много 8,37 %10 от 199
Немски · над 400 думиНякои следи от AI≥ 88най-много 4,02 %31 от 1035
Немски · над 400 думиНякои следи от AI (долният кехлибарен диапазон)≥ 85най-много 6,18 %51 от 1035

Какво не са тези числа

Върху какво измервахме

Всеки човешки документ по-долу е публикуван преди ChatGPT да съществува, така че авторството му не е въпрос на преценка.

Немски студентски дипломни работи, 2010-2021

n = 866

Цели документи, на езика и в жанра, които обслужваме на немски, човешки по конструкция, защото предхождат ChatGPT. Върху този корпус са определени немските прагове.

scripts/fetch-thesis-negatives.mjs

Валидационната половина на комбинацията: немски студентски дипломни работи, 2008-2021, цели документи

n = 1035

Отделената половина от реални немски дипломни работи (MOnAMi, Hochschule Mittweida, 2008-2021), оценена от ДВЕТЕ половини на проверката: цели документи, никога използвани за обучение на немския модел. Комбинираните немски прагове са определени върху нея. Това не са текстове от времето на нашите клиенти: изгладена дипломна работа от 2026 г. е популация, която никой не е измерил, и тази уговорка е част от числото.

scripts/calibrate-components.mjs

Статии с отворен достъп, преди 2022

n = 1412

Пълна академична проза. Статиите в списания са редактирани и написани от екипи, така че не са студентско писане: затова английските прагове не се преместват спрямо тях.

scripts/fetch-longform-corpus.mjs

Валидационната половина на комбинацията: статии + arXiv, откъси от 1500 думи

n = 199

Отделената половина от английски документи (arXiv и статии с отворен достъп отпреди 2022), оценена от ДВЕТЕ половини на проверката. Комбинираните прагове са определени върху нея. Проза от списания, не студентско писане: казваме го, защото тази уговорка е част от числото.

scripts/calibrate-components.mjs

Резюмета от arXiv, преди 2022

n = 236

Кратки текстове на английски. Пазят се за работата по AUC; не публикуваме процент фалшиво положителни резултати от тях, защото краткият прозорец на оценката не е това, което измерва корпус от резюмета.

scripts/fetch-human-corpus.mjs

Немски академични резюмета, преди 2022

n = 60

OpenAlex, филтриран по немски функционални думи, защото полето за език е ненадеждно. На него се основава решението оценката «ясни следи от AI» изобщо да не се издава за кратък немски текст.

scripts/fetch-german-corpus.mjs

Веднъж едва не публикувахме детектор, по-лош от хвърляне на монета

В ранна версия измерването върху 236 резюмета от arXiv отпреди 2022 даде AUC от 0.184. Хвърлянето на монета дава 0,50. Детекторът оценяваше текста, написан от машина, като по-човешки от текста, написан от хора; обръщането на резултата му би го подобрило. И през цялото време даваше уверени проценти.

Причината беше група показатели за лексикално богатство (K на Юл, MTLD, експонентата на Зипф, hapax legomena), всички обърнати и със силен ефект. Те оценяват плътната човешка академична проза като машинна, а лексикално разнообразната машинна проза като човешка. Това е същият механизъм зад публикуваната находка, че детекторите погрешно отбелязват повечето хора, които пишат на английски като втори език.

Днес тези показатели имат тегло нула. Все още се изчисляват и показват като податки, но не местят резултата. Публикуваме го, защото това е най-силният ни аргумент да измерваме: дефектът беше невидим от резултата и очевиден от корпуса, а детектор, който никога не е минал този тест, не знае дали има същия проблем.

Какво не може нито един детектор

Нито един AI детектор, включително този, не е доказателство за авторство. Тези инструменти измерват статистически свойства на текста, а формалното, структурирано или написано на втори език човешко писане споделя много от тях. Резултатът е повод за въпрос, никога за заключение.

Провери своя текст

Първите 1500 думи са безплатни, без акаунт. На български оценката се основава на структурата на текста и ти показва изреченията, които влияят; тази страница ти казва какво е измерено и какво не.

Пусни безплатния AI детектор

Изследователи и журналисти: корпусите, кодът за оценяване и инструментите за калибриране са в хранилището зад този сайт. Ако искаш да повториш или оспориш число от тази страница, пиши на contact@thesisdraft.com и ще ти помогнем.