Benchmark

Jak często nasz detektor AI myli się co do człowieka

Każdy detektor AI podaje pewny siebie procent. Żaden nie mówi, jak często ten procent myli się co do kogoś, kto sam napisał swoją pracę. Ta druga liczba ma znaczenie, jeśli to Ty jesteś oskarżonym studentem, więc to właśnie ją publikujemy, dla języków, w których ją zmierzyliśmy.

Ostatni pomiar: 24 sierpnia 2026. Każda liczba poniżej pochodzi ze skryptu w naszym repozytorium, który można ponownie uruchomić na tych samych oznaczonych korpusach.

Żaden z tych odsetków nie został zmierzony po polsku.

Liczby na tej stronie zmierzono na tekstach angielskich i niemieckich i pozostają one przypisane do tych języków: zapisanie ich po polsku nie czyni ich polskimi. Tekst polski jest oceniany wyłącznie według struktury tekstu (styl pisania jest pokazywany, ale się nie liczy), wstępnie: nie mamy jeszcze korpusu polskich prac na pewno napisanych przez ludzi, więc nie możemy Ci powiedzieć, jak często mylimy się przy polskim tekście, i dopóki tak jest, detektor po polsku nigdy nie wydaje czerwonego werdyktu. Wolimy Ci to powiedzieć, niż podać angielską liczbę jako Twoją.

Zmierzone odsetki fałszywych alarmów

Jak często tekst akademicki napisany na pewno przez człowieka dostaje nasz najmocniejszy werdykt. Dokładność to nie jedna liczba: zmienia się z językiem i długością dokumentu, więc podajemy cztery profile zamiast średniej, która ukryłaby te słabsze. Każdy odsetek to górna granica 95%, a nie zaobserwowana liczba: granica to to, co mamy prawo twierdzić, i zawsze jest gorszą z dwóch. Progi w tych tabelach są na naszych wewnętrznych skalach pomiaru; pokazany wynik to ta sama informacja na stałej osi, z bursztynem od 20 i czerwienią od 50.

ProfilNajmocniejszy werdyktFałszywe alarmyZaobserwowaneZmierzono na
Angielski · ponad 400 słówWyraźne ślady AInajwyżej 3,13 %2 z 199199 dokumentów EN z połowy walidacyjnej (skala połączona, w_style=0,5)
Niemiecki · ponad 400 słówWyraźne ślady AInajwyżej 1,63 %10 z 10351035 niemieckich prac z połowy walidacyjnej (skala połączona, w_style=0,5)
Angielski · poniżej 400 słówWyraźne ślady AInieopublikowane-brak odpowiedniej populacji ludzkich tekstów
Niemiecki · poniżej 400 słówwerdykt «wyraźne ślady AI» nigdy nie jest wydawany---

Krótki tekst niemiecki nigdy nie dostaje werdyktu «wyraźne ślady AI» i przy obecnych dowodach go nie dostanie.

Przy krótkich tekstach niemieckich żaden próg dość surowy, by wiarygodnie rozpoznać AI, nie kosztuje mniej niż około 7 fałszywych oskarżeń na 100. Jeden niewinny student na piętnastu to nie wymiana, którą akceptujemy, więc krótki profil niemiecki zatrzymuje się na «pewnych śladach AI». To zmierzona granica, a nie funkcja, której jeszcze nie zbudowano.

Słabsze werdykty, w których jest więcej szumu

Większość czytelników nigdy nie widzi najmocniejszego werdyktu. Widzi jeden z tych, a odsetki błędów tutaj to te, które naprawdę ich dotyczą. Dolny angielski pas bursztynowy jest zdecydowanie najbardziej zaszumiony.

ProfilWerdyktPrógFałszywe alarmyZaobserwowane
Angielski · ponad 400 słówPewne ślady AI≥ 96najwyżej 5,86 %6 z 199
Angielski · ponad 400 słówPewne ślady AI (dolny pas bursztynowy)≥ 91najwyżej 8,37 %10 z 199
Niemiecki · ponad 400 słówPewne ślady AI≥ 88najwyżej 4,02 %31 z 1035
Niemiecki · ponad 400 słówPewne ślady AI (dolny pas bursztynowy)≥ 85najwyżej 6,18 %51 z 1035

Czym te liczby nie są

Na czym mierzyliśmy

Każdy ludzki dokument poniżej został opublikowany, zanim istniał ChatGPT, więc jego autorstwo nie jest kwestią oceny.

Prace dyplomowe niemieckich studentów, 2010-2021

n = 866

Całe dokumenty, w języku i gatunku, które obsługujemy po niemiecku, ludzkie z definicji, bo powstały przed ChatGPT. Na tym korpusie ustalone są niemieckie progi.

scripts/fetch-thesis-negatives.mjs

Połowa walidacyjna połączenia: prace dyplomowe niemieckich studentów, 2008-2021, całe dokumenty

n = 1035

Odłożona połowa prawdziwych niemieckich prac dyplomowych (MOnAMi, Hochschule Mittweida, 2008-2021), oceniona przez OBIE połowy sprawdzenia: całe dokumenty, nigdy nieużyte do trenowania niemieckiego modelu. Na niej wyznaczono połączone niemieckie progi. To nie są teksty z czasów naszych klientów: dopracowana praca z 2026 roku to populacja, której nikt nie zmierzył, i to zastrzeżenie jest częścią liczby.

scripts/calibrate-components.mjs

Artykuły w otwartym dostępie, sprzed 2022 roku

n = 1412

Pełna proza akademicka. Artykuły w czasopismach są redagowane i pisane zespołowo, więc to nie są teksty studentów: dlatego angielskie progi nie są na ich podstawie przesuwane.

scripts/fetch-longform-corpus.mjs

Połowa walidacyjna połączenia: artykuły + arXiv, fragmenty po 1500 słów

n = 199

Odłożona połowa angielskich dokumentów (arXiv i artykuły w otwartym dostępie sprzed 2022 roku), oceniona przez OBIE połowy sprawdzenia. Na niej wyznaczono połączone progi. Proza czasopism, a nie teksty studentów: mówimy to, bo to zastrzeżenie jest częścią liczby.

scripts/calibrate-components.mjs

Streszczenia arXiv, sprzed 2022 roku

n = 236

Krótkie teksty po angielsku. Zachowane do pracy nad AUC; nie publikujemy na ich podstawie żadnego odsetka fałszywych alarmów, bo krótkie okno werdyktu to nie to, co mierzy korpus streszczeń.

scripts/fetch-human-corpus.mjs

Niemieckie streszczenia akademickie, sprzed 2022 roku

n = 60

OpenAlex, przefiltrowany według niemieckich słów funkcyjnych, bo pole języka jest niewiarygodne. Na nim opiera się decyzja, by przy krótkich tekstach niemieckich w ogóle nie wydawać werdyktu «wyraźne ślady AI».

scripts/fetch-german-corpus.mjs

Kiedyś prawie opublikowaliśmy detektor gorszy niż rzut monetą

We wczesnej wersji pomiar na 236 streszczeniach arXiv sprzed 2022 roku dał AUC równe 0.184. Rzut monetą to 0,50. Detektor oceniał tekst napisany przez maszynę jako bardziej ludzki niż tekst ludzi; odwrócenie wyniku by go poprawiło. A przez cały ten czas podawał pewne siebie procenty.

Przyczyną była rodzina wskaźników bogactwa leksykalnego (K Yule'a, MTLD, wykładnik Zipfa, hapax legomena), wszystkie odwrócone i o silnym efekcie. Oceniają gęstą ludzką prozę akademicką jako maszynową, a leksykalnie zróżnicowaną prozę maszynową jako ludzką. To ten sam mechanizm, który stoi za opublikowanym wynikiem, że detektory błędnie oznaczają większość osób piszących po angielsku jako drugim języku.

Dziś te wskaźniki ważą zero. Nadal są liczone i pokazywane jako wskazówki, ale nie zmieniają wyniku. Publikujemy to, bo to najmocniejszy argument, jaki mamy za mierzeniem: wada była niewidoczna w wyniku i oczywista w korpusie, a detektor, który nigdy nie zrobił tego testu, nie wie, czy ma ten sam problem.

Czego nie potrafi żaden detektor

Żaden detektor AI, łącznie z tym, nie jest dowodem autorstwa. Te narzędzia mierzą statystyczne właściwości tekstu, a formalne, uporządkowane albo pisane w drugim języku teksty ludzi mają wiele z nich. Wynik to powód, żeby zadać pytanie, a nigdy, żeby wyciągnąć wniosek.

Sprawdź swój tekst

Pierwsze 1500 słów jest za darmo, bez konta. Po polsku werdykt opiera się na strukturze tekstu i pokazuje Ci zdania, które ważą; ta strona mówi Ci, co zostało zmierzone, a co nie.

Uruchom darmowy detektor AI

Badacze i dziennikarze: korpusy, kod ewaluacji i narzędzia kalibracji są w repozytorium stojącym za tą stroną. Jeśli chcesz odtworzyć albo zakwestionować liczbę z tej strony, napisz na contact@thesisdraft.com, a pomożemy.