Benchmark
Jak często nasz detektor AI myli się co do człowieka
Każdy detektor AI podaje pewny siebie procent. Żaden nie mówi, jak często ten procent myli się co do kogoś, kto sam napisał swoją pracę. Ta druga liczba ma znaczenie, jeśli to Ty jesteś oskarżonym studentem, więc to właśnie ją publikujemy, dla języków, w których ją zmierzyliśmy.
Ostatni pomiar: 24 sierpnia 2026. Każda liczba poniżej pochodzi ze skryptu w naszym repozytorium, który można ponownie uruchomić na tych samych oznaczonych korpusach.
Żaden z tych odsetków nie został zmierzony po polsku.
Liczby na tej stronie zmierzono na tekstach angielskich i niemieckich i pozostają one przypisane do tych języków: zapisanie ich po polsku nie czyni ich polskimi. Tekst polski jest oceniany wyłącznie według struktury tekstu (styl pisania jest pokazywany, ale się nie liczy), wstępnie: nie mamy jeszcze korpusu polskich prac na pewno napisanych przez ludzi, więc nie możemy Ci powiedzieć, jak często mylimy się przy polskim tekście, i dopóki tak jest, detektor po polsku nigdy nie wydaje czerwonego werdyktu. Wolimy Ci to powiedzieć, niż podać angielską liczbę jako Twoją.
Zmierzone odsetki fałszywych alarmów
Jak często tekst akademicki napisany na pewno przez człowieka dostaje nasz najmocniejszy werdykt. Dokładność to nie jedna liczba: zmienia się z językiem i długością dokumentu, więc podajemy cztery profile zamiast średniej, która ukryłaby te słabsze. Każdy odsetek to górna granica 95%, a nie zaobserwowana liczba: granica to to, co mamy prawo twierdzić, i zawsze jest gorszą z dwóch. Progi w tych tabelach są na naszych wewnętrznych skalach pomiaru; pokazany wynik to ta sama informacja na stałej osi, z bursztynem od 20 i czerwienią od 50.
| Profil | Najmocniejszy werdykt | Fałszywe alarmy | Zaobserwowane | Zmierzono na |
|---|---|---|---|---|
| Angielski · ponad 400 słów | Wyraźne ślady AI | najwyżej 3,13 % | 2 z 199 | 199 dokumentów EN z połowy walidacyjnej (skala połączona, w_style=0,5) |
| Niemiecki · ponad 400 słów | Wyraźne ślady AI | najwyżej 1,63 % | 10 z 1035 | 1035 niemieckich prac z połowy walidacyjnej (skala połączona, w_style=0,5) |
| Angielski · poniżej 400 słów | Wyraźne ślady AI | nieopublikowane | - | brak odpowiedniej populacji ludzkich tekstów |
| Niemiecki · poniżej 400 słów | werdykt «wyraźne ślady AI» nigdy nie jest wydawany | - | - | - |
Krótki tekst niemiecki nigdy nie dostaje werdyktu «wyraźne ślady AI» i przy obecnych dowodach go nie dostanie.
Przy krótkich tekstach niemieckich żaden próg dość surowy, by wiarygodnie rozpoznać AI, nie kosztuje mniej niż około 7 fałszywych oskarżeń na 100. Jeden niewinny student na piętnastu to nie wymiana, którą akceptujemy, więc krótki profil niemiecki zatrzymuje się na «pewnych śladach AI». To zmierzona granica, a nie funkcja, której jeszcze nie zbudowano.
Słabsze werdykty, w których jest więcej szumu
Większość czytelników nigdy nie widzi najmocniejszego werdyktu. Widzi jeden z tych, a odsetki błędów tutaj to te, które naprawdę ich dotyczą. Dolny angielski pas bursztynowy jest zdecydowanie najbardziej zaszumiony.
| Profil | Werdykt | Próg | Fałszywe alarmy | Zaobserwowane |
|---|---|---|---|---|
| Angielski · ponad 400 słów | Pewne ślady AI | ≥ 96 | najwyżej 5,86 % | 6 z 199 |
| Angielski · ponad 400 słów | Pewne ślady AI (dolny pas bursztynowy) | ≥ 91 | najwyżej 8,37 % | 10 z 199 |
| Niemiecki · ponad 400 słów | Pewne ślady AI | ≥ 88 | najwyżej 4,02 % | 31 z 1035 |
| Niemiecki · ponad 400 słów | Pewne ślady AI (dolny pas bursztynowy) | ≥ 85 | najwyżej 6,18 % | 51 z 1035 |
Czym te liczby nie są
- Zero zaobserwowane to nie zero. Żaden z dwóch długich profili nie dał ani jednego fałszywego alarmu przy najsurowszym progu w surowych korpusach struktury. Mimo to publikujemy górną granicę 95% dla tej wielkości próby, bo napisanie «0%» byłoby dokładnie tą nadmierną pewnością, przeciw której istnieje ta strona.
- Angielski korpus jest niewłaściwego gatunku. Te dokumenty to artykuły w czasopismach: redagowane, profesjonalne, pisane zespołowo. Praca studenta nie jest niczym z tych rzeczy. Odsetek jest uczciwie zmierzony na tym, na czym deklaruje, że został zmierzony, a angielskie progi zostają tam, gdzie są, dopóki nie będzie dość prac studentów piszących po angielsku jako drugim języku, by uzasadnić ich przesunięcie.
- Krótki tekst nie ma opublikowanego odsetka. Krótki profil dotyczy okna kilkuset słów, a żaden ludzki korpus, którym dysponujemy, nie pochodzi z tego okna. Odsetki, które tu były, usunęliśmy 21 sierpnia 2026, zamiast je zostawić, bo wiarygodnie wyglądająca liczba bez populacji za nią pozostaje twierdzeniem bez podstaw.
- Korpusy AI są małe: około dwudziestu dokumentów na język, z dwóch rodzin modeli. Model, którego nie testowaliśmy, może zachowywać się inaczej.
- Polski nie jest skalibrowany. Tekst polski dostaje werdykt oparty wyłącznie na strukturze tekstu, wstępny, bez żadnego twierdzenia o dokładności, i nigdy nie dostaje czerwonego werdyktu.
Na czym mierzyliśmy
Każdy ludzki dokument poniżej został opublikowany, zanim istniał ChatGPT, więc jego autorstwo nie jest kwestią oceny.
Prace dyplomowe niemieckich studentów, 2010-2021
n = 866
Całe dokumenty, w języku i gatunku, które obsługujemy po niemiecku, ludzkie z definicji, bo powstały przed ChatGPT. Na tym korpusie ustalone są niemieckie progi.
scripts/fetch-thesis-negatives.mjs
Połowa walidacyjna połączenia: prace dyplomowe niemieckich studentów, 2008-2021, całe dokumenty
n = 1035
Odłożona połowa prawdziwych niemieckich prac dyplomowych (MOnAMi, Hochschule Mittweida, 2008-2021), oceniona przez OBIE połowy sprawdzenia: całe dokumenty, nigdy nieużyte do trenowania niemieckiego modelu. Na niej wyznaczono połączone niemieckie progi. To nie są teksty z czasów naszych klientów: dopracowana praca z 2026 roku to populacja, której nikt nie zmierzył, i to zastrzeżenie jest częścią liczby.
scripts/calibrate-components.mjs
Artykuły w otwartym dostępie, sprzed 2022 roku
n = 1412
Pełna proza akademicka. Artykuły w czasopismach są redagowane i pisane zespołowo, więc to nie są teksty studentów: dlatego angielskie progi nie są na ich podstawie przesuwane.
scripts/fetch-longform-corpus.mjs
Połowa walidacyjna połączenia: artykuły + arXiv, fragmenty po 1500 słów
n = 199
Odłożona połowa angielskich dokumentów (arXiv i artykuły w otwartym dostępie sprzed 2022 roku), oceniona przez OBIE połowy sprawdzenia. Na niej wyznaczono połączone progi. Proza czasopism, a nie teksty studentów: mówimy to, bo to zastrzeżenie jest częścią liczby.
scripts/calibrate-components.mjs
Streszczenia arXiv, sprzed 2022 roku
n = 236
Krótkie teksty po angielsku. Zachowane do pracy nad AUC; nie publikujemy na ich podstawie żadnego odsetka fałszywych alarmów, bo krótkie okno werdyktu to nie to, co mierzy korpus streszczeń.
scripts/fetch-human-corpus.mjs
Niemieckie streszczenia akademickie, sprzed 2022 roku
n = 60
OpenAlex, przefiltrowany według niemieckich słów funkcyjnych, bo pole języka jest niewiarygodne. Na nim opiera się decyzja, by przy krótkich tekstach niemieckich w ogóle nie wydawać werdyktu «wyraźne ślady AI».
scripts/fetch-german-corpus.mjs
Kiedyś prawie opublikowaliśmy detektor gorszy niż rzut monetą
We wczesnej wersji pomiar na 236 streszczeniach arXiv sprzed 2022 roku dał AUC równe 0.184. Rzut monetą to 0,50. Detektor oceniał tekst napisany przez maszynę jako bardziej ludzki niż tekst ludzi; odwrócenie wyniku by go poprawiło. A przez cały ten czas podawał pewne siebie procenty.
Przyczyną była rodzina wskaźników bogactwa leksykalnego (K Yule'a, MTLD, wykładnik Zipfa, hapax legomena), wszystkie odwrócone i o silnym efekcie. Oceniają gęstą ludzką prozę akademicką jako maszynową, a leksykalnie zróżnicowaną prozę maszynową jako ludzką. To ten sam mechanizm, który stoi za opublikowanym wynikiem, że detektory błędnie oznaczają większość osób piszących po angielsku jako drugim języku.
Dziś te wskaźniki ważą zero. Nadal są liczone i pokazywane jako wskazówki, ale nie zmieniają wyniku. Publikujemy to, bo to najmocniejszy argument, jaki mamy za mierzeniem: wada była niewidoczna w wyniku i oczywista w korpusie, a detektor, który nigdy nie zrobił tego testu, nie wie, czy ma ten sam problem.
Czego nie potrafi żaden detektor
Żaden detektor AI, łącznie z tym, nie jest dowodem autorstwa. Te narzędzia mierzą statystyczne właściwości tekstu, a formalne, uporządkowane albo pisane w drugim języku teksty ludzi mają wiele z nich. Wynik to powód, żeby zadać pytanie, a nigdy, żeby wyciągnąć wniosek.
Sprawdź swój tekst
Pierwsze 1500 słów jest za darmo, bez konta. Po polsku werdykt opiera się na strukturze tekstu i pokazuje Ci zdania, które ważą; ta strona mówi Ci, co zostało zmierzone, a co nie.
Uruchom darmowy detektor AIBadacze i dziennikarze: korpusy, kod ewaluacji i narzędzia kalibracji są w repozytorium stojącym za tą stroną. Jeśli chcesz odtworzyć albo zakwestionować liczbę z tej strony, napisz na contact@thesisdraft.com, a pomożemy.