Vertailu

Kuinka usein AI-tunnistimemme erehtyy ihmisestä

Jokainen AI-tunnistin antaa itsevarman prosenttiluvun. Kukaan ei kerro, kuinka usein se prosentti on väärässä, kun tekstin on kirjoittanut ihminen itse. Juuri tällä toisella luvulla on merkitystä, jos olet syytetty opiskelija, joten sen me julkaisemme niille kielille, joilla olemme sen mitanneet.

Viimeksi mitattu: 24. elokuuta 2026. Jokainen alla oleva luku tulee repositoriomme skriptistä, jonka voi ajaa uudelleen samoilla merkityillä aineistoilla.

Yhtäkään näistä osuuksista ei ole mitattu suomeksi.

Tämän sivun luvut on mitattu englannin- ja saksankielisillä teksteillä, ja ne kuuluvat niille kielille: niiden kirjoittaminen suomeksi ei tee niistä suomalaisia. Suomenkielinen teksti arvioidaan pelkästään tekstin rakenteen perusteella (kirjoitustyyli näytetään, mutta se ei vaikuta), ja alustavasti: meillä ei vielä ole aineistoa suomenkielisistä opinnäytetöistä, jotka ovat varmasti ihmisten kirjoittamia, joten emme voi sanoa, kuinka usein erehdymme suomenkielisestä tekstistä, ja niin kauan kuin näin on, tunnistin ei koskaan anna punaista arviota suomeksi. Kerromme sen mieluummin kuin esitämme englantilaisen luvun sinun lukunasi.

Mitatut väärien positiivisten osuudet

Kuinka usein akateeminen teksti, jonka on varmasti kirjoittanut ihminen, saa vahvimman arviomme. Tarkkuus ei ole yksi luku: se muuttuu kielen ja asiakirjan pituuden mukaan, joten raportoimme neljä profiilia keskiarvon sijaan, joka kätkisi heikot. Jokainen osuus on 95 %:n yläraja eikä havaittu määrä: yläraja on se, minkä meillä on oikeus väittää, ja se on aina kahdesta huonompi. Taulukoiden raja-arvot ovat sisäisillä mitta-asteikoillamme; näytetty pistemäärä on sama tieto kiinteällä akselilla, keltainen 20:stä ja punainen 50:stä alkaen.

ProfiiliVahvin arvioVäärät positiivisetHavaittuMitattu aineistolla
Englanti · yli 400 sanaaSelviä tekoälyn jälkiäenintään 3,13 %2/199199 EN-asiakirjaa validointipuoliskossa (yhdistetty asteikko, w_style=0,5)
Saksa · yli 400 sanaaSelviä tekoälyn jälkiäenintään 1,63 %10/1 0351 035 saksalaista opinnäytetyötä validointipuoliskossa (yhdistetty asteikko, w_style=0,5)
Englanti · alle 400 sanaaSelviä tekoälyn jälkiäei julkaistu-ei sopivaa ihmisaineistoa käytettävissä
Saksa · alle 400 sanaaarviota ”selviä tekoälyn jälkiä” ei koskaan anneta---

Lyhyt saksankielinen teksti ei koskaan saa arviota ”selviä tekoälyn jälkiä”, eikä se nykyisellä näytöllä tule sitä saamaan.

Lyhyellä saksankielisellä tekstillä jokainen raja-arvo, joka on tarpeeksi tiukka tunnistamaan tekoälyn luotettavasti, maksaa noin 7 väärää syytöstä sataa kohden. Yksi syytön opiskelija viidestätoista ei ole vaihtokauppa, jonka hyväksymme, joten lyhyt saksan profiili pysähtyy arvioon ”joitakin tekoälyn jälkiä”. Se on mitattu raja, ei vielä rakentamaton ominaisuus.

Heikommat arviot, jotka ovat kohinaisempia

Useimmat lukijat eivät koskaan näe vahvinta arviota. He näkevät jonkin näistä, ja näiden virheosuudet ovat ne, jotka heitä oikeasti koskevat. Englannin alempi keltainen vyöhyke on selvästi kohinaisin.

ProfiiliArvioRaja-arvoVäärät positiivisetHavaittu
Englanti · yli 400 sanaaJoitakin tekoälyn jälkiä≥ 96enintään 5,86 %6/199
Englanti · yli 400 sanaaJoitakin tekoälyn jälkiä (alempi keltainen vyöhyke)≥ 91enintään 8,37 %10/199
Saksa · yli 400 sanaaJoitakin tekoälyn jälkiä≥ 88enintään 4,02 %31/1 035
Saksa · yli 400 sanaaJoitakin tekoälyn jälkiä (alempi keltainen vyöhyke)≥ 85enintään 6,18 %51/1 035

Mitä nämä luvut eivät ole

Millä mittasimme

Jokainen alla oleva ihmisen kirjoittama asiakirja julkaistiin ennen ChatGPT:n syntyä, joten sen kirjoittaja ei ole arviointikysymys.

Saksalaisten opiskelijoiden opinnäytetyöt, 2010-2021

n = 866

Kokonaisia asiakirjoja kielellä ja lajityypissä, jota palvelemme saksaksi, määritelmällisesti ihmisten kirjoittamia, koska ne ovat ChatGPT:tä vanhempia. Saksan raja-arvot on asetettu tämän aineiston perusteella.

scripts/fetch-thesis-negatives.mjs

Yhdistelmän validointipuolisko: saksalaisten opiskelijoiden opinnäytetyöt, 2008-2021, kokonaiset asiakirjat

n = 1 035

Syrjään pidetty puolisko aitoja saksalaisia opinnäytetöitä (MOnAMi, Hochschule Mittweida, 2008-2021), jonka analyysin MOLEMMAT puoliskot ovat arvioineet: kokonaisia asiakirjoja, joita ei ole koskaan käytetty saksalaisen mallin koulutukseen. Saksan yhdistetyt raja-arvot on leikattu sen perusteella. Ne eivät ole asiakkaidemme ajan tekstejä: hiottu vuoden 2026 opinnäytetyö on joukko, jota kukaan ei ole mitannut, ja tämä varaus on osa lukua.

scripts/calibrate-components.mjs

Avoimesti saatavilla olevat artikkelit, ennen vuotta 2022

n = 1 412

Täyttä akateemista proosaa. Lehtiartikkelit on toimitettu ja ryhmien kirjoittamia, eli ne eivät ole opiskelijatekstiä: siksi englannin raja-arvoja ei siirretä niiden perusteella.

scripts/fetch-longform-corpus.mjs

Yhdistelmän validointipuolisko: artikkelit + arXiv, 1 500 sanan otteet

n = 199

Syrjään pidetty puolisko englanninkielisiä asiakirjoja (arXiv ja ennen vuotta 2022 julkaistut avoimet artikkelit), jonka analyysin MOLEMMAT puoliskot ovat arvioineet. Yhdistetyt raja-arvot on leikattu sen perusteella. Lehtiproosaa, ei opiskelijatekstiä: kerromme sen, koska tämä varaus on osa lukua.

scripts/calibrate-components.mjs

arXiv-tiivistelmät, ennen vuotta 2022

n = 236

Lyhyitä englanninkielisiä tekstejä. Säilytetty AUC-työtä varten; emme julkaise niistä väärien positiivisten osuutta, koska lyhyt arvioikkuna ei ole se, mitä tiivistelmäaineisto mittaa.

scripts/fetch-human-corpus.mjs

Saksankieliset tieteelliset tiivistelmät, ennen vuotta 2022

n = 60

OpenAlex, suodatettu saksan funktiosanojen perusteella, koska kielikenttä on epäluotettava. Sen varassa on päätös olla antamatta lyhyelle saksankieliselle tekstille lainkaan arviota ”selviä tekoälyn jälkiä”.

scripts/fetch-german-corpus.mjs

Julkaisimme kerran melkein tunnistimen, joka oli huonompi kuin kolikonheitto

Varhaisessa versiossa mittaus 236 ennen vuotta 2022 julkaistulla arXiv-tiivistelmällä antoi AUC-arvon 0.184. Kolikonheitto antaa 0,50. Tunnistin piti koneen kirjoittamaa tekstiä inhimillisempänä kuin ihmisten kirjoittamaa; tuloksen kääntäminen olisi parantanut sitä. Ja koko ajan se oli antanut itsevarmoja prosenttilukuja.

Syynä oli joukko sanaston rikkauden mittareita (Yulen K, MTLD, Zipfin eksponentti, hapax legomena), kaikki väärään suuntaan ja voimakkain vaikutuksin. Ne arvioivat tiiviin ihmisen kirjoittaman akateemisen proosan koneelliseksi ja sanastoltaan vaihtelevan koneproosan inhimilliseksi. Sama mekanismi on julkaistun tuloksen taustalla: tunnistimet merkitsevät virheellisesti suurimman osan englantia toisena kielenä kirjoittavista.

Nykyään näiden mittareiden paino on nolla. Ne lasketaan yhä ja näytetään vihjeinä, mutta ne eivät siirrä pistemäärää. Julkaisemme tämän, koska se on vahvin perusteemme mittaamiselle: virhe oli näkymätön tuloksessa ja ilmeinen aineistossa, eikä tunnistin, joka ei ole koskaan tehnyt tätä testiä, tiedä, onko sillä sama ongelma.

Mihin mikään tunnistin ei pysty

Mikään AI-tunnistin, ei myöskään tämä, ole todiste kirjoittajasta. Nämä työkalut mittaavat tekstin tilastollisia ominaisuuksia, ja muodollisella, jäsennellyllä tai toisella kielellä kirjoitetulla ihmistekstillä on monia samoja ominaisuuksia. Pistemäärä on syy esittää kysymys, ei koskaan vetää johtopäätöstä.

Tarkista tekstisi

Ilmainen, ilman tiliä. Suomeksi arvio perustuu tekstin rakenteeseen ja näyttää, mitkä virkkeet painavat; tämä sivu kertoo, mitä on mitattu ja mitä ei.

Aloita ilmainen AI-tunnistus

Tutkijat ja toimittajat: aineistot, arviointikoodi ja kalibrointityökalut ovat kaikki tämän sivuston takana olevassa repositoriossa. Jos haluat toistaa tai kyseenalaistaa jonkin tämän sivun luvun, kirjoita osoitteeseen contact@thesisdraft.com, niin autamme.