Vertailu
Kuinka usein AI-tunnistimemme erehtyy ihmisestä
Jokainen AI-tunnistin antaa itsevarman prosenttiluvun. Kukaan ei kerro, kuinka usein se prosentti on väärässä, kun tekstin on kirjoittanut ihminen itse. Juuri tällä toisella luvulla on merkitystä, jos olet syytetty opiskelija, joten sen me julkaisemme niille kielille, joilla olemme sen mitanneet.
Viimeksi mitattu: 24. elokuuta 2026. Jokainen alla oleva luku tulee repositoriomme skriptistä, jonka voi ajaa uudelleen samoilla merkityillä aineistoilla.
Yhtäkään näistä osuuksista ei ole mitattu suomeksi.
Tämän sivun luvut on mitattu englannin- ja saksankielisillä teksteillä, ja ne kuuluvat niille kielille: niiden kirjoittaminen suomeksi ei tee niistä suomalaisia. Suomenkielinen teksti arvioidaan pelkästään tekstin rakenteen perusteella (kirjoitustyyli näytetään, mutta se ei vaikuta), ja alustavasti: meillä ei vielä ole aineistoa suomenkielisistä opinnäytetöistä, jotka ovat varmasti ihmisten kirjoittamia, joten emme voi sanoa, kuinka usein erehdymme suomenkielisestä tekstistä, ja niin kauan kuin näin on, tunnistin ei koskaan anna punaista arviota suomeksi. Kerromme sen mieluummin kuin esitämme englantilaisen luvun sinun lukunasi.
Mitatut väärien positiivisten osuudet
Kuinka usein akateeminen teksti, jonka on varmasti kirjoittanut ihminen, saa vahvimman arviomme. Tarkkuus ei ole yksi luku: se muuttuu kielen ja asiakirjan pituuden mukaan, joten raportoimme neljä profiilia keskiarvon sijaan, joka kätkisi heikot. Jokainen osuus on 95 %:n yläraja eikä havaittu määrä: yläraja on se, minkä meillä on oikeus väittää, ja se on aina kahdesta huonompi. Taulukoiden raja-arvot ovat sisäisillä mitta-asteikoillamme; näytetty pistemäärä on sama tieto kiinteällä akselilla, keltainen 20:stä ja punainen 50:stä alkaen.
| Profiili | Vahvin arvio | Väärät positiiviset | Havaittu | Mitattu aineistolla |
|---|---|---|---|---|
| Englanti · yli 400 sanaa | Selviä tekoälyn jälkiä | enintään 3,13 % | 2/199 | 199 EN-asiakirjaa validointipuoliskossa (yhdistetty asteikko, w_style=0,5) |
| Saksa · yli 400 sanaa | Selviä tekoälyn jälkiä | enintään 1,63 % | 10/1 035 | 1 035 saksalaista opinnäytetyötä validointipuoliskossa (yhdistetty asteikko, w_style=0,5) |
| Englanti · alle 400 sanaa | Selviä tekoälyn jälkiä | ei julkaistu | - | ei sopivaa ihmisaineistoa käytettävissä |
| Saksa · alle 400 sanaa | arviota ”selviä tekoälyn jälkiä” ei koskaan anneta | - | - | - |
Lyhyt saksankielinen teksti ei koskaan saa arviota ”selviä tekoälyn jälkiä”, eikä se nykyisellä näytöllä tule sitä saamaan.
Lyhyellä saksankielisellä tekstillä jokainen raja-arvo, joka on tarpeeksi tiukka tunnistamaan tekoälyn luotettavasti, maksaa noin 7 väärää syytöstä sataa kohden. Yksi syytön opiskelija viidestätoista ei ole vaihtokauppa, jonka hyväksymme, joten lyhyt saksan profiili pysähtyy arvioon ”joitakin tekoälyn jälkiä”. Se on mitattu raja, ei vielä rakentamaton ominaisuus.
Heikommat arviot, jotka ovat kohinaisempia
Useimmat lukijat eivät koskaan näe vahvinta arviota. He näkevät jonkin näistä, ja näiden virheosuudet ovat ne, jotka heitä oikeasti koskevat. Englannin alempi keltainen vyöhyke on selvästi kohinaisin.
| Profiili | Arvio | Raja-arvo | Väärät positiiviset | Havaittu |
|---|---|---|---|---|
| Englanti · yli 400 sanaa | Joitakin tekoälyn jälkiä | ≥ 96 | enintään 5,86 % | 6/199 |
| Englanti · yli 400 sanaa | Joitakin tekoälyn jälkiä (alempi keltainen vyöhyke) | ≥ 91 | enintään 8,37 % | 10/199 |
| Saksa · yli 400 sanaa | Joitakin tekoälyn jälkiä | ≥ 88 | enintään 4,02 % | 31/1 035 |
| Saksa · yli 400 sanaa | Joitakin tekoälyn jälkiä (alempi keltainen vyöhyke) | ≥ 85 | enintään 6,18 % | 51/1 035 |
Mitä nämä luvut eivät ole
- Nolla havaittua ei ole nolla. Kumpikaan pitkistä profiileista ei tuottanut yhtään väärää positiivista tiukimmalla raja-arvolla raa'issa rakenneaineistoissa. Julkaisemme silti 95 %:n ylärajan tälle otoskoolle, koska ”0 %”:n kirjoittaminen olisi juuri sitä ylivarmuutta, jota vastaan tämä sivu on olemassa.
- Englanninkielinen aineisto on väärää lajityyppiä. Ne asiakirjat ovat lehtiartikkeleita: toimitettuja, ammattimaisia, ryhmien kirjoittamia. Opiskelijan opinnäytetyö ei ole mitään näistä. Osuus on mitattu rehellisesti sillä, millä se sanoo olevansa mitattu, ja englannin raja-arvot pysyvät paikallaan, kunnes englantia toisena kielenä kirjoitettuja opinnäytetöitä on tarpeeksi niiden siirtämisen perusteluksi.
- Lyhyelle tekstille ei ole julkaistua osuutta. Lyhyt profiili koskee muutaman sadan sanan ikkunaa, eikä yksikään hallussamme oleva ihmisaineisto ole peräisin siitä ikkunasta. Tässä aiemmin olleet osuudet poistettiin 21. elokuuta 2026 sen sijaan, että ne olisi jätetty paikalleen, koska uskottava luku ilman sen takana olevaa joukkoa on silti perusteeton väite.
- Tekoälyaineistot ovat pieniä: parikymmentä asiakirjaa kieltä kohden, kahdesta malliperheestä. Malli, jota emme ole testanneet, voi käyttäytyä toisin.
- Suomea ei ole kalibroitu. Suomenkielinen teksti saa arvion, joka perustuu pelkästään tekstin rakenteeseen, alustavasti, ilman mitään tarkkuusväitettä, eikä se koskaan saa punaista arviota.
Millä mittasimme
Jokainen alla oleva ihmisen kirjoittama asiakirja julkaistiin ennen ChatGPT:n syntyä, joten sen kirjoittaja ei ole arviointikysymys.
Saksalaisten opiskelijoiden opinnäytetyöt, 2010-2021
n = 866
Kokonaisia asiakirjoja kielellä ja lajityypissä, jota palvelemme saksaksi, määritelmällisesti ihmisten kirjoittamia, koska ne ovat ChatGPT:tä vanhempia. Saksan raja-arvot on asetettu tämän aineiston perusteella.
scripts/fetch-thesis-negatives.mjs
Yhdistelmän validointipuolisko: saksalaisten opiskelijoiden opinnäytetyöt, 2008-2021, kokonaiset asiakirjat
n = 1 035
Syrjään pidetty puolisko aitoja saksalaisia opinnäytetöitä (MOnAMi, Hochschule Mittweida, 2008-2021), jonka analyysin MOLEMMAT puoliskot ovat arvioineet: kokonaisia asiakirjoja, joita ei ole koskaan käytetty saksalaisen mallin koulutukseen. Saksan yhdistetyt raja-arvot on leikattu sen perusteella. Ne eivät ole asiakkaidemme ajan tekstejä: hiottu vuoden 2026 opinnäytetyö on joukko, jota kukaan ei ole mitannut, ja tämä varaus on osa lukua.
scripts/calibrate-components.mjs
Avoimesti saatavilla olevat artikkelit, ennen vuotta 2022
n = 1 412
Täyttä akateemista proosaa. Lehtiartikkelit on toimitettu ja ryhmien kirjoittamia, eli ne eivät ole opiskelijatekstiä: siksi englannin raja-arvoja ei siirretä niiden perusteella.
scripts/fetch-longform-corpus.mjs
Yhdistelmän validointipuolisko: artikkelit + arXiv, 1 500 sanan otteet
n = 199
Syrjään pidetty puolisko englanninkielisiä asiakirjoja (arXiv ja ennen vuotta 2022 julkaistut avoimet artikkelit), jonka analyysin MOLEMMAT puoliskot ovat arvioineet. Yhdistetyt raja-arvot on leikattu sen perusteella. Lehtiproosaa, ei opiskelijatekstiä: kerromme sen, koska tämä varaus on osa lukua.
scripts/calibrate-components.mjs
arXiv-tiivistelmät, ennen vuotta 2022
n = 236
Lyhyitä englanninkielisiä tekstejä. Säilytetty AUC-työtä varten; emme julkaise niistä väärien positiivisten osuutta, koska lyhyt arvioikkuna ei ole se, mitä tiivistelmäaineisto mittaa.
scripts/fetch-human-corpus.mjs
Saksankieliset tieteelliset tiivistelmät, ennen vuotta 2022
n = 60
OpenAlex, suodatettu saksan funktiosanojen perusteella, koska kielikenttä on epäluotettava. Sen varassa on päätös olla antamatta lyhyelle saksankieliselle tekstille lainkaan arviota ”selviä tekoälyn jälkiä”.
scripts/fetch-german-corpus.mjs
Julkaisimme kerran melkein tunnistimen, joka oli huonompi kuin kolikonheitto
Varhaisessa versiossa mittaus 236 ennen vuotta 2022 julkaistulla arXiv-tiivistelmällä antoi AUC-arvon 0.184. Kolikonheitto antaa 0,50. Tunnistin piti koneen kirjoittamaa tekstiä inhimillisempänä kuin ihmisten kirjoittamaa; tuloksen kääntäminen olisi parantanut sitä. Ja koko ajan se oli antanut itsevarmoja prosenttilukuja.
Syynä oli joukko sanaston rikkauden mittareita (Yulen K, MTLD, Zipfin eksponentti, hapax legomena), kaikki väärään suuntaan ja voimakkain vaikutuksin. Ne arvioivat tiiviin ihmisen kirjoittaman akateemisen proosan koneelliseksi ja sanastoltaan vaihtelevan koneproosan inhimilliseksi. Sama mekanismi on julkaistun tuloksen taustalla: tunnistimet merkitsevät virheellisesti suurimman osan englantia toisena kielenä kirjoittavista.
Nykyään näiden mittareiden paino on nolla. Ne lasketaan yhä ja näytetään vihjeinä, mutta ne eivät siirrä pistemäärää. Julkaisemme tämän, koska se on vahvin perusteemme mittaamiselle: virhe oli näkymätön tuloksessa ja ilmeinen aineistossa, eikä tunnistin, joka ei ole koskaan tehnyt tätä testiä, tiedä, onko sillä sama ongelma.
Mihin mikään tunnistin ei pysty
Mikään AI-tunnistin, ei myöskään tämä, ole todiste kirjoittajasta. Nämä työkalut mittaavat tekstin tilastollisia ominaisuuksia, ja muodollisella, jäsennellyllä tai toisella kielellä kirjoitetulla ihmistekstillä on monia samoja ominaisuuksia. Pistemäärä on syy esittää kysymys, ei koskaan vetää johtopäätöstä.
Tarkista tekstisi
Ilmainen, ilman tiliä. Suomeksi arvio perustuu tekstin rakenteeseen ja näyttää, mitkä virkkeet painavat; tämä sivu kertoo, mitä on mitattu ja mitä ei.
Aloita ilmainen AI-tunnistusTutkijat ja toimittajat: aineistot, arviointikoodi ja kalibrointityökalut ovat kaikki tämän sivuston takana olevassa repositoriossa. Jos haluat toistaa tai kyseenalaistaa jonkin tämän sivun luvun, kirjoita osoitteeseen contact@thesisdraft.com, niin autamme.