Μετρήσεις
Πόσο συχνά ο ανιχνευτής AI μας κάνει λάθος για έναν άνθρωπο
Κάθε ανιχνευτής AI βγάζει ένα σίγουρο ποσοστό. Κανείς δεν σου λέει πόσο συχνά αυτό το ποσοστό κάνει λάθος για κάποιον που έγραψε μόνος του την εργασία του. Αυτός ο δεύτερος αριθμός είναι αυτός που μετράει αν ο κατηγορούμενος φοιτητής είσαι εσύ, γι' αυτό δημοσιεύουμε αυτόν, για τις γλώσσες στις οποίες τον έχουμε μετρήσει.
Τελευταία μέτρηση: 24 Αυγούστου 2026. Κάθε αριθμός παρακάτω προέρχεται από ένα script στο αποθετήριό μας που μπορεί να ξανατρέξει στα ίδια επισημασμένα σώματα κειμένων.
Κανένα από αυτά τα ποσοστά δεν έχει μετρηθεί στα ελληνικά.
Οι αριθμοί αυτής της σελίδας μετρήθηκαν σε αγγλικά και γερμανικά κείμενα και μένουν δεμένοι με αυτές τις γλώσσες: γραμμένοι στα ελληνικά δεν γίνονται ελληνικοί. Ένα ελληνικό κείμενο αξιολογείται μόνο με βάση τη δομή του (το ύφος γραφής εμφανίζεται αλλά δεν μετράει), προσωρινά: δεν έχουμε ακόμη σώμα ελληνικών εργασιών γραμμένων σίγουρα από ανθρώπους, άρα δεν μπορούμε να σου πούμε πόσο συχνά κάνουμε λάθος σε ένα ελληνικό κείμενο, και όσο ισχύει αυτό ο ανιχνευτής δεν δίνει ποτέ κόκκινη ετυμηγορία στα ελληνικά. Προτιμούμε να σου το πούμε παρά να σου παρουσιάσουμε έναν αγγλικό αριθμό σαν δικό σου.
Μετρημένα ποσοστά ψευδώς θετικών
Πόσο συχνά ένα ακαδημαϊκό κείμενο γραμμένο σίγουρα από άνθρωπο παίρνει την πιο ισχυρή μας ετυμηγορία. Η ακρίβεια δεν είναι ένας αριθμός: αλλάζει με τη γλώσσα και το μήκος του εγγράφου, γι' αυτό αναφέρουμε τέσσερα προφίλ αντί για έναν μέσο όρο που θα έκρυβε τα αδύναμα. Κάθε ποσοστό είναι ένα άνω όριο 95% και όχι ο παρατηρούμενος αριθμός: το όριο είναι αυτό που έχουμε το δικαίωμα να ισχυριστούμε, και είναι πάντα το χειρότερο από τα δύο. Τα κατώφλια σε αυτούς τους πίνακες είναι στις εσωτερικές μας κλίμακες μέτρησης· η βαθμολογία που εμφανίζεται είναι η ίδια πληροφορία σε σταθερό άξονα, πορτοκαλί από το 20 και κόκκινο από το 50.
| Προφίλ | Πιο ισχυρή ετυμηγορία | Ψευδώς θετικά | Παρατηρήθηκαν | Μετρήθηκε σε |
|---|---|---|---|---|
| Αγγλικά · πάνω από 400 λέξεις | Έντονα ίχνη AI | το πολύ 3,13 % | 2 από 199 | 199 έγγραφα EN του μισού επικύρωσης (συνδυασμένη κλίμακα, w_style=0,5) |
| Γερμανικά · πάνω από 400 λέξεις | Έντονα ίχνη AI | το πολύ 1,63 % | 10 από 1.035 | 1.035 γερμανικές εργασίες του μισού επικύρωσης (συνδυασμένη κλίμακα, w_style=0,5) |
| Αγγλικά · κάτω από 400 λέξεις | Έντονα ίχνη AI | δεν δημοσιεύεται | - | δεν διαθέτουμε σχετικό ανθρώπινο πληθυσμό |
| Γερμανικά · κάτω από 400 λέξεις | η ετυμηγορία «έντονα ίχνη AI» δεν δίνεται ποτέ | - | - | - |
Ένα σύντομο γερμανικό κείμενο δεν παίρνει ποτέ την ετυμηγορία «έντονα ίχνη AI», και με τα σημερινά δεδομένα δεν θα την πάρει.
Στα σύντομα γερμανικά κανένα κατώφλι αρκετά αυστηρό ώστε να αναγνωρίζει αξιόπιστα το AI δεν κοστίζει λιγότερο από περίπου 7 ψευδείς κατηγορίες στις 100. Ένας αθώος φοιτητής στους δεκαπέντε δεν είναι ανταλλαγή που δεχόμαστε, γι' αυτό το σύντομο γερμανικό προφίλ σταματά στο «κάποια ίχνη AI». Είναι ένα μετρημένο όριο, όχι μια λειτουργία που δεν φτιάχτηκε ακόμη.
Οι πιο αδύναμες ετυμηγορίες, που έχουν περισσότερο θόρυβο
Οι περισσότεροι αναγνώστες δεν βλέπουν ποτέ την πιο ισχυρή ετυμηγορία. Βλέπουν μία από αυτές, και τα ποσοστά σφάλματος εδώ είναι αυτά που τους αφορούν πραγματικά. Η χαμηλότερη αγγλική πορτοκαλί ζώνη είναι με διαφορά αυτή με τον περισσότερο θόρυβο.
| Προφίλ | Ετυμηγορία | Κατώφλι | Ψευδώς θετικά | Παρατηρήθηκαν |
|---|---|---|---|---|
| Αγγλικά · πάνω από 400 λέξεις | Κάποια ίχνη AI | ≥ 96 | το πολύ 5,86 % | 6 από 199 |
| Αγγλικά · πάνω από 400 λέξεις | Κάποια ίχνη AI (χαμηλότερη πορτοκαλί ζώνη) | ≥ 91 | το πολύ 8,37 % | 10 από 199 |
| Γερμανικά · πάνω από 400 λέξεις | Κάποια ίχνη AI | ≥ 88 | το πολύ 4,02 % | 31 από 1.035 |
| Γερμανικά · πάνω από 400 λέξεις | Κάποια ίχνη AI (χαμηλότερη πορτοκαλί ζώνη) | ≥ 85 | το πολύ 6,18 % | 51 από 1.035 |
Τι δεν είναι αυτοί οι αριθμοί
- Το παρατηρούμενο μηδέν δεν είναι μηδέν. Κανένα από τα δύο μακρά προφίλ δεν έδωσε ούτε ένα ψευδώς θετικό στο πιο αυστηρό κατώφλι στα ακατέργαστα σώματα δομής. Δημοσιεύουμε παρ' όλα αυτά το άνω όριο 95% για αυτό το μέγεθος δείγματος, γιατί το να γράψουμε «0%» θα ήταν ακριβώς η υπερβολική σιγουριά απέναντι στην οποία υπάρχει αυτή η σελίδα.
- Το αγγλικό σώμα είναι λάθος είδους. Αυτά τα έγγραφα είναι άρθρα περιοδικών: επιμελημένα, επαγγελματικά, γραμμένα από ομάδες. Μια φοιτητική εργασία δεν είναι τίποτα από αυτά. Το ποσοστό μετρήθηκε τίμια σε αυτό που λέει ότι μετρήθηκε, και τα αγγλικά κατώφλια μένουν εκεί που είναι μέχρι να υπάρξουν αρκετές φοιτητικές εργασίες σε αγγλικά ως δεύτερη γλώσσα για να δικαιολογήσουν τη μετακίνησή τους.
- Το σύντομο κείμενο δεν έχει κανένα δημοσιευμένο ποσοστό. Το σύντομο προφίλ αφορά ένα παράθυρο λίγων εκατοντάδων λέξεων, και κανένα ανθρώπινο σώμα που διαθέτουμε δεν προέρχεται από αυτό το παράθυρο. Τα ποσοστά που υπήρχαν εδώ αφαιρέθηκαν στις 21 Αυγούστου 2026 αντί να μείνουν, γιατί ένας πειστικός αριθμός χωρίς πληθυσμό πίσω του παραμένει αβάσιμος ισχυρισμός.
- Τα σώματα AI είναι μικρά: περίπου είκοσι έγγραφα ανά γλώσσα, από δύο οικογένειες μοντέλων. Ένα μοντέλο που δεν έχουμε δοκιμάσει μπορεί να συμπεριφερθεί διαφορετικά.
- Τα ελληνικά δεν είναι βαθμονομημένα. Ένα ελληνικό κείμενο παίρνει ετυμηγορία που βασίζεται μόνο στη δομή του κειμένου, προσωρινή, χωρίς κανέναν ισχυρισμό ακρίβειας, και δεν παίρνει ποτέ κόκκινη ετυμηγορία.
Πάνω σε τι μετρήσαμε
Κάθε ανθρώπινο έγγραφο παρακάτω δημοσιεύτηκε πριν υπάρξει το ChatGPT, άρα η πατρότητά του δεν είναι ζήτημα κρίσης.
Εργασίες Γερμανών φοιτητών, 2010-2021
n = 866
Ολόκληρα έγγραφα στη γλώσσα και το είδος που εξυπηρετούμε στα γερμανικά, ανθρώπινα εκ κατασκευής επειδή προηγούνται του ChatGPT. Σε αυτό το σώμα ορίστηκαν τα γερμανικά κατώφλια.
scripts/fetch-thesis-negatives.mjs
Μισό επικύρωσης του συνδυασμού: εργασίες Γερμανών φοιτητών, 2008-2021, ολόκληρα έγγραφα
n = 1.035
Το μισό που κρατήθηκε στην άκρη από πραγματικές γερμανικές εργασίες (MOnAMi, Hochschule Mittweida, 2008-2021), βαθμολογημένο και από τα ΔΥΟ μισά του ελέγχου: ολόκληρα έγγραφα που δεν χρησιμοποιήθηκαν ποτέ για την εκπαίδευση του γερμανικού μοντέλου. Τα συνδυασμένα γερμανικά κατώφλια ορίστηκαν πάνω του. Δεν είναι κείμενα της εποχής των πελατών μας: μια γυαλισμένη εργασία του 2026 είναι πληθυσμός που κανείς δεν έχει μετρήσει, και αυτή η επιφύλαξη είναι μέρος του αριθμού.
scripts/calibrate-components.mjs
Άρθρα ανοιχτής πρόσβασης, πριν το 2022
n = 1.412
Πλήρης ακαδημαϊκός λόγος. Τα άρθρα περιοδικών είναι επιμελημένα και γραμμένα από ομάδες, άρα δεν είναι φοιτητική γραφή: γι' αυτό τα αγγλικά κατώφλια δεν μετακινούνται με βάση αυτά.
scripts/fetch-longform-corpus.mjs
Μισό επικύρωσης του συνδυασμού: άρθρα + arXiv, αποσπάσματα 1.500 λέξεων
n = 199
Το μισό που κρατήθηκε στην άκρη από αγγλικά έγγραφα (arXiv και άρθρα ανοιχτής πρόσβασης πριν το 2022), βαθμολογημένο και από τα ΔΥΟ μισά του ελέγχου. Τα συνδυασμένα κατώφλια ορίστηκαν πάνω του. Λόγος περιοδικών, όχι φοιτητική γραφή: το λέμε επειδή αυτή η επιφύλαξη είναι μέρος του αριθμού.
scripts/calibrate-components.mjs
Περιλήψεις arXiv, πριν το 2022
n = 236
Σύντομα αγγλικά κείμενα. Κρατήθηκαν για τη δουλειά πάνω στο AUC· δεν δημοσιεύουμε κανένα ποσοστό ψευδώς θετικών από αυτά, επειδή ένα σύντομο παράθυρο ετυμηγορίας δεν είναι αυτό που μετρά ένα σώμα περιλήψεων.
scripts/fetch-human-corpus.mjs
Γερμανικές επιστημονικές περιλήψεις, πριν το 2022
n = 60
OpenAlex, φιλτραρισμένο με βάση γερμανικές λειτουργικές λέξεις επειδή το πεδίο γλώσσας είναι αναξιόπιστο. Σε αυτό στηρίζεται η απόφαση να μη δίνεται καθόλου η ετυμηγορία «έντονα ίχνη AI» σε σύντομα γερμανικά κείμενα.
scripts/fetch-german-corpus.mjs
Κάποτε παραλίγο να δημοσιεύσουμε έναν ανιχνευτή χειρότερο από το στρίψιμο ενός νομίσματος
Σε μια πρώιμη εκδοχή, η μέτρηση σε 236 περιλήψεις arXiv πριν το 2022 έδωσε AUC 0.184. Το στρίψιμο νομίσματος είναι 0,50. Ο ανιχνευτής θεωρούσε το κείμενο της μηχανής πιο ανθρώπινο από αυτό των ανθρώπων· αν αντιστρέφαμε το αποτέλεσμά του, θα βελτιωνόταν. Και όλο αυτό το διάστημα έβγαζε σίγουρα ποσοστά.
Η αιτία ήταν μια οικογένεια δεικτών λεξιλογικού πλούτου (το K του Yule, MTLD, ο εκθέτης του Zipf, τα hapax legomena), όλοι με αντίθετη κατεύθυνση και ισχυρή επίδραση. Βαθμολογούν τον πυκνό ανθρώπινο ακαδημαϊκό λόγο ως μηχανικό και τον λεξιλογικά ποικίλο λόγο της μηχανής ως ανθρώπινο. Είναι ο ίδιος μηχανισμός πίσω από το δημοσιευμένο εύρημα ότι οι ανιχνευτές επισημαίνουν λανθασμένα την πλειονότητα όσων γράφουν αγγλικά ως δεύτερη γλώσσα.
Σήμερα αυτοί οι δείκτες έχουν βάρος μηδέν. Υπολογίζονται ακόμη και εμφανίζονται ως ενδείξεις, αλλά δεν μετακινούν τη βαθμολογία. Το δημοσιεύουμε επειδή είναι το ισχυρότερο επιχείρημα που έχουμε υπέρ της μέτρησης: το σφάλμα ήταν αόρατο από το αποτέλεσμα και προφανές από το σώμα κειμένων, και ένας ανιχνευτής που δεν έχει κάνει ποτέ αυτό το τεστ δεν ξέρει αν έχει το ίδιο πρόβλημα.
Τι δεν μπορεί να κάνει κανένας ανιχνευτής
Κανένας ανιχνευτής AI, ούτε αυτός, δεν αποτελεί απόδειξη πατρότητας. Αυτά τα εργαλεία μετρούν στατιστικές ιδιότητες του κειμένου, και η επίσημη, δομημένη ή σε δεύτερη γλώσσα ανθρώπινη γραφή μοιράζεται πολλές από αυτές. Μια βαθμολογία είναι λόγος να κάνεις μια ερώτηση, ποτέ να βγάλεις συμπέρασμα.
Έλεγξε το κείμενό σου
Δωρεάν, χωρίς λογαριασμό. Στα ελληνικά η ετυμηγορία βασίζεται στη δομή του κειμένου και σου δείχνει τις προτάσεις που βαραίνουν· αυτή η σελίδα σου λέει τι έχει μετρηθεί και τι όχι.
Ξεκίνα τον δωρεάν ανιχνευτή AIΕρευνητές και δημοσιογράφοι: τα σώματα κειμένων, ο κώδικας αξιολόγησης και τα εργαλεία βαθμονόμησης βρίσκονται όλα στο αποθετήριο πίσω από αυτόν τον ιστότοπο. Αν θέλεις να αναπαραγάγεις ή να αμφισβητήσεις κάποιον αριθμό αυτής της σελίδας, γράψε στο contact@thesisdraft.com και θα σε βοηθήσουμε.