Genauigkeit
Wie oft irrt sich unser KI-Check?
Bei einer deutschen Abschlussarbeit, die du selbst geschrieben hast, zeigt unser KI-Check in höchstens 1,63 % der Fälle fälschlich Rot. Das heißt: weniger als 2 von 100 selbst geschriebenen Arbeiten werden zu Unrecht rot markiert, und mehr als 93 von 100 bekommen Grün. Gemessen haben wir das an 1.035 echten deutschen Abschlussarbeiten, die vor ChatGPT entstanden sind.
Was die drei Farben bedeuten
- Grün: Der Text zeigt kaum Muster, die für KI-Texte typisch sind.
- Gelb: Einige Stellen ähneln KI-Texten. Das kommt auch bei selbst geschriebenen Arbeiten vor, besonders bei sehr formellem Stil.
- Rot: Deutliche KI-Muster. Das ist das stärkste Ergebnis, und es ist das seltenste bei selbst geschriebenen Texten.
Wie oft ein selbst geschriebener Text falsch markiert wird
Die Zahlen sind jeweils der ungünstigste Wert, der zu unserer Messung passt. Die echte Fehlerquote liegt eher darunter.
| Text | Fälschlich Rot | Fälschlich Gelb oder Rot |
|---|---|---|
| Deutsch, über 400 Wörter | höchstens 1,63 % | höchstens 6,18 % |
| Englisch, über 400 Wörter | höchstens 3,13 % | höchstens 8,37 % |
| Deutsch, unter 400 Wörtern | nie, kurze deutsche Texte bekommen kein Rot | noch nicht gemessen |
| Englisch, unter 400 Wörtern | noch nicht gemessen | noch nicht gemessen |
Unter 300 Wörtern geben wir gar kein Ergebnis aus. Für eine verlässliche Aussage ist so ein Text zu kurz.
So haben wir gemessen
Wir haben unseren KI-Check auf Texte angewendet, bei denen sicher ist, dass Menschen sie geschrieben haben: Sie sind entstanden, bevor es ChatGPT gab. Dann haben wir gezählt, wie oft der Check trotzdem Gelb oder Rot anzeigt.
- Deutsch: 1.035 Abschlussarbeiten der Hochschule Mittweida aus den Jahren 2008 bis 2021, jeweils die ganze Arbeit. Keine davon wurde verwendet, um den Check zu trainieren.
- Englisch: 199 wissenschaftliche Fachartikel von vor 2022. Das sind keine Studierendenarbeiten, sondern professionell geschriebene Texte. Für englische Abschlussarbeiten fehlt uns noch eine ausreichend große Sammlung.
Warum kurze deutsche Texte nie Rot bekommen
Bei deutschen Texten unter 400 Wörtern würde jede Einstellung, die KI zuverlässig erkennt, etwa 7 von 100 selbst geschriebenen Texten fälschlich rot markieren. Das ist uns zu viel. Kurze deutsche Texte bekommen deshalb höchstens Gelb.
Was ein Ergebnis bedeutet, und was nicht
Kein KI-Detektor, auch unserer nicht, ist ein Beweis dafür, wer einen Text geschrieben hat. Er erkennt Muster, die in KI-Texten häufig vorkommen. Diese Muster tauchen manchmal auch in sehr formellen Texten auf oder bei Menschen, die in einer Fremdsprache schreiben. Ein Ergebnis ist deshalb ein Anlass für ein Gespräch, nie ein Urteil.
Wurde deine eigene Arbeit von einem KI-Detektor markiert? Unser Ratgeber zu einem KI-Detektor, der bei selbst geschriebenem Text ausschlägt erklärt, wie du reagierst.
Was wir noch nicht wissen
- Unsere deutschen Vergleichsarbeiten stammen aus den Jahren 2008 bis 2021. Wie sich Arbeiten verhalten, die heute mit Schreibprogrammen stark überarbeitet wurden, hat noch niemand gemessen.
- Wir haben den Check mit Texten einiger verbreiteter KI-Modelle getestet. Ein Modell, das wir nicht getestet haben, kann sich anders verhalten.
Für Hochschulen und Prüfende
Studierende und Prüfende bekommen bei uns dasselbe: dieselbe Prüfung, dieselbe Farbskala und dieselbe Fehlerquote. Wenn Sie Fragen zur Messung haben oder eine Zahl nachprüfen möchten, schreiben Sie an contact@thesisdraft.com. Wie ein fairer Ablauf bei einem KI-Verdacht aussehen kann, beschreibt unser Leitfaden für Betreuende und Prüfende.
Häufige Fragen
Wie genau ist der KI-Check von ThesisDraft?
Bei deutschen Abschlussarbeiten mit mehr als 400 Wörtern bekommt ein selbst geschriebener Text in höchstens 1,63 % der Fälle fälschlich Rot und in höchstens 6,18 % der Fälle Gelb oder Rot. Gemessen an 1.035 echten deutschen Abschlussarbeiten, die vor ChatGPT geschrieben wurden.
Kann ein KI-Detektor beweisen, dass ein Text mit KI geschrieben wurde?
Nein. Kein KI-Detektor, auch unserer nicht, beweist, wer einen Text geschrieben hat. Er erkennt Muster, die in KI-Texten häufig sind. Ein Ergebnis ist ein Anlass für ein Gespräch, nie ein Urteil.
Warum bekommen kurze deutsche Texte nie Rot?
Bei deutschen Texten unter 400 Wörtern würden zu viele selbst geschriebene Texte fälschlich Rot bekommen, etwa 7 von 100. Das nehmen wir nicht in Kauf. Kurze deutsche Texte bekommen deshalb höchstens Gelb.
Sehen Studierende und Prüfende dasselbe Ergebnis?
Ja. Es gibt nur eine Prüfung, eine Farbskala und eine Fehlerquote. Wer vor der Abgabe prüft, sieht dasselbe wie jemand, der die Arbeit danach prüft.
Wie erkenne ich, ob ein KI-Detektor viele Fehlalarme produziert?
Frag nach zwei Dingen: wie oft er selbst geschriebene Texte fälschlich markiert, und an welchen Texten das gemessen wurde. Ohne beides kann ein Anbieter nicht sagen, wie oft er sich irrt. Achte auch auf die Länge: Bei kurzen Texten ist die Fehlerquote höher, deshalb gibt unser Check deutschen Texten unter 400 Wörtern höchstens Gelb.
Hat ThesisDraft die geringste Fehlerquote aller KI-Detektoren?
Das können wir nicht sagen. Einen Vergleich gibt es nur, wenn andere Anbieter ihre Fehlerquote zusammen mit den Texten veröffentlichen, an denen sie gemessen wurde, und das tun viele nicht. Wir veröffentlichen unsere, damit du sie mit dem vergleichen kannst, was andere angeben.
Prüfe deine eigene Arbeit
Die ersten 1.500 Wörter sind kostenlos, ohne Konto und ohne Namen.
Kostenlos prüfen