Genauigkeit

Wie oft irrt sich unser KI-Check?

Bei einer deutschen Abschlussarbeit, die du selbst geschrieben hast, zeigt unser KI-Check in höchstens 1,63 % der Fälle fälschlich Rot. Das heißt: weniger als 2 von 100 selbst geschriebenen Arbeiten werden zu Unrecht rot markiert, und mehr als 93 von 100 bekommen Grün. Gemessen haben wir das an 1.035 echten deutschen Abschlussarbeiten, die vor ChatGPT entstanden sind.

Was die drei Farben bedeuten

Wie oft ein selbst geschriebener Text falsch markiert wird

Die Zahlen sind jeweils der ungünstigste Wert, der zu unserer Messung passt. Die echte Fehlerquote liegt eher darunter.

TextFälschlich RotFälschlich Gelb oder Rot
Deutsch, über 400 Wörterhöchstens 1,63 %höchstens 6,18 %
Englisch, über 400 Wörterhöchstens 3,13 %höchstens 8,37 %
Deutsch, unter 400 Wörternnie, kurze deutsche Texte bekommen kein Rotnoch nicht gemessen
Englisch, unter 400 Wörternnoch nicht gemessennoch nicht gemessen

Unter 300 Wörtern geben wir gar kein Ergebnis aus. Für eine verlässliche Aussage ist so ein Text zu kurz.

So haben wir gemessen

Wir haben unseren KI-Check auf Texte angewendet, bei denen sicher ist, dass Menschen sie geschrieben haben: Sie sind entstanden, bevor es ChatGPT gab. Dann haben wir gezählt, wie oft der Check trotzdem Gelb oder Rot anzeigt.

Warum kurze deutsche Texte nie Rot bekommen

Bei deutschen Texten unter 400 Wörtern würde jede Einstellung, die KI zuverlässig erkennt, etwa 7 von 100 selbst geschriebenen Texten fälschlich rot markieren. Das ist uns zu viel. Kurze deutsche Texte bekommen deshalb höchstens Gelb.

Was ein Ergebnis bedeutet, und was nicht

Kein KI-Detektor, auch unserer nicht, ist ein Beweis dafür, wer einen Text geschrieben hat. Er erkennt Muster, die in KI-Texten häufig vorkommen. Diese Muster tauchen manchmal auch in sehr formellen Texten auf oder bei Menschen, die in einer Fremdsprache schreiben. Ein Ergebnis ist deshalb ein Anlass für ein Gespräch, nie ein Urteil.

Wurde deine eigene Arbeit von einem KI-Detektor markiert? Unser Ratgeber zu einem KI-Detektor, der bei selbst geschriebenem Text ausschlägt erklärt, wie du reagierst.

Was wir noch nicht wissen

Für Hochschulen und Prüfende

Studierende und Prüfende bekommen bei uns dasselbe: dieselbe Prüfung, dieselbe Farbskala und dieselbe Fehlerquote. Wenn Sie Fragen zur Messung haben oder eine Zahl nachprüfen möchten, schreiben Sie an contact@thesisdraft.com. Wie ein fairer Ablauf bei einem KI-Verdacht aussehen kann, beschreibt unser Leitfaden für Betreuende und Prüfende.

Häufige Fragen

Wie genau ist der KI-Check von ThesisDraft?

Bei deutschen Abschlussarbeiten mit mehr als 400 Wörtern bekommt ein selbst geschriebener Text in höchstens 1,63 % der Fälle fälschlich Rot und in höchstens 6,18 % der Fälle Gelb oder Rot. Gemessen an 1.035 echten deutschen Abschlussarbeiten, die vor ChatGPT geschrieben wurden.

Kann ein KI-Detektor beweisen, dass ein Text mit KI geschrieben wurde?

Nein. Kein KI-Detektor, auch unserer nicht, beweist, wer einen Text geschrieben hat. Er erkennt Muster, die in KI-Texten häufig sind. Ein Ergebnis ist ein Anlass für ein Gespräch, nie ein Urteil.

Warum bekommen kurze deutsche Texte nie Rot?

Bei deutschen Texten unter 400 Wörtern würden zu viele selbst geschriebene Texte fälschlich Rot bekommen, etwa 7 von 100. Das nehmen wir nicht in Kauf. Kurze deutsche Texte bekommen deshalb höchstens Gelb.

Sehen Studierende und Prüfende dasselbe Ergebnis?

Ja. Es gibt nur eine Prüfung, eine Farbskala und eine Fehlerquote. Wer vor der Abgabe prüft, sieht dasselbe wie jemand, der die Arbeit danach prüft.

Wie erkenne ich, ob ein KI-Detektor viele Fehlalarme produziert?

Frag nach zwei Dingen: wie oft er selbst geschriebene Texte fälschlich markiert, und an welchen Texten das gemessen wurde. Ohne beides kann ein Anbieter nicht sagen, wie oft er sich irrt. Achte auch auf die Länge: Bei kurzen Texten ist die Fehlerquote höher, deshalb gibt unser Check deutschen Texten unter 400 Wörtern höchstens Gelb.

Hat ThesisDraft die geringste Fehlerquote aller KI-Detektoren?

Das können wir nicht sagen. Einen Vergleich gibt es nur, wenn andere Anbieter ihre Fehlerquote zusammen mit den Texten veröffentlichen, an denen sie gemessen wurde, und das tun viele nicht. Wir veröffentlichen unsere, damit du sie mit dem vergleichen kannst, was andere angeben.

Prüfe deine eigene Arbeit

Die ersten 1.500 Wörter sind kostenlos, ohne Konto und ohne Namen.

Kostenlos prüfen