So funktioniert es

Warum zwei Detektoren beim selben Text andere Werte zeigen

Jeder Detektor misst etwas anderes und hat auf anderen Texten gelernt, deshalb sind zwei verschiedene Werte bei einem Text kein Fehler — es sind zwei verschiedene Blickwinkel. Der Wert sagt nicht, welchen Anteil des Textes ein Modell geschrieben hat; er sagt, wie sehr der Text dem ähnelt, was dieses Werkzeug als maschinelles Schreiben kennt. Wenn die Werkzeuge deutlich auseinandergehen, ist das für sich genommen eine Information: Der Text ist ein Grenzfall und über Prozente lässt er sich nicht entscheiden. DetekceGPT zeigt deshalb sieben Detektoren nebeneinander und fasst sie nicht zu einer Zahl zusammen.

Jeder misst eine andere Eigenschaft

Ein Werkzeug berechnet, wie vorhersehbar das nächste Wort ist, ein zweites verfolgt die Streuung der Satzlängen, ein drittes sucht nach Wendungen, die für Modelle typisch sind, und ein viertes vergleicht den Text mit Ihren früheren Arbeiten. Das sind keine unterschiedlich genauen Antworten auf eine Frage, sondern Antworten auf vier verschiedene Fragen.

Deshalb kommt ein Text bei einem Detektor hoch und beim nächsten niedrig heraus: Er hat einen maschinellen Rhythmus, aber keine typischen Floskeln, oder umgekehrt. In DetekceGPT sehen Sie das direkt — KI-Floskeln, Maschineller Eindruck und Stilabweichung sind drei eigene Werte und jeder wird für sich gelesen.

Gleiches Signal, andere Skala

Auch wenn zwei Werkzeuge Ähnliches verfolgen, rechnen sie das Ergebnis jeweils anders in Prozent um. Jedes hat eine eigene Grenze, ab der es einen Satz markiert, und einen eigenen Satz von Texten, auf denen es kalibriert wurde. Sechzig Prozent im einen Werkzeug bedeuten also nicht dasselbe wie sechzig im anderen.

Auch die Sprache spielt mit. Die meisten Detektoren sind auf Englisch entstanden und verhalten sich in anderen Sprachen anders, deshalb ist der Abstand zwischen den Werkzeugen bei einem deutschen Text oft größer als bei einem englischen.

Was man mit dem Widerspruch macht

Nicht mitteln. Der Mittelwert zweier Zahlen, die Unterschiedliches messen, ergibt keinen Sinn und verdeckt vor allem das Interessanteste — dass die Werkzeuge sich nicht einig waren. Lesen Sie stattdessen die Sätze, die die einzelnen Detektoren markiert haben, und vergleichen Sie, ob sie auf dieselben Stellen zeigen.

Stimmen sie bei denselben Passagen überein, haben Sie eine belastbarere Grundlage. Zeigt jedes woandershin, nehmen Sie es als Hinweis, dass der Text ein Grenzfall ist, und stützen Sie die Entscheidung auf etwas anderes — auf die Abweichung von früheren Texten der Autorin oder des Autors oder auf ein Gespräch über den Inhalt.

Häufige Fragen

Welcher Detektor ist der richtige?

Keiner. Von außen lässt sich die Genauigkeit nicht prüfen, weil Sie die Texte nicht kennen, auf denen das Werkzeug gelernt hat. Testen Sie es an fünf Texten, bei denen Sie die Urheberschaft sicher kennen.

Lohnt es sich, einen Text durch mehrere Werkzeuge zu schicken?

Als Sonde ja, als Beweis nein. Mehr Zahlen bedeuten nicht mehr Sicherheit, nur mehr Blickwinkel — und die können auseinandergehen.

Warum gibt DetekceGPT keine einzelne Gesamtzahl aus?

Weil dafür Größen zusammengerechnet werden müssten, die verschiedene Eigenschaften messen. Eine Zahl wirkt sicherer, würde aber den Widerspruch zwischen den Detektoren verdecken — also das Nützlichste daran.

Probieren Sie es an Ihrem eigenen Text

Text einfügen oder Datei hochladen und den Score sowie die konkreten Sätze ansehen, die verdächtig ausgefallen sind.

Erkennung starten

Weitere Artikel