Um zu prüfen, ob ein Text von KI geschrieben wurde, führe drei Signale in dieser Reihenfolge aus: einen Detektor-Score, den du auf Satzebene liest, Quellenfragen, die du dem Autor stellst, bevor du KI erwähnst, und Metadaten-Prüfungen der Datei selbst. Behandle jedes als Indiz, nicht als Beweis. Kein einzelnes Signal – auch nicht unseres – belegt die Urheberschaft, daher ergibt sich die Entscheidung daraus, wie die Signale zusammenwirken.
Was misst ein KI-Detektor-Score eigentlich?
Ein Detektor liest Muster. Satzrhythmus, Wortvorhersagbarkeit, wie gleichmäßig die Ideen verteilt sind, ob sich das Vokabular um das wahrscheinlichste nächste Wort gruppiert. Er gibt eine Wahrscheinlichkeitsschätzung aus, dass der Text maschinell generiertem Schreiben ähnelt, nicht eine Tatsachenfeststellung darüber, wer ihn getippt hat.
Dieser Unterschied ist wichtig, wenn du die Person bist, die handeln muss. Ein Score von 92 % bedeutet nicht „92 % sicher, dass diese Person betrogen hat“. Es bedeutet, dass der Text viele der statistischen Signale trägt, die das Modell mit generierter Prosa assoziiert. Menschliches Schreiben kann diese Signale ebenfalls tragen – stark bearbeitete Entwürfe, formelhafte Genres, Formulierungen in einer Zweitsprache und unter Zeitdruck verfasste Texte treiben die Zahl alle nach oben. Wenn du die Mechanik verstehen willst, geht unsere Aufschlüsselung von wie KI-Erkennung funktioniert die zugrunde liegenden Signale durch.
Deshalb ist die Ausgabe auf Satzebene besser als eine einzelne Dokumentzahl. Ein markierter Absatz in einem ansonsten gewöhnlichen Aufsatz sieht ganz anders aus als jeder Satz mit hohem Score. Ersteres ist oft ein stilistisches Artefakt. Letzteres ist ein Gespräch wert.
Führe unsere eigenen Zahlen als Plausibilitätsprüfung dafür aus, wie verrauscht das ist. Am 2026-09-13 haben wir zwei Korpora mit dem DeAIze-Detektor (lokales Ensemble, Lite-Tier) bei einer Markierungsschwelle von 30 % bewertet. Ein Satz von 23 handgeschriebenen DeAIze-Leitfäden erzielte einen Mittelwert von 21 % KI, einen Median von 22 %, eine Spanne von 0–46 % – und 5 dieser 23 wurden bei dieser Schwelle immer noch markiert. Zwölf uneditierte Modellausgaben erzielten einen Mittelwert von 33 %, einen Median von 34 %, eine Spanne von 4–46 %. Menschliches Schreiben und rohe Modellausgaben überschnitten sich stark. Das ist unsere eigene Messung, kein Urteil eines Dritten, und es ist das klarste Argument, das ich dir gegen das Handeln aufgrund einer einzelnen Zahl geben kann.
Welche Quellenfragen sollten Sie stellen, bevor Sie KI erwähnen?
Fragen Sie nach der Arbeit, nicht nach dem Werkzeug. In dem Moment, in dem Sie sagen: „Haben Sie KI verwendet?“, haben Sie das Gespräch in ein Verhör verwandelt, und Sie werden so oder so eine defensive Antwort erhalten. Beginnen Sie stattdessen mit Fragen, deren Antworten Sie überprüfen können.
- Führen Sie mich durch, wie das entstanden ist. Fragen Sie nach der Reihenfolge der Arbeit: Lesen, Notizen, Entwerfen, Überarbeiten. Ein Autor mit einem echten Prozess beschreibt Chaos – Fehlstarts, einen gestrichenen Abschnitt, eine aufgegebene Quelle.
- Woher kam das Argument? Fragen Sie, was sie dazu bewogen hat, diese Behauptung der naheliegenden Alternative vorzuziehen. Mit dieser Frage tut sich KI-unterstützte Arbeit am schwersten, weil die Wahl nie getroffen wurde.
- Können Sie mir die Version davor zeigen? Fragen Sie nach der Entwurfsgeschichte, nicht nach der endgültigen Datei.
- Was würden Sie ändern, wenn Sie eine weitere Woche hätten? Autoren, die ihre Arbeit beherrschen, haben eine Liste parat. Autoren, die sie zusammengesetzt haben, oft nicht.
- Welcher Teil war am schwierigsten? Spezifische Schwierigkeit ist ein starkes Signal für Urheberschaft. Vage Schwierigkeit ist kein Beweis für irgendetwas – manche Leute erinnern sich wirklich nicht.
Achten Sie auf Substanz, nicht auf Selbstsicherheit. Ein nervöser Autor, der seine Argumentation erklären kann, gehört in eine völlig andere Kategorie als ein flüssiger Autor, der nicht sagen kann, warum Absatz drei existiert. Angst ist kein Beweis.
Wenn Sie ein belastbares Vorher-Nachher für Ihre eigenen Notizen benötigen, bewertet DeAIze jeden Satz und schreibt nur die markierten Zeilen um, bewertet dann erneut und zeigt beide Zahlen. Der kostenlose Tarif bietet Ihnen bei der Anmeldung 200 Wörter, ohne Karte – genug, um den Workflow an einem Absatz zu testen, bevor Sie irgendetwas entscheiden. Siehe Preise für die kostenpflichtigen Tarife.
Was Metadaten und Versionsverlauf Ihnen verraten können
Metadaten sind das leiseste Signal und manchmal das nützlichste, weil sie schwer beiläufig zu fälschen und leicht zu überprüfen sind.
| Prüfung | Was sie zeigen kann | Was sie nicht zeigen kann |
|---|---|---|
| Dateieigenschaften (Autor, erstellt, geändert) | Ob die Datei in einem Zug oder von einem anderen Konto als dem Rest der Einreichung erstellt wurde | Ob die Wörter selbst generiert wurden |
| Versionsverlauf in Google Docs oder Word | Eine echte Entstehungsspur – lange Bearbeitungen, gelöschte Passagen, Kommentare | Nichts, wenn der Verfasser woanders entworfen und eingefügt hat |
| Aktivierte Änderungsverfolgung | Ob tatsächlich überarbeitet wurde | Ob ein früherer Entwurf maschinell geschrieben wurde |
| Einfügeverhalten | Große einzelne Einfügungen ohne Bearbeitungsspur | Warum die Einfügung erfolgte |
| Formatierungsrückstände | Seltsame Überschriftenstile, übrig gebliebenes Markdown, gerade Anführungszeichen in einem Dokument mit typografischen Anführungszeichen | Urheberschaft |
Eine saubere Entstehungsgeschichte ist ein schwacher Hinweis auf Urheberschaft. Eine fehlende beweist nichts – viele ehrliche Autoren schreiben in einer Notizen-App und fügen einmal ein. Lesen Sie die Tabelle als Liste von Dingen, nach denen Sie fragen können, nicht als Liste von Dingen, die überführen.
Wie kombinieren Sie die Signale zu einer Entscheidung?
Ordnen Sie jede Einreichung einem von drei Bereichen zu. Der Punkt ist, dass Sie aufhören, einen hohen Wert als Urteil zu behandeln.
- Geringe Besorgnis. Niedrige oder gemischte Detektorwerte, eine plausible Prozessgeschichte und eine vorhandene Entstehungsspur. Abheften und weitergehen.
- Ein Gespräch wert. Hoher Detektorwert mit den meisten Sätzen markiert, schwache Antworten zur Argumentation und keine Entstehungsgeschichte. Sie beschuldigen trotzdem nicht. Sie bitten um den nächsten Entwurf mit Notizen oder darum, dass man Ihnen das Argument persönlich erläutert.
- Eskalieren Sie wegen des Prozesses, nicht wegen der Erkennung. Mehrere widersprüchliche Signale plus eine Richtlinie, die bereits definiert, was als Falschdarstellung gilt. Behandeln Sie es über das bestehende Verfahren Ihrer Einrichtung, mit der Detektorausgabe als einem Punkt in einer Akte, niemals als Befund.
Die Kategorie, die Sie wählen, sollte davon abhängen, was Sie sagen würden, wenn der Verfasser Sie bitten würde, sie schriftlich zu begründen. Wenn die ehrliche Antwort „Das Tool hat es gesagt“ lautet, sind Sie noch nicht so weit.
Dies ist der Teil, den Redakteure und Lehrkräfte am schwierigsten finden, und es lohnt sich, ihn klar zu benennen: Die Kosten einer falschen Anschuldigung sind höher als die Kosten eines übersehenen Falls. Ein Student, der vor einer Klasse zu Unrecht beschuldigt wird, erinnert sich jahrelang daran. Eine einzelne unentdeckte Einreichung ist ein schlechter Tag. Richten Sie Ihren Prozess entsprechend aus. Unser Leitfaden zu False Positives und was zu tun ist, wenn Sie beschuldigt werden ist für die andere Seite dieses Schreibtischs geschrieben und lesenswert, bevor Sie eine E-Mail senden.
Was tun Sie, wenn die Signale sich widersprechen?
Sie werden sich widersprechen. Das ist der Normalfall, nicht die Ausnahme.
Hoher Detektor-Score, überzeugende Antworten zur Entstehung. Vertrauen Sie den Prozessbeweisen mehr als dem Score. Fragen Sie nach der Entwurfshistorie, wenn Sie einen Papiernachweis wünschen, und schließen Sie den Fall dann ab. Formelhafte Schreibweise und starke Bearbeitung führen beide zu hohen Messwerten bei legitimer Arbeit.
Niedriger Detektor-Score, ausweichende Antworten. Ein niedriger Score ist keine Unbedenklichkeitsbescheinigung. Wenn der Verfasser sein eigenes Argument nicht erklären kann, ist das ein Schreibproblem, das Sie direkt ansprechen können – bitten Sie um eine Überarbeitung mit beigefügter Begründung, was eine normale redaktionelle Bitte ist und es überhaupt nicht erfordert, KI zu erwähnen.
Alles schlägt Alarm, und der Autor ist kein Muttersprachler des Englischen. Dies ist das häufigste Falsch-Positiv-Muster in der Praxis. Vorhersehbare Formulierungen und einfachere Satzstrukturen treiben die Bewertungen in die Höhe. Lesen Sie unseren Artikel darüber, warum Detektoren nicht-muttersprachliche englische Autoren markieren, bevor Sie irgendetwas entscheiden, und gewichten Sie das Quellgespräch viel stärker.
Zwei Detektoren sind sich uneinig. Das kommt oft vor, weil sie unterschiedliche Signale gewichten und unterschiedliche Schwellenwerte verwenden. Uneinigkeit ist eine Information: Sie sagt Ihnen, dass der Text in der Grauzone liegt. Vergleichen Sie die Ausgabe auf Satzebene statt der Schlagzeilenzahlen und prüfen Sie, ob dieselben Zeilen von beiden markiert werden. Wenn nicht, ist Ihre Beweislage schwach.
Der Autor gibt zu, KI für Teile verwendet zu haben. Jetzt befinden Sie sich im Bereich der Richtlinien, nicht der Erkennung. Prüfen Sie, was Ihre Institution oder Publikation tatsächlich über unterstütztes Verfassen sagt, und wenden Sie diese Regel dann auf den konkreten Fall an. Viele Richtlinien erlauben Unterstützung und verbieten die falsche Darstellung der Urheberschaft. Das ist eine andere Frage als die, ob der Text maschinenhaft klingt – und es ist die Frage, die Sie von Anfang an hätten stellen sollen.
Eine weitere Sache, die die Zahlen stützen: KI-Verrat ist keine zuverlässige Abkürzung. In derselben Messung vom 13.09.2026 enthielt unsere von Menschen geschriebene Stichprobe etwa 4 KI-verräterische Phrasen pro 100 Wörter, und die uneditierte Modellausgabe enthielt etwa 1 pro 100 Wörter. Die angeblich verräterischen Konstruktionen tauchten häufiger in der menschlichen Schreibweise auf. Jede Checkliste, die Ihnen sagt, Sie sollen „delve“ und „moreover“ zählen, misst das Falsche.
Schreiben Sie Ihre Triage-Schritte auf, bevor die nächste Einreichung eintrifft. Ein Prozess, den Sie dem Autor zeigen können, ist die einzige Art, die einer Anfechtung standhält – und sie ist die einzige Art, die es Ihnen ermöglicht, mit gutem Gewissen zu handeln, wenn die Signale tatsächlich übereinstimmen.
Messhinweis: Die Zahlen in diesem Artikel stammen aus unserem eigenen Detektorlauf vom 13.09.2026 — n = 23 handgeschriebene Leitfäden gegenüber n = 12 unbearbeiteten Modellausgaben, medianer KI-Score 22 % bzw. 34 %. Methode: /methodology/.