deslopify.me

All of deslopify.me

Forschung

Die Studien hinter dem Slop Score

Unten findest du klar verständliche Zusammenfassungen der wissenschaftlichen Literatur und Branchenstudien, die geprägt haben, wie dieses Tool stilistischen Slop misst. Jede Behauptung verlinkt auf ihre Quelle; wo Studien sich widersprechen, sind beide verlinkt.

Jede Seite hier verlinkt Primärquellen und kennzeichnet, wo eine Quelle Eigeninteressen verfolgt (ein Detektor-Anbieter, der „Menschen können KI nicht erkennen“ publiziert, will dir etwas verkaufen). Wenn zwei Quellen sich widersprechen, sind beide verlinkt.

Wie Slop klingt

Unsere redaktionelle Definition. Slop ist ein stilistisches Register — stimmlose, hedge-lastige, austauschbare Prosa — kein Urteil darüber, ob ein Text von einer KI stammt. Wie es bei 20, bei 60, bei 90 klingt.

Erkennen Menschen KI-Texte?

Sechs Studien, zwei entgegengesetzte Schlussfolgerungen. Ungeübte Leser:innen liegen auf Zufallsniveau (~50 %) bei modernen Frontier-Modellen; geschulte Fachexpert:innen erreichen 60–70 % in vertrauten Genres. Wir gehen jede Studie durch, darunter eine, deren Befund der gängigen Lesart widerspricht.

Die Grenzen der KI-Erkennung

Verzerrung zulasten von Nicht-Muttersprachler:innen (Liang 2023 in Stanford: 61 % Falsch-Positiv-Rate bei TOEFL-Essays). Umgehung durch Paraphrasen (Krishna 2023 bei NeurIPS). Memorisierte kanonische Texte. Eine theoretische Schranke von Sadasivan et al. Warum wir ein Diagnose-Tool entwickelt haben und kein Urteilswerkzeug.

In Blindtests bevorzugen Leser:innen KI-Marketingtexte

Zhang & Gosline 2023 (MIT Sloan / Berkeley Haas, 1.203 Teilnehmende): In Blindtests schnitten KI-generierte Werbetexte bei Zufriedenheit und Zahlungsbereitschaft besser ab als die von menschlichen Experten. Leser:innen meiden KI-Prosa nicht; sie bevorzugen Menschen nur dann, wenn man ihnen sagt, was was ist. Warum Slop ≠ schlechte Qualität ist.

Wie groß ist der KI-Anteil im Web mittlerweile?

Branchenstudien kommen übereinstimmend auf rund 50 % neuer Artikel, die überwiegend von KI geschrieben sind, und 74 % neuer Seiten, bei denen KI in irgendeiner Form beteiligt ist, mit nur wenigen Prozent reiner KI. Die Zahlen widersprechen sich, weil jede Messung auf einem Detektor beruht; die Richtung nicht.

Offene Benchmarks

Wie der Slop Score gegen die CI-verankerten Kalibrierungsanker, die Zhang-&-Gosline-4-Paradigmen-Experimentalanker und die Paraphrasen-Resistenz-Deltas (−17 oberflächlich vs −33 inhaltlich) abschneidet. Plus, was wir noch nicht messen können.

Warum wir das veröffentlichen

Die KI-Detektor-Branche wirbt mit Genauigkeitsangaben von über 95 %, die auf unabhängigen Testsets in sich zusammenfallen (Liang 2023; Sadasivan et al.). Die ehrliche Antwort auf „Wie gut ist dieser Score?“ lautet: Die Kalibrierung hält beim stilistischen Register und bricht bei adversarialer Paraphrasierung — und wir zeigen dir genau, wo. Dafür sind diese Seiten da.

Wenn du einen Fehler findest oder eine Studie kennst, die wir aufnehmen sollten, erreichst du uns über die Warteliste-E-Mail. Wir aktualisieren die Quellenangaben, wenn sich die Forschungslage ändert.