deslopify.me

All of deslopify.me

Bekannte Grenzen

Wann der Slop Score falsch liegt

Eine ehrliche Liste, wo dieses Tool fehlschlägt. Wir veröffentlichen sie statt eines 99-%-Genauigkeits-Banners, weil die binären KI-Detektoren, die mit solchen Bannern werben, regelmäßig verklagt werden — und wir lieber nützlich als beeindruckend sind.

Kurze Texte (unter ~150 Wörtern)

Jede Engine hier braucht ein paar Absätze, um zu greifen. Die lexikalische Schicht rechnet pro 500 Wörter. Die strukturellen Signale (Satzlängenvarianz, Absatz-Uniformität, Tricolon-Dichte) brauchen eine Stichprobe, an der sie Varianz messen können. Die epistemische Engine sucht nach Haltung und Konkretheit, die in einen Tweet nicht passen. Eine 60-Wort-Produktbeschreibung wird unvorhersehbar bewertet, egal wer sie geschrieben hat. Füge einen Absatz ein, idealerweise drei.

Englische Nicht-Muttersprachler:innen

Die Stanford-Studie Liang et al. 2023 zeigte, dass sieben führende KI-Detektoren 61 % der TOEFL-Essays, die komplett von englischen Nicht-Muttersprachler:innen verfasst wurden, als KI markierten. Der Mechanismus: Detektoren lernen, dass eingeschränkter Wortschatz gleich KI bedeute, aber eingeschränkter Wortschatz ist auch ein Kennzeichen von L2-Englisch. Unser Score ist zerlegbar, was das teilweise entschärft. Wenn deine lexikalische Schicht ausschlägt, strukturell und epistemisch aber sauber bleiben, schreibst du in einem formalen oder L2-Register — nenn es so, nicht Slop. Lies die Balken der einzelnen Engines, nicht nur den Gesamtwert.

Hochtechnische oder fachspezifische Texte

Patentprosa, juristische Verträge, wissenschaftliche Abstracts und Engineering-Dokumentation landen alle im mittleren bis hohen Slop-Bereich, weil sie das sollen: Ein Vertrag, der eine überraschende Haltung einnimmt, ist ein Haftungsfall, und ein wissenschaftliches Abstract mit persönlich erlebten Details verfehlt seinen Zweck. Der Score gibt das stilistische Register hier korrekt wieder, aber das Urteil („sloppy“) ist im Kontext falsch. Benutze deslopify nicht für Texte, deren Genre ein unpersönliches Register verlangt.

Paraphrasierte / von Menschen redigierte KI

Eine entschlossene Person, die KI-Output sorgfältig redigiert — Satzlängen variiert, ein, zwei konkrete Beispiele ergänzt — kann jedes musterbasierte Werkzeug aushebeln, unseres eingeschlossen. Das akademische Ergebnis dazu ist Krishna et al. 2023 (NeurIPS): Ihr DIPPER-Paraphraser senkte die True-Positive-Rate von DetectGPT von 70,3 % auf 4,6 %. Branchen-Detektoren haben ähnliche Einbrüche bei Texten veröffentlicht, die durch gängige Paraphraser geschickt wurden. Slop übersteht beiläufige Bearbeitung, weil die strukturellen Muster tief sitzen; eine sorgfältige Überarbeitung durch jemanden, der weiß, worauf zu achten ist, übersteht er nicht. Was in Ordnung ist. Die bearbeitende Person macht genau die Arbeit, die der Score eingefordert hat.

Codeblöcke, Faktenlisten und Referenzmaterial

Eine Seite, die zu 80 % aus Bullet-Feature-Listen und zu 20 % aus Prosa besteht, erhält einen hohen Struktur-Score (Formatierungsdichte sättigt das Signal), ohne dass das etwas über die Prosa aussagt. Wir machen das in der Aufschlüsselung der einzelnen Engines sichtbar. Wenn strukturell dominiert und die anderen beiden niedrig bleiben, siehst du ein Formatierungsartefakt — die Prosa selbst ist okay.

Der Score ist kein Qualitätsurteil

Eine Studie von Zhang & Gosline aus dem Jahr 2023 (MIT Sloan / Berkeley Haas) ließ 1.203 Teilnehmende blind kurze Überzeugungstexte bewerten. KI-generierte Marketingtexte schnitten besser ab als die von menschlichen Expert:innen, sowohl bei Zufriedenheit als auch bei Zahlungsbereitschaft. „Wenig Slop“ ist also nicht „gut geschrieben“, und „viel Slop“ ist nicht „schlecht geschrieben“. Viel Slop heißt: Der Text klingt austauschbar. Für eine Produktbeschreibung ist austauschbar okay. Für deinen persönlichen Essay ist austauschbar das ganze Problem.

Sprachen jenseits von Englisch, Deutsch und Spanisch

Die Diagnose-Engines laufen heute in diesen drei Sprachen. Jede bringt ein kuratiertes Wörterbuch, strukturelle Regex-Muster und einen Sonnet-Judge-Prompt mit, der in der Sprache abgestimmt ist. Slop ist ein sprachspezifisches Register; eine generische Übersetzungsschicht über einer einzigen englischen Engine würde Zahlen produzieren, die nichts bedeuten. Wenn die Sprache des eingefügten Textes nicht zur Spracheinstellung der Seite passt, folgen die Engines dem Text, und ein Banner bietet an, die UI zu wechseln.

Füge einen Absatz auf Polnisch oder Mandarin ein, und die Engines laufen weiter, aber behandle den Score als Rauschen. Eine neue Locale braucht ein kuratiertes Wörterbuch, frische Regex-Muster, einen kalibrierten Sonnet-Prompt und sechs fixierte Ankertexte, die durch einen Live-Tuning-Durchlauf laufen. Drei Locales, denen wir vertrauen, sind die Obergrenze, bei der wir live gehen. Zehn, die mehrsprachig aussehen, es aber nicht sind, wären ein schlechteres Produkt.

Modelle, an denen wir nicht getestet haben

Unser Kalibrierungs-Set wurde anhand von Output zeitgenössischer Frontier-Modelle (Claude, GPT, Gemini) zusammengestellt. Neue Modelle, die explizit auf Detection-Umgehung trainiert sind, sind ein bewegliches Ziel. Wir bewerten das Ankerset nach jeder Gewichts-Änderung neu und veröffentlichen die Ergebnisse auf unserer Kalibrierungsseite; sobald eine neue Modellklasse die Bänder sprengt, werden die Engines überarbeitet. Ein Marketing-Patch reicht dafür nicht.

Was wir als Nächstes veröffentlichen möchten

  • Cross-Model-Robustheits-Zahlen (gleicher Prompt, vier Modellfamilien — bilden die Scores Cluster?).
  • Paraphrasen-Resistenz-Benchmark (Roh-KI, dann durch DIPPER / QuillBot, Score-Delta).
  • Ein Teildatensatz mit englischen Texten von Nicht-Muttersprachler:innen, mit kontrollierten Register-Proben.

Wenn du auf einen Fall stößt, in dem der Score sich falsch anfühlt, sag uns Bescheid. Es gibt noch keinen „Score melden“-Flow; die E-Mail-Adresse der Warteliste ist der Kanal, bis es einen gibt.