Limitaciones conocidas
Cuándo se equivoca el Slop Score
Una lista honesta de dónde falla esta herramienta. La publicamos en lugar de un cartel de 99 % de precisión porque los detectores binarios de IA que enarbolan esos carteles acaban en los tribunales, y preferimos ser útiles antes que impresionantes.
Textos cortos (menos de ~150 palabras)
Todos nuestros motores necesitan unos cuantos párrafos para funcionar. La capa léxica puntúa por cada 500 palabras. Las señales estructurales (varianza de frase, uniformidad de párrafo, densidad de tricolones) necesitan una muestra contra la que medir varianza. El motor epistémico busca una postura y una especificidad que no caben en un tuit. Una descripción de producto de 60 palabras puntúa de forma impredecible, escriba quien escriba. Pega un párrafo; idealmente tres.
Hablantes no nativos de inglés
El estudio de Stanford Liang et al. 2023 mostró que siete de los principales detectores de IA marcaron como IA el 61 % de los ensayos TOEFL escritos enteramente por hablantes no nativos de inglés. El mecanismo: los detectores aprenden que variedad léxica limitada = IA, pero la variedad léxica limitada también es un sello del inglés como L2. Nuestro score se puede descomponer, lo que mitiga parcialmente el problema. Si tu capa léxica se dispara pero las capas estructural y epistémica se mantienen limpias, escribes en un registro formal o L2 — llámalo así, no slop. Lee las barras por motor, no solo la cifra global.
Escritura muy técnica o de especialistas en un dominio
La prosa de patentes, los contratos legales, los resúmenes científicos y la documentación de ingeniería puntúan todos como slop medio-alto, y es lo esperable: un contrato que toma una postura sorprendente es una reclamación de mala praxis, y un resumen científico que recurre a la anécdota personal está haciendo el trabajo equivocado. En estos casos, el score refleja con precisión el registro estilístico, pero el veredicto («sloppy») es contextualmente erróneo. No uses deslopify para textos cuyo género exige un registro impersonal.
IA parafraseada / editada por humanos
Quien edita con cuidado el resultado de la IA — variando longitud de frase, añadiendo uno o dos ejemplos concretos — puede vencer a cualquier herramienta basada en patrones, la nuestra incluida. El resultado académico aquí es Krishna et al. 2023 (NeurIPS): su parafraseador DIPPER redujo la tasa de verdaderos positivos de DetectGPT del 70,3 % al 4,6 %. Los detectores de la industria han publicado caídas parecidas sobre texto reescrito por parafraseadores comunes. El slop sobrevive a la edición informal porque los patrones estructurales son profundos; no sobrevive a una reescritura cuidadosa hecha por alguien que sabe qué está buscando. Lo cual está bien. Quien reescribe está haciendo exactamente el trabajo que el score pedía.
Bloques de código, listas de hechos y material de referencia
Una página que es 80 % lista de funciones con viñetas y 20 % prosa puntúa alto en estructural (la densidad de formato satura la señal) sin que eso signifique nada sobre la prosa. Lo mostramos en el desglose por motor. Si estructural domina y las otras dos se mantienen bajas, estás viendo un efecto del formato — la prosa en sí está bien.
El score no es un veredicto de calidad
Un estudio de 2023 de Zhang & Gosline (MIT Sloan / Berkeley Haas) pasó a 1.203 participantes por evaluaciones ciegas de contenido persuasivo corto. Los textos de marketing generados por IA puntuaron más alto que los de expertos humanos tanto en satisfacción como en disposición a pagar. Así que «poco slop» no es «buena escritura» y «mucho slop» no es «mala escritura». Mucho slop significa que el texto suena intercambiable. Para una descripción de producto, intercambiable está bien. Para tu ensayo personal, intercambiable es justo el problema.
Idiomas más allá del inglés, alemán y español
Los motores de diagnóstico funcionan hoy en esas tres lenguas. Cada una viene con un diccionario propio, patrones regex estructurales y un prompt de juez Sonnet ajustado para cada idioma. El slop es un registro nativo de cada lengua; una capa de traducción genérica sobre un único motor inglés produciría números que no significan nada. Cuando el idioma del texto pegado no coincide con el idioma del sitio, los motores siguen al texto y un aviso ofrece cambiar la interfaz.
Pega un párrafo en polaco o mandarín y los motores siguen corriendo, pero trata el score como ruido. Añadir un idioma exige un diccionario propio, patrones regex frescos, un prompt Sonnet calibrado y seis textos ancla fijos sometidos a un ajuste en vivo. Tres idiomas en los que confiamos es el techo con el que lanzamos. Ofrecer diez que parecen multilingües pero no lo son sería un producto peor.
Modelos contra los que no hemos probado
Nuestro conjunto de calibración se construyó con resultados de modelos punteros actuales (Claude, GPT, Gemini). Los modelos nuevos entrenados explícitamente para evadir detección son un blanco móvil. Volvemos a puntuar el conjunto de textos ancla tras cada cambio de pesos y publicamos los resultados en nuestra página de calibración; en el momento en que una nueva clase de modelo rompe las bandas, los motores se reescriben. Un parche de marketing no lo resuelve.
Lo que nos gustaría publicar a continuación
- Cifras de robustez entre modelos (mismo prompt, cuatro familias de modelos — ¿los scores se agrupan?).
- Benchmark de resistencia a paráfrasis (IA cruda, luego por DIPPER / QuillBot, delta del score).
- Un subconjunto de inglés no nativo con muestras de registro controladas.
Si te topas con un caso en el que el score te parezca erróneo, dínoslo. Aún no hay un flujo para «notificar este score»; el correo de la lista de espera es el canal hasta que lo haya.