deslopify.me

Investigación

Investigación

¿Detectan los humanos los textos de IA?

Seis estudios, dos conclusiones opuestas. Los lectores sin entrenamiento aciertan al azar con los modelos de frontera; los expertos entrenados en géneros familiares llegan al 60–70 %. Repasamos cada uno, incluido el que contradice el titular y queda enterrado en el marketing de los proveedores de detectores.

La respuesta corta

Los lectores sin entrenamiento identifican los textos de los LLM más avanzados al azar, en torno al 50 %. Los expertos en la materia con entrenamiento que leen géneros que les son familiares (ensayos que califican, abstracts que revisan) llegan al 60–70 %. Ningún estudio revisado por pares ha mostrado una precisión humana fiable por encima del 80 % sobre lo que producen los modelos más avanzados actuales. El género y quien evalúa pesan más que cualquier "habilidad humana" estable.

Los estudios siguientes son los más citados en el debate, incluidos varios que aparecen en argumentos de los proveedores de que los humanos no pueden detectar la IA de forma fiable. Incluimos también el que esos recopilatorios suelen dejar fuera: el estudio de educadores en el que los docentes llegan al 70 %.

Los estudios

Clark et al. 2021, "All That's Human Is Not Gold" (ACL)

arXiv:2107.00061 · 255 relatos, ~2.111 artículos de prensa, 50 recetas, GPT-2 y GPT-3 contra escritura humana. Los evaluadores no entrenados acertaron el 57,9% con GPT-2 y el 49,9% con GPT-3, literalmente azar. El entrenamiento (con instrucciones, ejemplos anotados, ejemplos emparejados) subió la precisión a ~55 %, sin diferencia significativa respecto a los no entrenados. Es la referencia revisada por pares más sólida que respalda la afirmación de que "los humanos aciertan al azar", porque ACL es una conferencia de PLN de primer nivel y la muestra abarca géneros variados.

Jones & Bergen 2024, test de Turing sobre GPT-4 (NAACL)

arXiv:2405.08007 · 500 participantes, tests de Turing conversacionales de cinco minutos. GPT-4 fue juzgado como humano el 54% de las veces; los humanos reales el 67%; ELIZA el 22%. La tasa de paso de GPT-4 no fue estadísticamente diferente del azar (z = 0,14, p = 0,48). Salvedad: esto es mensajería interactiva, no análisis forense de texto pegado; la dinámica es distinta.

El estudio de educadores, docentes al 70%

International Journal for Educational Integrity (2023), 140 docentes + 145 estudiantes, ensayos universitarios generados por ChatGPT. Los docentes acertaron el 70%; los estudiantes el 60%. Este es el estudio que contradice el titular "los humanos no pueden detectar". Evaluadores entrenados leyendo un género familiar (ensayos que califican cada semana) superan cualquier encuadre de "habilidad humana" general.

Abstracts quirúrgicos (revista Arthroscopy)

Revisores académicos, abstracts generados por ChatGPT en cirugía de hombro y codo (Arthroscopy, 2023): 62% de precisión con una tasa de falsos positivos del 38% (abstracts humanos reales marcados como IA). Dominio muy estrecho.

Cartas de motivación en cirugía plástica

Canadian Society of Plastic Surgeons (2023), GPT-4, 11 cartas de motivación de IA + 11 humanas, evaluadas por 2 cirujanos retirados con más de 20 años de experiencia: 65,9% de precisión. N minúsculo, básicamente un caso de estudio.

Abstracts de investigación dental (Nature Scientific Reports, marzo 2026)

150 abstracts, seis investigadores noveles, ChatGPT 3.5 (hoy tres generaciones por detrás). La precisión osciló entre el 44% y el 76%, varianza inter-evaluadores extrema, sobre un modelo que nadie pide detectar desde hace años.

Qué dice la literatura, leída en conjunto

  • No entrenado × modelo de frontera × género neutro ≈ azar (Clark, Jones).
  • Entrenado × modelo de frontera × género familiar ≈ 60–70% (docentes sobre ensayos, revisores sobre abstracts). Por encima del azar, pero lejos de ser fiable.
  • Ninguno de los estudios publicados mide la capacidad de cuantificar el grado de parecido con la IA en una escala continua; todos son elecciones binarias forzadas. Por esa brecha construimos un score continuo con explicaciones por característica.

Lectura cuidadosa de los resúmenes de proveedores

La industria de los detectores tiene un interés comercial en el encuadre "los humanos no pueden detectar la IA de forma fiable": es el argumento para comprar una herramienta. Los estudios más citados son reales, pero los textos de los proveedores abren con los resultados más desfavorables para los humanos (Clark 2021, Jones 2024) y entierran el estudio de educadores al 70%. Suele faltar Liang et al. 2023, el paper de Stanford que muestra que los detectores marcan mal el 61% de los ensayos humanos de hablantes no nativos de inglés como IA. Ese estudio apunta en sentido contrario dentro del mismo debate, y por eso conviene entender los límites de la detección de IA antes de confiar en una sola herramienta.

Qué significa esto para el Slop Score

No nos dedicamos a responder "¿esto es IA?". La razón: la pregunta no se resuelve limpiamente, y los productos que intentan responderla cargan con una deuda de precisión que crece cada vez que un tribunal lee su metodología. El registro slop es medible con independencia de la autoría: los humanos lo producen, las reescrituras cuidadosas de IA lo evitan. Puntuamos el registro y mostramos los tramos; quien escribe decide qué hacer con ellos.