Research
Cómo funcionan las marcas de agua en texto
Una marca de agua puede vivir en dos sitios de un texto: en la estadística de la elección de palabras, colocada por el proveedor del modelo al generar, o en caracteres que no se ven, inyectados en el propio texto. Las dos familias tienen historias de robustez muy distintas. Esto es lo que dice la investigación publicada sobre cada una — y lo que nuestro diagnóstico y el reescritor hacen realmente al respecto.
Una firma escondida en la elección de palabras
Kirchenbauer et al., ICML 2023 (arXiv:2301.10226) presentaron el esquema sobre el que se construye el trabajo posterior. En cada paso de generación, una función pseudoaleatoria sembrada por los tokens anteriores divide el vocabulario en una lista «verde» y una «roja», y el modelo recibe un empujón hacia las palabras verdes. Cada elección individual pasa desapercibida; a lo largo de unos cientos de palabras, el exceso de tokens verdes se convierte en una firma estadística. El texto se lee con normalidad. No se ve nada. Detectarla exige la clave secreta que generó las listas verdes — es decir, decide el proveedor del modelo quién puede comprobarlo, no quien lee.
SynthID-Text: la versión en producción
Dathathri et al., Nature 2024 (Nature 634, 818–823) describe SynthID-Text, la implementación de esta idea por Google DeepMind en Gemini — la primera marca de agua estadística de texto desplegada a escala de consumo, y de código abierto para otros proveedores. El propio artículo reconoce los límites: la detección queda del lado del proveedor (sin la clave nadie puede verificar nada), la fiabilidad cae con texto corto o de baja entropía — respuestas factuales, traducciones, código — y la robustez está medida frente a ediciones ligeras, no frente a reescrituras completas.
¿Quién marca texto hoy? (agosto de 2026)
Google ejecuta SynthID-Text en producción en Gemini y opera un portal SynthID Detector de acceso restringido — la verificación de texto sigue del lado del proveedor, tras una lista de espera. Anthropic anunció el 11 de agosto de 2026 que los modelos Claude publicados después del 2 de agosto de 2026 llevarán una marca de agua invisible a nivel de modelo, API incluida, sin posibilidad de desactivarla; el mecanismo no está documentado y aún no existe una herramienta pública de verificación. Esto sustituye al estado anterior de la API de Claude y es relevante para el registro de cumplimiento de este sitio. OpenAI sigue entregando texto sin marcar — su marca de agua de texto está construida y retenida desde 2024; su trabajo de procedencia cubre imagen y audio vía C2PA, un estándar que según su propia especificación no puede viajar con texto plano pegado.
Un hecho enmarca toda esta página: sin la clave del proveedor, nadie puede comprobar si un texto pegado lleva una marca de agua estadística moderna. Para los esquemas bien diseñados no es una carencia de ingeniería sino una demostración — Christ, Gunn y Zamir (arXiv:2306.09194) construyen marcas de agua computacionalmente indetectables sin la clave. Los tests de caja negra publicados que sí funcionan (arXiv:2405.20777) interrogan al modelo generador con cientos de consultas elegidas — no un cuadro de pegado. Cualquier herramienta que afirme ver una marca SynthID o Claude en tu texto vende algo que no puede hacer. Eso nos incluye: nuestra página de limitaciones lo dice con todas las letras.
El pariente burdo: caracteres que no se ven
La otra familia no toca el modelo en absoluto. Esconde marcas en el propio texto: espacios de ancho cero entre letras, caracteres de control de dirección, caracteres de relleno, o letras latinas sustituidas por cirílicas de aspecto idéntico (homóglifos). Algunas herramientas los usan como marca de procedencia primitiva o como rastreador de copiado; los mismos caracteres se usan también de forma adversarial — un espacio de ancho cero dentro de una palabra la parte en dos para cualquier detector basado en tokens, y los caracteres de anulación bidireccional son la pieza detrás de los ataques «Trojan Source» descritos por Boucher y Anderson (arXiv:2111.00169). Ninguna regulación trata estos caracteres como un esquema de marcado reconocido, y son trivialmente frágiles: reescribir el texto a mano, o cualquier pasada de normalización, los elimina.
Aquí es donde este sitio actúa. El panel de Procedencia del diagnóstico cuenta en cada texto pegado los caracteres invisibles, los de control de dirección, las variantes ocultas de espacio y las palabras suplantadas con homóglifos (mediante una tabla curada de confusables — las palabras enteras en otro alfabeto nunca saltan). Nunca cambian tu puntuación, porque no dicen nada sobre cómo se lee el texto. El reescritor los elimina de su entrada y devuelve las letras suplantadas al alfabeto latino.
¿Cuánto sobrevive al parafraseo?
Krishna et al., NeurIPS 2023 (arXiv:2303.13408) enfrentaron los detectores a DIPPER, un modelo de parafraseo. La detección por clasificadores se desplomó (DetectGPT: del 70,3 % al 4,6 % de positivos detectados con un 1 % de falsos positivos). Las marcas de agua fueron el método más robusto de los probados — y aun así perdieron alrededor de una quinta parte de sus detecciones con una sola pasada de parafraseo. Sadasivan et al. 2023 (arXiv:2303.11156) fueron más lejos: el parafraseo recursivo empuja la detección de marcas de agua hacia el azar, y un ataque de suplantación puede incluso plantar una marca de agua en texto que el modelo nunca escribió.
El contrapunto es real y merece la misma visibilidad. El estudio de fiabilidad posterior de Kirchenbauer et al. (arXiv:2306.04634) halló que las marcas de agua resisten el parafraseo humano y automático mejor de lo que sugerían los primeros resultados — si hay texto suficiente. La detección es función de la longitud: unos cientos de palabras parafraseadas suelen conservar una firma legible; un texto del tamaño de un tuit, no. El artículo de SynthID-Text describe la misma curva. El texto corto y muy editado es el punto débil de todos los esquemas; el texto largo y poco editado es donde las marcas de agua funcionan de verdad.
Qué significa esto para deslopify
Nuestro reescritor no parafrasea frase a frase: vuelve a generar el texto con otro modelo, conservando el significado, los hechos y las citas literales. Una marca de agua estadística vive en la elección de palabras del modelo original, así que el texto regenerado ya no la lleva — salvo en lo que se cite literalmente. Es una propiedad del parafraseo, documentada en la literatura de arriba, no una función que hayamos construido — y no medimos, prometemos ni optimizamos nada de esto.
La razón es la misma que sostiene nuestra posición sobre la detección de IA: la procedencia debería salir de la transparencia, no de una carrera armamentística. Si reescribes texto generado por IA y lo publicas para informar al público, las normas europeas de transparencia pueden seguir exigiéndote que lo declares — que una marca de agua desaparezca no hace desaparecer la obligación. El reescritor lo dice junto a su salida, y nuestra guía del artículo 50 y la guía de marcado explican qué exige la transparencia en la práctica. Las marcas de agua son una respuesta honesta a «¿de dónde salió este texto?». Decirlo tú mismo es una mejor.