Nature 634, 818–823 · 23 octubre 2024 · Google DeepMind · Curso completo

La marca de agua invisible del texto artificial

SynthID-Text, explicado desde cero: sin dar por sabido qué es un token, qué es una probabilidad ni qué es un contraste de hipótesis. Con animaciones, algoritmos línea a línea, 77 referencias enlazadas y el artículo original para descargar.

ARTÍCULO · Scalable watermarking for identifying large language model outputs
AUTORES · Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam (contribución igual) + 19 más, incluidos Demis Hassabis y Pushmeet Kohli
SEDE · Google DeepMind (Londres) y Google (Mountain View)
FECHAS · Recibido 8-abr-2024 · Aceptado 5-sep-2024 · Publicado 23-oct-2024
ESTADO · Desplegado en producción en Gemini y Gemini Advanced. Código abierto en GitHub
MÉTRICAS · 204.000 accesos · 161 citas · Altmetric 1.251
Ampliación de agosto de 2026 He añadido el preprint de Panfilov et al. para explicar un límite que SynthID no cubre: proteger el razonamiento opaco que una API transporta entre llamadas. Ir al experimento de la maleta opaca, capítulo 22.

Antes de empezar: descarga el artículo y tenlo abierto al lado. Este curso lo sigue capítulo a capítulo y te irá diciendo a qué figura, definición o algoritmo corresponde cada apartado, así que se aprovecha mucho más leyendo los dos en paralelo. Si solo vas a abrir un archivo, que sea el material suplementario: el artículo de Nature tiene un límite de páginas muy estricto y casi toda la maquinaria matemática está allí.

Demostración de aperturarevelado

Dos respuestas. Misma calidad aparente. Una salió de un modelo con marca de agua; la otra, no. A ojo son indistinguibles. Pulsa el revelado.

Lafotosíntesiseselprocesoporelcuallasplantasconviertenlaluzsolarenenergíaquímicaalmacenada
Lasplantasusanlaluzdelsolparafabricaralimentoapartirdelaguaydeldióxidodecarbono

■ ficha rellena = ese token puntuó 1 en la lotería secreta · ▢ ficha hueca = puntuó 0

Sin la clave secreta, las dos parecen ruido. Con ella, una de las dos tiene demasiadas fichas rellenas para ser casualidad. Eso es toda la marca de agua: un desequilibrio estadístico que solo existe si sabes dónde mirar.

Parte I de V

Cimientos

Seis capítulos con todo lo que hace falta saber antes de tocar el artículo. Si ya dominas probabilidad, entropía y contraste de hipótesis, puedes saltar a la Parte II, pero conviene al menos hojear el capítulo 04, porque la idea de función pseudoaleatoria es la que sostiene el método entero.

BásicoCapítulo 01

Qué es un modelo de lenguaje

Empecemos por el principio del principio. Un modelo de lenguaje es una máquina de completar frases. Nada más. Le das un trozo de texto y te dice qué es lo más probable que venga después.

También en el facsímil: puedes ampliar esta base en F03, capítulo 01: qué es un LLM y seguir su arquitectura en F03, capítulo 02: Transformer por dentro.

Ejemplo de calle

El teclado predictivo del móvil. Escribes "voy a comprar" y arriba te salen tres sugerencias: "pan", "el", "un". Eso ya es un modelo de lenguaje, solo que muy pequeño y muy tonto. ChatGPT o Gemini son exactamente lo mismo, con dos diferencias: han leído una fracción enorme de todo lo escrito por la humanidad, y en vez de tres sugerencias manejan cientos de miles a la vez.

La historia en cuatro saltos

  1. Modelos de n-gramas (años 80–2000) (Jurafsky y Martin, cap. 3 → ref. 73; Chen y Goodman, 1999 → ref. 74). Contar. Literalmente: cuentas cuántas veces aparece "voy a comprar pan" en un corpus gigante y cuántas veces "voy a comprar coche", y das más probabilidad al que más sale. Funciona sorprendentemente bien y sorprendentemente mal: no puede generalizar a frases que nunca ha visto.
  2. Modelos neuronales (Bengio et al., 2003 → ref. 40). En vez de contar frases, se aprende a representar cada palabra como un vector de números ("embedding"), de modo que "perro" y "gato" acaben cerca en ese espacio. Ahora sí se puede generalizar: si nunca has visto "voy a comprar dálmata" pero sí "voy a comprar perro", el modelo sabe qué hacer.
  3. El Transformer (Vaswani et al., 2017 → ref. 41). La arquitectura que lo cambió todo. Su mecanismo de atención permite que, al predecir una palabra, el modelo mire simultáneamente a todas las anteriores y decida cuáles importan. Antes había que procesar el texto en orden, palabra a palabra; ahora se procesa en paralelo, y eso permitió entrenar modelos mil veces más grandes.
  4. La escala (Brown et al., 2020 → ref. 43; Kaplan et al., 2020 → ref. 44). Se descubre que, si haces el modelo suficientemente grande y le das suficientes datos, aparecen capacidades que nadie programó: traducir, razonar, escribir código. Ahí nacen los LLM tal como los conocemos.

Qué significa "entrenar"

Se toma un texto enorme, se le tapa una palabra y se le pide al modelo que adivine cuál era. Se compara con la real, se mide el error y se ajustan levemente los miles de millones de parámetros internos para equivocarse un poco menos. Se repite billones de veces. Eso es todo. El modelo nunca ve una etiqueta de "esto es correcto" puesta por un humano: la etiqueta es la propia palabra siguiente del texto. Por eso se llama autosupervisado.

El paso extra: RLHF

Un modelo entrenado solo así es un imitador de internet: útil pero desagradable, propenso a divagar. Encima se aplica aprendizaje por refuerzo con retroalimentación humana (Christiano et al., 2017 → ref. 45; Ouyang et al., 2022 → ref. 46): personas comparan pares de respuestas, se entrena un modelo de recompensa con esas preferencias, y se ajusta el modelo para maximizarla. De ahí salen las variantes "-IT" (instruction tuned) que usa el artículo.

Guárdate esto

El RLHF tiene un efecto secundario que será crítico en el capítulo 05: reduce la variedad de respuestas del modelo. El modelo aprende a dar "la respuesta que gusta" y deja de explorar alternativas. Se llama colapso de modo (Casper et al., 2023 → ref. 26). Y menos variedad significa, como veremos, menos sitio donde esconder la marca de agua.

BásicoCapítulo 02

Tokens: el alfabeto real de las máquinas

La mayoría de los LLM actuales no reciben palabras completas ni frases como unidades indivisibles. El tokenizador convierte el texto en identificadores de tokens, y el modelo procesa esos identificadores. Al decodificarlos, un token puede corresponder a una palabra frecuente, una subpalabra, un signo, un byte o incluso un carácter.

También en el facsímil: la relación entre token, vocabulario y embedding se desarrolla en F01, capítulo 09: del token al embedding; el recorrido de texto a tensor continúa en F03, capítulo 02.

¿Por qué no usar palabras?

Porque el diccionario sería infinito. Nombres propios, erratas, palabras compuestas alemanas, URLs, código. Cualquier palabra no vista sería un agujero negro.

¿Por qué no usar solo caracteres?

No es porque las letras "carezcan de semántica". El significado no vive dentro de una letra ni tampoco dentro de un token aislado: emerge de las representaciones que el modelo construye al relacionar la secuencia completa con su contexto. Existen modelos que trabajan directamente con caracteres, como CANINE (Clark et al., 2022 → ref. 75), y con bytes, como ByT5 (Xue et al., 2022 → ref. 76).

El compromiso es de ingeniería. Para el mismo texto, caracteres o bytes producen secuencias mucho más largas. Eso aumenta el número de pasos de generación y el coste de la atención. Las subpalabras acortan la secuencia sin volver imposible representar nombres, código, erratas o palabras raras. No son la única solución posible, pero sí la más habitual en los LLM sobre los que se estudió SynthID-Text.

La solución: subpalabras

El algoritmo estándar es Byte-Pair Encoding (Sennrich, Haddow y Birch, 2016 → ref. 47), y su implementación más usada es SentencePiece (Kudo y Richardson, 2018 → ref. 48). Funciona así:

  1. Empiezas con un vocabulario de caracteres sueltos.
  2. Buscas el par de símbolos adyacentes más frecuente en todo el corpus. Digamos que es e+r.
  3. Lo fusionas en un símbolo nuevo: er. Ahora el vocabulario tiene un elemento más.
  4. Repites hasta llegar al tamaño de vocabulario deseado (típicamente entre 32.000 y 256.000).

El resultado es un vocabulario de piezas reutilizables: una palabra frecuente puede acabar representada por un solo token y una palabra rara puede dividirse en varios. La segmentación concreta depende del tokenizador, por eso no debemos mirar una palabra impresa y asumir cuántos tokens ocupa sin comprobarlo.

Ejemplo de calle

Es el juego del Scrabble con fichas de tamaños distintos. Tienes fichas grandes con palabras enteras muy usadas, fichas medianas con sílabas y prefijos, y fichas pequeñas con letras sueltas. Puedes escribir cualquier cosa, pero lo habitual sale rápido con pocas fichas.

Por qué esto importa para la marca de agua Toda la maquinaria de SynthID-Text opera sobre identificadores de tokens, no sobre palabras impresas. La lotería secreta puntúa tokens, la ventana de contexto contiene 4 tokens y la detección reconstruye sus g-values. El detector debe reproducir el mismo tokenizador y la misma configuración que el generador. Si cambia la segmentación, cambian los identificadores, las ventanas y las semillas; la puntuación deja de ser comparable y la detección se degrada o queda invalidada.
Laboratorio 01tokenización

Tokenizador simplificado de demostración. Escribe una frase y observa cómo se parte. Las palabras comunes salen enteras; las raras, en trozos.

lamarcadeaguaesindetectable

10 tokens para 27 caracteres

Un tokenizador real de Gemma tiene unas 256.000 entradas y se aprende de datos. Este tiene 40 y es una caricatura, pero el principio, fichas de tamaño variable, es el mismo.

BásicoCapítulo 03

Probabilidad, distribuciones y muestreo

Aquí está el 80 % de las matemáticas del artículo. Con calma.

También en el facsímil: logits, softmax, temperatura, top-k, top-p y muestreo se explican y se practican en F03, capítulo 04: de los logits al sampling.

Probabilidad

Un número entre 0 y 1 que mide cuán esperable es algo. 0 = imposible. 1 = seguro. 0,5 = tan probable como su contrario. Se escribe P(A).

Distribución de probabilidad

Una lista de todos los resultados posibles con su probabilidad, que suma exactamente 1. Un dado justo tiene la distribución {1:⅙, 2:⅙, …, 6:⅙}. Un modelo de lenguaje tiene la distribución {"casa":0,003, "perro":0,001, …} sobre los 256.000 tokens de su vocabulario.

Condición de normalización
Σx ∈ V p(x) = 1
El símbolo Σ (sigma) significa "suma de todos". Se lee: "la suma de las probabilidades de todos los tokens x del vocabulario V vale 1". Si te encuentras una lista de números que no suma 1, no es una distribución de probabilidad.

Probabilidad condicionada

La probabilidad de algo dado que ya sabemos otra cosa. Se escribe con una barra vertical: P(A | B), "probabilidad de A dado B".

Ejemplo de calle

La probabilidad de que llueva hoy es, pongamos, 0,2. Pero la probabilidad de que llueva dado que el cielo está negro y hay viento del oeste es 0,9. Es el mismo suceso; lo que ha cambiado es lo que sabes. Un modelo de lenguaje es exactamente eso: P(siguiente token | todo lo escrito hasta ahora). La barra vertical es el corazón de la notación del artículo.

Muestrear

Sacar un resultado al azar respetando las probabilidades. Si "pan" tiene 0,4 y "coche" tiene 0,1, muestrear mil veces debería darte unos 400 panes y unos 100 coches. Muestrear no es elegir el más probable: es tirar el dado. Elegir siempre el máximo se llama greedy decoding y produce texto plano y repetitivo (Holtzman et al., 2020 → ref. 34).

Cómo se muestrea en la práctica

El método de la ruleta: colocas las probabilidades una detrás de otra en el intervalo [0,1], generas un número uniforme u entre 0 y 1, y ves en qué tramo cae.

Laboratorio 02ruleta de muestreo

Cada tirada suelta un número uniforme entre 0 y 1 y mira en qué tramo cae. Tira muchas veces y observa cómo las frecuencias observadas convergen a las probabilidades teóricas: eso es la ley de los grandes números.

pan
queso
aceite
vino
pan teórico0,450
observadoSin datos
queso teórico0,250
observadoSin datos
aceite teórico0,180
observadoSin datos
vino teórico0,120
observadoSin datos
Tiradas: 0

Con 10 tiradas los porcentajes bailan muchísimo. Con 10.000 se pegan a los teóricos. Esta convergencia es literalmente el mecanismo con el que funciona la detección de la marca de agua: acumular tiradas hasta que el azar deje de ser una explicación creíble.

Esperanza (o valor esperado o media)

Valor esperado de una variable aleatoria X
E[X] = Σx x · P(X = x)
Cada resultado posible multiplicado por su probabilidad, todo sumado. Es el promedio a largo plazo. Ojo a una trampa clásica: la esperanza puede ser un valor imposible. La esperanza de un dado es 3,5, y ningún dado saca 3,5.

Caso que usaremos sin parar: si X vale 1 con probabilidad ½ y 0 con probabilidad ½ (una moneda), entonces E[X] = 1·½ + 0·½ = 0,5. Esa es la línea base contra la que se compara todo texto sospechoso.

Independencia

Dos sucesos son independientes si saber uno no te dice nada del otro. Formalmente P(A y B) = P(A)·P(B). Dos lanzamientos de moneda son independientes; la moneda no tiene memoria. Esta propiedad es la que permitirá multiplicar cuartos y mitades en la demostración del capítulo 14.

Varianza y desviación típica

Dispersión
Var(X) = E[(X − E[X])²]   ·   σ = √Var(X)
Cuánto se separan típicamente los resultados de su media. Para una moneda con valores 0/1: Var = ¼ y σ = 0,5. Retén ese 0,5: aparecerá en la fórmula de detección.
NúcleoCapítulo 04

Azar falso: hashes, semillas y funciones pseudoaleatorias

Este capítulo es el que más gente se salta y el que más falta hace. Toda la marca de agua descansa sobre una idea contraintuitiva: necesitamos algo que sea aleatorio para el atacante y perfectamente predecible para nosotros, a la vez.

El problema

El generador tiene el modelo delante y decide los tokens. El detector aparece meses después, solo con un texto pegado en un formulario. Para verificar la marca, el detector necesita reconstruir exactamente las mismas "tiradas de moneda" que usó el generador. No puede pedirle el registro a nadie: tiene que recalcularlas.

La solución: función hash

Una función que convierte cualquier entrada en un número de tamaño fijo, con tres propiedades:

  1. Determinista. La misma entrada produce siempre exactamente la misma salida. Hoy, mañana y en otro ordenador.
  2. Efecto avalancha. Cambia un solo carácter de la entrada y la salida cambia por completo, sin ningún parecido con la anterior.
  3. Unidireccional en la práctica. De la salida no puedes reconstruir la entrada mejor que probando a lo bruto.
Ejemplo de calle

Una trituradora de papel mágica. Si metes el mismo folio, sale exactamente el mismo confeti, trocito por trocito. Si cambias una coma, sale un confeti completamente distinto. Y del confeti nadie reconstruye el folio. Lo importante: dos personas con el mismo folio y la misma trituradora obtienen el mismo confeti sin hablar entre ellas. Eso es lo que permite que generador y detector se pongan de acuerdo sin comunicarse.

Laboratorio 03efecto avalancha

Escribe algo y mira el hash. Cambia una sola letra, o un espacio. La salida no se parece en nada, pero vuelve a escribir el texto original y reaparece idéntica.

entrada: "la marca de agua" (16 caracteres)
hash decimal: 3507496424
hash hexadecimal: 0xD11025E8
binario: 1101000100010000
0010010111101000
normalizado a [0,1]: 0,816653 → g-value Bernoulli = 1

Este hash de demostración es FNV-1a de 32 bits. Los reales usados en criptografía son de 256 bits y mucho más robustos, pero la propiedad que nos interesa, determinismo más efecto avalancha, es idéntica.

Pseudoaleatoriedad

Un ordenador no puede generar azar de verdad; es una máquina determinista. Lo que hace es partir de una semilla (un número inicial) y aplicar una fórmula que produce una secuencia que parece aleatoria. Misma semilla, misma secuencia. Siempre.

Ejemplo de calle

Minecraft. Metes la semilla 4785623 y te genera un mundo con una montaña concreta al norte y un lago con forma de riñón. Metes la misma semilla en el ordenador de tu amigo, en otro país, y sale exactamente el mismo mundo. El mundo parece caótico y natural, pero está completamente determinado por ese número.

Función pseudoaleatoria (PRF): el concepto criptográfico

Es la formalización de esa idea, y viene de Goldreich, Goldwasser y Micali (1986 → ref. 49). Una familia de funciones {h(·, k)} indexada por una clave k es pseudoaleatoria si un adversario que no conoce k no puede distinguirla de una función elegida de verdad al azar, ni siquiera pudiendo hacerle muchísimas preguntas.

El artículo lo exige explícitamente en dos sitios: para el generador de semillas y para el cálculo de los g-values. Y añade la condición de que aleatorizar la clave aleatorice la salida:

Condición de aleatorización de la clave
para todo x<t :   Pk ~ Unif(R) [ fr(x<t, k) ] = Unif(R)
Se lee: "si eliges la clave uniformemente al azar, la semilla resultante también está distribuida uniformemente, sea cual sea el texto". Traducción práctica: sin la clave, un atacante no tiene absolutamente ninguna pista sobre qué tokens están favorecidos en cada paso. La marca es indistinguible del ruido.

Muestreo por transformada inversa

Última pieza técnica de este capítulo, y hace falta para entender la Definición 4 del artículo. Es el truco universal para convertir un número uniforme en una muestra de cualquier distribución.

  1. Tienes u, uniforme entre 0 y 1 (eso te lo da el hash normalizado).
  2. Tienes F, la función de distribución acumulada de lo que quieres: F(x) = P(X ≤ x).
  3. Devuelves F⁻¹(u), la inversa.

Para Bernoulli(0,5) esto se reduce a algo trivial: si u < 0,5 → 0; si no → 1. Para Uniforme[0,1], F⁻¹ es la identidad y el número se queda tal cual. El método general es de Devroye (1986 → ref. 50).

Ejemplo de calle

Es la ruleta del laboratorio 02, al revés. Tienes un número entre 0 y 1 y quieres saber en qué casilla cae. La función acumulada es el mapa de dónde empieza y acaba cada casilla.

NúcleoCapítulo 05

Entropía: la moneda con la que se paga la marca

Este concepto decide qué textos se pueden marcar y cuáles no. Viene de Claude Shannon (1948 → ref. 51), el artículo que fundó la teoría de la información.

También en el facsímil: puedes ver cómo la entropía cambia al tocar la temperatura y el muestreo en F03, capítulo 04, y cómo una puntuación incierta se transforma en una decisión en F07, capítulo 05: calibración e incertidumbre.

La intuición antes que la fórmula

La entropía mide cuánta sorpresa hay en una distribución. O, equivalentemente, cuánta información aporta conocer el resultado.

  • Una moneda con dos caras iguales: sabes el resultado de antemano. Sorpresa = 0. Entropía = 0.
  • Una moneda justa: no tienes ni idea. Máxima sorpresa para dos opciones. Entropía = 1 bit.
  • Un dado justo: aún más incertidumbre. Entropía ≈ 2,58 bits.
  • Una moneda trucada que sale cara el 99 % de las veces: casi nunca te sorprende. Entropía ≈ 0,08 bits.
Entropía de Shannon
H(p) = − Σx p(x) · log2 p(x)
Desglose pieza a pieza:
· log₂ p(x) es "cuántos bits de información aporta este resultado". Como p(x) ≤ 1, el logaritmo es negativo, de ahí el signo menos delante de todo.
· p(x) · log₂ p(x) pondera esa información por lo frecuente que es el resultado.
· La Σ lo suma todo.

Qué es un logaritmo, por si acaso: log₂(8) = 3 porque 2³ = 8. Es "¿a qué exponente hay que elevar 2 para obtener este número?". Y un bit es la información de una respuesta sí/no equiprobable.

El resultado que importa

Para un vocabulario de n opciones, la entropía es máxima cuando todas son igual de probables, y vale exactamente log₂(n). Es mínima (cero) cuando una opción tiene toda la probabilidad.

Laboratorio 04calculadora de entropía

Compara dos pasos de generación. En el contexto abierto hay varias continuaciones plausibles; en el factual casi toda la probabilidad cae sobre una. Después mueve los controles y observa cómo cambia el presupuesto disponible para marcar.

1 · ContextoPara confirmar el diagnóstico necesitamos una…
2 · Distribución didáctica pLM
prueba0,280
revisión0,250
consulta0,240
imagen0,230
0,280
0,250
0,240
0,230
Entropía
H = 2,000 bits (máximo 2,000)
Distribución casi uniforme. Máxima libertad: la marca de agua tiene todo el presupuesto que necesita.

Estas probabilidades son una simulación docente, no una medición de Gemma. Cada etiqueta representa el texto visible de un token en un vocabulario de juguete. En producción se trabajarían los identificadores y probabilidades del tokenizador real.

La frase que resume el artículo entero

Una marca de agua generativa no inserta una etiqueta visible ni caracteres ajenos al texto. Introduce una señal estadística al aprovechar parte de la aleatoriedad que ya tenía el muestreo. Si el modelo conserva cerca de 2 bits de entropía en un paso, existen varias continuaciones plausibles entre las que repartir esa señal. Si la entropía se acerca a 0, casi todas las muestras producen el mismo token y ese paso aporta muy poca evidencia. Además, la detección necesita acumular muchos pasos: una respuesta factual de una palabra no permite decidir nada por sí sola, mientras que un texto largo y diverso puede reunir suficiente señal para un contraste estadístico.

Perplejidad: la entropía disfrazada

Perplejidad
PPL = 2H   o equivalentemente   PPL = exp( −(1/T) Σt ln p(xt|x<t) )
Es la exponencial de la entropía cruzada media por token. Se interpreta como "entre cuántas opciones equiprobables está dudando efectivamente el modelo". Perplejidad 1 = certeza absoluta. Perplejidad 50 = el modelo está tan perdido como si eligiera al azar entre 50 opciones.

El concepto viene del reconocimiento de voz (Jelinek et al., 1977 → ref. 52). En el artículo se usa como medida de daño: si una marca de agua sube la perplejidad, está metiendo palabras que no encajan, o sea, está estropeando el texto.
Ejemplo de calle

La perplejidad es la cara que pones leyendo. "Fui al súper a comprar pan" → cara neutra. "Fui al súper a comprar termodinámica" → levantas una ceja. Un texto con marca de agua bien hecha no debería hacerte levantar la ceja ni una sola vez.

NúcleoCapítulo 06

Estadística para decidir: ¿esto es casualidad o no?

El detector de SynthID-Text no es un clasificador de inteligencia artificial. Es un contraste de hipótesis clásico, del siglo XX. Vamos a montarlo desde cero.

También en el facsímil: matriz de confusión, sensibilidad, falsos positivos, umbrales y coste del error se trabajan en F07, capítulo 02: métricas clásicas; la elección y calibración del umbral continúa en F07, capítulo 05.

La pregunta

Alguien te trae un texto. Cuentas cuántos tokens tienen g = 1. Salen 3.180 de 6.000, o sea un 53 %. ¿Es eso raro? Si el texto no tuviera marca, esperarías el 50 %. Pero el azar fluctúa. ¿Cuándo dejas de creer al azar?

Las dos hipótesis

  • H₀ (hipótesis nula): el texto no está marcado. Cada g-value es una moneda justa.
  • H₁ (hipótesis alternativa): el texto está marcado. Las monedas están sesgadas hacia el 1.

La estrategia es siempre la misma: se supone H₀ cierta y se calcula lo improbable que sería ver lo que hemos visto. Si sale absurdamente improbable, se rechaza H₀. Nunca se "demuestra" H₁; solo se descarta el azar. Este marco es de Neyman y Pearson (1933 → ref. 53).

Ley de los grandes números y teorema central del límite

Dos teoremas que hacen posible todo esto:

  • Ley de los grandes números: al promediar muchas muestras independientes, la media observada converge a la media real. Ya lo viste en el laboratorio 02.
  • Teorema central del límite: además, la media de muchas variables independientes se distribuye aproximadamente como una campana de Gauss, sea cual sea la forma original. Por eso podemos calcular probabilidades exactas sobre la media aunque cada g-value individual sea un simple 0/1.
Error típico de la media
SE = σ / √n
Cuánto se mueve típicamente la media muestral alrededor de la media real. La clave es el √n del denominador: para reducir el error a la mitad, hace falta cuatro veces más datos. Para monedas 0/1 tenemos σ = 0,5, así que SE = 0,5/√n.

Con n = 6.000: SE = 0,5/77,46 ≈ 0,00645. Es decir, si el texto no está marcado, la proporción observada debería quedarse casi siempre entre 0,48 y 0,52.
Estadístico z
z = ( media observada − media bajo H₀ ) / SE
Cuántos errores típicos te has alejado de lo esperado. Con media observada 0,53: z = (0,53 − 0,50)/0,00645 ≈ 4,65. Un z de 4,65 corresponde a una probabilidad del orden de 10⁻⁶: uno entre un millón. En ese punto, "ha sido casualidad" deja de ser una explicación admisible.
Laboratorio 05¿moneda trucada?

Una moneda con sesgo ajustable. Lánzala y observa cuándo el juez estadístico se atreve a acusarla. Con pocas tiradas, un sesgo grande pasa desapercibido; con muchas, un sesgo mínimo es indefendible.

0,53
Sin datos todavía. Lanza la moneda.
Evidencia acumulada

Sustituye "cara" por "token con g = 1" y tienes, literalmente, el detector de SynthID-Text. La única diferencia es que el artículo usa una función de puntuación bayesiana en lugar de este contraste frecuentista, porque rinde algo mejor.

Los cuatro casos: TPR, FPR y compañía

El texto SÍ está marcadoEl texto NO está marcado
AcusoVerdadero positivo (VP)Falso positivo (FP), acusar a un inocente
No acusoFalso negativo (FN), se me escapaVerdadero negativo (VN)
Las dos tasas
TPR = VP / (VP + FN)   ·   FPR = FP / (FP + VN)
TPR (sensibilidad, "recall"): de todos los textos marcados, qué fracción pillo. FPR: de todos los textos honestos, qué fracción acuso injustamente. Mover el umbral siempre sube una y baja la otra: no hay forma de mejorar las dos a la vez sin cambiar el método. La curva que dibuja este compromiso se llama curva ROC (Fawcett, 2006 → ref. 54).

El artículo reporta siempre TPR @ FPR = 1 %: fija el daño colateral tolerable primero (acusar como mucho a 1 de cada 100 textos humanos) y luego mide cuántos culpables se pillan con esa restricción. Es la forma honesta de reportar un detector, y es exactamente lo que no hacen los "detectores de IA" comerciales.

Frecuentista contra bayesiano

EnfoqueQué respondeVentajaEn el artículo
Frecuentista"Si el texto no estuviera marcado, ¿qué probabilidad habría de ver esto?" → p-valorGarantía teórica sobre la tasa de falsos positivos, sin necesidad de datos previosFunciones de puntuación 1–3
Bayesiano"Dado lo que veo, ¿qué probabilidad hay de que esté marcado?" → probabilidad posteriorRinde mejor, porque aprende de ejemplos reales de textos marcados y no marcadosFunción de puntuación 4, la que usan por defecto
Ejemplo de calle

Frecuentista: "si este señor fuera inocente, sería rarísimo que sus huellas estuvieran ahí". Bayesiano: "dadas las huellas, y sabiendo cómo suelen ser estos casos, hay un 97 % de probabilidad de que sea culpable". La segunda es más útil, pero exige haber visto muchos casos antes.

Parte II de V

El problema

Por qué alguien invierte años de trabajo de un equipo de veinticuatro personas en marcar texto, y por qué las alternativas obvias no valen.

BásicoCapítulo 07

El texto sintético dejó de notarse

El artículo abre con tres estudios que dicen lo mismo desde ángulos distintos: las personas ya no distinguimos texto artificial de texto humano.

  • Köbis y Mossink (2021 → ref. 1): los participantes no supieron separar poesía generada por IA de poesía de Maya Angelou.
  • Clark et al. (2021 → ref. 2): los evaluadores humanos de texto generado rinden apenas por encima del azar, y su rendimiento no mejora sin entrenamiento específico.
  • Jakesch, Hancock y Naaman (2023 → ref. 3): el más interesante. No es que fallemos al azar: fallamos sistemáticamente, porque usamos heurísticas equivocadas. Creemos que lo humano es lo que tiene erratas, primera persona y expresiones espontáneas. Los modelos producen eso sin esfuerzo, así que nuestras propias reglas nos traicionan.
Ejemplo de calle

Los billetes falsos. Mientras las falsificaciones eran malas, bastaba con mirarlas al trasluz y usar el sentido común. Cuando se volvieron indistinguibles al tacto y a la vista, hubo que meter marcas de agua, hilos de seguridad y tintas que solo se ven bajo luz ultravioleta. Fíjate en el cambio de enfoque: se dejó de intentar detectar lo falso y se pasó a certificar lo legítimo. SynthID-Text hace exactamente eso.

El problema técnico que casi nadie menciona: la pescadilla que se muerde la cola

No es solo el fraude académico ni la desinformación. Es que internet es el material de entrenamiento de la próxima generación de modelos. Si el texto sintético inunda la web sin etiquetar, los modelos futuros se entrenan con su propia salida.

  • Colapso del modelo (Shumailov et al., Nature 2024 → ref. 8). Entrenar recursivamente con datos generados hace que el modelo degenere: primero pierde las colas de la distribución (los casos raros, las minorías, lo excepcional) y acaba convergiendo a una versión empobrecida y homogénea de la realidad. Curiosidad: Shumailov es también coautor del artículo que estamos estudiando.
  • Modelos autofágicos (Alemohammad et al., ICLR 2024 → ref. 9). Bautizan el fenómeno como MAD, Model Autophagy Disorder: los sistemas generativos que se autoconsumen "se vuelven locos", y sin datos frescos reales la calidad o la diversidad se degradan inevitablemente.
  • Bucles de realimentación (Taori y Hashimoto, 2023 → ref. 10; Wyllie, Shumailov y Papernot, FAccT 2024 → ref. 11). Los sesgos del conjunto original se amplifican en cada vuelta, incluidos los sesgos de equidad hacia grupos concretos.
Ejemplo de calle

Una fotocopiadora que fotocopia sus propias fotocopias. La primera copia está bien. La número cincuenta es una mancha gris. Ahora imagina que la fotocopiadora es internet y las copias son textos. Poder marcar cuáles son copias permite al menos no volver a meterlas en la bandeja.

El objetivo del trabajo no es cazar tramposos. Es que el ecosistema de información siga siendo distinguible de sí mismo.
NúcleoCapítulo 08

Tres familias de soluciones, y por qué eligen la tercera

Familia A: recuperación

Guardar todo lo generado en una base de datos y buscar el texto sospechoso dentro. Krishna et al. (NeurIPS 2023 → ref. 12) demostraron que es, de hecho, la defensa más robusta frente a la paráfrasis, porque busca por similitud semántica y no por marcas frágiles.

  • Ventaja: resiste ediciones. Si el texto se parece lo suficiente, se encuentra.
  • Problema 1: escala y coordinación absurdas. Miles de millones de respuestas diarias, indexadas para siempre.
  • Problema 2: desastre de privacidad. Obliga a almacenar y consultar todas las conversaciones de todos los usuarios. El artículo lo señala explícitamente.
Ejemplo de calle

El portero que apunta en una libreta el nombre de todo el que entra en la discoteca. Funciona, pero necesitas una libreta infinita y estás fichando a todo el mundo, incluido el que solo entró a pedir un vaso de agua.

Familia B: detección a posteriori (post hoc)

No tocar nada durante la generación; analizar el texto después. Dos escuelas:

  1. Estadística de caja blanca. GLTR (Gehrmann, Strobelt y Rush, 2019 → ref. 55) fue pionero: coloreaba cada palabra según su rango de probabilidad en un modelo de referencia, porque el texto de máquina se queda en las opciones más probables y el humano sorprende más a menudo. DetectGPT (Mitchell et al., ICML 2023 → ref. 13) refinó la idea con la curvatura de la probabilidad: el texto generado tiende a estar en un máximo local de la función de log-probabilidad, así que si lo perturbas ligeramente, la probabilidad cae más de lo que caería en texto humano.
  2. Clasificadores entrenados. Ghostbuster (Verma et al., NAACL 2024 → ref. 14) y Binoculars (Hans et al., ICML 2024 → ref. 15), que compara la perplejidad medida por dos modelos distintos para normalizar la dificultad intrínseca del texto. Antes, Grover (Zellers et al., NeurIPS 2019 → ref. 56) ya había mostrado que el mejor detector de un generador suele ser el propio generador.
Los cuatro problemas
  • Coste: normalmente requieren pasar el texto por uno o varios modelos.
  • Fragilidad fuera de dominio: Elkhatat, Elsaid y Almeer (2023 → ref. 16) evaluaron herramientas comerciales y encontraron un rendimiento muy inconsistente.
  • Injusticia estructural: Liang et al. (Patterns 2023 → ref. 17) demostraron que estos detectores acusan sistemáticamente a personas que escriben en inglés como segunda lengua. Su prosa es más regular y menos "sorprendente", que es justo la señal que el detector interpreta como artificial.
  • Caducidad: dependen de que existan diferencias entre texto humano y de máquina. Esa diferencia se estrecha con cada generación de modelos. Sadasivan et al. (2023 → ref. 57) argumentaron incluso que, en el límite, la detección fiable es imposible.
Punto para debatir en clase

Por esto los "detectores de IA" que se usan en institutos y universidades son peligrosos: no fallan al azar, fallan más contra quien peor puede defenderse. Un sistema de marca de agua tiene, en cambio, una tasa de falsos positivos que puede fijarse matemáticamente por adelantado, y esa garantía no depende del estilo de quien escribe.

Familia C: marca de agua

La idea viene del mundo de la imagen y el audio, donde lleva décadas funcionando (Cox et al., 2007 → ref. 58; para texto, la revisión de Kamaruddin et al., 2018 → ref. 18). En texto se divide en tres subtipos:

SubtipoCómo funcionaPega
Por ediciónSe genera el texto normal y se retoca después: sustituir sinónimos, insertar caracteres Unicode invisibles.Deja artefactos. Un corrector, un copiar-pegar o un cambio de codificación la borran.
Por datos
(Gu et al., 2022 → ref. 19)
Se entrena el modelo con frases-gatillo, como una puerta trasera.Solo marca cuando aparece el gatillo. Sirve para detectar uso no autorizado de un modelo, no para atribuir texto en general.
Generativala del artículoSe modifica el procedimiento de muestreo mientras el texto nace.Requiere que quien opera el modelo coopere.
La marca generativa es la única que permite controlar con precisión el impacto en la calidad y que además es baratísima de verificar: el detector no necesita el modelo. Y eso importa, porque el modelo suele ser propietario y pesar cientos de gigabytes.
Honestidad del artículo Los autores escriben explícitamente que ningún método de detección es infalible y que las tres familias son complementarias, no excluyentes. Un sistema serio usaría marca de agua para su propio modelo, detección post hoc para lo demás y estándares de procedencia de contenido para el resto.
Parte III de V

El método

Once capítulos desmontando SynthID-Text pieza a pieza. A partir de aquí todo lo anterior se usa.

NúcleoCapítulo 09

Cómo escribe realmente un modelo, paso a paso

Ya sabemos qué es un token y qué es una distribución. Ahora el bucle completo.

La distribución del modelo
pLM( · | x<t )   con   x<t = x1, x2, …, xt−1
Se lee: "la probabilidad de cada posible token siguiente, dado el texto ya escrito". El punto central "·" es un hueco: significa "para cualquier token que pongas aquí". El resultado no es una palabra, es una lista de cientos de miles de números que suman 1. Después se muestrea de esa lista, se añade el token al final y se repite hasta llegar a la longitud máxima o hasta que salga el token especial de fin, EOS.
Laboratorio 06generación autorregresiva

Cada paso: calcular la distribución, tirar la ruleta, añadir el token, repetir. Fíjate en cómo cambian por completo las barras en cuanto cambia la última palabra.

(vacío, el modelo aún no ha escrito nada)

p_LM( · | texto actual )

El0,34
Hoy0,22
Un0,18
Cuando0,14
La0,12

Las probabilidades están inventadas para la demo, pero la mecánica es exactamente esta. Un modelo real hace esto entre 20 y 100 veces por segundo.

Los mandos de decodificación

MandoQué haceFórmulaEjemplo de calle
temperatura τDivide los logits antes de normalizar. τ<1 apunta la distribución; τ>1 la aplana.pi ∝ exp(zi/τ)El mando de un altavoz. Bajo = todos cantan lo mismo. Alto = cada uno va por libre.
top-kSe queda con los k tokens más probables y tira el resto. El artículo usa k = 100.V′ = argtop-k(p)En el bar solo puedes pedir de entre los 100 platos más vendidos.
top-pSe queda con los más probables hasta acumular masa p. También llamado nucleus sampling.min V′ : ΣV′ p ≥ pLos platos que se llevan el 90 % de los pedidos, sean 3 o sean 40.

El origen del top-k está en Fan, Lewis y Dauphin (2018 → ref. 36) y el del top-p en Holtzman et al. (2020 → ref. 34), cuyo título,"el curioso caso de la degeneración del texto neuronal", describe el problema que resuelven: elegir siempre lo más probable produce texto que se repite en bucle.

El término "temperatura" viene de la física estadística, concretamente de las máquinas de Boltzmann (Ackley, Hinton y Sejnowski, 1985 → ref. 35): la distribución de probabilidad tiene la misma forma matemática que la distribución de estados de un sistema físico a temperatura T.

Definición 1 del artículo · leerla bien importa

Los autores definen p_LM como la distribución de la que el método de decodificación muestrea, con todos esos retoques ya aplicados. Es decir: SynthID-Text no compite con top-k ni con la temperatura, se coloca al final de la cadena. Es compatible con top-k para todo k ≥ 2, con top-p para todo p ∈ (0,1] y con toda temperatura τ > 0. Lo único que necesita es que quede algo de aleatoriedad. Con entropía exactamente cero, no hay marca posible.

NúcleoCapítulo 10

La arquitectura: exactamente tres piezas

Esta descomposición viene del marco de Piet et al. (2023 → ref. 21), que analizaron y compararon sistemáticamente los esquemas de marca de agua existentes. Es la figura 1 del artículo y el esqueleto de todo lo que sigue.

#PiezaEntradaSalidaSe usa
1Generador de semillaTexto reciente + clave secreta kSemilla rtAl generar y al detectar
2Algoritmo de muestreoDistribución pLM + semilla rtToken elegido xtSolo al generar
3Función de puntuaciónTexto cualquiera + clave kUn número: la evidenciaSolo al detectar

El truco central de toda la familia es este: el algoritmo de muestreo introduce una correlación entre la semilla rt y el token elegido xt. Esa correlación es la firma. La función de puntuación, más tarde, mide cuánta correlación hay.

Ejemplo de calle

Un sorteo de mesas en una boda. La semilla es "qué día es hoy". El algoritmo de muestreo es "hoy, con el número que ha salido, cuando haya empate elijo al que lleve corbata azul". La función de puntuación es el fotógrafo que, meses después, cuenta cuántos invitados llevan corbata azul en las fotos: si hay muchísimos más de lo normal, sabe que el reparto se manipuló. Y lo sabe sin conocer a los invitados: solo con las fotos y la regla.

Las piezas 1 y 3 son adaptaciones de trabajos previos. Lo nuevo de este artículo es la pieza 2: Tournament sampling.
NúcleoCapítulo 11

Pieza 1: el generador de semilla

Necesitamos, en cada paso, un número aleatorio, con dos condiciones que parecen contradictorias: que parezca aleatorio a quien no tenga la clave, y que sea reproducible exactamente por un detector que solo verá el texto final. El capítulo 04 ya nos dio la herramienta: una función hash con clave.

Generador de semilla · ventana deslizante
rt := fr(x<t, k) = h( xt−H, …, xt−1, k )
h es la función hash. H es el tamaño de la ventana: cuántos tokens hacia atrás se miran. En todos los experimentos del artículo, H = 4. k es la clave de marcado, un entero secreto. El resultado vive en el espacio de enteros de nsec bits, donde nsec es el parámetro de seguridad.

Definición 2 del artículo: el espacio de semillas es R = {0,1}nsec y la distribución de semillas es la uniforme sobre ese espacio.

Este generador no lo inventan ellos: viene de Aaronson y Kirchner (2022 → ref. 22) y de Kirchenbauer et al. (ICML 2023 → ref. 23), los dos trabajos fundacionales de las marcas generativas modernas.

Laboratorio 07ventana deslizante H = 4

La ventana avanza un token cada vez. Los cuatro tokens de dentro, más la clave, producen la semilla del paso siguiente. Cambia la clave y verás que todas las semillas cambian de golpe.

Lamarcadeaguaviajaescondidadentrodelpropiotextogeneradoporelmodelo

ficha rellena = dentro de la ventana · borde grueso = token que se va a generar

ventana (H=4) = [ La, marca, de, agua ]
r5 = h( La, marca, de, agua, k=42 ) = 64802
→ esta semilla decide la lotería que elegirá "viaja"
42

Observación crucial: el detector puede recalcular estas mismas semillas leyendo el texto final, porque los cuatro tokens de la ventana están ahí escritos. No necesita el modelo. Solo texto, clave y regla.

Por qué H = 4 y no 1 ni 50

H pequeñoH grande
Las ventanas se repiten muchísimo dentro del mismo texto ("de la", "que el"), lo que trae el problema del capítulo 15.La marca se vuelve frágil: editar un solo token estropea las H semillas siguientes.
Más ventanas repetidas = más pasos sin marcar = menos evidencia.Más robusto frente a repeticiones, pero un atacante rompe la marca con muy pocas ediciones.

Con H = 4, un token corrompido arruina como mucho cuatro ventanas. Kirchenbauer et al. estudiaron este compromiso con más detalle en un trabajo posterior sobre la fiabilidad de las marcas (2024 → ref. 59).

Nota de diseño: el artículo insiste en que Tournament sampling se puede emparejar con cualquier generador de semillas. La ventana deslizante es una elección, no una parte inseparable del método. Kuditipudi et al. (ref. 24), por ejemplo, usan una secuencia de claves fija y una puntuación basada en distancia de edición, que es más robusta frente a ediciones aunque más cara.

NúcleoCapítulo 12

Los g-values: la lotería secreta del vocabulario

Ya tenemos una semilla por paso. Ahora hay que convertirla en algo que puntúe tokens. En una frase: dada la semilla del paso, cada token del vocabulario recibe un número secreto. En la configuración principal del artículo ese número es un 0 o un 1.

Ejemplo de calle

Cada mañana a las 8:00, alguien lanza una moneda por cada palabra del diccionario y apunta el resultado. "Perro": cara. "Bicicleta": cruz. "Mañana": cara. La lista cambia cada día, es decir, con cada semilla, pero si sabes qué día es y tienes la libreta, puedes reconstruirla exactamente. Si no la tienes, para ti son monedas al aire.

Definición 4 · g-value de capa ℓ para el token x
g(x, r) := Fg−1 ( h(x, ℓ, r) / 2nsec )
Se lee de dentro hacia fuera, en tres pasos:
1. Hashear. h(x, ℓ, r) mezcla tres cosas: el token, el número de capa y la semilla. Que ℓ entre en el hash es lo que garantiza que cada capa del torneo use una lotería distinta e independiente.
2. Normalizar. Se divide entre 2nsec, el máximo posible. El resultado cae en [0,1] y, para nsec grande, se comporta como un uniforme.
3. Transformar. Fg−1 es el muestreo por transformada inversa del capítulo 04, que convierte ese uniforme en una muestra de la distribución elegida.
Definición 3 · la distribución de g-values Puede ser cualquier distribución de una variable real: es un hiperparámetro del método. El artículo usa principalmente Bernoulli(0,5),0 o 1 con igual probabilidad, y también explora Uniforme[0,1]. Con Bernoulli(0,5), la mitad del vocabulario tiene g=1 y la otra mitad g=0, y ese reparto cambia por completo en cada paso y en cada capa.
Laboratorio 08la lotería

Vocabulario de juguete de 12 tokens. Cambia la semilla o la capa y observa cómo se redistribuyen por completo. Las fichas rellenas son "la lista de palabras favorecidas" de este paso.

casa 1perro 1sol 0correr 0azul 0pero 1tiempo 0ciudad 0comer 1verde 1nunca 0libro 1
Distribución Bernoulli(0,5): 6 de 12 tokens tienen g = 1 en esta capa con esta semilla.
7
1

Con Bernoulli(0,5) esperas ~50 % de fichas rellenas. Ese 50 % es la línea base de la detección. Si en un texto largo aparecen muchas más de las que tocan por azar, hay marca.

¿Por qué Bernoulli y no algo más fino?

Porque con Bernoulli(0,5) hay muchísimos empates, y los empates son exactamente lo que hace falta para que la marca no distorsione el texto: cuando dos candidatos empatan, el desempate es uniforme y el modelo recupera su libertad. Con Uniforme[0,1] casi nunca hay empates, la marca es más agresiva por capa, pero el equilibrio se rompe antes. Es un ejemplo bonito de cómo una elección aparentemente burda, una moneda en vez de un número real, resulta ser la correcta.

NúcleoCapítulo 13

Pieza 2: Tournament sampling

Aquí está la aportación original. Todo lo anterior existía. Lo nuevo es cómo usar los g-values para elegir el token.

En vez de sacar un token de la chistera, sacamos varios y organizamos un torneo de eliminatorias donde gana el que puntúa más alto en la lotería secreta.

Versión mínima: un solo partido

  1. Saco N tokens muestreando de pLM. Son muestras independientes, así que pueden salir repetidos. El artículo lo repite en cada línea: "may contain repeats".
  2. Miro sus g-values con la semilla de este paso.
  3. Gana el que tenga el g-value más alto. Si empatan, elijo uniformemente entre los empatados.
Algoritmo 1 · Tournament sampling de una capa
Entrada: distribución p_LM(·|x<t), semilla r_t, número de muestras N ≥ 2,
         función g con distribución f_g (ver Definición 4)
1: Extraer Y = [y₁, y₂, …, y_N], N muestras independientes de p_LM(·|x<t)
   (puede contener repetidos)
2: Y* := [ y ∈ Y : g₁(y, r_t) = max_{y'∈Y} g₁(y', r_t) ]
   (los que empatan en lo más alto; puede contener repetidos)
3: Muestrear x_t ~ Uniforme(Y*)
4: devolver x_t
Ejemplo de calle

Vas a pedir en el bar y no te decides. Le dices al camarero: "tráeme dos tapas al azar de la carta". Llegan bravas y croquetas. Miras tu libreta secreta de hoy: bravas = cara, croquetas = cruz. Te quedas con las bravas. Nadie que te vea comiendo bravas sospecha nada: las bravas estaban en la carta y podías haberlas pedido igual. Pero si te vigilan 200 días y siempre acabas comiendo lo que ese día era "cara", ahí ya no cuela.

Versión completa: el torneo de m capas

  • Se muestrean Nm candidatos. Con N = 2 y m = 3, son 8.
  • Se emparejan y se juega la capa 1 con g1. Quedan 4.
  • Se reemparejan y se juega la capa 2 con g2. Quedan 2.
  • Se juega la capa 3 con g3. Queda 1: ese es xt.

Cada capa usa una lotería distinta. Esto es esencial: el ganador final tiende a puntuar alto en g₁, en g₂ y en g₃ a la vez. En lugar de una prueba estadística por token, tienes m pruebas por token. Ahí está la ganancia sobre los métodos anteriores.

Algoritmo 2 · Tournament sampling multicapa
Entrada: p_LM(·|x<t), semilla r_t, N ≥ 2, función g, número de capas m ≥ 1
1: Extraer N^m muestras independientes y⁰₀, y⁰₁, …, y⁰_{N^m−1} ~ p_LM(·|x<t)
2: para ℓ = 1 hasta m hacer            ← recorre las capas
3:   para j = 0 hasta N^{m−ℓ} − 1 hacer    ← recorre los partidos de la capa
4:     Y := [ y^{ℓ−1}_{Nj}, y^{ℓ−1}_{Nj+1}, …, y^{ℓ−1}_{Nj+N−1} ]  ← los N contendientes
5:     Y* := [ y ∈ Y : g_ℓ(y, r_t) = max_{y'∈Y} g_ℓ(y', r_t) ]     ← los máximos
6:     Muestrear y^ℓ_j ~ Uniforme(Y*)                              ← desempate al azar
7:   fin para
8: fin para
9: devolver x_t := y^m₀
Leyendo la notación con calma
  • yj = ganador del partido j de la capa . Superíndice = capa, subíndice = partido.
  • La capa 0 son los candidatos iniciales: Nm de ellos.
  • Tras la capa ℓ quedan Nm−ℓ supervivientes. Cuando ℓ = m queda N⁰ = 1.
  • La línea 4 agrupa de N en N consecutivamente. Como los candidatos salieron en orden aleatorio, agrupar por orden equivale a emparejar al azar.
  • Las líneas 5 y 6 son el partido: coger los máximos y desempatar uniformemente. Esas dos líneas son todo el algoritmo.

Dónde está la semántica y dónde está la marca

El torneo no recibe una bolsa de letras sin significado. Primero, el LLM transforma el contexto en una distribución pLM: las continuaciones coherentes reciben más probabilidad y las incompatibles reciben menos. Esa distribución es donde se manifiestan el conocimiento contextual y las preferencias aprendidas por el modelo.

Después entra SynthID-Text. Sus funciones g no intentan comprender los candidatos y no necesitan hacerlo: asignan puntuaciones pseudoaleatorias a sus identificadores. El torneo solo puede elegir entre muestras que ya proceden de pLM. Por eso conviene mirar siempre las dos capas por separado: el modelo decide qué resulta plausible; la marca introduce una correlación secreta dentro de ese margen de elección.

Laboratorio 09el torneo, ronda a ronda

Cambia de escenario y sigue el mismo paso de generación desde el contexto hasta el ganador. En ambos casos usamos m = 3 capas, N = 2 contendientes y 2³ = 8 muestras iniciales. Lo que cambia es la libertad que deja la distribución del modelo.

1 · ContextoPara confirmar el diagnóstico necesitamos una…
2 · Modelo, pLM
3 · SynthID

La semilla asigna un g-value a cada muestra. No juzga su significado: busca una correlación que el detector pueda reconstruir.

Este laboratorio usa un vocabulario didáctico en el que cada etiqueta visible equivale a un token. Un tokenizador real operaría con IDs y podría dividir alguna de estas palabras en varias piezas. Los porcentajes son escenarios simulados para comparar entropías, no logits medidos de Gemma.

¿No es carísimo muestrear 2³⁰ candidatos?

2³⁰ son más de mil millones. Por fuerza bruta sería imposible. No se hace así: el artículo describe una implementación vectorizada (sección E del suplementario) que calcula el resultado del torneo con operaciones matriciales sobre la distribución, sin materializar nunca los candidatos. El análisis de complejidad está en la sección F. En la práctica el sobrecoste es del 0,57 % de la latencia, como veremos en el capítulo 20.

AvanzadoCapítulo 14

La demostración: por qué esto no estropea el texto

Esta es la pregunta que hunde a casi todos los esquemas de marca de agua: si estás sesgando la elección de palabras, ¿no estás empeorando el texto?

El artículo hace primero un trabajo de limpieza conceptual, porque "no distorsionador" significaba tres cosas distintas según el autor: Kuditipudi et al. (ref. 24), Christ, Gunn y Zamir (ref. 25) y Hu et al. (ref. 27) usaban definiciones incompatibles. Aquí se ordenan de la más débil a la más fuerte:

NivelQué garantizaAnalogía
De un token
(la más débil)
Promediando sobre la semilla rt, la distribución del token de salida es exactamente igual a pLM.Cada tirada individual del dado es justa.
De una secuenciaLa probabilidad de generar un texto completo concreto es la misma con marca y sin ella.Una partida entera es justa.
De K secuencias
(la más fuerte)
Lo mismo para K respuestas consecutivas tomadas en conjunto, incluidas sus correlaciones.Una noche entera de partidas es justa.

El teorema, con la cuenta hecha a mano

Queremos la probabilidad de que el token a gane un partido, promediando sobre todas las loterías posibles. Llamemos p(a) a su probabilidad en el modelo. Los g-values son Bernoulli(0,5) independientes entre tokens distintos.

Paso 1 · descomponer en casos
P(gana a) = P(y₁=a, y₂=a) + 2 · Σb≠a P(y₁=a, y₂=b) · P(a le gana a b)
O salen los dos iguales, y entonces gana a seguro, o sale a contra otro token b. El factor 2 es porque a puede salir en primera o en segunda posición. Como las dos muestras son independientes, P(y₁=a, y₂=a) = p(a)² y P(y₁=a, y₂=b) = p(a)·p(b).
Paso 2 · ¿con qué probabilidad gana a a un rival b?
g(a)=1, g(b)=0 → prob ¼ → gana a → aporta ¼
g(a)=g(b) → prob ½ → empate, desempate justo → aporta ½ · ½ = ¼
g(a)=0, g(b)=1 → prob ¼ → pierde a → aporta 0

Total: P(a le gana a b) = ¼ + ¼ = ½
Este es el corazón de la demostración. Como las monedas son justas e independientes y los empates se resuelven al azar, ningún token tiene ventaja a priori. La ventaja existe solo una vez conocida la semilla, y eso es justo lo que detectaremos después.
Paso 3 · sustituir y simplificar
P(gana a) = p(a)² + 2 · p(a) · (1 − p(a)) · ½
= p(a)² + p(a) − p(a)²
= p(a)
La distribución de salida es idéntica a la del modelo. Ni un decimal de diferencia, y no depende de p(a): vale para cualquier distribución. El texto no empeora porque, promediando sobre las claves, no ha cambiado absolutamente nada.
Ejemplo de calle

Un camarero reparte las propinas del turno lanzando una moneda entre dos compañeros. A final de mes, cada uno se ha llevado exactamente lo que le tocaba. Pero si grabas los lanzamientos y sabes qué moneda usó cada día, puedes demostrar que el reparto no fue aleatorio puro: siguió un patrón. Se conservan las cuentas y aun así queda huella. Esa es toda la magia.

Con N > 2 la magia se rompe, a propósito

Con 3 o más contendientes el equilibrio se pierde: un token con g=1 gana con solo aparecer una vez entre los N, mientras que uno con g=0 necesita que todos los contendientes sean g=0. Eso favorece a los g altos y desplaza la distribución. Con un vocabulario de dos tokens, la cuenta exacta es:

Probabilidad de salida con N contendientes (vocabulario de 2)
P(sale a) = ½·p + ¼·(1 − (1−p)N) + ¼·pN
Los tres términos son los tres casos de lotería: empate (½ de probabilidad, la salida sigue a p), g(a)=1 y g(b)=0 (¼, gana a si aparece al menos una vez), y el simétrico (¼, gana a solo si aparecen todos a).

Con N = 2 esto se simplifica exactamente a p: ½p + ¼(2p−p²) + ¼p² = p. Con N ≥ 3 deja de valer p, y ahí nace la distorsión.
Laboratorio 10simulador de distorsión

Vocabulario didáctico de dos tokens, "prueba" y "revisión", para el contexto "necesitamos una…". Mueve la probabilidad de "prueba" y el número de contendientes. La barra rayada es la distribución del modelo; la sólida, la salida tras el torneo.

0,80
2
modelo0,800
torneo0,800

Probabilidad de emitir "prueba": barra rayada = modelo · barra sólida = torneo

DIFERENCIA = 0,000000 → NO DISTORSIONADOR.
La distribución de salida es exactamente la del modelo, para cualquier valor de p.

Con N = 2 las dos barras coinciden siempre, sea cual sea p. Con N = 3 ya se separan. Ese hueco es, literalmente, el precio en calidad que pagas por una marca más fuerte.

La configuración de producción SynthID-Text se configura como no distorsionador de una secuencia. Preserva la calidad y da buena detectabilidad, a cambio de reducir algo la diversidad entre respuestas distintas: si haces la misma pregunta varias veces, las respuestas se parecen un poco más que sin marca. Los niveles más fuertes reducirían la detectabilidad y aumentarían el coste; los más débiles reducirían calidad y diversidad. Es un compromiso elegido a conciencia, discutido en la sección G.3 del suplementario.
NúcleoCapítulo 15

Enmascarado de contexto repetido: el remedio contra los bucles

Hay un problema que aparece en cuanto aplicas el esquema tal cual. Si la ventana de H tokens se repite dentro del mismo texto, y se repite constantemente con secuencias como "de la", "y el" o "en el", entonces la semilla es la misma, luego la lotería es la misma, luego el mismo token vuelve a estar favorecido.

El sesgo se acumula en la misma dirección una y otra vez. El resultado documentado por Kuditipudi et al. (ref. 24) y Christ et al. (ref. 25) son bucles repetitivos: el modelo se engancha y repite la misma frase.

Ejemplo de calle

Una ruleta en la que, cada vez que la bola cae en el mismo sitio, el crupier vuelve a favorecer ese mismo número. A la tercera vuelta la mesa entera está sobre ese número y la partida se ha roto.

La solución, tomada de Hu et al. (ICLR 2024 → ref. 27), es llevar un historial de ventanas ya usadas. Si la ventana actual ya está en el historial, se apaga la marca en ese paso y se muestrea del modelo con normalidad. Se pierde una pizca de evidencia, pero se elimina el sesgo acumulado.

Algoritmo 3 · generación con enmascarado de contexto repetido de K secuencias
Entrada: LLM p_LM, tamaño de ventana H, hash h, clave k,
         algoritmo de muestreo S, entero K ≥ 1, flujo de prompts (x¹, x², …)
1: para i ≥ 1 hacer                        ← una respuesta por prompt
2:   C_i := ∅                               ← historial de ventanas de esta respuesta
3:   t := n, donde n = longitud del prompt xⁱ
4:   mientras xⁱ_t ≠ EOS hacer
5:     t := t + 1
6:     si (xⁱ_{t−H}, …, xⁱ_{t−1}) ∈ C_i ∪ C_{i−1} ∪ … ∪ C_{i−K+1} entonces
7:       Muestrear xⁱ_t ~ p_LM(·|xⁱ_<t)      ← SIN marca: ventana ya usada
8:     si no
9:       r_t := h(xⁱ_{t−H}, …, xⁱ_{t−1}, k)
10:      Muestrear xⁱ_t := S(p_LM(·|xⁱ_<t), r_t)    ← CON marca (el torneo)
11:      C_i := C_i ∪ {(xⁱ_{t−H}, …, xⁱ_{t−1})}     ← anotar la ventana
12:    fin si
13:  fin mientras
14:  devolver respuesta yⁱ := xⁱ_{n+1:t}
15: fin para
Valor de KAlcance del historialGarantíaCoste
K = 1Solo la respuesta actualNo-distorsión de una secuenciaMínimo. Es lo que usan
K > 1Las K−1 respuestas anteriores tambiénNo-distorsión de K secuenciasHay que guardar historial entre respuestas
K = ∞Historial eternoMáximaCada ventana se usa una sola vez en la historia. La detectabilidad se desploma
El compromiso, dicho claro

Cuanto más fuerte es la garantía de no-distorsión, menos evidencia de marca puedes recoger. No hay comida gratis: el mismo mecanismo que protege la calidad es el que borra huella. El artículo elige K = 1 como punto dulce.

NúcleoCapítulo 16

Pieza 3: la detección

Llega un texto. No sabemos de dónde viene. Solo tenemos el texto tokenizado, la clave k y la regla del generador de semillas. No tenemos el modelo, y no lo necesitamos.

  1. Tokenizar: x1, …, xT.
  2. Para cada posición t, recalcular rt = h(xt−H,…,xt−1, k).
  3. Para cada posición y cada capa, calcular g(xt, rt).
  4. Promediar todo.
  5. Comparar con un umbral.
Ecuación (1) del artículo · puntuación media
Score(x) = ( 1 / (m·T) ) · Σt=1T Σℓ=1m g( xt, rt )
T = número de tokens. m = número de capas. El doble sumatorio recorre todas las posiciones y todas las capas: en total m·T valores. Se divide por m·T para obtener una media. Con Bernoulli(0,5), esta media tiende a 0,5 en texto no marcado y sube por encima en texto marcado.

El cálculo que conviene tener en la cabeza

Caso ideal: una capa, máxima entropía, dos tokens equiprobables. ¿Cuánto vale el g-value esperado del ganador?

Lotería (gA, gB)Prob.Qué pasag del ganador
(1, 1)¼Gane quien gane, g = 11,000
(0, 0)¼Gane quien gane, g = 00,000
(1, 0)¼A gana si aparece: 1 − 0,5² = 0,750,750
(0, 1)¼Simétrico0,750
Media ponderada0,625

Una capa sube el g medio de 0,50 a 0,625 en el mejor de los casos. Parece poquísimo, y lo es por token. Pero se acumula, y el capítulo 06 ya nos dio la herramienta para saber cuánto.

Detección como contraste de hipótesis
SE = 0,5 / √(m·T)   ·   z = (Score − 0,5) / SE

m = 30, T = 200 → n = 6.000 → SE ≈ 0,00645
Score = 0,53 → z ≈ 4,65 → p ≈ 10−6
Si el texto no estuviera marcado, ver algo así sería un accidente de uno entre un millón. Cálculo simplificado con fines didácticos: en el sistema real los g-values de un mismo token están algo correlacionados entre capas, y el artículo usa una función de puntuación bayesiana en lugar de esta aproximación gaussiana.
Ejemplo de calle

Lanzas una moneda 10 veces y salen 7 caras: te encoges de hombros. La lanzas 6.000 veces y salen 3.180 caras en vez de 3.000: la moneda está trucada y no hay discusión. La marca de agua no es un mensaje escondido en el texto; es una moneda ligeramente trucada repetida miles de veces.

Laboratorio 11el detector

Dos campanas: la de texto humano (rayada, centrada en 0,50) y la de texto marcado (sólida, desplazada). Alarga el texto y mira cómo se estrechan y se separan. Mueve el umbral para ver el compromiso entre falsos positivos y verdaderos positivos.

200
30
0,512
n = m·T = 30×200 = 6000 g-values · SE = 0,5/√n = 0,00645
media sin marca = 0,500 · con marca ≈ 0,537
TPR = 100.0 % (culpables detectados) · FPR = 3.15 % (inocentes acusados)

Con T pequeño las campanas se solapan y no puedes separar nada. Al crecer T, ambas se estrechan como 1/√T y se separan limpiamente. Esa es toda la historia de la detectabilidad.

Las cuatro funciones de puntuación

  1. Media, la ecuación (1). Simple, sin parámetros.
  2. Media ponderada, repondera la evidencia de cada capa, porque las capas profundas del torneo aportan menos que las primeras.
  3. Versiones frecuentistas, contraste de hipótesis sobre esas medias, devolviendo un p-valor con garantía teórica sobre la tasa de falsos positivos.
  4. Bayesiana parametrizada, la que usan por defecto. Aprende de datos (textos marcados y no marcados) y calcula la probabilidad posterior de que el texto esté marcado. Es la que mejor rinde.
Predicción selectiva: el derecho a no mojarse Cuando los errores salen caros, el sistema puede abstenerse. Se configura para que, en los casos en los que sí decide, alcance TPR = 95 % y FPR = 1 %; cuando la puntuación cae en la zona ambigua, responde "no lo sé" en lugar de arriesgar. La tasa de abstención baja con textos más largos y temperaturas más altas. Es un diseño mucho más sensato que un veredicto binario forzado, y es exactamente lo que un detector usado en contextos disciplinarios debería hacer.
AvanzadoCapítulo 17

Los mandos: cuántas capas y por qué no infinitas

Añadir capas suena a ganancia gratis: cada capa aporta un g-value más por token, o sea más evidencia y menos varianza en la ecuación (1). Pero hay techo, y el artículo lo dice con una frase que conviene subrayar:

Cada capa del torneo consume parte de la entropía disponible para embeber la marca, y la fuerza de la marca correspondiente a una capa disminuye conforme se avanza en el torneo.

La capa 1 elige entre 8 candidatos genuinamente distintos. La capa 3 elige entre 2 supervivientes ya filtrados, que se parecen más entre sí. Queda menos variedad que explotar. Rendimientos decrecientes. La sección H del suplementario da el análisis teórico de la fuerza de una capa en función de un cierto tipo de entropía; análisis similares existen para otros esquemas (refs. 23, 24, 25).

ParámetroValor por defectoQué controla
m (capas)30Evidencia por token. Rendimientos decrecientes
H (ventana)4Robustez frente a ediciones vs repetición de contexto
f_gBernoulli(0,5)Frecuencia de empates, y con ella la no-distorsión
N (contendientes)2No distorsionador (2) o distorsionador (>2)
K (enmascarado)1Alcance de la garantía de calidad
puntuaciónbayesianaCómo se convierte la evidencia en veredicto
El coste oculto: diversidad Tanto SynthID-Text como Gumbel reducen la diversidad entre respuestas, medida con Self-BLEU (Zhu et al., 2018 → ref. 60; basado en BLEU, Papineni et al., 2002 → ref. 61): cuanto más bajo, más diversas son las respuestas entre sí. Pregunta lo mismo diez veces y las diez respuestas se parecerán algo más que sin marca. La buena noticia: SynthID-Text ofrece un compromiso diversidad/detectabilidad mejor que Gumbel a las tres temperaturas probadas.
AvanzadoCapítulo 18

Los rivales, explicados de verdad

El artículo se compara con dos esquemas concretos. Para entender qué aporta Tournament sampling hay que entender contra qué compite. Este capítulo no está en el artículo con este detalle; lo reconstruimos a partir de las fuentes originales.

Rival 1: Soft Red List (Kirchenbauer et al., ICML 2023 → ref. 23)

El primer esquema moderno de marca generativa, y el más citado. La idea:

  1. Con la semilla del paso, se parte el vocabulario en dos: una lista verde con una fracción γ de los tokens (típicamente γ = 0,25 o 0,5) y una lista roja con el resto.
  2. Antes de muestrear, se suma una constante δ a los logits de todos los tokens verdes. Esto los hace más probables.
  3. Se muestrea normalmente de la distribución modificada.
Soft Red List · modificación de logits y detección
i ∝ exp( zi + δ · 1[ i ∈ verde ] )

z = ( |s|verde − γT ) / √( T γ (1−γ) )
Arriba, la generación: δ es la fuerza de la marca. Si δ = 0 no hay marca; si δ → ∞ se prohíben los tokens rojos por completo (la versión "dura").

Abajo, la detección: se cuentan los tokens verdes del texto, |s|verde. Bajo la hipótesis nula esperarías γT de ellos, con desviación típica √(Tγ(1−γ)), que es la varianza de una binomial. El estadístico z te dice a cuántas desviaciones típicas estás. Es exactamente el contraste del capítulo 06.
Ejemplo de calle

Cada día se sortea qué mitad de la carta del bar está "de oferta" y se le baja el precio un euro. Tú pides lo que te apetece, pero acabas pidiendo de la oferta más a menudo de lo normal. El problema salta a la vista: si la oferta del día no incluye lo que de verdad querías, acabas comiendo algo peor. Por eso es distorsionador.

Ventaja: simplicísimo y muy detectable. Problema: cambia la distribución siempre, así que degrada el texto. δ es un mando directo entre calidad y detección. Zhao et al. (ICLR 2024 → ref. 62) propusieron una variante con lista verde fija,Unigram-Watermark, con garantías demostrables de robustez frente a ediciones, a costa de ser más fácil de deducir por un atacante.

Rival 2: Gumbel sampling (Aaronson y Kirchner, 2022 → ref. 22)

Un enfoque radicalmente distinto y muy elegante. En vez de tocar las probabilidades, se cambia la forma de sortear. La semilla genera un número uniforme ri ∈ (0,1) para cada token del vocabulario, y luego:

Gumbel sampling · muestreo y detección
xt = argmaxi   ri 1/pi

Score = Σt log( 1 / (1 − rxt) )
La primera fórmula parece salida de la nada, pero tiene una propiedad extraordinaria: si los ri son uniformes independientes, el argmax de ri1/pi sigue exactamente la distribución p. Es una variante del truco de Gumbel-max, de ahí el nombre. Es decir: es no distorsionador por construcción, sin necesidad de demostración larga.

La detección explota que el token elegido tiende a tener un r alto. Sumar log(1/(1−r)) da un estadístico que sigue una distribución conocida bajo la hipótesis nula.
Ejemplo de calle

Una carrera en la que cada corredor lleva un lastre proporcional a lo improbable que es y, además, un dorsal con un número secreto del día. Gana el que mejor combina ambas cosas. La carrera es justa en el sentido de que cada corredor gana con la frecuencia que le tocaría, pero quien conoce los dorsales ve que los ganadores tienen números sospechosamente altos.

Ventaja: no distorsionador y barato. Desventaja frente a Tournament: extrae una sola señal por token. Tournament sampling extrae m señales por token porque juega m capas independientes, y por eso reduce la varianza del estadístico y detecta mejor con menos texto. Es exactamente ahí donde está la ganancia del artículo.

Soft Red ListGumbelTournament (SynthID)
Qué modificaLos logitsEl procedimiento de sorteoEl procedimiento de sorteo
DistorsiónSí, controlada por δNoConfigurable: N=2 no, N>2 sí
Señales por token11m (por defecto 30)
Latencia extra+0,28 %+0,26 %+0,57 %
ResultadoPeor compromiso calidad/detecciónPeor detección a igual longitudMejor en ambas categorías

Y un tercer camino: marcas indetectables

Christ, Gunn y Zamir (COLT 2024 → ref. 25) demostraron algo teóricamente precioso: es posible construir marcas de agua criptográficamente indetectables, es decir, tales que ningún adversario con poder computacional polinómico pueda distinguir el texto marcado del no marcado sin la clave. El precio es que necesitan más texto para detectar y son más difíciles de llevar a producción. Es el extremo teórico del espectro en el que SynthID-Text ocupa el punto práctico.

La configuración distorsionadora de SynthID-Text

No distorsionadorDistorsionador
ContendientesN = 2N > 2
CalidadIdéntica, con garantía matemáticaSe degrada de forma controlable
DetectabilidadBuenaMayor
Se compara conGumbel samplingSoft Red List
Uso típicoProducción, chatbots de consumoContextos donde detectar es crítico

Resultado reportado: en la categoría distorsionadora, SynthID-Text ofrece tasas de detección sustancialmente más altas para el mismo efecto sobre log(perplejidad).

AvanzadoCapítulo 19

Escalabilidad: casar la marca con el muestreo especulativo

Este capítulo convierte el artículo de "buena idea académica" en "sistema desplegado". En producción nadie genera texto con el bucle simple del capítulo 09. Se usa muestreo especulativo, y hasta este artículo nadie había investigado cómo combinarlo con una marca de agua.

También en el facsímil: el lugar del muestreo especulativo dentro de la inferencia moderna, junto con KV cache, batching y hardware, se explica en F03, capítulo 07: inferencia optimizada.

Qué es el muestreo especulativo

Descrito independientemente por Chen et al. (2023 → ref. 5) y Leviathan, Kalman y Matias (ICML 2023 → ref. 63):

  1. Un modelo borrador, pequeño y rápido, propone los siguientes 3 o 4 tokens de un tirón.
  2. El modelo objetivo, grande y lento, verifica esas propuestas todas a la vez en una sola pasada.
  3. Acepta el prefijo que coincide con lo que él habría hecho y rechaza a partir del primer desacuerdo, corrigiéndolo con una distribución residual cuidadosamente construida.

La clave: verificar cuatro tokens de golpe cuesta casi lo mismo que generar uno, porque el cuello de botella es mover los pesos del modelo desde la memoria, no la aritmética. Y, esto es esencial, el resultado es estadísticamente idéntico a haber usado solo el modelo grande. No es una aproximación.

Ejemplo de calle

Un becario redacta rápido cuatro párrafos y el jefe los revisa todos de una sentada, en vez de dictar palabra por palabra. Si el becario acierta, el jefe firma los cuatro. En cuanto encuentra uno que él no habría escrito, tacha desde ahí y lo reescribe. El documento final es exactamente el que habría escrito el jefe, pero se ha tardado un tercio.

Laboratorio 12muestreo especulativo

El borrador propone tres tokens. El objetivo verifica. Ficha rellena = aceptado; ficha tachada = rechazado y corregido con el torneo marcado.

Pulsa "Siguiente bloque": el modelo borrador propondrá 3 tokens de golpe.

El conflicto

¿Por qué chocan marca y muestreo especulativo? Porque el muestreo especulativo se apoya en una regla de aceptación construida para reproducir pLM exactamente. Si el modelo objetivo, además, tiene que aplicar un torneo sesgado por una semilla, la regla de aceptación deja de casar: o aceptas tokens que la marca no habría elegido (pierdes marca) o rechazas tokens buenos (pierdes velocidad).

AlgoritmoPreservaSacrificaCuándo usarlo
Especulativo marcado de alta detectabilidadLa detectabilidad, intactaPuede bajar la eficiencia y subir la latenciaCuando detectar importa más que ir rápido
Especulativo marcado rápidoLa eficiencia, intacta (si la marca es no distorsionadora a nivel de token)Puede bajar algo la detectabilidadProducción, donde la velocidad es requisito duro

Para compensar la pérdida del segundo proponen además una función de puntuación bayesiana aprendida específica para este caso, que recupera buena parte de la detectabilidad.

La garantía teórica

Emparejado con una marca no distorsionadora a nivel de token, el muestreo especulativo marcado rápido preserva la tasa de aceptación de forma demostrable: el número medio de tokens del borrador que el modelo grande acepta no cambia. Lo confirman con Gemma 7B-IT como objetivo y Gemma 2B-IT como borrador, con 3 tokens de anticipación. Y añaden que el resultado debería valer para cualquier marca no distorsionadora, no solo la suya.

Parte IV de V

La evidencia

Qué se midió, con cuántos datos y qué salió. Incluido el experimento que ningún grupo académico podría haber hecho.

BásicoCapítulo 20

Resultados, con las cifras exactas

También en el facsímil: para convertir estas cifras en una evaluación defendible, vuelve a F07, capítulo 01: qué decisión permite una eval, F07, capítulo 02: métricas y F07, capítulo 04: evaluación humana y evaluadores.

Montaje experimental

ElementoConfiguración
ModelosGemma 2B-IT y 7B-IT (ref. 28), Mistral 7B-IT v0.2 (ref. 29)
Decodificacióntop-k con k = 100; temperaturas 0,5 / 0,7 / 1,0
PromptsELI5 (ref. 30): preguntas que exigen respuestas explicativas de varias frases
Positivos (no distorsionador)2 conjuntos disjuntos de 10.000 prompts (test y desarrollo)
Positivos (distorsionador)1.500 prompts de test
NegativosRespuestas escritas por humanos a 10.000 preguntas de ELI5
Longitudes fijasSe filtran los textos más largos que el objetivo y se truncan (p. ej. exactamente 200 tokens)
Hardware4 TPU v5e (ref. 31)
MétricaTPR @ FPR = 1 %, calculada empíricamente
IntervalosBootstrap con 500 remuestreos, intervalos de confianza al 90 %

Nota metodológica: usar respuestas humanas de ELI5 como negativos es una elección exigente. Son textos del mismo dominio y registro que los generados, no textos cualesquiera. Un negativo fácil habría inflado los resultados.

Resultado 1: la calidad no se toca. Con 20 millones de testigos.

Este es el experimento que hace único al artículo, y que solo puede hacer quien opera un producto con cientos de millones de usuarios. Se enrutó una fracción aleatoria de consultas reales de Gemini a un modelo marcado y una cantidad equivalente a su versión sin marcar. Después se compararon los pulgares arriba y abajo.

MedidaResultadoInterpretación
Volumen analizado≈ 20.000.000 de respuestasMarcadas y no marcadas
Tasa de pulgar arriba+0,01 % (a favor del marcado)Estadísticamente insignificante
Tasa de pulgar abajo−0,02 % (a favor del marcado)Estadísticamente insignificante

Ambas diferencias caen holgadamente dentro de los intervalos de confianza del 95 %. Y fíjate en el detalle: el modelo marcado salió mínimamente mejor en las dos métricas. Eso es exactamente lo que esperas del ruido estadístico cuando no hay diferencia real. Si hubiera salido siempre a favor del no marcado, habría que sospechar.

Por qué esto importa metodológicamente Es un experimento A/B con asignación aleatoria sobre usuarios reales haciendo tareas reales, no un panel de evaluadores pagados juzgando ejemplos artificiales. Los autores afirman que es la primera investigación sistemática de marcas de agua dentro de un sistema de producción a gran escala. Con 20 millones de muestras, el poder estadístico es tan alto que incluso una degradación minúscula habría salido a la luz.
Evaluaciones adicionales de calidad
  • Test controlado con humanos: 3.000 preguntas de ELI5 con Gemma 7B-IT, comparando lado a lado cinco dimensiones: gramaticalidad y coherencia, relevancia, corrección, utilidad y calidad global. Sin diferencia significativa en ninguna, tanto en el análisis de tres vías con empates (test trinomial) como restringiendo a respuestas sin empate (bootstrap sobre el cociente de preferencias). Los datos y anotaciones se publicaron (ref. 7).
  • Automáticas: sin diferencia significativa en perplejidad ni en benchmarks estándar de capacidad.

Resultado 2: detecta mejor que la competencia

  • Frente a Gumbel: mejor detectabilidad a igual longitud de texto. La ventaja crece en entropía baja (temperaturas bajas, modelos grandes), el régimen difícil. Con entropía alta van parecidos.
  • Frente a Soft Red List: compromiso más favorable, con detección sustancialmente más alta para el mismo efecto sobre log(perplejidad).
  • Comparación limpia: todos los métodos usan el mismo generador de semillas (ventana, H = 4) y el mismo enmascarado de contexto. Lo único que cambia es el algoritmo de muestreo. Así se aísla la contribución real de Tournament sampling, en vez de comparar sistemas enteros con variables confundidas.
  • Multilingüe: rendimiento consistente entre idiomas, mientras que un detector post hoc se hunde en las lenguas para las que no fue entrenado. Ventaja estructural: la marca no depende del estilo del idioma, solo de los tokens.

Resultado 3: el coste computacional es despreciable

Configuración (Gemma 7B-IT sobre 4 TPU v5e)ms por tokenSobrecoste
Sin marca15,527N/D
Tournament sampling, 30 capas15,615+0,57 %
Gumbel samplingN/D+0,26 %
Soft Red ListN/D+0,28 %

Sí, Tournament sampling cuesta el doble que sus rivales. Pero el doble de "prácticamente nada" sigue siendo prácticamente nada: 88 microsegundos por token.

La complejidad de la marca no crece con el tamaño del modelo. Cuando el modelo se hace un orden de magnitud más caro, el peso relativo de la marca se reduce en ese mismo orden. Cuanto más grandes sean los modelos del futuro, más barato será marcarlos.
NúcleoCapítulo 21

Limitaciones y ataques

Una de las mejores cosas del artículo es lo explícita que es su sección de limitaciones. Ninguna de estas es un secreto: están todas escritas por los propios autores.

También en el facsímil: la defensa por capas, los límites de confianza y la validación de entradas y salidas se estudian en F09, capítulo 03: seguridad de aplicaciones LLM.

1. Requiere cooperación

Solo funciona si quien opera el servicio decide aplicarla. Para detectar texto de un actor que no marca hacen falta otros métodos. No es una solución general al problema de la detección: es una pieza de un sistema mayor.

2. Los modelos abiertos son un problema estructural

Si el modelo se puede descargar y ejecutar en tu portátil, no hay forma de imponer la marca: basta con borrar esas líneas del código de muestreo. Es un desafío de gobernanza, no técnico. Gu et al. (ICLR 2024 → ref. 64) exploraron si una marca puede destilarse dentro de los pesos del modelo para que sobreviva, con resultados prometedores pero parciales.

3. Los tres ataques

AtaqueEn qué consisteAnalogíaReferencia
Scrubbing
(borrado)
Editar el texto para eliminar la marca. La paráfrasis con otro modelo es lo más efectivo.Lavar el billete hasta que se vaya la tinta.33, 12
Stealing
(robo)
Sondear el modelo muchísimas veces para inferir qué tokens están favorecidos y reconstruir parte de la regla.Observar mil partidas hasta deducir cómo hace trampas el crupier.32
Spoofing
(suplantación)
Fabricar texto marcado sin usar el modelo, para que un texto humano parezca sintético. El más grave: permite incriminar.Falsificar la marca de agua para que un billete legítimo parezca falso.32

Jovanović, Staab y Vechev (ICML 2024 → ref. 32) mostraron que el robo de marca es viable con del orden de millones de tokens de consulta y un coste modesto, y que una vez robada la marca, el spoofing se vuelve barato. Es investigación en curso.

4. La paráfrasis debilita la marca

Es la vulnerabilidad más directa: si pides a otro modelo que reescriba el texto, la mayoría de ventanas de contexto cambian y las semillas dejan de coincidir. Los autores añaden un matiz importante: parafrasear suele cambiar el texto de forma significativa, así que el atacante paga un precio real, y ese precio crece si quiere conservar el contenido exacto.

Zhang et al. (ICML 2024 → ref. 33) fueron más lejos con un resultado teórico incómodo: bajo ciertas hipótesis, ninguna marca de agua fuerte puede ser robusta frente a un atacante con acceso a un modelo de calidad comparable. El título lo dice todo: "marcas de agua en la arena".

5. Entropía baja

Ya visto: respuestas cortas, factuales o muy restringidas son prácticamente indetectables. Nada lo arregla, porque no es un fallo del método sino un límite de la información.

Cómo enmarcar esto en una discusión de clase

SynthID-Text no responde a "¿escribió esto una IA?". Responde a algo mucho más acotado y mucho más honesto: "¿salió esto de este sistema concreto, que decidió marcarlo?". Es una herramienta de rendición de cuentas para quien despliega el modelo, no un detector universal de plagio. Confundir ambas cosas es el error más común al hablar de este trabajo, y el que produce las peores decisiones institucionales.

AvanzadoCapítulo 22

La marca identifica el texto, pero no protege lo que viaja oculto

Hasta aquí hemos estudiado una señal escondida dentro de las decisiones de muestreo del texto visible. En agosto de 2026, Panfilov et al. publicaron un resultado que obliga a mirar la otra mitad de una aplicación moderna: algunos proveedores devuelven al cliente bloques opacos que representan razonamiento anterior, y el cliente los reenvía en llamadas posteriores. Esos bloques no son SynthID, no son una marca de agua y no sirven para atribuir públicamente un texto. Son estado de conversación transportado por la API.

La conexión importa porque una organización puede hacer bien la procedencia del documento y, al mismo tiempo, publicar un registro peligroso. El texto que ve una persona puede estar marcado, revisado y anonimizado, mientras un campo ilegible del JSON conserva datos que nadie inspeccionó. Procedencia, confidencialidad e integridad son propiedades distintas. Ninguna sustituye a las otras.

También en el facsímil: la arquitectura completa, las fronteras de confianza y el tratamiento de trazas se desarrollan en F09, capítulo 03: seguridad de aplicaciones LLM. Este capítulo se concentra en entender el hallazgo de Panfilov et al. mediante una reconstrucción local segura.

Ejemplo de calle: la maleta y el billete

Lucía factura una maleta cerrada. Nadie puede abrirla durante el trayecto, pero la etiqueta solo dice "equipaje válido" y no "equipaje de Lucía, vuelo 402, asiento 18A". Si el sistema acepta esa maleta en otro vuelo, el candado sigue intacto y, aun así, la seguridad ha fallado. El problema no era romper el cierre: era que el cierre no estaba unido al pasajero y al trayecto correctos.

Dos canales que no debes confundir

Diferencia entre la salida visible marcada y el razonamiento opaco Una petición produce una respuesta visible, donde puede vivir SynthID, y un bloque opaco de estado. El registro puede limpiar el texto visible y conservar el bloque opaco. Si ese bloque se acepta fuera de su contexto, aparece una superficie de replay. UNA PETICIÓN, DOS ARTEFACTOS API del modelo Prompt + herramientas + historial CANAL VISIBLE Respuesta para Lucía Aquí puede vivir SynthID-Text: una señal estadística en los tokens. CANAL OPACO Sobre de razonamiento El cliente no puede leerlo, pero puede almacenarlo y reenviarlo. REGISTRO COMPARTIDO "Ya lo he limpiado" Texto visible: dato retirado Firma SynthID: puede persistir Bloque opaco: sigue incluido RIESGO NO INSPECCIONADO Replay fuera de contexto Otra sesión, otro usuario o un modelo más débil LECTURA CORRECTA Marcar el texto y proteger el estado oculto son controles distintos.
Figura didáctica basada en la arquitectura y el modelo de amenaza descritos por Panfilov et al. (2026, ref. 77). No representa el formato interno exacto de ningún proveedor.

Un bloque opaco es un campo que la aplicación conserva pero no interpreta. Puede contener un ciphertext, texto cifrado; un nonce, número usado una vez; un tag de autenticación, que detecta alteraciones; y metadatos como versión o identificador de clave. El conjunto suele describirse mediante AEAD, cifrado autenticado con datos asociados. AEAD intenta dar confidencialidad e integridad a la vez. Los datos asociados o AAD no se cifran, pero quedan autenticados: si cambian, la verificación falla.

El hallazgo del paper no consiste en romper AES. Los autores observaron que, durante sus pruebas de julio de 2026, determinados sobres eran compatibles entre sesiones, usuarios e incluso modelos de una misma familia. Al mover un bloque válido hacia un modelo compatible y menos protegido, pudieron provocar que el sistema reconstruyera el razonamiento. El fallo estaba en qué contexto aceptaba el sobre, no en una factorización mágica de la clave.

Propuesta del paper, apéndice A: encadenar el sobre a su contexto
τn+1 = H(user_id || session_id || H(τn || salt2) || salt1)
De quién es: es la construcción propuesta por Panfilov et al. (2026, ref. 77), no una identidad universal de criptografía. Qué expresa: el siguiente identificador autenticado depende del usuario, la sesión y el estado anterior. Si alguien cambia de usuario, salta un turno o trasplanta el bloque a otra conversación, la cadena deja de coincidir. Qué no resuelve: rotación de claves, revocación, migración de sesiones, almacenamiento, autorización y monitorización siguen necesitando diseño propio.
Experimento principal: la maleta opacaWeb Crypto + datos sintéticos

Vas a construir un sobre AES-GCM en este navegador, trasladarlo a otro contexto y decidir qué se puede publicar. El secreto sk_demo_CURSO_NO_REAL_7F3A es inventado y no funciona en ningún servicio. La práctica enseña el mecanismo defensivo; no reproduce el ataque contra APIs reales.

Comprobando Web Crypto
Cierra la maleta

Elige qué partes del contexto quedarán autenticadas como AAD. Empieza sin marcar nada para reproducir el diseño portable; después repite con más vínculos.

Origen
lucia · sesion-a · modelo-pro · turno-17
AAD
Todavía no creado
Nonce
Todavía no creado
Ciphertext
Todavía no creado
Cambia el billete

Mueve exactamente el mismo sobre. Si el dato que cambiaste no formaba parte del AAD, el cifrado puede seguir siendo íntegro aunque el contexto sea incorrecto.

Origenlucia / sesion-a / modelo-pro / turno-17
Destinolucia / sesion-a / modelo-pro / turno-17
Aún no hay pruebaCrea el sobre del paso 1 y elige un destino.
Publica el registro de Lucía

Una limpieza tradicional solo ve texto plano. Decide qué retiras y comprueba si el artefacto público sigue cargando un contenedor que tú no puedes auditar.

Texto que revisa LucíaIncidencia resuelta. Credencial sk_demo_CURSO_NO_REAL_7F3A revocada.
Campo opaco del JSON[Primero crea el sobre]
PendienteEjecuta la auditoría antes de compartir el registro.
Cambia la unidad de análisis

Los tres porcentajes siguientes proceden del mismo estudio, pero responden a preguntas distintas. Elige el denominador antes de escribir el titular.

0,3 %
1.028 / 315.320 bloques

Mide bloques individuales con al menos una fuga. Parece pequeño porque una sola sesión puede contener muchos bloques.

Qué midió realmente el estudio

Los autores reunieron 6.708 trayectorias públicas de GitHub y Hugging Face y reconstruyeron 315.320 bloques. Detectaron al menos un artefacto de privacidad en 1.028 bloques, aproximadamente el 0,3 %. Al agrupar por trayectoria, 328 de 6.708 sesiones tenían al menos una fuga, el 4,9 %. En las sesiones genuinas, 64 de 704 artefactos recuperados aparecían solo en el razonamiento y no en el historial visible. Esa última cifra no significa que el modelo inventara necesariamente todos los datos: el propio paper separa como posibilidades la memoria del modelo y la permanencia de valores que el usuario había retirado del texto visible.

El conjunto no es una muestra aleatoria de todas las aplicaciones de IA. Son trazas que alguien decidió publicar y que todavía contenían bloques compatibles. Por eso los porcentajes describen ese corpus observado, no la prevalencia mundial. Aun así, el hallazgo operativo es fuerte: pedir al agente que "limpie" una conversación puede empeorar el problema, porque el modelo vuelve a leer la historia y repite en su razonamiento los valores que intenta retirar.

ProcedenciaSynthID-Text

Ayuda a detectar que el texto visible salió de un sistema cooperante. No cifra ni sanea registros.

Publicación seguraHigiene de trazas

Retira secretos, PII y campos opacos antes de subir sesiones, datasets o logs a un repositorio.

AntirreplayAEAD ligado al contexto

Autentica usuario, sesión, modelo e historial para que un sobre válido no sea aceptable en cualquier destino.

Qué debes llevarte a un proyecto real

No guardes una respuesta completa de proveedor como si fuera texto inocuo. Define un esquema de persistencia que permita explícitamente los campos necesarios y descarte el resto. Antes de publicar un log, elimina bloques de razonamiento, firmas, cabeceras de autorización, resultados de herramientas y adjuntos temporales. Si necesitas continuidad, conserva un identificador del lado servidor o un sobre con contexto autenticado, caducidad, versión de clave y política de revocación. Y separa en tus requisitos qué control prueba procedencia, cuál protege confidencialidad y cuál evita replays.

Corte temporal imprescindible

El preprint se publicó el 10 de agosto de 2026 y describe pruebas realizadas en julio. Tras la divulgación responsable, los proveedores introdujeron mitigaciones. Los propios autores indican que, en agosto de 2026, el ataque principal ya no era reproducible con el procedimiento publicado. Este capítulo enseña la clase de fallo arquitectónico y sus defensas; no afirma que una API actual siga siendo vulnerable.

Leer el preprint completo: Panfilov et al., "Stealing Reasoning Traces from Proprietary LLM APIs" (arXiv:2608.09867v1) ↗

BásicoCapítulo 23

La normativa: marcar el texto ya es obligatorio en Europa

Este trabajo no aparece en el vacío. Cuando se publicó, en octubre de 2024, la Unión Europea acababa de aprobar la primera ley del mundo que obliga a marcar el contenido generado por máquinas. Dos años después, esa obligación ya está en vigor, y SynthID-Text es exactamente el tipo de tecnología que la ley presupone que existe.

También en el facsímil: el AI Act, ISO 42001, el reparto de responsabilidades y la construcción de evidencias se desarrollan en F09, capítulo 04: cumplimiento y auditoría.

Qué es el Reglamento de IA

El Reglamento (UE) 2024/1689, conocido como AI Act, entró en vigor el 1 de agosto de 2024. Es un reglamento, no una directiva: se aplica directamente en los 27 Estados miembros sin necesidad de trasposición nacional. Y su alcance es extraterritorial: afecta a cualquier empresa, esté donde esté, que ponga sus sistemas o su contenido delante de usuarios en la UE.

Sus obligaciones se escalonan en el tiempo. La que nos interesa es el artículo 50, la capa de transparencia, y es importante entender que no es una norma de riesgo alto: no depende de para qué uses la IA. Se aplica prácticamente a cualquier sistema que hable con personas o genere contenido.

Las cuatro obligaciones del artículo 50

ApartadoSituaciónQuién respondeQué exige
50(1)Sistemas que interactúan directamente con personas (chatbots, agentes, avatares)ProveedorDiseñarlos de forma que la persona sepa que está hablando con una máquina
50(2)Sistemas que generan audio, imagen, vídeo o TEXTO sintéticoProveedorQue las salidas estén marcadas en formato legible por máquina y sean detectables como generadas o manipuladas artificialmente
50(3)Reconocimiento de emociones y categorización biométricaResponsable del despliegueInformar a las personas expuestas
50(4)Ultrafalsificaciones (deepfakes) y textos publicados sobre asuntos de interés públicoResponsable del despliegueRevelar que el contenido es artificial, con excepciones limitadas para obra editorial revisada por humanos y obra artística

El apartado 50(2) es el que describe, sin nombrarla, una marca de agua. Fíjate en la formulación: no dice "pon una etiqueta visible". Dice marcado en formato legible por máquina y detectable. Una etiqueta visible se borra con un copiar y pegar; lo que la norma pide es algo que sobreviva dentro del propio contenido y que una herramienta automática pueda verificar. Es literalmente la definición de la pieza 3 del capítulo 10.

Los cuatro adjetivos que lo complican todo

El Reglamento exige que las soluciones de marcado sean eficaces, interoperables, robustas y fiables. Y aquí está el problema técnico de fondo: ninguna tecnología disponible cumple hoy los cuatro requisitos por sí sola. Los metadatos firmados criptográficamente son verificables y fiables, pero desaparecen con una captura de pantalla o una recarga en una red social. Las marcas de agua imperceptibles como SynthID sobreviven mucho mejor al procesado, pero no son universalmente robustas. El capítulo 21 explica por qué: basta parafrasear. Por eso la respuesta oficial no es "usad esta técnica", sino "usad varias en capas".

El Código de buenas prácticas

Para convertir un artículo de ley en algo que un ingeniero pueda implementar, la Oficina Europea de IA elaboró en un proceso multiactor el Código de buenas prácticas sobre transparencia del contenido generado por IA, publicado en junio de 2026. Es un instrumento voluntario: firmarlo no es obligatorio, pero es la vía reconocida para demostrar que cumples. A finales de julio de 2026 lo habían firmado en torno a 190 empresas y organizaciones.

El Código propone un enfoque en capas con tres mecanismos:

  1. Metadatos firmados digitalmente. Registrar en los metadatos si el contenido es generado o manipulado por IA, firmado y con sello de tiempo de forma segura y a prueba de manipulaciones. Aunque el Código no lo nombra, la única tecnología que cumple esa descripción es C2PA (Coalition for Content Provenance and Authenticity), el estándar de "credenciales de contenido".
  2. Marca de agua imperceptible. Es decir: esto. Lo que hemos estudiado durante veintiún capítulos.
  3. Huella digital o registro (opcional). Una base de datos consultable, que es la familia A del capítulo 08, con sus mismos problemas de escala y privacidad.

Las directrices finales de la Comisión Europea sobre el artículo 50 se publicaron el 20 de julio de 2026, y son el instrumento que las autoridades nacionales de vigilancia del mercado usarán como referencia principal al evaluar el cumplimiento. La Comisión ha publicado además un juego de iconos para etiquetar contenido generado o modificado por IA, de uso voluntario.

El calendario

1 ago 2024Entra en vigor el Reglamento (UE) 2024/1689.
23 oct 2024Se publica SynthID-Text en Nature. El artículo que estamos estudiando aparece justo entre la aprobación de la ley y su aplicación.
10 jun 2026Se publica el Código de buenas prácticas sobre transparencia del contenido generado por IA.
20 jul 2026La Comisión publica las directrices finales sobre el artículo 50.
2 ago 2026El artículo 50 es aplicable. Las autoridades nacionales pueden exigir su cumplimiento desde esta fecha. El contenido generado antes no hay que marcarlo retroactivamente: cuenta la fecha de generación.
2 dic 2026Fin del periodo transitorio acordado en el paquete Digital Omnibus: los sistemas generativos que ya estaban en el mercado antes del 2 de agosto tienen hasta esta fecha para cumplir la obligación de marcado del 50(2).
2 feb 2027Los proveedores deben disponer de una solución de interoperabilidad para la detección de marcas de agua.
Las sanciones El incumplimiento del artículo 50 puede acarrear multas de hasta 15 millones de euros o el 3 % del volumen de negocio anual mundial, la cifra que sea mayor (artículo 99 del Reglamento). Para pymes y empresas emergentes se aplica la cifra menor. Y hay un detalle procesal importante: la carga de probar que se informó a tiempo recae en la organización, no en el regulador.

Por qué esto cambia la lectura del artículo

Vuelve al capítulo 21, a la lista de limitaciones. Los propios autores escriben que la marca generativa requiere que quien opera el modelo coopere, y que con modelos abiertos no hay forma de imponerla. Esa era, en 2024, una debilidad puramente técnica que dependía de la buena voluntad de cada empresa.

Dos años después, esa cooperación ha dejado de ser voluntaria para quien opera un servicio en Europa. La ley no resuelve el problema de los modelos que cualquiera puede descargar y ejecutar en su portátil, que sigue abierto, pero sí resuelve el de los grandes proveedores comerciales, que es de donde sale la inmensa mayoría del texto sintético del mundo.

La normativa europea convierte una decisión de ingeniería en una obligación jurídica, y con ello transforma el sentido del artículo: SynthID-Text pasa de ser una demostración de que la marca de agua se puede desplegar a escala, a ser la prueba de que se debe poder.

Otros proveedores

El movimiento no es exclusivo de Google. Diversos proveedores de modelos han firmado el Código de buenas prácticas como proveedores de modelos y de sistemas generativos, y han empezado a incorporar marcas imperceptibles en el texto junto con metadatos C2PA firmados en los archivos que generan, en algunos casos aplicándolo a escala mundial y no solo en la UE. Es el efecto Bruselas de manual: una norma regional acaba fijando el estándar global porque a las empresas les sale más barato aplicarlo en todas partes que mantener dos versiones del producto.

Advertencia de vigencia Este capítulo describe la situación a mediados de agosto de 2026. La regulación de la IA se está moviendo muy deprisa: fechas, periodos transitorios y detalles del Código han cambiado varias veces durante 2026 (el paquete Digital Omnibus retrasó otras partes del Reglamento pero dejó el artículo 50 en su fecha original). Antes de citar cualquier plazo en un trabajo, comprueba las fuentes primarias: el texto consolidado del Reglamento y la página de la Comisión sobre transparencia del contenido generado por IA, ambas en la bibliografía.

El debate académico previo

Nada de esto surgió de repente. Solaiman et al. (2019 → ref. 65), en el contexto del lanzamiento escalonado de GPT-2, ya discutían estrategias de publicación y detección. Bender, Gebru et al. (FAccT 2021 → ref. 66) advirtieron sobre los riesgos de los modelos de lenguaje a gran escala. Las revisiones de Wu et al. (ref. 4) y Liu et al. (ref. 67) recogen el estado del arte. El propio artículo se presenta en esos términos: no como la solución al problema, sino como "un hito práctico para un despliegue responsable, transparente y con rendición de cuentas".

Parte V de V

Material de repaso

Resumen ejecutable, glosario, bibliografía anotada de 77 referencias.

BásicoCapítulo 24

La idea entera, en doce líneas

  1. Un modelo escribe token a token, sorteando de una distribución de probabilidad.
  2. Esa distribución tiene entropía: incertidumbre que el modelo iba a desperdiciar de todos modos.
  3. Antes de sortear, se genera una semilla secreta con un hash de los últimos 4 tokens y una clave.
  4. Esa semilla asigna a cada token del vocabulario un 0 o un 1 secreto: su g-value. Una lotería distinta por capa.
  5. En vez de sortear un token, se sortean 2³⁰ candidatos y se juega un torneo de 30 rondas eliminatorias.
  6. En cada ronda gana el token con el g-value más alto de esa capa; los empates se resuelven al azar.
  7. Como cada partido tiene exactamente 2 contendientes, la distribución de salida es matemáticamente idéntica a la original.
  8. Pero el ganador tiende a tener g-values altos. Miles de tokens después, esa tendencia es un pico estadístico enorme.
  9. El detector recalcula las semillas leyendo el texto, sin necesitar el modelo, promedia los g-values y hace un contraste de hipótesis.
  10. Si la ventana de contexto ya se usó, se apaga la marca en ese paso para evitar bucles.
  11. Todo esto cuesta 88 microsegundos por token y sobrevive al muestreo especulativo.
  12. Ha pasado por 20 millones de conversaciones reales sin que nadie notara nada.
Lo verdaderamente elegante no es el torneo. Es que el precio de la marca se paga en una moneda que al lector le sobra: la aleatoriedad que el modelo iba a tirar a la basura.
BásicoCapítulo 25

Glosario

Autorregresivo
Que genera de izquierda a derecha usando lo ya generado como entrada del paso siguiente.
Bernoulli(0,5)
Distribución de una moneda justa: vale 1 con probabilidad ½ y 0 con probabilidad ½. Media 0,5, desviación típica 0,5.
Bootstrap
Técnica para estimar la incertidumbre remuestreando con reemplazo los propios datos. El artículo usa 500 remuestreos.
BPE (Byte-Pair Encoding)
Algoritmo que construye el vocabulario de tokens fusionando repetidamente los pares de símbolos más frecuentes.
Capa ℓ / número de capas m
Ronda del torneo. Cada capa usa su propia función g. Por defecto m = 30.
Clave de marcado k
Entero secreto. Sin ella no se puede detectar la marca ni predecir qué tokens están favorecidos.
Colapso de modo
Pérdida de diversidad en las salidas del modelo, típicamente inducida por RLHF.
Colapso del modelo
Degeneración que sufre un modelo entrenado recursivamente con datos generados por modelos.
Distribución de probabilidad
Lista de resultados posibles con sus probabilidades, que suma exactamente 1.
ELI5
Conjunto de datos de preguntas que requieren respuestas explicativas largas. Se usa para generar los textos de prueba.
Entropía
Incertidumbre de una distribución, medida en bits. Es el "combustible" de la marca de agua.
EOS
Token especial de fin de secuencia. Cuando se muestrea, la generación termina.
Esperanza E[X]
Promedio a largo plazo de una variable aleatoria: cada resultado por su probabilidad, sumado.
Función hash
Función determinista que convierte cualquier entrada en un número de tamaño fijo con aspecto aleatorio.
g-value
Puntuación pseudoaleatoria asignada a un token dada la semilla y la capa. Normalmente 0 o 1.
Gumbel sampling
Esquema rival no distorsionador: elige argmax de ri1/pi. Extrae una señal por token.
Logit
Puntuación sin normalizar que el modelo asigna a cada token antes de convertirla en probabilidad.
Muestreo por transformada inversa
Convertir un uniforme(0,1) en una muestra de cualquier distribución aplicando la inversa de su acumulada.
Muestreo especulativo
Aceleración: un modelo pequeño propone varios tokens y el grande los verifica en una sola pasada.
No-distorsión
Propiedad de que la distribución de salida coincide, promediando sobre la semilla, con la del modelo original.
p-valor
Probabilidad de observar algo tan extremo como lo observado si la hipótesis nula fuera cierta.
Perplejidad
Exponencial de la entropía cruzada media. Mide lo "sorprendente" que resulta un texto a un modelo.
PRF (función pseudoaleatoria)
Familia de funciones con clave, computacionalmente indistinguible de una función aleatoria para quien no tiene la clave.
Predicción selectiva
Mecanismo por el que el detector se abstiene cuando no está seguro en lugar de arriesgar un veredicto.
RLHF
Aprendizaje por refuerzo con retroalimentación humana. Alinea el modelo con preferencias humanas y reduce entropía.
Self-BLEU
Medida de similitud entre respuestas distintas del mismo modelo. Valor bajo = más diversidad.
Semilla rt
Número pseudoaleatorio que determina la lotería del paso t. Hash de la ventana y la clave.
Soft Red List
Esquema rival distorsionador: divide el vocabulario en verde/rojo y suma δ a los logits verdes.
Scrubbing / stealing / spoofing
Borrar la marca / deducir la regla sondeando / fabricar marca falsa para incriminar.
Temperatura τ
Parámetro que aplana (τ alta) o apunta (τ baja) la distribución antes de muestrear.
Token
Unidad mínima de texto que maneja el modelo: palabra, trozo de palabra o signo.
Top-k / top-p
Recortes de la distribución: los k más probables, o los que acumulan una masa p.
Tournament sampling
El algoritmo propuesto: torneo de eliminatorias entre candidatos, ganando los de g-value alto.
TPR / FPR
Fracción de textos marcados detectados / fracción de textos honestos acusados por error.
Artículo 50 (Reglamento de IA)
Capa de transparencia del Reglamento (UE) 2024/1689. Su apartado 2 obliga a marcar el contenido sintético en formato legible por máquina. Aplicable desde el 2 de agosto de 2026.
C2PA
Estándar de metadatos de procedencia firmados criptográficamente. Robusto mientras los metadatos sobreviven; se pierde con una captura de pantalla.
AAD (datos asociados autenticados)
Contexto que no se cifra, pero queda protegido por el tag de un esquema AEAD. Si cambia un usuario, una sesión o un modelo incluido en el AAD, la verificación debe fallar.
AEAD
Cifrado autenticado con datos asociados. Protege la confidencialidad del contenido y detecta alteraciones, además de poder ligar el sobre a contexto externo.
Bloque opaco de razonamiento
Estado que una API devuelve al cliente para reenviarlo después, pero cuyo contenido el cliente no puede inspeccionar directamente.
Replay
Reutilización de un mensaje, firma o sobre válido fuera de su orden o contexto original. Un cifrado intacto también puede sufrir replay si no autentica el destino correcto.
Ventana deslizante H
Los últimos H tokens que entran en el hash de la semilla. En el artículo, H = 4.
Vocabulario V
Conjunto de todos los tokens posibles. Del orden de cientos de miles.
BásicoCapítulo 26

Bibliografía anotada

Referencias 1–36: bibliografía original del artículo (recuadro blanco). Referencias 37–77: añadidos de contexto de esta clase, no citados por los autores (recuadro negro).

El problema: indistinguibilidad y contaminación de datos
1Köbis, N. y Mossink, L. D. "Artificial intelligence versus Maya Angelou". Comput. Hum. Behav. 114, 106553 (2021).Las personas no distinguen poesía generada de poesía humana.DOI ↗
2Clark, E. et al. "All that's "human" is not gold". ACL-IJCNLP (2021).La evaluación humana de texto generado apenas supera el azar.Buscar ↗
3Jakesch, M., Hancock, J. T. y Naaman, M. "Human heuristics for AI-generated language are flawed". PNAS 120 (2023).Fallamos sistemáticamente porque usamos las pistas equivocadas.DOI ↗
8Shumailov, I. et al. "AI models collapse when trained on recursively generated data". Nature 631, 755–759 (2024).El colapso del modelo. Coautor del artículo que estudiamos.DOI ↗
9Alemohammad, S. et al. "Self-consuming generative models go MAD". ICLR (2024).Buscar ↗
10Taori, R. y Hashimoto, T. "Data feedback loops". ICML (2023).Buscar ↗
11Wyllie, S., Shumailov, I. y Papernot, N. "Fairness feedback loops". ACM FAccT (2024).Entrenar con datos sintéticos amplifica el sesgo.Buscar ↗
Detección: recuperación y post hoc
4Wu, J. et al. "A survey on LLM-generated text detection". arXiv:2310.14724 (2024).Revisión general. Buen punto de partida.arXiv ↗
12Krishna, K. et al. "Paraphrasing evades detectors of AI-generated text, but retrieval is an effective defense". NeurIPS (2023).arXiv ↗
13Mitchell, E. et al. "DetectGPT". ICML (2023).Detección por curvatura de la probabilidad, sin entrenamiento.arXiv ↗
14Verma, V. et al. "Ghostbuster". NAACL (2024).arXiv ↗
15Hans, A. et al. "Spotting LLMs with Binoculars". ICML (2024).arXiv ↗
16Elkhatat, A. M., Elsaid, K. y Almeer, S. "Evaluating the efficacy of AI content detection tools". Int. J. Educ. Integrity 19, 17 (2023).DOI ↗
17Liang, W. et al. "GPT detectors are biased against non-native English writers". Patterns 4, 100779 (2023).Lectura obligatoria antes de usar un detector con estudiantes.DOI ↗
Marca de agua: fundamentos y esquemas
18Kamaruddin, N. S. et al. "A review of text watermarking". IEEE Access 6, 8011–8028 (2018).DOI ↗
19Gu, C. et al. "Watermarking pre-trained language models with backdooring". arXiv:2210.07543 (2022).arXiv ↗
21Piet, J. et al. "Mark my words: analyzing and evaluating language model watermarks". arXiv:2312.00273 (2023).De aquí sale el marco de tres piezas del capítulo 10.arXiv ↗
22Aaronson, S. y Kirchner, H. "Watermarking of large language models" (2022).Gumbel sampling. Charla, no artículo formal, pero fundacional.PPT ↗
23Kirchenbauer, J. et al. "A watermark for large language models". ICML (2023).Soft Red List. El trabajo más citado del área.arXiv ↗
24Kuditipudi, R. et al. "Robust distortion-free watermarks for language models". TMLR (2024).Puntuación por distancia de edición, más robusta frente a paráfrasis.PDF ↗
25Christ, M., Gunn, S. y Zamir, O. "Undetectable watermarks for language models". COLT (2024).Marcas criptográficamente indetectables. El extremo teórico.arXiv ↗
27Hu, Z. et al. "Unbiased watermark for large language models". ICLR (2024).Origen del enmascarado de contexto repetido.arXiv ↗
Ataques y límites
32Jovanović, N., Staab, R. y Vechev, M. "Watermark stealing in large language models". ICML (2024).arXiv ↗
33Zhang, H. et al. "Watermarks in the sand: impossibility of strong watermarking". ICML (2024).Resultado de imposibilidad. El contrapunto necesario.arXiv ↗
Modelos, decodificación e infraestructura
5Chen, C. et al. "Accelerating large language model decoding with speculative sampling". arXiv:2302.01318 (2023).arXiv ↗
6Gemini Team. "Gemini: a family of highly capable multimodal models". arXiv:2312.11805 (2023).arXiv ↗
7SynthID-Team. Código y datos. GitHub: google-deepmind/synthid-text (2024).Implementación de referencia y datos de la evaluación humana.GitHub ↗
20SynthID-Team. "Watermarking AI-generated text and video with SynthID". Google DeepMind Blog (2024).Web ↗
26Casper, S. et al. "Open problems and fundamental limitations of RLHF". TMLR (2023).De aquí viene el concepto de colapso de modo.PDF ↗
28Gemma Team. "Gemma: open models based on Gemini research and technology". arXiv:2403.08295 (2024).arXiv ↗
29Jiang, A. Q. et al. "Mistral 7B". arXiv:2310.06825 (2023).arXiv ↗
30Fan, A. et al. "ELI5: long form question answering". ACL (2019).arXiv ↗
31Google Cloud. "TPU v5e" (2024).Web ↗
34Holtzman, A. et al. "The curious case of neural text degeneration". ICLR (2020).Origen del top-p / nucleus sampling.arXiv ↗
35Ackley, D. H., Hinton, G. E. y Sejnowski, T. J. "A learning algorithm for Boltzmann machines". Cogn. Sci. 9, 147–169 (1985).De aquí viene la palabra "temperatura".Buscar ↗
36Fan, A., Lewis, M. y Dauphin, Y. "Hierarchical neural story generation". ACL (2018).Origen del top-k.arXiv ↗
Añadidos · fundamentos de modelos de lenguaje
37Hochreiter, S. y Schmidhuber, J. "Long short-term memory". Neural Computation 9, 1735–1780 (1997).Lectura complementaria: la arquitectura recurrente anterior al Transformer.DOI ↗
38Mikolov, T. et al. "Efficient estimation of word representations in vector space". ICLR Workshop (2013).Lectura complementaria: word2vec, los embeddings que popularizaron la idea de "palabras como vectores".arXiv ↗
39Sutskever, I., Vinyals, O. y Le, Q. V. "Sequence to sequence learning with neural networks". NeurIPS (2014).Lectura complementaria.arXiv ↗
40Bengio, Y. et al. "A neural probabilistic language model". JMLR 3, 1137–1155 (2003).El primer modelo de lenguaje neuronal. Capítulo 01.JMLR ↗
41Vaswani, A. et al. "Attention is all you need". NeurIPS (2017).El Transformer. Si solo lees uno de esta lista, lee este.arXiv ↗
42Radford, A. et al. "Language models are unsupervised multitask learners" (2019).GPT-2. Lectura complementaria.Buscar ↗
43Brown, T. et al. "Language models are few-shot learners". NeurIPS (2020).GPT-3 y el aprendizaje en contexto.arXiv ↗
44Kaplan, J. et al. "Scaling laws for neural language models". arXiv:2001.08361 (2020).arXiv ↗
45Christiano, P. et al. "Deep reinforcement learning from human preferences". NeurIPS (2017).arXiv ↗
46Ouyang, L. et al. "Training language models to follow instructions with human feedback". NeurIPS (2022).InstructGPT. El origen de los modelos "-IT".arXiv ↗
47Sennrich, R., Haddow, B. y Birch, A. "Neural machine translation of rare words with subword units". ACL (2016).BPE. Capítulo 02.arXiv ↗
48Kudo, T. y Richardson, J. "SentencePiece". EMNLP (2018).arXiv ↗
73Jurafsky, D. y Martin, J. H. Speech and Language Processing. 3.ª ed. (borrador en línea, gratuito).El manual de referencia del área. Su capítulo 3 explica los modelos de n-gramas desde cero, con el suavizado y la perplejidad. Si algo de la Parte I se te ha quedado corto, está aquí.Libro ↗
74Chen, S. F. y Goodman, J. "An empirical study of smoothing techniques for language modeling". Computer Speech & Language 13, 359–394 (1999).El trabajo clásico sobre cómo hacer que los n-gramas no asignen probabilidad cero a lo que nunca han visto. El problema que los modelos neuronales resolvieron por otra vía.Buscar ↗
75Clark, J. H., Garrette, D., Turc, I. y Wieting, J. "CANINE: pre-training an efficient tokenization-free encoder for language representation". Transactions of the Association for Computational Linguistics 10, 73–91 (2022).Demuestra que operar directamente sobre caracteres es una decisión arquitectónica viable. El coste relevante es la longitud de la secuencia, no una supuesta falta de semántica.DOI ↗
76Xue, L. et al. "ByT5: towards a token-free future with pre-trained byte-to-byte models". Transactions of the Association for Computational Linguistics 10, 291–306 (2022).Modelo generativo que procesa bytes UTF-8. Permite comparar robustez, simplicidad del preprocesado y mayor coste de secuencias más largas.DOI ↗
Añadidos · matemáticas y criptografía
49Goldreich, O., Goldwasser, S. y Micali, S. "How to construct random functions". JACM 33, 792–807 (1986).Funciones pseudoaleatorias. Capítulo 04.DOI ↗
50Devroye, L. Non-Uniform Random Variate Generation. Springer (1986).Muestreo por transformada inversa y todo lo demás.Web ↗
51Shannon, C. E. "A mathematical theory of communication". Bell Syst. Tech. J. 27, 379–423 (1948).La entropía. Capítulo 05.DOI ↗
52Jelinek, F. et al. "Perplexity, a measure of the difficulty of speech recognition tasks". J. Acoust. Soc. Am. 62, S63 (1977).Buscar ↗
53Neyman, J. y Pearson, E. S. "On the problem of the most efficient tests of statistical hypotheses". Phil. Trans. R. Soc. A 231, 289–337 (1933).El marco del contraste de hipótesis. Capítulo 06.DOI ↗
54Fawcett, T. "An introduction to ROC analysis". Pattern Recogn. Lett. 27, 861–874 (2006).TPR, FPR y curvas ROC, explicado con claridad.DOI ↗
Añadidos · detección, marcas y contexto
55Gehrmann, S., Strobelt, H. y Rush, A. M. "GLTR: statistical detection and visualization of generated text". ACL demos (2019).arXiv ↗
56Zellers, R. et al. "Defending against neural fake news". NeurIPS (2019).Grover: el mejor detector de un generador suele ser el propio generador.arXiv ↗
57Sadasivan, V. S. et al. "Can AI-generated text be reliably detected?". arXiv:2303.11156 (2023).arXiv ↗
58Cox, I. et al. Digital Watermarking and Steganography. 2.ª ed., Morgan Kaufmann (2007).El libro de referencia del marcado en imagen y audio.Buscar ↗
59Kirchenbauer, J. et al. "On the reliability of watermarks for large language models". ICLR (2024).Estudio del compromiso de robustez frente a ediciones.arXiv ↗
60Zhu, Y. et al. "Texygen: a benchmarking platform for text generation models". SIGIR (2018).Origen de la métrica Self-BLEU.arXiv ↗
61Papineni, K. et al. "BLEU: a method for automatic evaluation of machine translation". ACL (2002).ACL ↗
62Zhao, X. et al. "Provable robust watermarking for AI-generated text". ICLR (2024).Unigram-Watermark, con garantías de robustez.Buscar ↗
63Leviathan, Y., Kalman, M. y Matias, Y. "Fast inference from transformers via speculative decoding". ICML (2023).arXiv ↗
64Gu, C. et al. "On the learnability of watermarks for language models". ICLR (2024).¿Puede una marca destilarse dentro de los pesos? Relevante para modelos abiertos.Buscar ↗
65Solaiman, I. et al. "Release strategies and the social impacts of language models". arXiv:1908.09203 (2019).arXiv ↗
66Bender, E. M., Gebru, T. et al. "On the dangers of stochastic parrots". ACM FAccT (2021).DOI ↗
67Liu, A. et al. "A survey of text watermarking in the era of large language models". arXiv:2312.07913 (2024).Revisión reciente y completa del área.arXiv ↗
77Panfilov, A., Schmotz, D., Shumailov, I. et al. "Stealing reasoning traces from proprietary LLM APIs". arXiv:2608.09867v1 [cs.CR] (2026).Explica la portabilidad de bloques opacos de razonamiento, la extracción observada en julio de 2026, las fugas encontradas en trazas públicas y una defensa mediante sobres ligados al contexto. Los autores indican que el ataque principal dejó de ser reproducible tras la divulgación y las mitigaciones.arXiv ↗
Añadidos · normativa y estándares
68Reglamento (UE) 2024/1689 del Parlamento Europeo y del Consejo, por el que se establecen normas armonizadas en materia de inteligencia artificial (Reglamento de IA). Artículo 50: obligaciones de transparencia. En vigor desde el 1 de agosto de 2024; artículo 50 aplicable desde el 2 de agosto de 2026.Texto consolidado y navegable en artificialintelligenceact.eu/article/50/ y en EUR-Lex. La fuente primaria: léela antes que cualquier resumen.Web ↗
69Comisión Europea. Directrices sobre las obligaciones de transparencia para proveedores y responsables del despliegue de determinados sistemas de IA. Versión final, 20 de julio de 2026.digital-strategy.ec.europa.eu, el instrumento interpretativo que usan las autoridades nacionales de vigilancia del mercado.Web ↗
70Oficina Europea de IA. Código de buenas prácticas sobre transparencia del contenido generado por IA (junio de 2026).Voluntario. Define el enfoque en capas: metadatos firmados, marca de agua imperceptible y, opcionalmente, huella digital o registro. Unos 190 firmantes a finales de julio de 2026.Web ↗
71C2PA (Coalition for Content Provenance and Authenticity). Content Credentials: C2PA Technical Specification.El estándar de metadatos de procedencia firmados criptográficamente. Complementario, no alternativo, a la marca de agua: se pierde al copiar y pegar, pero es verificable de forma inequívoca cuando sobrevive.Web ↗
72Comisión Europea. Paquete Digital Omnibus sobre IA (2026): régimen transitorio para el marcado del artículo 50(2) hasta el 2 de diciembre de 2026 y aplazamiento de otras partes del Reglamento.Comprueba el estado de tramitación antes de citar plazos: es la parte que más ha cambiado durante 2026.Web ↗