Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Las marcas de agua

Dos mecanismos llevan el nombre de «marca de agua», y se confunden sin parar. Este capítulo fabrica uno de cada clase ante sus ojos, en un texto y luego en una imagen, y destruye el segundo delante de usted para mostrar su verdadero límite.

Información

Todo se calcula en su navegador. El texto lo genera un modelo de juguete aprendido en este dispositivo, la imagen se dibuja en un lienzo local, y el mensaje que esconde no se envía nunca a ninguna parte. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición.

Dos mecanismos que se confunden

Se llama «marca de agua» a dos mecanismos muy distintos, y esa confusión cuesta cara. El primero declara el origen de un archivo en sus metadatos, como una etiqueta pegada encima. El segundo modifica discretamente el contenido mismo, como una textura tejida en la tela. Un archivo puede llevar uno, otro, los dos, o ninguno de los dos.

Este capítulo fabrica el segundo mecanismo ante sus ojos, en un texto y luego en una imagen, porque se calcula. El primero no se calcula: se declara, o no se declara. Después viene la comparación de los dos, con lo que sobrevive a cada uno y lo que ninguno de los dos sustituye.

Una marca de agua de lista verde, puesta sobre un texto

En cada palabra que genera, el modelo de juguete de este sitio calcula una lista de candidatos posibles. Una clave secreta, combinada con la palabra anterior, designa una mitad de esa lista como «verde». El sorteo se empuja después ligeramente hacia esa mitad. Ajuste la clave y la fuerza de ese empuje, y luego genere un texto: cada palabra producida se muestra con la etiqueta que la clave le da en ese instante.

Una palabra o un número. Hay que volver a usar la misma clave para reencontrar la marca de agua después. Un servicio real la mantiene en secreto; aquí sigue visible para que el cálculo se pueda verificar.
3,0
En cero, ningún empuje: el sorteo ignora la lista verde. Cuanto más sube la fuerza, más la favorece, a costa de un texto más forzado.
El modelo completa este comienzo, como en el capítulo la próxima palabra. El modelo ha aprendido sobre una novela francesa: escriba en francés para verlo funcionar.

El texto generado aparecerá aquí, palabra por palabra, con el color que la clave le da.

El texto de arriba se mide con la misma clave, y cualquier otro texto también: pegue uno, o modifique el que acaba de aparecer, y mídalo. El resultado no es nunca «con marca de agua» o «sin marca de agua»: es una proporción, que hay que comparar con lo que valdría sin marca de agua.

Rellenado por el texto generado más arriba. Sustitúyalo por cualquier otro texto para medirlo a su vez, con la misma clave escrita más arriba.

La proporción de palabras en lista verde, y su lectura, aparecerán aquí.

Una marca de agua en los bits de menor peso de una imagen

Una imagen digital es una rejilla de números, uno por canal de color y por píxel, de cero a doscientos cincuenta y cinco. Cambiar el bit más bajo de uno solo de esos números modifica su valor en uno como máximo: nada que se vea. Esta demostración dibuja una imagen, esconde un mensaje en exactamente esos bits, lo recupera, y luego le deja destruirlo.

Determina el dibujo de fondo. La misma semilla devuelve siempre la misma imagen, en cualquier dispositivo.
Unas decenas de signos caben sin problema en una imagen de este tamaño.

La imagen fabricada, y el mensaje recuperado en ella, aparecerán aquí.

Elija ahora una operación banal, de las que un envío por mensajería o una publicación en una red aplican por su cuenta, y mire si el mensaje sobrevive.

Cuatro opciones, ninguna concebida para borrar una marca de agua: son gestos corrientes.

La imagen después de la operación elegida, y lo que queda del mensaje, aparecerán aquí.

El método

La marca de agua de lista verde, paso a paso

  1. Para la palabra en curso, obtener la lista de candidatos posibles y su probabilidad, exactamente como en el capítulo la próxima palabra.
  2. Combinar la clave secreta y la palabra inmediatamente anterior, y sacar de ahí un número entre cero y uno mediante una función de hash. Por debajo de un medio, el candidato es verde; por encima, es rojo. La mitad del vocabulario es verde en cada etapa, pero nunca la misma mitad: cambia con la palabra anterior.
  3. Añadir la fuerza elegida al logit de cada candidato verde, antes de la temperatura y del sorteo: ese es el sesgo que el modelo de juguete acepta en esta etapa precisa.
  4. Sortear normalmente en esa distribución corregida. Una palabra verde tiene ahora más probabilidades de ser elegida, sin que ninguna palabra se vuelva imposible; y cuando todos los candidatos de ese paso comparten el mismo color, el sesgo no cambia nada, porque no hay nada que desempatar.
  5. Repetir para la palabra siguiente: la palabra anterior ha cambiado, así que la lista verde también.
  6. Para medir un texto, repetir el cálculo de la etapa dos sobre cada una de sus palabras, con la misma clave, y contar la proporción de palabras verdes. Con la clave que ha servido para generar, esa proporción supera claramente la mitad; en un texto cualquiera, o con otra clave, se queda cerca de la mitad.
  7. Comparar esa proporción medida con la mitad esperada mediante un cálculo de desviación reducida: cuanto mayor es la desviación, más raro sería observar esa proporción en un texto que no hubiera recibido esta marca de agua. Ese número nunca se convierte en un veredicto.

Esconder un mensaje en los bits de menor peso, paso a paso

  1. Dibujar la imagen y leer sus píxeles: para cada uno, tres números de cero a doscientos cincuenta y cinco, uno por canal de color.
  2. Escribir la longitud del mensaje, en número de bytes, en los treinta y dos primeros bits disponibles.
  3. Escribir cada byte del mensaje a continuación, ocho bits cada uno.
  4. Para cada bit que hay que escribir, tomar el número siguiente en la rejilla de los canales de color, borrar su bit más bajo y poner en él el bit del mensaje. El número cambia en uno como máximo, sobre una escala de doscientos cincuenta y cinco: ningún ojo ve la diferencia.
  5. Para recuperar el mensaje, releer los mismos bits en el mismo orden, reconstruir la longitud y luego los bytes, y convertirlos en texto.
  6. Una operación que recalcula los píxeles, una recompresión o un cambio de tamaño, recalcula también su bit más bajo, sin preocuparse de lo que llevaba. El mensaje solo sobrevive si ese valor se mantiene idéntico, bit a bit.

Dos formas de marcar un contenido

Las dos pruebas de arriba ponen en su sitio a los dos mecanismos que este capítulo distingue.

La procedencia declarada: legible, y frágil

Una norma técnica pública, C2PA, dice cómo adjuntar a un archivo información firmada sobre su origen y su historial: qué aparato o qué programa lo produjo, qué modificaciones ha sufrido. Una aplicación que lee esa norma muestra esa información con claridad, bajo el nombre de Content Credentials. Es una etiqueta, en sentido propio: dice de dónde viene el archivo, no toca nada dentro del propio archivo.

Una etiqueta se despega. La propia norma lo reconoce: su información de procedencia puede separarse del archivo, lo que la vuelve perdible con una simple captura de pantalla o una reedición del archivo. Un envío por mensajería que recomprime una imagen, una captura de pantalla que solo copia los píxeles mostrados, una exportación a un formato que ignora ese bloque de metadatos: ninguno de esos gestos es un ataque, y cada uno basta para borrar la procedencia sin dejar rastro del borrado.

Ahí está el contrasentido más extendido: una imagen sin procedencia declarada no es una imagen que esconda algo. Es quizá una imagen a la que simplemente se le ha caído la etiqueta por el camino, lo que les pasa a la casi totalidad de las imágenes que circulan.

La marca de agua estadística: discreta, y más resistente, no invencible

La marca de agua estadística no se añade al lado del contenido: modifica el contenido mismo, de forma mínima y repartida. En un texto, empujando el sorteo hacia una lista de palabras elegida por una clave, como acaba de hacer la demostración de arriba. En una imagen, modificando píxeles de una forma que puede ser mucho más discreta que los bits de menor peso empleados aquí para seguir siendo explicable.

Esa diferencia de naturaleza cambia todo en cuanto a la resistencia. Una etiqueta de metadatos desaparece con un solo gesto, porque nunca es más que datos al lado de los datos. Una marca de agua estadística hay que deshacerla en el contenido mismo: copiar un texto a mano no cambia nada en su lista verde, y una imagen conserva a veces una marca de agua a través de operaciones que borrarían su procedencia sin esfuerzo.

Esa resistencia tiene dos límites, y los dos se acaban de ver más arriba. El primero: una marca de agua supone que el fabricante la haya puesto en el momento de la creación. Nada obliga a un servicio a hacerlo, y nada lo prueba después si el contenido ha circulado sin ella. El segundo: una marca de agua tampoco es invencible. Un trabajo citado en el capítulo una imagen fabricada muestra que un ataque de regeneración, que añade ruido a una imagen y luego la reconstruye, retira las marcas de agua invisibles a nivel del píxel preservando la calidad visual. La recompresión o el cambio de tamaño que usted acaba de elegir más arriba es su versión elemental, aplicada a un mecanismo distinto pero a la misma idea: recalcular los píxeles borra lo que en ellos se escondía.

  • Una marca de agua estadística modifica el contenido mismo, así que viaja con copias a las que una etiqueta de metadatos no sigue.
  • Su detección devuelve una proporción y una desviación medidas, nunca una palabra para zanjar.
  • Marcas de agua de esta familia están realmente desplegadas y publicadas, revisadas por pares.
  • No se pone por sí sola: sin un fabricante que decida aplicarla, no hay nada que detectar.
  • No resiste a todo: una operación lo bastante insistente, aunque sea banal, acaba con ella.
  • Nunca dice si un contenido es verdadero o falso, solo si lleva la marca de una fabricación determinada.

Lo que la investigación ha medido

Una norma técnica pública define cómo adjuntar a un archivo información verificable y firmada sobre su origen y su historial de modificación, y reconoce ella misma que esa información es separable del archivo, y por tanto perdible con una captura de pantalla o una reedición, sin que nada señale la pérdida.

Insertar en un texto generado una marca de agua estadística invisible al ojo, favoreciendo ligeramente ciertas palabras en cada etapa, y detectarla luego mediante un test estadístico: es exactamente la mecánica que la demostración de más arriba acaba de poner en marcha. Un mecanismo de esta familia, integrado en el muestreo de un servicio real, se ha publicado y revisado por pares en la revista Nature: lo que esta página simplifica con fines pedagógicos está desplegado en otras partes a una escala completamente distinta.

El gesto que conviene guardar

Ante un archivo cuyo origen importa, dos reflejos sustituyen demasiado a menudo a un juicio. El primero: buscar una procedencia declarada y, al no encontrarla, concluir que el archivo esconde algo. La propia norma dice lo contrario: la ausencia de procedencia es el estado normal de la casi totalidad de los archivos que circulan, no una prueba. El segundo: pedir a una herramienta de detección un veredicto, sobre un texto o sobre una imagen. Una evaluación independiente de catorce herramientas de detección de texto, incluidas herramientas empleadas en la enseñanza, concluye que ninguna es a la vez fiable y precisa; el fabricante de una de las más usadas retiró él mismo su herramienta seis meses después de su lanzamiento, alegando una tasa de fiabilidad demasiado baja para ser útil.

La demostración de marca de agua de lista verde de más arriba se aplica esa misma prudencia a sí misma: su resultado es una proporción y una desviación reducida, nunca una palabra para zanjar. Ante un contenido cuyo origen importa de verdad, la pregunta útil sigue siendo siempre la misma: quién lo publicó primero, en qué fecha, y si está corroborado en otra parte. Un indicio técnico documenta una duda, nunca la sustituye.

Para ir más lejos

La mecánica que este capítulo deja de lado, la que detecta el rastro involuntario de una fabricación antes que una marca de agua puesta a propósito, se trata en los capítulos una imagen fabricada y una voz fabricada. El sorteo que la marca de agua de texto acaba de sesgar se explica en detalle en el capítulo la próxima palabra. Las situaciones en las que ninguna de estas herramientas basta están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.

Fuentes