Una imagen fabricada
Una imagen fabricada por una máquina lleva a menudo el rastro de las operaciones que la produjeron, y ese rastro se mide. Esta demostración fabrica dos imágenes en su dispositivo, muestra dónde aparece el rastro, y muestra a partir de cuándo se vuelve ilegible.
Todo se calcula en su navegador. Las dos imágenes se dibujan en este dispositivo, sus espectros se calculan aquí, y ninguna imagen se descarga de ninguna parte. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición.
Dos imágenes, el mismo contenido, una operación de diferencia
Las dos imágenes de abajo salen del mismo campo de partida. Una se muestra tal cual. La otra pasa por un cuello de botella: se reduce y luego se amplía repitiendo cada píxel, lo cual es la operación de sobremuestreo que los generadores de imágenes encadenan para pasar de un pequeño mapa de valores a una imagen de gran tamaño. Nada más las separa.
Lance la fabricación. Las dos imágenes, sus dos espectros y la medición con cifras aparecerán aquí.
Lo que la medición muestra
El rastro es una falta, no un pico
La idea extendida quiere que una imagen fabricada muestre picos en su espectro. Lo que esta demostración mide es lo contrario, y es más interesante. En las frecuencias de la rejilla de sobremuestreo, la imagen fabricada tiene sistemáticamente menos energía que su vecindad, unos once decibelios. Esas frecuencias son exactamente las que el núcleo de repetición anula: al repetir cada píxel un número determinado de veces, se aplica un filtro cuyos ceros caen en los múltiplos de ese número. El espectro conserva por tanto el hueco de la herramienta que lo ha producido.
En la imagen de control, sin ruido añadido, la misma medición da menos de un decibelio de diferencia, en un sentido o en el otro, porque no hay ninguna razón para que una textura privilegie o evite esas frecuencias. La diferencia entre las dos imágenes no es por tanto una impresión: es un número, y se puede repetir.
Desaparece con casi nada
Desplace el control de ruido y mire cómo se funde la medición. Los valores obtenidos con la semilla por defecto, en el factor ocho, son estos.
| Ruido añadido | Imagen de control | Imagen fabricada |
|---|---|---|
| ninguno | +0,2 | -11,0 |
| 2 niveles | -0,5 | -4,6 |
| 5 niveles | -0,8 | -1,6 |
| 10 niveles | -1,2 | -0,5 |
| 20 niveles | -0,7 | +0,2 |
| 40 niveles | -0,4 | +0,8 |
Con cinco niveles de gris de ruido, es decir el dos por ciento de la escala, el rastro ya se ha fundido: de once decibelios cae a menos de dos, justo el doble de lo que la imagen de control muestra por sí sola. Con diez niveles, ya no existe: la desviación medida en la imagen fabricada pasa por debajo de la del control, y ya nada las distingue. Un ruido de esa amplitud es invisible al ojo, y se produce por sí solo: una recompresión, una captura de pantalla, un cambio de tamaño, un filtro de retoque hacen lo mismo sin que nadie lo haya querido.
El rastro es indiscutible y no sobrevive a casi nada. Las dos mitades de esta frase cuentan igual.
El método
El cálculo entero, para quien quiera repetirlo sin esta página.
- Fabricar el campo de partida. Cinco capas de ruido suavizado, cada vez más finas, sumadas con una amplitud que se reduce a la mitad en cada capa. Se obtiene una textura cuya energía decrece con la frecuencia, como la de una fotografía. El sorteo aleatorio se inicializa con la semilla mostrada, así que es reproducible.
- Fabricar la segunda imagen. Promediar el campo por bloques cuadrados del lado elegido, lo que da una imagen pequeña, y luego ampliarla repitiendo cada píxel otras tantas veces. Es un sobremuestreo por vecino más próximo.
- Añadir el ruido, si lo hay, con la misma amplitud a las dos imágenes.
- Pasar cada imagen a luminancia, quitarle su media, y calcular luego su transformada de Fourier en dos dimensiones. Quitar la media es indispensable: si no, la componente continua aplasta todo y el espectro no es más que un punto en el centro.
- Recentrar el espectro, tomar la amplitud de cada frecuencia, y convertirla en decibelios respecto al máximo.
- Medir. Hacer la media de los decibelios en las frecuencias cuyas dos coordenadas son múltiplos del paso de rejilla, después la media de los decibelios en todo lo demás, y restar. Esa es la desviación de rejilla. Un valor cercano a cero quiere decir que esas frecuencias no tienen nada de particular. Un valor claramente negativo quiere decir que ha pasado por ahí un núcleo de repetición.
El paso de rejilla vale el lado de la imagen dividido por el factor de sobremuestreo. Cambie el factor en la demostración, y el paso cambia con él: la medición va a buscar el rastro a otro sitio, y lo encuentra. Eso es lo que muestra que la medición sigue de verdad a la operación, y que no encuentra lo que le apetece encontrar.
Lo que esta demostración no hace
- Muestra que una operación de fabricación deja un rastro medible y reproducible en el dominio de las frecuencias.
- Muestra que ese rastro depende del ajuste de la operación, y se desplaza con él.
- Muestra a partir de qué perturbación el rastro deja de ser legible.
- No detecta nada. Esta página fabrica ella misma las dos imágenes: sabe cuál es cuál, no lo adivina, y no devuelve ninguna puntuación de confianza.
- No juzga ninguna imagen que usted le lleve, y no acepta archivos. Una herramienta que pretendiera zanjar sobre una imagen real mentiría.
- No reproduce un generador de imágenes real. El sobremuestreo es una de sus operaciones, no todas, y las arquitecturas recientes atenúan deliberadamente esa firma.
Lo que la investigación ha medido
Tres resultados publicados encuadran esta demostración, y un cuarto le pone el límite.
Las imágenes producidas por redes generativas presentan artefactos sistemáticos visibles en el dominio frecuencial, causados por las operaciones de sobremuestreo comunes a esas arquitecturas. El componente de sobremuestreo de las redes antagónicas deja una huella espectral característica y reproducible, aprovechable incluso sin haber visto ese modelo concreto en el entrenamiento. Esos trabajos dicen lo mismo que la medición de arriba: la herramienta firma su paso.
El límite también está publicado, y es nítido. Un trabajo revisado por pares establece que las marcas de agua invisibles a nivel del píxel se pueden retirar mediante un ataque de regeneración, que añade ruido y luego reconstruye la imagen, y que esa familia de ataques preserva la calidad visual. Sus autores concluyen que hay que pasar de las marcas de agua invisibles a marcas que preserven el sentido de la imagen. Lo que el control de ruido de esta página hace en tres segundos es la versión elemental de ese ataque.
Un último hecho cierra la discusión sobre el ojo humano: observadores humanos ya no distinguen de forma fiable un rostro sintético de un rostro real, y juzgan incluso los rostros sintéticos, de media, más dignos de confianza. Fiarse de la propia impresión no es por tanto un método de reserva.
El gesto que conviene guardar
Ante una imagen cuyo origen importa, no busque el indicio en la imagen. Busque la fuente: quién la publicó primero, en qué fecha, y qué dicen los metadatos de procedencia cuando existen. Ese camino se trata en el capítulo las marcas de agua. Un indicio técnico sirve para documentar una duda, nunca para concluir por sí solo.
Para ir más lejos
El mismo trabajo sobre una señal sonora está en el capítulo una voz fabricada. Las dos formas de marcar un contenido están en el capítulo las marcas de agua. Las situaciones en las que la herramienta se cierra están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.
Fuentes
- Leveraging Frequency Analysis for Deep Fake Image Recognition Joel Frank, Thorsten Eisenhofer, Lea Schönherr, Asja Fischer, Dorothea Kolossa, Thorsten Holz, 2020. Establece que las imágenes generadas por redes generativas presentan artefactos sistemáticos visibles en el dominio frecuencial, causados por las operaciones de sobremuestreo comunes a esas arquitecturas.
- Detecting and Simulating Artifacts in GAN Fake Images Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019. Establece que el componente de sobremuestreo usado por las redes antagónicas deja una huella espectral característica y reproducible, aprovechable para detectar una imagen generada incluso sin haber visto ese modelo concreto en el entrenamiento.
- Invisible Image Watermarks Are Provably Removable Using Generative AI Xuandong Zhao, Kexun Zhang, Zihao Su, Saastha Vasan, Ilya Grishchenko, Christopher Kruegel, Giovanni Vigna, Yu-Xiang Wang, Lei Li, NeurIPS 2024. Establece que un ataque de regeneración, que añade ruido a una imagen y luego la reconstruye, retira las marcas de agua invisibles a nivel del píxel preservando la calidad visual, y que los autores recomiendan en consecuencia pasar a marcas que preserven el sentido de la imagen.
- AI-synthesized faces are indistinguishable from real faces and more trustworthy Sophie J. Nightingale, Hany Farid, 2022. Establece que observadores humanos ya no logran distinguir de forma fiable un rostro sintético de un rostro real, y juzgan incluso los rostros sintéticos de media más dignos de confianza.