Una voz fabricada
Una voz se fabrica superponiendo armónicos y haciéndolos resonar después como un conducto vocal. Esta demostración fabrica un mismo sonido dos veces, una a lo bruto y otra con cuidado, y le deja comparar lo que se oye y lo que se ve en su trazado.
Todo se calcula en su navegador. Los dos sonidos se fabrican en este dispositivo, su espectro se calcula aquí, y ningún sonido se envía ni se recibe de ningún servidor. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición. Los dos botones «Escuchar» emiten un sonido: suba el volumen si quiere oírlo, o lea directamente los trazados, con leyenda para leerse sin él.
Un mismo sonido, fabricado dos veces
Los dos sonidos de esta página parten del mismo punto de partida: la misma altura, la misma semilla, la misma duración de un segundo. Uno se deja bruto, el otro recibe un tratamiento adicional, descrito más abajo en la sección «El método». Nada más los distingue.
Lance la fabricación. Los dos sonidos, sus dos espectrogramas y la diferencia medida entre armónicos y fondo aparecerán aquí, con un botón «Escuchar» para cada uno.
Lo que la demostración muestra
Un tren de armónicos, desnudo o con forma
Los dos sonidos parten del mismo gesto: una serie de armónicos afinada en la misma altura, la misma semilla, la misma duración. La versión bruta se detiene ahí. La versión cuidada hace dos cosas más: da forma a la amplitud de cada armónico con tres resonancias fijas, que dan su color a una vocal, y añade una microvariación de altura y de amplitud de un periodo a otro, más un soplo de nivel bajo. Nada más las separa.
En el trazado, la diferencia se ve antes de oírse: la versión bruta muestra bandas finas y perfectamente nítidas, casi sin energía entre ellas. La versión cuidada muestra bandas más anchas, concentradas en las tres resonancias, con un fondo ligeramente grisáceo entre los armónicos: ese es el soplo.
Una diferencia que se borra con casi nada
Esa diferencia, entre el nivel de los armónicos y el nivel del fondo entre ellos, se mide en decibelios sobre una sola imagen de sesenta y cuatro milisegundos tomada en el medio del sonido. Los valores obtenidos en la altura por defecto, ciento treinta hercios, son estos.
| Ruido de línea añadido | Versión bruta | Versión cuidada |
|---|---|---|
| ninguno | 49,7 | 11,7 |
| 1 % | 30,3 | 11,5 |
| 2 % | 24,6 | 11,3 |
| 5 % | 17,1 | 10,6 |
| 10 % | 11,8 | 9,8 |
| 20 % | 8,4 | 8,4 |
Sin ningún ruido añadido, la diferencia de la versión bruta es casi cuatro veces mayor que la de la versión cuidada: un tren de armónicos desnudo, sin soplo ni irregularidad, es más nítido de lo que ninguna voz real lo es nunca. Añada el menor ruido de línea, y ese exceso de nitidez se desploma: en el diez por ciento, la diferencia de la versión bruta ya se ha dividido por más de cuatro. En el veinte por ciento, las dos diferencias son rigurosamente iguales: la medición ya no distingue la versión bruta de la versión cuidada.
Lo que vuelve un sonido demasiado nítido para ser verdadero es justamente lo que una línea telefónica corriente borra primero.
El método
Lo que calcula cada versión, para quien quiera repetirlo sin esta página.
- Fabricar un tren de armónicos afinado en la altura elegida: para cada rango entero, un seno en ese rango por la frecuencia fundamental, de amplitud uno partido por ese rango. Es la forma de una fuente glótica simplificada, común a las dos versiones.
- Versión bruta: pararse ahí. Una envolvente de amplitud muy corta en los dos bordes solo evita el chasquido del principio y del final: nada más se añade.
- Versión cuidada: dar forma a la amplitud de cada armónico con tres resonancias fijas, habituales para la vocal elegida, no medidas en una persona real. Hacer variar la altura y la amplitud de un periodo a otro, en una pequeña fracción sorteada por la semilla. Mezclar un soplo: un ruido de nivel bajo, sorteado por la misma semilla.
- Llevar los dos sonidos a la misma amplitud de pico, para que la comparación no dependa nunca de una simple diferencia de volumen.
- Si el ajuste lo pide, añadir después el mismo ruido de línea a los dos sonidos: es lo que una transmisión corriente añade de todos modos, haya fabricación o no.
- Medir: tomar una imagen de 1024 muestras en el centro del sonido, calcular su espectro por transformada de Fourier, anotar el nivel de cada armónico, anotar el nivel medio entre ellos, y restar.
Cambie la altura o la vocal en la demostración, y las resonancias se desplazan con ellas: la medición sigue al sonido, nunca copia una cifra escrita por adelantado.
Lo que esta demostración no hace
- Muestra que un sonido de habla se fabrica en dos pisos: una fuente que vibra, un conducto que resuena, y que el segundo piso cambia todo lo que vuelve vivo a un sonido.
- Muestra una diferencia medible entre los armónicos y el fondo del espectro, presente en las dos versiones.
- Muestra a partir de qué ruido de línea esa diferencia deja de distinguir las dos versiones.
- No detecta nada. Esta página fabrica ella misma los dos sonidos: sabe cuál es cuál, no lo adivina.
- No juzga ninguna grabación que usted le lleve, y no acepta ningún archivo. Una herramienta que pretendiera zanjar sobre una voz real mentiría.
- No reproduce un sistema de clonación de voz real. Esos aprenden sus ajustes de la grabación de una persona real, mientras que aquí las tres resonancias se ponen a mano, sobre un sonido de síntesis.
Lo que la investigación ha medido
Tres resultados publicados sitúan lo que esta página hace sentir en un minuto.
Clonar una voz exige hoy muy poca materia: un trabajo de investigación describe un sistema, llamado VALL-E, capaz de sintetizar un habla personalizada juzgada de alta calidad a partir de una grabación de tres segundos solamente de una persona a la que nunca ha oído. Tres segundos es menos que el tiempo de decir el propio nombre.
Los indicios que quedan tienen que ver con artefactos de tratamiento de la señal identificables en el audio fabricado, y la investigación sobre su detección se apoya precisamente en ese tipo de rastro para construir sus conjuntos de datos de referencia. Pero los sistemas encargados de detectarlos siguen careciendo de robustez frente a las condiciones acústicas reales, y generalizan mal a métodos de generación que no han visto en el entrenamiento.
Ninguna de estas fuentes mide directamente el oído humano ante una voz clonada reciente: no es por tanto una afirmación que esta página pueda hacer en su lugar. Lo que permiten decir es más modesto, y igual de útil: un sistema entrenado especialmente para detectar una voz fabricada ya le cuesta generalizar a un método nuevo, y un exceso de nitidez espectral, cuando existe, es justamente el tipo de rastro que un ruido de línea corriente borra antes de que le sirva a nadie, humano o detector.
Una voz conocida, al teléfono
En enero de 2024, una autoridad pública estadounidense, la Federal Communications Commission, documentó y sancionó jurídicamente una campaña real de fraude: una llamada automatizada, difundida en Nuevo Hampshire antes de la primaria presidencial del estado, llevaba una voz clonada por IA que imitaba al presidente Joe Biden, y pedía a los votantes quedarse en casa y «guardar su voto» saltándose esa primaria. Nada en el sonido avisaba a nadie de su fabricación.
Una llamada telefónica ya comprime el sonido, le añade ruido de línea, y no deja al oído más que una banda de frecuencias estrecha. Es exactamente la combinación que esta página acaba de fabricar con su propio ajuste de ruido de línea: las condiciones en las que un indicio tiene más probabilidades de desaparecer son las de una llamada corriente, no las de un estudio de grabación.
El gesto que conviene guardar
Ante una voz conocida que pide, por teléfono, algo urgente, una transferencia, un código, una dirección, no intente juzgar la voz: esta página acaba de mostrar hasta qué punto eso es poco fiable. Cuelgue, y llame usted mismo al número que ya tiene, no al que acaba de llamar. Si la llamada tiene que continuar de inmediato, haga una pregunta cuya respuesta no esté escrita en ninguna parte en público. Una familia o un equipo también pueden acordar por adelantado una palabra que solo la persona real conozca, para las situaciones en las que la urgencia vuelve difícil de verificar todo lo demás. El gesto no cuesta nada: el fraude documentado más arriba, en cambio, costó caro a quien confió en su oído.
Para ir más lejos
El mismo trabajo sobre una imagen está en el capítulo una imagen fabricada. Las dos formas de marcar un contenido en el origen están en el capítulo las marcas de agua. Las situaciones en las que la herramienta se cierra están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.
Fuentes
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection Joel Frank, Lea Schönherr, 2021. Establece que la investigación sobre la detección de voz sintética se apoya en artefactos de tratamiento de la señal identificables en el audio generado, y aporta un conjunto de datos de referencia para estudiarlos.
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild Xuechen Liu, Xin Wang, Md Sahidullah, Jose Patino, Hector Delgado, Tomi Kinnunen, Massimiliano Todisco, Junichi Yamagishi, Nicholas Evans, Andreas Nautsch, Kong Aik Lee, 2021. Establece que los sistemas de detección del habla sintética siguen careciendo de robustez frente a los entornos acústicos reales, y generalizan mal a métodos de generación no vistos en el entrenamiento.
- FCC Makes AI-Generated Voices in Robocalls Illegal (declaración adoptada: FCC 24-17) Federal Communications Commission (FCC), 2024. Establece que una autoridad pública estadounidense documentó y sancionó jurídicamente una campaña real de fraude que usaba una voz clonada por IA imitando a un responsable político ante votantes antes de una elección.
- Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, Furu Wei, 2023. Establece que el sistema VALL-E sintetiza un habla personalizada juzgada de alta calidad a partir de una grabación de tres segundos solamente de una persona a la que nunca ha oído.