Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Una voz fabricada

Una voz se fabrica superponiendo armónicos y haciéndolos resonar después como un conducto vocal. Esta demostración fabrica un mismo sonido dos veces, una a lo bruto y otra con cuidado, y le deja comparar lo que se oye y lo que se ve en su trazado.

Varios micrófonos montados en pies alrededor de una batería, en un estudio de grabación
Grabar una voz exigía un estudio. Copiarla exige hoy unos segundos de sonido. Fotografía: dan paluska, página del archivo, licencia CC BY 2.0 (texto de la licencia).
Información

Todo se calcula en su navegador. Los dos sonidos se fabrican en este dispositivo, su espectro se calcula aquí, y ningún sonido se envía ni se recibe de ningún servidor. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición. Los dos botones «Escuchar» emiten un sonido: suba el volumen si quiere oírlo, o lea directamente los trazados, con leyenda para leerse sin él.

Un mismo sonido, fabricado dos veces

Los dos sonidos de esta página parten del mismo punto de partida: la misma altura, la misma semilla, la misma duración de un segundo. Uno se deja bruto, el otro recibe un tratamiento adicional, descrito más abajo en la sección «El método». Nada más los distingue.

Una palabra o un número. Fija la microvariación de altura, el grano del soplo y el ruido de línea: la misma semilla da exactamente el mismo sonido y el mismo trazado, en cualquier dispositivo.
Tres resonancias fijas dan su color a cada vocal. Cambian con esta elección.
130 Hz
La frecuencia fundamental, en hercios. Una voz grave empieza hacia 90, una voz aguda sube hacia 240.
0 %
Añadido después a los dos sonidos, para imitar una línea telefónica o un archivo comprimido. El ajuste más instructivo de la página.

Lance la fabricación. Los dos sonidos, sus dos espectrogramas y la diferencia medida entre armónicos y fondo aparecerán aquí, con un botón «Escuchar» para cada uno.

Lo que la demostración muestra

Un tren de armónicos, desnudo o con forma

Los dos sonidos parten del mismo gesto: una serie de armónicos afinada en la misma altura, la misma semilla, la misma duración. La versión bruta se detiene ahí. La versión cuidada hace dos cosas más: da forma a la amplitud de cada armónico con tres resonancias fijas, que dan su color a una vocal, y añade una microvariación de altura y de amplitud de un periodo a otro, más un soplo de nivel bajo. Nada más las separa.

En el trazado, la diferencia se ve antes de oírse: la versión bruta muestra bandas finas y perfectamente nítidas, casi sin energía entre ellas. La versión cuidada muestra bandas más anchas, concentradas en las tres resonancias, con un fondo ligeramente grisáceo entre los armónicos: ese es el soplo.

Una diferencia que se borra con casi nada

Esa diferencia, entre el nivel de los armónicos y el nivel del fondo entre ellos, se mide en decibelios sobre una sola imagen de sesenta y cuatro milisegundos tomada en el medio del sonido. Los valores obtenidos en la altura por defecto, ciento treinta hercios, son estos.

Diferencia medida entre el nivel de los armónicos y el nivel del fondo del espectro, en decibelios, según el ruido de línea añadido después de la fabricación. Semilla «ODERSA», altura 130 Hz, vocal [a].
Ruido de línea añadidoVersión brutaVersión cuidada
ninguno49,711,7
1 %30,311,5
2 %24,611,3
5 %17,110,6
10 %11,89,8
20 %8,48,4

Sin ningún ruido añadido, la diferencia de la versión bruta es casi cuatro veces mayor que la de la versión cuidada: un tren de armónicos desnudo, sin soplo ni irregularidad, es más nítido de lo que ninguna voz real lo es nunca. Añada el menor ruido de línea, y ese exceso de nitidez se desploma: en el diez por ciento, la diferencia de la versión bruta ya se ha dividido por más de cuatro. En el veinte por ciento, las dos diferencias son rigurosamente iguales: la medición ya no distingue la versión bruta de la versión cuidada.

Lo que vuelve un sonido demasiado nítido para ser verdadero es justamente lo que una línea telefónica corriente borra primero.

El método

Lo que calcula cada versión, para quien quiera repetirlo sin esta página.

  1. Fabricar un tren de armónicos afinado en la altura elegida: para cada rango entero, un seno en ese rango por la frecuencia fundamental, de amplitud uno partido por ese rango. Es la forma de una fuente glótica simplificada, común a las dos versiones.
  2. Versión bruta: pararse ahí. Una envolvente de amplitud muy corta en los dos bordes solo evita el chasquido del principio y del final: nada más se añade.
  3. Versión cuidada: dar forma a la amplitud de cada armónico con tres resonancias fijas, habituales para la vocal elegida, no medidas en una persona real. Hacer variar la altura y la amplitud de un periodo a otro, en una pequeña fracción sorteada por la semilla. Mezclar un soplo: un ruido de nivel bajo, sorteado por la misma semilla.
  4. Llevar los dos sonidos a la misma amplitud de pico, para que la comparación no dependa nunca de una simple diferencia de volumen.
  5. Si el ajuste lo pide, añadir después el mismo ruido de línea a los dos sonidos: es lo que una transmisión corriente añade de todos modos, haya fabricación o no.
  6. Medir: tomar una imagen de 1024 muestras en el centro del sonido, calcular su espectro por transformada de Fourier, anotar el nivel de cada armónico, anotar el nivel medio entre ellos, y restar.

Cambie la altura o la vocal en la demostración, y las resonancias se desplazan con ellas: la medición sigue al sonido, nunca copia una cifra escrita por adelantado.

Lo que esta demostración no hace

  • Muestra que un sonido de habla se fabrica en dos pisos: una fuente que vibra, un conducto que resuena, y que el segundo piso cambia todo lo que vuelve vivo a un sonido.
  • Muestra una diferencia medible entre los armónicos y el fondo del espectro, presente en las dos versiones.
  • Muestra a partir de qué ruido de línea esa diferencia deja de distinguir las dos versiones.
  • No detecta nada. Esta página fabrica ella misma los dos sonidos: sabe cuál es cuál, no lo adivina.
  • No juzga ninguna grabación que usted le lleve, y no acepta ningún archivo. Una herramienta que pretendiera zanjar sobre una voz real mentiría.
  • No reproduce un sistema de clonación de voz real. Esos aprenden sus ajustes de la grabación de una persona real, mientras que aquí las tres resonancias se ponen a mano, sobre un sonido de síntesis.

Lo que la investigación ha medido

Tres resultados publicados sitúan lo que esta página hace sentir en un minuto.

Clonar una voz exige hoy muy poca materia: un trabajo de investigación describe un sistema, llamado VALL-E, capaz de sintetizar un habla personalizada juzgada de alta calidad a partir de una grabación de tres segundos solamente de una persona a la que nunca ha oído. Tres segundos es menos que el tiempo de decir el propio nombre.

Los indicios que quedan tienen que ver con artefactos de tratamiento de la señal identificables en el audio fabricado, y la investigación sobre su detección se apoya precisamente en ese tipo de rastro para construir sus conjuntos de datos de referencia. Pero los sistemas encargados de detectarlos siguen careciendo de robustez frente a las condiciones acústicas reales, y generalizan mal a métodos de generación que no han visto en el entrenamiento.

Ninguna de estas fuentes mide directamente el oído humano ante una voz clonada reciente: no es por tanto una afirmación que esta página pueda hacer en su lugar. Lo que permiten decir es más modesto, y igual de útil: un sistema entrenado especialmente para detectar una voz fabricada ya le cuesta generalizar a un método nuevo, y un exceso de nitidez espectral, cuando existe, es justamente el tipo de rastro que un ruido de línea corriente borra antes de que le sirva a nadie, humano o detector.

Una voz conocida, al teléfono

En enero de 2024, una autoridad pública estadounidense, la Federal Communications Commission, documentó y sancionó jurídicamente una campaña real de fraude: una llamada automatizada, difundida en Nuevo Hampshire antes de la primaria presidencial del estado, llevaba una voz clonada por IA que imitaba al presidente Joe Biden, y pedía a los votantes quedarse en casa y «guardar su voto» saltándose esa primaria. Nada en el sonido avisaba a nadie de su fabricación.

Una llamada telefónica ya comprime el sonido, le añade ruido de línea, y no deja al oído más que una banda de frecuencias estrecha. Es exactamente la combinación que esta página acaba de fabricar con su propio ajuste de ruido de línea: las condiciones en las que un indicio tiene más probabilidades de desaparecer son las de una llamada corriente, no las de un estudio de grabación.

El gesto que conviene guardar

Ante una voz conocida que pide, por teléfono, algo urgente, una transferencia, un código, una dirección, no intente juzgar la voz: esta página acaba de mostrar hasta qué punto eso es poco fiable. Cuelgue, y llame usted mismo al número que ya tiene, no al que acaba de llamar. Si la llamada tiene que continuar de inmediato, haga una pregunta cuya respuesta no esté escrita en ninguna parte en público. Una familia o un equipo también pueden acordar por adelantado una palabra que solo la persona real conozca, para las situaciones en las que la urgencia vuelve difícil de verificar todo lo demás. El gesto no cuesta nada: el fraude documentado más arriba, en cambio, costó caro a quien confió en su oído.

Para ir más lejos

El mismo trabajo sobre una imagen está en el capítulo una imagen fabricada. Las dos formas de marcar un contenido en el origen están en el capítulo las marcas de agua. Las situaciones en las que la herramienta se cierra están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.

Fuentes