Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Lo que pasa con un archivo subido

Antes de subir un archivo a un servicio que usa inteligencia artificial se plantea una pregunta precisa: ¿puede este contenido reaparecer, más tarde, ante otra persona?

Subir un archivo a un servicio que usa inteligencia artificial rara vez desencadena una explicación clara de lo que le ocurre después a ese archivo. La pregunta que hay que hacerse no es «¿me va a espiar la IA?», una fórmula demasiado vaga para verificarse. La pregunta documentada por la investigación es más precisa: ¿puede este contenido reaparecer, más tarde, ante otra persona? Un trabajo escolar, una fotografía de familia, un expediente profesional: el gesto de subir un archivo se ha vuelto banal, la pregunta de qué será de él después no lo es.

Un modelo puede retener pasajes enteros

En 2021, Nicholas Carlini y su equipo publican una demostración directa. Con solo interrogar a GPT-2, un modelo de lenguaje anterior a los asistentes conversacionales actuales, extraen de él centenares de secuencias de texto reproducidas palabra por palabra desde sus datos de entrenamiento: nombres, números de teléfono, direcciones de correo, conversaciones, código informático. Algunas de esas secuencias solo aparecían una vez en los datos de origen. Otra constatación del estudio: los modelos más grandes memorizan más que los más pequeños. Ninguna de esas informaciones se había buscado por un medio indirecto: simplemente salieron en respuesta a preguntas corrientes, hechas como en cualquier uso habitual del modelo.

Lo que hace crecer este riesgo

Un segundo estudio, publicado por parte del mismo equipo en 2023, mide con precisión lo que aumenta la memorización. Tres factores, cada uno medido por separado: el tamaño del modelo, la repetición de un mismo ejemplo en los datos de entrenamiento, y la longitud del texto dado como contexto antes de pedir una continuación. Cuanto más grande es un modelo, cuanto más se ha repetido un ejemplo, cuanto más largo es el contexto aportado, más aumenta la probabilidad de recuperar un fragmento memorizado. Los autores describen una memorización más extendida de lo que se pensaba, llamada a agravarse con modelos cada vez más grandes, salvo que se tomen medidas para contenerla.

El riesgo no es solo teórico

Queda una objeción posible: ¿apuntan estas demostraciones a modelos de laboratorio, sin relación con un servicio realmente usado? Un estudio de 2023, dirigido por Milad Nasr, responde apuntando a modelos ya desplegados: modelos abiertos como Pythia o GPT-Neo, semiabiertos como LLaMA o Falcon, y un modelo cerrado accesible únicamente por un servicio en línea, ChatGPT. Extrae de ellos gigabytes de datos de entrenamiento. Para ChatGPT, un modelo cuyas respuestas están normalmente encuadradas, los autores desarrollan una técnica que fuerza al modelo a salirse de su comportamiento habitual: esa técnica hace salir datos de entrenamiento a una tasa 150 veces superior a la observada cuando el modelo responde normalmente. El encuadre de un modelo reduce ese riesgo, no lo anula. Extraer gigabytes no supone ningún acceso privilegiado al modelo: el estudio procede por simple consulta, en las mismas condiciones que cualquier uso corriente del servicio.

La pregunta que hay que hacerse antes de subir un archivo

Lo que estos estudios miden en conjunto desplaza la pregunta inicial. No se trata de saber si un modelo lee un archivo en el momento en que lo recibe, algo que un uso normal ya supone. Se trata de saber si ese contenido puede servir después para entrenar o reentrenar un modelo, y por tanto sumarse al depósito del que un fragmento puede, en las condiciones medidas más arriba, reaparecer algún día. Antes de subir un archivo a un servicio que usa IA se plantean dos preguntas: ¿dice ese servicio, con claridad, para qué sirven los datos subidos? ¿Y ofrece una opción real de negarse a que sirvan para entrenar lo que sea? La ausencia de respuesta a una u otra es, en sí, una información.

Lo que le ocurre a un contenido confiado a un servicio, y lo que ese servicio dice realmente de ello, se detalla en el capítulo del curso que le está dedicado.

Lo que la investigación ha medido, y lo que no dice:

  • La extracción de datos de entrenamiento memorizados, incluida información personal, interrogando a un modelo realmente desplegado.
  • Una memorización que aumenta con el tamaño del modelo, la repetición de un ejemplo, y la longitud del contexto aportado.
  • Una vigilancia en tiempo real de lo que se escribe: estos estudios documentan una posible reaparición posterior, no una lectura instantánea transmitida a un tercero.

Fuentes

Este artículo se publica bajo licencia CC BY 4.0: cópielo, tradúzcalo, vuelva a publicarlo citando a la ODERSA.

Volver al blog