Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

Lo que se le da, y lo que puede devolver

Dejar un texto, una imagen o un archivo en un servicio de inteligencia artificial desencadena cuatro cosas distintas, que las condiciones de uso suelen reunir en una sola frase. Este capítulo las separa, porque el riesgo no es el mismo en cada una.

Un cuarto técnico donde converge una decena de cables de red conectados a paneles de parcheo
Lo que se sube a un servicio en línea sale por cables, hacia máquinas que no son las nuestras. Fotografía: Brian Hankins (Bhankins), página del archivo, licencia Public domain.

La pregunta «¿me espía la inteligencia artificial?» no se puede verificar: es demasiado vaga para que una respuesta sea verdadera o falsa. La pregunta que sí se verifica es más estrecha. ¿Lo que acabo de subir puede reaparecer algún día, ante otra persona? Esa pregunta tiene una respuesta medida, y depende de cuatro gestos que primero hay que distinguir.

Las cuatro cosas que «dar» reúne

Una misma subida de archivo desencadena hasta cuatro operaciones. No tienen ni el mismo carácter inevitable, ni las mismas consecuencias.

Leer, para responder ahora
El contenido se trocea en unidades y se coloca en el contexto del modelo, que calcula su respuesta a partir de ahí. Esta operación es inevitable: es exactamente lo que se le pide al servicio. Termina con la respuesta.
Conservar, en los servidores del servicio
El contenido y la respuesta se registran, para el historial de la conversación, para tramitar avisos, para la moderación. Un plazo de conservación es una decisión del servicio, no una propiedad del modelo.
Reentrenar, con ese contenido entre otros
El contenido se suma al depósito de datos que servirá para entrenar una versión siguiente del modelo. Aquí es donde la subida deja de ser un intercambio y se convierte en una aportación duradera, a menudo sin que la persona lo haya querido.
Devolver, más tarde, a otra persona
Un modelo entrenado con un contenido puede reproducirlo palabra por palabra en respuesta a una pregunta corriente hecha por otra persona. No es una hipótesis: es el resultado medido por los trabajos citados más abajo.

Las dos primeras operaciones son cosa de una política de servicio, que se lee y se compara. Las dos últimas son cosa del funcionamiento de un modelo, y es lo que explica este capítulo.

Un modelo retiene, y eso se mide

Un modelo no tiene una base de datos donde se pudieran recuperar los textos que ha leído. Sus datos de entrenamiento no están guardados en algún sitio dentro de él: han modificado sus parámetros. Por eso la palabra «memoria» induce a error. Y sin embargo pasajes enteros vuelven a salir, y la investigación sabe en qué condiciones.

En 2021, un equipo dirigido por Nicholas Carlini extrae de un modelo de lenguaje centenares de secuencias reproducidas palabra por palabra desde sus datos de entrenamiento, entre ellas información personal identificable. El método no tiene nada de rodeo: son preguntas corrientes. Algunas de las secuencias recuperadas solo aparecían una vez en los datos de origen.

Un segundo estudio, en 2023, mide lo que hace crecer ese fenómeno. Tres factores, cada uno establecido por separado.

  1. El tamaño del modelo. Cuantos más parámetros tiene, más memoriza.
  2. La duplicación de un ejemplo en los datos. Un contenido presente varias veces vuelve a salir con más facilidad que un contenido presente una vez.
  3. La longitud del texto dado como contexto antes de pedir una continuación. Cuanto más largo es el comienzo, más probable es la devolución.

A estas alturas queda una objeción abierta: puede que estas demostraciones apunten a modelos de laboratorio, sin relación con un servicio realmente usado. Un tercer estudio, del mismo año, responde apuntando a modelos ya desplegados en producción, incluido un modelo de gran público cuyas respuestas están encuadradas, y extrae de ellos gigabytes de datos de entrenamiento por simple interrogación. El encuadre de un modelo reduce ese riesgo. No lo anula.

Estos trabajos miden una devolución posible más tarde, a un tercero. No documentan una lectura instantánea transmitida a alguien mientras usted escribe. Confundir las dos cosas hace perder lo único útil aquí, que es saber qué riesgo se corre en qué momento.

Leer lo que un servicio dice de verdad

Una política de uso se lee buscando tres formulaciones precisas, y no una impresión general de seriedad.

Lo que la frase recubre

«Mejorar nuestros servicios» es la fórmula que recubre más a menudo el reentrenamiento, sin nombrarlo. No es ni mentirosa ni informativa. El texto útil dice, en su lugar, qué se hace con el contenido, y quién lo hace.

La opción, y su valor por defecto

A veces existe una negativa al reentrenamiento, y su forma cuenta más que su existencia. Una negativa que se aplica por defecto protege a todo el mundo. Una negativa que hay que ir a buscar en un ajuste solo protege a las personas que saben que está ahí, es decir, a casi nadie. Una política se juzga por su valor por defecto, no por sus opciones.

El plazo, y lo que queda después

Un plazo de conservación no dice nada del modelo ya entrenado. Borrar una conversación quita un registro de un servidor; eso no quita de un modelo lo que ese contenido ya ha modificado en él. Un modelo entrenado no se desentrena de un contenido al borrar una cuenta.

Antes de subir un archivo

Tres preguntas, en este orden. La ausencia de respuesta a una de ellas es en sí misma una respuesta.

  1. ¿Este servicio dice, con claridad y sin fórmulas envolventes, para qué sirven los contenidos subidos?
  2. ¿La negativa al reentrenamiento es el comportamiento por defecto, o un ajuste que hay que ir a buscar?
  3. ¿Este contenido pertenece a otra persona? Un expediente profesional, un trabajo de un alumno, un documento médico, una fotografía de familia comprometen a personas que no han aceptado nada.

Este último punto es el que más se olvida, y el único que no se repara. Aceptar condiciones para uno mismo es una decisión. Aceptarlas para un tercero que no está presente, no lo es.

Lo que se sube, lo que no se sube

No existe una lista universal, porque el riesgo depende de lo que esté en juego. Este reparto vale para un servicio cuya política de reentrenamiento no está clara.

  • Un texto ya público, o destinado a serlo.
  • Un contenido que solo le afecta a usted y cuya divulgación no le costaría nada.
  • Un ejemplo reconstruido, donde los nombres, las fechas y los importes se han sustituido antes de subirlo.
  • Un identificador, una contraseña, una clave, un token de acceso.
  • Un dato de salud, un documento de identidad, un número de cuenta.
  • Un documento cubierto por un secreto profesional, un contrato con cláusula de confidencialidad, un expediente de recursos humanos.
  • El trabajo de una persona menor de edad, entregado en un marco escolar.
  • Un contenido cuya subida compromete a alguien que no le ha pedido nada.

El gesto que conviene guardar

Sustituir antes de enviar. La mayoría de los usos profesionales de un modelo no piden los nombres reales, ni las fechas reales, ni los importes reales: piden la forma del problema. Un expediente reescrito con datos de sustitución obtiene la misma ayuda y no aporta nada al depósito. Es el único gesto de este capítulo que no depende de la política de ningún servicio.

Para ir más lejos

La mecánica que hace que un modelo responda incluso sin saber nada se trata en el capítulo por qué inventa. La composición de los datos y sus efectos se tratan en el capítulo de dónde vienen los sesgos. Las situaciones en las que la herramienta se cierra por completo están reunidas en cuándo no usarla. Hay una lectura más corta del mismo tema publicada en el blog: lo que pasa con un archivo subido. El índice del curso está en la página entender.

Fuentes