Este es un sitio oficial de la ODERSA. Así es como puede saberlo

El dominio oficial

La dirección de este sitio termina en odersa.org. Cada servicio de la asociación está en un subdominio de odersa.org y en ningún otro lugar. Si la dirección que aparece en la barra de su navegador no termina en odersa.org, este sitio no es nuestro.

Gratuito, y sin cuenta

Todo está abierto desde el primer momento. Sin registro, sin cuenta, sin contraseña, sin suscripción, sin publicidad. Nada se reserva a quien paga, porque aquí no se paga nada.

Ningún dato recopilado

Este sitio no le sigue la pista: ni rastreadores, ni cookies de seguimiento, ninguna herramienta de medición incorporada en estas páginas, y nada medido en su dispositivo. Nuestro alojamiento cuenta los accesos de forma agregada, como hace cualquier servidor que responde: un total, nunca un perfil. No hace falta que nos crea: abra las herramientas de desarrollo de su navegador, pestaña Red, y recargue la página. Verá la lista completa de lo que el sitio pide. Todo viene de odersa.org, nada sale a otra parte.

Contenidos libres

Los contenidos se publican bajo licencia CC BY 4.0. Puede copiarlos, traducirlos, imprimirlos y redistribuirlos, tanto para sus clases como para su gente, con una única condición: citar a la ODERSA.

De dónde vienen los sesgos

Un modelo no tiene opinión. Cuenta lo que ha visto, y luego sortea dentro de sus cuentas. Esta demostración le deja deformar usted mismo la composición de un corpus, y le muestra al modelo devolviendo exactamente la deformación que acaba de poner.

La sala de lectura de la biblioteca Sainte-Geneviève de París, sus largas mesas y sus estanterías bajo una bóveda
Un corpus de entrenamiento es una colección de textos. Lo que una colección contiene, y lo que deja fuera, reaparece en las respuestas. Fotografía: JOHN TOWNER heytowner, página del archivo, licencia CC0 (texto de la licencia).
Información

Todo se calcula en su navegador. El corpus se fabrica en este dispositivo, el modelo se aprende sobre él en este dispositivo, y nada de lo que usted ajusta sale de su máquina. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición.

Deformar un corpus, y mirar qué hace el modelo con él

El corpus de esta demostración está escrito para ella, en francés, lengua en la que el nombre de la profesión lleva el género en su propia forma, y su composición está equilibrada al principio. Cada control fija, para una profesión, la proporción de frases en las que el sujeto es femenino. En cincuenta, el corpus dice tanto lo uno como lo otro. Mueva un control, y usted decide lo que el modelo habrá leído. Las frases del corpus, el cuadro de recuentos y el texto generado que aparecen más abajo están por tanto en francés; esta página da el equivalente en español de las palabras que usted ajusta.

La composición del corpus
50 %
En cero, ninguna frase dice « ingénieure », la forma femenina. En cien, ninguna dice « ingénieur », la masculina.
50 %
El mismo ajuste, sobre otra profesión.
50 %
El mismo ajuste, sobre una profesión de dirección.
50 %
El mismo ajuste, sobre una profesión artesanal.

Otras cuatro profesiones se quedan equilibradas en cincuenta y sirven de control: « chercheur » (investigador), « enseignant » (docente), « technicien » (técnico) y « avocat » (abogado). No se mueven, y eso es lo que vuelve legible la diferencia.

Las ciudades presentes en el corpus

El corpus contiene además frases de la forma « Le train part de ville », el tren sale de tal ciudad. Desmarque una ciudad para retirarla por completo de los datos, y mire lo que el modelo puede seguir diciendo. El corpus escribe el nombre de la ciudad como lo escribe el francés, y esa es la forma que usted volverá a encontrar en el resultado.

Una palabra o un número. Dos personas que escriban la misma semilla obtienen exactamente el mismo texto generado, lo que hace esta demostración citable en clase.

Ajuste la composición, y luego lance el aprendizaje. La distribución del modelo, el corpus fabricado y un texto generado aparecerán aquí.

Lo que la demostración muestra

El resultado no tiene nada de sorprendente, y eso es precisamente lo que hay que entender. La proporción de femenino que devuelve el modelo es la proporción que usted ha puesto en el control. No un valor parecido, no una tendencia: el mismo valor. Un modelo de n-gramas solo cuenta, así que su resultado es un recuento.

De ahí salen dos enseñanzas, y no se confunden.

El sesgo es una consecuencia, no una intención

Nadie ha escrito en el modelo que una profesión pertenezca a un género. La regla ha aparecido en las cuentas, porque estaba en los datos. Por eso buscar la intención en un modelo es una pérdida de tiempo: la pregunta útil es siempre «¿de qué está hecho este corpus?», y esa pregunta trata de personas que han recogido, filtrado y publicado datos.

Lo que está ausente es imposible, no improbable

Retire una ciudad del corpus, y el modelo no vuelve a proponerla nunca. No la propone pocas veces: no puede proponerla, porque no tiene ninguna cuenta. Ningún ajuste de temperatura, ningún corte, ninguna longitud de contexto la hará volver. Y fíjese en lo que este corpus nunca ha contenido: París, Londres, Nueva York, Tokio no forman parte de él. Un modelo aprendido sobre eso daría la impresión de un mundo donde esas ciudades no existen, sin señalar nunca la ausencia.

Esa es la mitad del problema que se olvida. Un sesgo se nota cuando una respuesta es falsa. Una ausencia no se nota nunca, puesto que no hay nada que mirar.

El método

Aquí está el cálculo entero. Se puede repetir sin esta página, con un lápiz.

  1. Fabricar el corpus. Para cada profesión, escribir cuarenta frases cortas en francés. Si el control está en noventa, el noventa por ciento de esas frases son « Elle est ingénieure. » y el resto « Il est ingénieur. », o sea «Ella es ingeniera.» y «Él es ingeniero.». El reparto se extiende mediante un recuento entero, nunca mediante un sorteo: el corpus es por tanto el mismo para todo el mundo con el mismo ajuste.
  2. Trocear. El texto se convierte en una serie de unidades: « Elle », « est », « ingénieure », «.». El troceado empleado aquí es un troceado en palabras, más legible que el troceado en subpalabras de los modelos reales, que tiene su propio capítulo.
  3. Contar. Para cada contexto de dos unidades, anotar todas las unidades que lo han seguido y cuántas veces. ¿El contexto « Elle est » ha aparecido en ochenta frases? Entonces su tabla contiene las profesiones en femenino, cada una con su cuenta.
  4. Dividir. La probabilidad de una unidad después de un contexto es su cuenta dividida por el total de la tabla. Eso es todo lo que el modelo sabe.
  5. Sortear. Para generar texto, sortear en esa tabla según esas probabilidades, con un generador sembrado por la semilla mostrada.

En la etapa cuatro, la igualdad entre el ajuste y el resultado deja de ser misteriosa: una frecuencia relativa es la razón que usted ha puesto. Es lo que hace un modelo que cuenta, y es la base sobre la que los grandes modelos añaden sus mecanismos.

Lo que un modelo real añade, y lo que no quita

Esta demostración es honesta con una condición: decir dónde se detiene la analogía.

  • La mecánica de fondo es la misma. Un modelo aprende regularidades estadísticas en un corpus, y las devuelve.
  • La conclusión práctica es la misma. Corregir un sesgo en el modelo sin tocar los datos no trata la causa.
  • El efecto de la ausencia es el mismo, y es más grave en un modelo real, donde nadie puede leer el corpus para comprobar qué falta.
  • Un modelo real no copia proporciones: generaliza, y una regularidad aprendida sobre una palabra se transporta a otras palabras que nunca se han visto en ese contexto. Una deformación puede por tanto extenderse más allá de los casos presentes en los datos.
  • Este corpus es sintético y deliberadamente minúsculo. Sus proporciones no describen ningún país, ninguna profesión, ninguna población. Describen el gesto que usted acaba de hacer con un control.
  • Un corpus real casi nunca es legible. Precisamente por eso se propuso una documentación normalizada de los conjuntos de datos, y por eso una composición no documentada es una información que falta, no un detalle.

Lo que la investigación ha medido

Tres resultados publicados sitúan lo que la demostración hace sentir.

Incrustaciones de palabras aprendidas sobre grandes corpus de textos corrientes, en particular artículos de prensa, reproducen estereotipos de género medibles, asociando con más fuerza ciertas profesiones a un género. Un modelo estadístico estándar aprendido sobre un corpus web corriente reproduce automáticamente sesgos humanos ya conocidos y medidos por los tests psicológicos, incluidos los de género y origen. Y el efecto no se queda en el texto: sistemas comerciales de clasificación de género por imagen han presentado una tasa de error de hasta el 34,7 % en mujeres de piel oscura frente al 0,8 % en hombres de piel clara, una diferencia medida según el color de piel y el género combinados.

Esta última cifra dice el coste real. Una diferencia de rendimiento de esa magnitud no es una imperfección técnica: es un servicio que funciona para algunas personas y no para otras.

El gesto que conviene guardar

Ante una respuesta que le sorprenda por su regularidad, no pregunte al modelo por qué piensa eso: no lo sabe, y su explicación se calcula igual que el resto. Pregunte sobre qué ha aprendido, y quién ha documentado ese corpus. Cuando la respuesta a esa pregunta no existe, esa es la respuesta.

Para ir más lejos

El troceado del texto en unidades se trata en el capítulo las palabras en trozos. La distribución y su sorteo se tratan en el capítulo la próxima palabra. Qué pasa con un contenido confiado a un servicio se trata en el capítulo lo que se le da. Las situaciones en las que la herramienta se cierra están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.

Fuentes