De dónde vienen los sesgos
Un modelo no tiene opinión. Cuenta lo que ha visto, y luego sortea dentro de sus cuentas. Esta demostración le deja deformar usted mismo la composición de un corpus, y le muestra al modelo devolviendo exactamente la deformación que acaba de poner.
Todo se calcula en su navegador. El corpus se fabrica en este dispositivo, el modelo se aprende sobre él en este dispositivo, y nada de lo que usted ajusta sale de su máquina. Abra la pestaña Red de su navegador y manipule la demostración: no sale ninguna petición.
Deformar un corpus, y mirar qué hace el modelo con él
El corpus de esta demostración está escrito para ella, en francés, lengua en la que el nombre de la profesión lleva el género en su propia forma, y su composición está equilibrada al principio. Cada control fija, para una profesión, la proporción de frases en las que el sujeto es femenino. En cincuenta, el corpus dice tanto lo uno como lo otro. Mueva un control, y usted decide lo que el modelo habrá leído. Las frases del corpus, el cuadro de recuentos y el texto generado que aparecen más abajo están por tanto en francés; esta página da el equivalente en español de las palabras que usted ajusta.
Ajuste la composición, y luego lance el aprendizaje. La distribución del modelo, el corpus fabricado y un texto generado aparecerán aquí.
Lo que la demostración muestra
El resultado no tiene nada de sorprendente, y eso es precisamente lo que hay que entender. La proporción de femenino que devuelve el modelo es la proporción que usted ha puesto en el control. No un valor parecido, no una tendencia: el mismo valor. Un modelo de n-gramas solo cuenta, así que su resultado es un recuento.
De ahí salen dos enseñanzas, y no se confunden.
El sesgo es una consecuencia, no una intención
Nadie ha escrito en el modelo que una profesión pertenezca a un género. La regla ha aparecido en las cuentas, porque estaba en los datos. Por eso buscar la intención en un modelo es una pérdida de tiempo: la pregunta útil es siempre «¿de qué está hecho este corpus?», y esa pregunta trata de personas que han recogido, filtrado y publicado datos.
Lo que está ausente es imposible, no improbable
Retire una ciudad del corpus, y el modelo no vuelve a proponerla nunca. No la propone pocas veces: no puede proponerla, porque no tiene ninguna cuenta. Ningún ajuste de temperatura, ningún corte, ninguna longitud de contexto la hará volver. Y fíjese en lo que este corpus nunca ha contenido: París, Londres, Nueva York, Tokio no forman parte de él. Un modelo aprendido sobre eso daría la impresión de un mundo donde esas ciudades no existen, sin señalar nunca la ausencia.
Esa es la mitad del problema que se olvida. Un sesgo se nota cuando una respuesta es falsa. Una ausencia no se nota nunca, puesto que no hay nada que mirar.
El método
Aquí está el cálculo entero. Se puede repetir sin esta página, con un lápiz.
- Fabricar el corpus. Para cada profesión, escribir cuarenta frases cortas en francés. Si el control está en noventa, el noventa por ciento de esas frases son « Elle est ingénieure. » y el resto « Il est ingénieur. », o sea «Ella es ingeniera.» y «Él es ingeniero.». El reparto se extiende mediante un recuento entero, nunca mediante un sorteo: el corpus es por tanto el mismo para todo el mundo con el mismo ajuste.
- Trocear. El texto se convierte en una serie de unidades: « Elle », « est », « ingénieure », «.». El troceado empleado aquí es un troceado en palabras, más legible que el troceado en subpalabras de los modelos reales, que tiene su propio capítulo.
- Contar. Para cada contexto de dos unidades, anotar todas las unidades que lo han seguido y cuántas veces. ¿El contexto « Elle est » ha aparecido en ochenta frases? Entonces su tabla contiene las profesiones en femenino, cada una con su cuenta.
- Dividir. La probabilidad de una unidad después de un contexto es su cuenta dividida por el total de la tabla. Eso es todo lo que el modelo sabe.
- Sortear. Para generar texto, sortear en esa tabla según esas probabilidades, con un generador sembrado por la semilla mostrada.
En la etapa cuatro, la igualdad entre el ajuste y el resultado deja de ser misteriosa: una frecuencia relativa es la razón que usted ha puesto. Es lo que hace un modelo que cuenta, y es la base sobre la que los grandes modelos añaden sus mecanismos.
Lo que un modelo real añade, y lo que no quita
Esta demostración es honesta con una condición: decir dónde se detiene la analogía.
- La mecánica de fondo es la misma. Un modelo aprende regularidades estadísticas en un corpus, y las devuelve.
- La conclusión práctica es la misma. Corregir un sesgo en el modelo sin tocar los datos no trata la causa.
- El efecto de la ausencia es el mismo, y es más grave en un modelo real, donde nadie puede leer el corpus para comprobar qué falta.
- Un modelo real no copia proporciones: generaliza, y una regularidad aprendida sobre una palabra se transporta a otras palabras que nunca se han visto en ese contexto. Una deformación puede por tanto extenderse más allá de los casos presentes en los datos.
- Este corpus es sintético y deliberadamente minúsculo. Sus proporciones no describen ningún país, ninguna profesión, ninguna población. Describen el gesto que usted acaba de hacer con un control.
- Un corpus real casi nunca es legible. Precisamente por eso se propuso una documentación normalizada de los conjuntos de datos, y por eso una composición no documentada es una información que falta, no un detalle.
Lo que la investigación ha medido
Tres resultados publicados sitúan lo que la demostración hace sentir.
Incrustaciones de palabras aprendidas sobre grandes corpus de textos corrientes, en particular artículos de prensa, reproducen estereotipos de género medibles, asociando con más fuerza ciertas profesiones a un género. Un modelo estadístico estándar aprendido sobre un corpus web corriente reproduce automáticamente sesgos humanos ya conocidos y medidos por los tests psicológicos, incluidos los de género y origen. Y el efecto no se queda en el texto: sistemas comerciales de clasificación de género por imagen han presentado una tasa de error de hasta el 34,7 % en mujeres de piel oscura frente al 0,8 % en hombres de piel clara, una diferencia medida según el color de piel y el género combinados.
Esta última cifra dice el coste real. Una diferencia de rendimiento de esa magnitud no es una imperfección técnica: es un servicio que funciona para algunas personas y no para otras.
El gesto que conviene guardar
Ante una respuesta que le sorprenda por su regularidad, no pregunte al modelo por qué piensa eso: no lo sabe, y su explicación se calcula igual que el resto. Pregunte sobre qué ha aprendido, y quién ha documentado ese corpus. Cuando la respuesta a esa pregunta no existe, esa es la respuesta.
Para ir más lejos
El troceado del texto en unidades se trata en el capítulo las palabras en trozos. La distribución y su sorteo se tratan en el capítulo la próxima palabra. Qué pasa con un contenido confiado a un servicio se trata en el capítulo lo que se le da. Las situaciones en las que la herramienta se cierra están reunidas en cuándo no usarla. Todas las demostraciones del sitio están reunidas en la página demostraciones, y el índice del curso en la página entender.
Fuentes
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama, Adam Tauman Kalai, 2016. Establece que incrustaciones de palabras entrenadas sobre grandes corpus de textos corrientes reproducen estereotipos de género medibles, por ejemplo asociando con más fuerza ciertas profesiones a un género antes que al otro.
- Semantics derived automatically from language corpora contain human-like biases Aylin Caliskan, Joanna J. Bryson, Arvind Narayanan, 2017. Establece que un modelo estadístico estándar entrenado sobre un corpus web corriente reproduce automáticamente sesgos humanos ya conocidos y medidos por los tests psicológicos de tipo IAT, incluidos los de género y raza.
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification Joy Buolamwini, Timnit Gebru, 2018. Establece que sistemas comerciales de clasificación de género por imagen han presentado una tasa de error de hasta el 34,7 % en mujeres de piel oscura frente al 0,8 % en hombres de piel clara.
- Datasheets for Datasets Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018. Establece que existe una propuesta normalizada para documentar la procedencia, la composición y el modo de recogida de un conjunto de datos, a fin de poder remontarse al origen de un sesgo constatado en lugar de descubrirlo solo una vez desplegado el modelo.
- Corpus sintético de la ODERSA, escrito para esta demostración ODERSA, 2026, publicado bajo licencia CC BY 4.0. Su composición por defecto está equilibrada, sus frases se pueden leer enteras en esta página, y no describe ninguna población real.