El glosario
Cada palabra que emplea este curso, definida con claridad, con un ancla para que un capítulo remita directamente a ella.
El vocabulario corriente de este campo es engañoso, y saber por qué forma parte del curso. Palabras tomadas de la mente humana, «entender», «saber», «aprender», «alucinar», describen aquí un cálculo, nunca un estado interior. Un modelo de lenguaje no entiende nada, no sabe nada y no aprende nada en el sentido en que lo hace una persona: ajusta parámetros numéricos sobre un corpus, y luego calcula una continuación probable a partir de un texto recibido en la entrada. Decir que «alucina» no describe un trastorno: nombra un resultado plausible y falso, producido por el mismo cálculo que produce una respuesta correcta. Este glosario conserva esas palabras porque el curso y la investigación las emplean, pero cada definición las devuelve al cálculo que designan realmente.
Las palabras, en orden alfabético
Cada entrada lleva un ancla: un capítulo del curso puede remitir directamente a ella. Una palabra enlazada, dentro de una definición, tiene su propia entrada, más arriba o más abajo en esta lista.
- Ajuste fino (fine-tuning)
- Un segundo entrenamiento, más corto y hecho sobre un corpus más estrecho, que ajusta un modelo ya entrenado para una tarea o un estilo concretos. Parte de los parámetros obtenidos en el primer entrenamiento en lugar de empezar de cero. Un modelo con ajuste fino sigue siendo un modelo de lenguaje: su mecánica de cálculo no cambia, solo sus parámetros se desplazan un poco.
- Alfabetización en inteligencia artificial
- El conjunto de saberes, destrezas y actitudes que permiten usar un sistema de inteligencia artificial, cuestionarlo y, para algunos públicos, diseñarlo, sin entregarse a él a ciegas. Un marco común publicado en 2026 por la OCDE y la Comisión Europea la describe en cuatro ámbitos de competencias, pensados para la enseñanza primaria y secundaria. El detalle de ese marco y de los marcos internacionales que lo completan está reunido en la página los marcos oficiales.
- Alucinación
- Una respuesta inventada pero formulada con el mismo aplomo que una respuesta correcta. Sale del mismo cálculo que cualquier otra respuesta: nada, en el funcionamiento del modelo, separa un hecho verificado de una extrapolación plausible, y los procedimientos de entrenamiento y de evaluación actuales recompensan una respuesta plausible antes que una admisión de incertidumbre. Un trabajo teórico sostiene que cierta tasa de alucinación sería matemáticamente inevitable para este tipo de modelo; la conclusión sigue en discusión, y otros trabajos cuestionan que sus hipótesis se apliquen a los usos reales.
- Aplomo
- El tono seguro de una respuesta, sea correcta o no. Un modelo no baja el tono cuando inventa: nada en su formulación distingue un hecho verificado de una alucinación. La seguridad de una respuesta no es por tanto nunca una prueba de su exactitud.
- Aprendizaje automático
- La familia de métodos en la que un programa regula su comportamiento a partir de ejemplos, en lugar de seguir reglas escritas a mano una a una. Un modelo de lenguaje y un generador de imágenes son dos aplicaciones suyas. El aprendizaje profundo es su rama más empleada hoy.
- Aprendizaje profundo
- Una forma de hacer aprendizaje automático con una red neuronal compuesta de numerosas capas apiladas. Cada capa transforma un poco más la información recibida de la anterior, lo que permite detectar regularidades que una regla escrita a mano no captaría. Es la técnica que hay detrás de los modelos de lenguaje y de los generadores de imágenes actuales.
- Artefacto
- Un rastro dejado por la fabricación de una imagen o de un sonido, invisible al ojo o al oído pero medible mediante un cálculo. Las operaciones que amplían una imagen durante su generación dejan por ejemplo una huella regular, detectable en el detalle de las frecuencias del archivo. Un artefacto ayuda a detectar una imagen fabricada, pero los modelos recientes dejan cada vez menos.
- Caja negra
- Un sistema cuyas respuestas se pueden observar pero cuyo razonamiento interno no se puede leer, ni siquiera siendo quien lo diseñó. Un modelo de lenguaje es una caja negra en ese sentido: sus parámetros, miles de millones de números ajustados durante el entrenamiento, no tienen un significado individual que una persona pudiera releer uno a uno. Eso no impide probar lo que el sistema hace en la práctica, solo explicar por qué lo hace exactamente así.
- Clonación de voz
- Una técnica que reproduce la voz de una persona concreta a partir de una muestra de audio, para hacerle decir una frase que nunca ha pronunciado. Una autoridad pública estadounidense documentó y sancionó así una campaña real que usaba una voz clonada imitando a un responsable político ante votantes antes de una elección. Es una forma de ultrafalsificación aplicada específicamente a la voz.
- Código abierto
- Un modelo cuyo código, cuyos parámetros o ambos se publican, para que otras personas puedan inspeccionarlos, reutilizarlos o verificarlos, en lugar de acceder a ellos únicamente a través de un servicio cerrado. La apertura no dice nada por sí sola de los datos de entrenamiento empleados: un modelo puede publicar sus parámetros sin documentar nunca su corpus. «Código abierto» y «conjunto de datos documentado» siguen siendo por tanto dos garantías distintas, rara vez reunidas.
- Conjunto de datos
- Un corpus organizado y documentado para un uso concreto: se supone que su composición, su origen y la forma en que se ha recogido son conocidas, y no solo su contenido. Existe una propuesta de documentación normalizada desde 2018 para eso, con el fin de remontarse al origen de un sesgo constatado en lugar de descubrirlo una vez desplegado el modelo. Un conjunto de datos no documentado no es, en la práctica, más que un corpus.
- Corpus
- El conjunto de textos, imágenes o sonidos con los que un modelo aprende, su única fuente de regularidades. Un conjunto de datos es un corpus organizado y documentado para un uso concreto; la palabra corpus designa el contenido en bruto, antes de ese trabajo. Lo que no está en el corpus no existe para el modelo de ninguna manera: ni como una cosa rara, ni como una cosa falsa.
- Detector
- Una herramienta que pretende decir si un texto, una imagen o una voz los ha producido un modelo. Una evaluación independiente de catorce detectores de texto, entre ellos herramientas comerciales vendidas a la enseñanza, no encontró ninguno que fuera a la vez fiable y preciso. Un detector nunca devuelve un veredicto: en el mejor de los casos, un indicio que hay que contrastar.
- Distribución de probabilidad
- La lista de los tokens posibles para continuar un texto, cada uno acompañado de un número entre cero y uno que dice su probabilidad, siendo la suma de todos uno. El modelo calcula esa lista en cada etapa, y luego un muestreo elige un token dentro. La temperatura, el top-k y el top-p son tres formas de retocar esa lista antes de sortear en ella.
- Entrenamiento
- El cálculo, hecho una vez antes de cualquier puesta a disposición, que ajusta los parámetros de un modelo para que devuelva cada vez mejor las regularidades de su corpus. Una vez terminado el entrenamiento, esos parámetros quedan fijos: usarlos después para producir una respuesta es una operación distinta, la inferencia. Un ajuste fino es un segundo entrenamiento, más corto, sobre un corpus más estrecho.
- Extracción de datos de entrenamiento
- El hecho de obtener, mediante una pregunta corriente hecha al modelo, un pasaje que figuraba palabra por palabra en su corpus de entrenamiento. Así, investigadores han extraído gigabytes de datos de entrenamiento de modelos realmente desplegados en producción, mediante un método simple. Es la prueba más directa de la memorización: ya no es una posibilidad teórica, es un texto recuperado.
- Falso positivo y falso negativo
- Las dos formas en que un detector se equivoca: el falso positivo acusa a un contenido humano de haberlo producido un modelo, el falso negativo deja pasar un contenido producido por un modelo diciendo que es humano. Varios detectores de texto muy usados clasifican así por error la mayoría de los textos de hablantes no nativos de inglés como generados por una máquina, mientras reconocen correctamente los de hablantes nativos: ese falso positivo no se reparte al azar. Una herramienta que busca reducir uno de esos dos riesgos aumenta casi siempre el otro.
- Generador de imágenes
- Un sistema que produce una imagen nueva a partir de una descripción en texto. El método más empleado hoy para ello es el modelo de difusión. Como un modelo de lenguaje, un generador de imágenes no ha visto ninguna escena real que copiaría: ensambla una imagen plausible a partir de las regularidades visuales de su corpus de entrenamiento.
- Incrustación (embedding)
- La representación de una palabra o de un token en forma de una lista de números, construida durante el entrenamiento para que dos palabras empleadas en contextos parecidos reciban listas parecidas. Incrustaciones aprendidas sobre grandes corpus de textos corrientes reproducen así estereotipos de género medibles, por ejemplo asociando con más fuerza ciertas profesiones a un género antes que al otro. Una incrustación dice por tanto tanto del corpus de origen como de las palabras mismas.
- Inferencia
- El cálculo que produce una respuesta a partir de un modelo ya entrenado, por oposición al entrenamiento que fijó antes sus parámetros. Es lo que ocurre cada vez que una instrucción recibe una respuesta: ningún parámetro cambia, solo se ejecuta un cálculo sobre valores ya fijados.
- Instrucción (prompt)
- El texto dado como entrada a un modelo para obtener una respuesta. Su formulación cambia lo que el modelo devuelve, puesto que calcula su continuación a partir de ese texto preciso y de ningún otro. Una instrucción sigue siendo texto corriente: no manda nada en el sentido de un programa, orienta un cálculo probable.
- Marca de agua
- Una señal depositada voluntariamente en un contenido generado, invisible en el uso corriente, que una herramienta dedicada puede recuperar. En un texto puede tomar la forma de un ligero favoritismo estadístico hacia ciertas palabras en cada etapa, un favoritismo demasiado discreto para verse al leer pero detectable mediante un cálculo, un método ya publicado y revisado por pares. Una marca de agua supone que la herramienta que la puso, u otra que conozca el método, siga existiendo para buscarla.
- Memorización
- El hecho de que un modelo pueda devolver palabra por palabra un fragmento de sus datos de entrenamiento, en lugar de reformularlo. Ese fenómeno aumenta con el tamaño del modelo, con el número de veces que un mismo contenido está duplicado en los datos, y con la longitud del texto dado como contexto antes de pedir una continuación. Un modelo no tiene un archivo donde recuperar ese texto: el contenido ha modificado sus parámetros, y es esa modificación la que puede, en algunos casos, devolverlo casi intacto.
- Metadatos
- Información adjunta a un archivo y que trata del propio archivo, su origen, la fecha de su creación, las modificaciones que ha sufrido, antes que de lo que muestra. Un dato de procedencia es un tipo de metadato. Un metadato puede desaparecer con una simple captura de pantalla o con un guardado en otro formato, lo que lo vuelve frágil como prueba.
- Modelo de difusión
- Una técnica que fabrica una imagen partiendo de un ruido visual aleatorio, y quitándolo luego por etapas sucesivas hasta hacer aparecer una imagen plausible, guiada por una descripción en texto. Es el método más empleado hoy detrás de los generadores de imágenes. Como toda imagen generada, el resultado puede llevar un artefacto que revela su fabricación, incluso cuando nada es visible a simple vista.
- Modelo de lenguaje
- Un sistema entrenado sobre texto que calcula, a partir de lo que precede, el token más probable para continuar. Repite ese cálculo token tras token para ensamblar una respuesta entera. No consulta ninguna base de hechos al lado de ese cálculo: todo lo que devuelve viene de la misma operación, trátese de un hecho verificado o de una alucinación.
- Muestreo
- El gesto que elige un token en la distribución de probabilidad calculada por el modelo, en lugar de tomar sistemáticamente el más probable. Elegir siempre el más probable produce un texto plano y repetitivo; sortear según las probabilidades, eventualmente reencuadradas por la temperatura, el top-k o el top-p, produce un texto más natural.
- Parámetro
- Un número interno al modelo, ajustado durante el entrenamiento, que pesa en su cálculo. También se llama peso. Un modelo tiene miles de millones, y ninguno de ellos, tomado por separado, tiene un sentido que una persona pudiera leer: es su conjunto el que produce un cálculo útil, nunca un parámetro solo.
- Procedencia
- El rastro verificable del origen de un archivo y de su historial de modificación, adjunto al archivo antes que escondido en su contenido. Una norma técnica pública, C2PA, define cómo adjuntar esa información de forma firmada y verificable. El estándar reconoce él mismo que esa información puede separarse del archivo, y por tanto perderse con una simple captura de pantalla: la procedencia protege el archivo de origen, no sus copias.
- Red neuronal
- Una estructura de cálculo hecha de capas de unidades simples, cada una combinando lo que recibe con parámetros propios. El nombre viene de una inspiración lejana en la neurona biológica, pero una unidad de red no piensa, igual que una neurona aislada no piensa: es el ajuste del conjunto, mediante el entrenamiento, lo que produce un cálculo útil. El transformador es la arquitectura de este tipo más empleada hoy para el texto.
- Sesgo
- Una desviación sistemática que el modelo reproduce, aprendida en las regularidades del corpus que lo entrenó, nunca una opinión que se hubiera formado. Si los datos asocian más a menudo una profesión a un género, el modelo devolverá la misma asociación, en el mismo grado. El sesgo de representación es una forma particular suya: la que viene de lo que falta en los datos antes que de lo que en ellos sobra.
- Sesgo de representación
- El sesgo que viene de que un grupo, una situación o un idioma está ausente o subrepresentado en los datos de entrenamiento, antes que de una asociación deformada. Un sistema de clasificación por imagen presentó así una tasa de error de hasta el 34,7 % en mujeres de piel oscura frente al 0,8 % en hombres de piel clara, una desviación ligada a la composición de los datos de aprendizaje. Lo que los datos no contienen, el modelo no puede devolverlo: no se equivoca en ello, lo ignora.
- Temperatura
- Un ajuste que suaviza o endurece la distribución de probabilidad calculada por el modelo, antes del muestreo. Una temperatura más alta acerca las probabilidades de las distintas palabras posibles, lo que vuelve las elecciones menos previsibles; una temperatura más baja acentúa la diferencia a favor de la palabra ya más probable. No es una medida física: la palabra está tomada de una fórmula de física estadística, sin relación con un calor real.
- Token (unidad)
- La unidad de texto más pequeña que un modelo maneja, a menudo más corta que una palabra entera. Una palabra rara o desconocida se trocea entonces en varios tokens hechos de fragmentos ya conocidos, lo que permite tratarla sin haberla visto nunca tal cual. Cada token se convierte después en número antes de cualquier cálculo: un modelo no lee nunca letras, lee números.
- Tokenización
- La operación que trocea un texto en tokens antes de cualquier cálculo. El método más empleado hoy viene en origen de un algoritmo de compresión de datos de 1994, sin relación con el lenguaje en su concepción. Un mismo contenido traducido a idiomas distintos puede exigir hasta quince veces más tokens según el idioma, lo que vuelve algunos idiomas más lentos y más costosos de tratar que otros.
- Top-k
- Un método que restringe el sorteo a los k tokens más probables en cada etapa, siendo k un número fijado por adelantado. Los tokens menos probables se descartan así antes incluso del muestreo, lo que evita una elección demasiado improbable sin volver el resultado completamente previsible.
- Top-p
- Un método que restringe el sorteo al conjunto más pequeño de tokens cuyas probabilidades acumuladas alcanzan p, antes que a un número fijo de tokens como el top-k. Ese conjunto cambia por tanto de tamaño de una etapa a otra: amplio cuando varias palabras quedan cercanas en probabilidad, reducido cuando una palabra domina claramente a las demás. Este método, llamado también muestreo nucleus, sustituye a la elección sistemática de la palabra más probable, más plana y repetitiva.
- Transformador (transformer)
- La arquitectura de red neuronal que hay detrás de los modelos de lenguaje actuales. En lugar de leer un texto token tras token en un orden estricto, compara cada token con todos los demás tokens de la ventana de contexto de una sola vez, y pondera su importancia unos respecto a otros. Es esa mecánica de comparación simultánea la que ha permitido entrenar modelos sobre corpus mucho más grandes que antes.
- Ultrafalsificación (deepfake)
- Una imagen, un vídeo o un sonido fabricado o modificado por un modelo para hacer creer en un acontecimiento que nunca ha ocurrido. La clonación de voz es una forma suya, aplicada a la voz. Observadores humanos ya no logran distinguir de forma fiable un rostro de síntesis reciente de un rostro real, y lo juzgan incluso de media más digno de confianza.
- Ventana de contexto
- La cantidad máxima de texto, contada en tokens, que un modelo puede tener en cuenta a la vez para calcular su respuesta. Lo que se ha escrito antes de esa ventana ya no entra en el cálculo en curso, exactamente como si nunca hubiera existido. Un documento más largo que la ventana debe cortarse o resumirse antes de confiarlo entero al modelo.
Ver las nociones en acción
Este glosario fija el vocabulario. El curso entender lo emplea capítulo a capítulo, y las demostraciones lo ponen en movimiento: en ellas se ajusta una temperatura, se deforma un corpus, se mira aparecer una marca de agua.
Fuentes
Las definiciones que comprometen un hecho preciso lo enlazan aquí, término por término, sin cargar cada una de ellas.
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019. Artefacto. El componente de sobremuestreo de las imágenes generadas deja una huella espectral característica y reproducible.
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018. Sesgo de representación. Sistemas comerciales de clasificación de género por imagen han presentado una tasa de error de hasta el 34,7 % en mujeres de piel oscura frente al 0,8 % en hombres de piel clara.
- FCC Makes AI-Generated Voices in Robocalls Illegal (declaración FCC 24-17), Federal Communications Commission (FCC), 2024. Clonación de voz. Una autoridad pública estadounidense documentó y sancionó una campaña real de fraude por voz clonada, imitando a un responsable político antes de una elección.
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023. Detector. Catorce herramientas de detección evaluadas: ninguna es a la vez fiable y precisa.
- The Curious Case of Neural Text Degeneration, Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, Yejin Choi, 2020. Muestreo y top-p. Elegir sistemáticamente la palabra más probable produce un texto plano y repetitivo; el muestreo nucleus, que trunca la parte poco fiable de la distribución, produce un texto más natural.
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023. Extracción de datos de entrenamiento. Se han extraído gigabytes de datos de entrenamiento de modelos realmente desplegados en producción, mediante un ataque simple.
- GPT detectors are biased against non-native English writers, Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou, 2023. Falso positivo y falso negativo. Varios detectores muy usados clasifican por error la mayoría de los textos de hablantes no nativos de inglés como generados por una IA, mientras identifican correctamente los de hablantes nativos.
- A Watermark for Large Language Models, John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein, 2023. Marca de agua. Es posible insertar en un texto generado una marca de agua estadística invisible al ojo humano, detectable después mediante un test estadístico.
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam, Johannes Welbl, et al., 2024. Marca de agua. Una marca de agua estadística integrada en la producción de texto se ha publicado y revisado por pares en la revista Nature.
- Why Language Models Hallucinate, Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, 2025. Alucinación. Los procedimientos de entrenamiento y de evaluación actuales recompensan producir una respuesta plausible antes que admitir una incertidumbre.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu, Sanjay Jain, Mohan Kankanhalli, 2024. Alucinación. En discusión: este trabajo sostiene que cierta tasa de alucinación es matemáticamente inevitable para este tipo de modelo; trabajos posteriores cuestionan que sus hipótesis se apliquen a los usos reales y finitos de los modelos.
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022. Ultrafalsificación. Observadores humanos ya no distinguen de forma fiable un rostro sintético de un rostro real, y juzgan incluso los rostros sintéticos de media más dignos de confianza.
- Datasheets for Datasets, Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018. Conjunto de datos. Existe una propuesta normalizada para documentar la procedencia, la composición y el modo de recogida de un conjunto de datos.
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education («AILit Framework»), OCDE y Comisión Europea, 2026. Alfabetización en inteligencia artificial. El marco común publicado por la OCDE y la Comisión Europea, cuatro ámbitos de competencias para primaria y secundaria.
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini, Daphne Ippolito, Matthew Jagielski, Katherine Lee, Florian Tramer, Chiyuan Zhang, 2023. Memorización. Aumenta con el tamaño del modelo, con la duplicación de un ejemplo en los datos, y con la longitud del texto dado como contexto.
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama, Adam Tauman Kalai, 2016. Incrustación. Incrustaciones aprendidas sobre grandes corpus de textos corrientes reproducen estereotipos de género medibles.
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026. Procedencia. Una norma técnica pública define cómo adjuntar a un archivo información verificable y firmada sobre su origen.
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026. Procedencia. El estándar reconoce él mismo que su manifiesto puede separarse del archivo, y por tanto perderse con una simple captura de pantalla.
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton, Oriol Vinyals, Jeff Dean, 2015. Temperatura. El parámetro de temperatura en la fórmula softmax suaviza o endurece la distribución de probabilidad calculada por el modelo.
- A New Algorithm for Data Compression, Philip Gage, 1994. Tokenización. El algoritmo que hoy se usa para la tokenización se concibió en origen como un método general de compresión de datos, sin relación con el lenguaje.
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr, Adel Bibi, 2023. Tokenización. Un mismo contenido traducido a distintos idiomas puede necesitar hasta quince veces más tokens según el idioma.
- Hierarchical Neural Story Generation, Angela Fan, Mike Lewis, Yann Dauphin, 2018. Top-k. El muestreo top-k, que restringe el sorteo a las k palabras más probables en cada etapa, sirve para generar un texto más variado que una elección siempre determinista.