No sabe que no sabe
Un modelo de lenguaje no miente y no sabe que se equivoca: produce siempre la palabra más probable, sea esa palabra verdadera o no.
Un modelo de lenguaje puede afirmar un hecho falso con exactamente la misma seguridad que un hecho verdadero. No es una mentira, y tampoco es un error que el modelo pudiera evitar estando más atento. La razón está en la forma en que se fabrica un texto, y en la forma en que estos modelos se evalúan durante su entrenamiento.
Lo que un modelo hace, exactamente
Un modelo de lenguaje no consulta una base de hechos para responder. Produce, token tras token, la palabra más probable dado todo lo que precede. Esa producción continúa de la misma manera, sea exacta o no la frase que se está escribiendo: nada, en el cálculo, se detiene para verificar un hecho contra el mundo real. Una respuesta falsa se escribe con la misma fluidez que una respuesta correcta, porque pasa por la misma mecánica.
Un examen donde adivinar renta más que abstenerse
Queda una pregunta: ¿por qué el entrenamiento no corrige esa tendencia al aplomo? Un estudio de Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala y Edwin Zhang, publicado en 2025, responde con una comparación precisa. Los procedimientos que evalúan un modelo durante su entrenamiento funcionan a menudo como un examen de opción múltiple puntuado a la antigua: una respuesta correcta gana un punto, una casilla dejada en blanco no gana ninguno, una respuesta falsa tampoco cuesta ninguno. Con ese baremo, adivinar sigue siendo siempre la mejor estrategia, incluso sin saber. Un modelo entrenado y luego puntuado con reglas parecidas aprende la misma lección: responder, en lugar de admitir una incertidumbre, hace ganar terreno en las puntuaciones que cuentan.
Como el alumnado ante una pregunta difícil, los modelos a veces adivinan en lugar de admitir su incertidumbre.
Los autores no se quedan en un diagnóstico. Avanzan una respuesta tan simple de enunciar como difícil de generalizar: cambiar el baremo de las evaluaciones para que admitir una incertidumbre cueste menos que una respuesta falsa. Mientras eso no sea la norma en las tablas que hacen la clasificación de los modelos, adivinar seguirá siendo la estrategia que más renta en el entrenamiento.
Por qué no se ve desde dentro
Nada, en el texto producido, lleva el rastro de esa incertidumbre. Un modelo no dispone de un módulo separado que evalúe su propia fiabilidad antes de escribir una frase: ninguna frontera interna separa «lo sé» de «lo estoy adivinando». Esa ausencia, documentada por la síntesis de Lei Huang y sus coautores sobre el conjunto de las causas y las formas de alucinación en los grandes modelos de lenguaje, explica por qué el error es tan difícil de detectar desde fuera: no se anuncia con ninguna señal en el tono, la longitud o la estructura de la frase.
Un debate sin zanjar: ¿es inevitable la alucinación?
Un punto va más lejos, y sigue discutido. En 2024, Ziwei Xu, Sanjay Jain y Mohan Kankanhalli publican una demostración formal, basada en la teoría de la computabilidad: un modelo de lenguaje, como función computable, no puede aprender todas las funciones computables posibles, y producirá por tanto siempre, sobre un conjunto infinito de preguntas posibles, al menos una respuesta falsa. Los autores presentan ese resultado como un límite estructural válido para todo modelo de este tipo. Es un trabajo teórico, no una constatación de uso: los propios autores señalan que ese mundo formal sigue siendo más simple que el mundo real.
En 2025, Atsushi Suzuki, Yulan He, Feng Tian y Zhongyuan Wang responden sin contradecir la demostración: la aceptan, pero cuestionan su alcance. Según ellos, aunque la alucinación no pueda desaparecer por completo sobre un conjunto infinito de casos, su probabilidad siempre puede reducirse, hasta volverse despreciable, mejorando los datos de entrenamiento y los métodos. Un resultado de imposibilidad teórica, obtenido con un argumento sobre un mundo de funciones computables, no diría por tanto nada de los problemas realmente encontrados en el uso. El desacuerdo versa menos sobre las matemáticas, que nadie pone en duda, que sobre lo que permiten concluir para un modelo realmente usado.
La tesis de la inevitabilidad
Un modelo de lenguaje es una función computable. No puede aprender todas las funciones computables posibles. Alucinará por tanto siempre, en al menos una pregunta, sea cual sea la calidad de su entrenamiento (Xu, Jain, Kankanhalli, 2024).
La respuesta de 2025
La demostración se sostiene, pero solo sobre un conjunto infinito de casos. En la práctica, la probabilidad de una alucinación se reduce con mejores datos, hasta volverse despreciable (Suzuki, He, Tian, Wang, 2025).
Lo que los dos textos comparten, a pesar de su desacuerdo, coincide con la constatación de partida: ni la teoría ni la práctica permiten a un modelo distinguir, en el momento en que escribe, una respuesta incierta de una respuesta falsa dicha con la misma seguridad. El capítulo del curso dedicado a por qué un modelo inventa detalla la mecánica que hay detrás de esa constatación.
Fuentes
- Why Language Models Hallucinate Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, 2025.
- A Survey on Hallucination in Large Language Models Lei Huang et al., 2023.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models Ziwei Xu, Sanjay Jain, Mohan Kankanhalli, 2024. Trabajo teórico cuyo alcance práctico está cuestionado: véase la fuente siguiente.
- Hallucinations are inevitable but can be made statistically negligible Atsushi Suzuki, Yulan He, Feng Tian, Zhongyuan Wang, 2025.
Este artículo se publica bajo licencia CC BY 4.0: cópielo, tradúzcalo, vuelva a publicarlo citando a la ODERSA.