它不知道自己不知道
语言模型不说谎,也不知道自己错了:它永远产出概率最高的那个词,不管这个词是真的还是假的。
语言模型可以用和陈述一个真事实完全相同的笃定,去断言一个假事实。这不是说谎,也不是一个只要更用心就能避开的错误。原因在于一段文本是怎么造出来的,以及这些模型在训练期间是怎么被评价的。
模型到底做了什么
语言模型回答问题时不查任何事实库。它一个词元接一个词元地产出最有可能的那个词,依据的是它前面的全部内容。不管正在写出来的这句话准不准,这个产出过程都以同样的方式继续:计算里没有任何一步会停下来,把一个事实拿去和真实世界核对。一个错误的回答写得和一个正确的回答一样流畅,因为它走的是同一套机理。
一场“猜比弃答更划算”的考试
还有一个问题:为什么训练没有纠正这种笃定的倾向?Adam Tauman Kalai、Ofir Nachum、Santosh S. Vempala 和 Edwin Zhang 在 2025 年发表的一项研究,用一个精确的类比作出了回答。在训练期间评价模型的那些流程,常常像一场按老规矩打分的多选题考试:答对得一分,留空不得分,答错也不扣分。在这种记分规则下,即使不知道,猜也永远是最好的策略。一个按相近规则训练并打分的模型,学到的正是同一个教训:作答,而不是承认不确定,能在那些算数的分数上占到便宜。
就像学生面对一道难题,模型有时会去猜,而不是承认自己不确定。
作者们并不止于诊断。他们提出了一个说起来简单、推广起来很难的对策:改掉评测的记分规则,让承认不确定的代价小于给出一个错误答案。只要给模型排名的那些评分表还没把这条当成惯例,猜就仍然是在训练里回报最高的策略。
为什么从里面看不出来
产出的文本里,没有任何东西带着这份不确定的痕迹。模型没有一个独立的模块,会在写下一句话之前评估自己的可靠程度:它内部没有任何界线把“我知道”和“我在猜”分开。这一处缺失,被 Lei Huang 及其合作者关于大语言模型幻觉全部成因与形态的综述记录下来,它解释了为什么这种错误从外面极难发现:语气、长度或句子结构上都没有任何迹象来预告它。
一个没有定论的争议:幻觉是不可避免的吗
有一点走得更远,而它仍在讨论中。2024 年,Ziwei Xu、Sanjay Jain 和 Mohan Kankanhalli 发表了一个基于可计算性理论的形式论证:语言模型作为一个可计算函数,不可能学会所有可能的可计算函数,因此在一个无限的可能问题集合上,它总会至少产出一个错误答案。作者把这个结果呈现为对所有这类模型都成立的结构性限度。这是一项理论工作,不是一次使用观察:作者自己也指出,这个形式化的世界比真实世界简单。
2025 年,Atsushi Suzuki、Yulan He、Feng Tian 和 Zhongyuan Wang 作出回应,但没有反驳那个论证:他们接受它,只是质疑它的适用范围。在他们看来,即使幻觉无法在一个无限的案例集合上彻底消失,它的概率仍然可以通过改进训练数据和方法而降低,一直降到可以忽略。也就是说,一个用“可计算函数世界”里的论证得出的理论不可能性结果,对使用中真正遇到的问题并没有说什么。这场分歧针对的不是数学,数学没人质疑,而是数学能为一个真正被使用的模型推出什么结论。
“不可避免”这一方
语言模型是一个可计算函数。它不可能学会所有可能的可计算函数。所以不管训练质量多高,它至少在一个问题上总会产生幻觉(Xu, Jain, Kankanhalli,2024 年)。
2025 年的回应
那个论证成立,但只在一个无限的案例集合上成立。在实践中,幻觉的概率会随着数据变好而降低,一直降到可以忽略(Suzuki, He, Tian, Wang,2025 年)。
尽管有分歧,两篇文章共有的东西回到了最初那个结论:无论理论还是实践,都不能让模型在写出来的那一刻,把一个不确定的回答和一个用同样笃定说出的错误回答区分开。课程里讲模型为什么会编造的那一章,详细讲了这个结论背后的机理。
来源
- Why Language Models Hallucinate Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang,2025 年。
- A Survey on Hallucination in Large Language Models Lei Huang 等,2023 年。
- Hallucination is Inevitable: An Innate Limitation of Large Language Models Ziwei Xu, Sanjay Jain, Mohan Kankanhalli,2024 年。一项理论工作,其实践适用范围受到质疑:见下一条来源。
- Hallucinations are inevitable but can be made statistically negligible Atsushi Suzuki, Yulan He, Feng Tian, Zhongyuan Wang,2025 年。
本文以 CC BY 4.0 许可协议发布: 欢迎复制、翻译、再发布,署名 ODERSA 即可。