Interview: 从训练目标角度分析LLM幻觉的根本原因


题目解析

LLM幻觉是指模型生成看似合理但实际不正确的内容。本题要求从训练目标的本质出发分析其根源,而非仅停留在现象层面。需要理解语言建模目标和事实准确性之间的内在张力,这是当前大模型最核心的未解问题之一。

解答思路

根本原因在于训练目标的错配:语言模型的训练目标是最大化下一个token的条件概率P(x_t x_{<t}),这本质上是学习语言的分布模式而非事实知识的可靠存储。模型学到的是”什么文本序列看起来合理”而非”什么是真的”。当模型面对不确定的知识时,训练目标驱动它生成流畅连贯的文本,而非承认无知。这种流畅性优先的倾向是幻觉的根源。

关键要点

三个核心原因:1)训练数据中的知识以隐式方式分布存储在参数中,检索不精确,不像数据库那样可靠提取;2)RLHF中的helpful导向可能强化了模型”编造答案”的倾向而非拒绝回答;3)beam search等解码策略倾向于高概率序列,这些序列往往是泛化的模式而非精确事实。

加分回答

讨论知识的参数化存储vs外部存储的根本矛盾,提到通过校准训练(calibration)让模型输出的置信度更可靠,以及Retrieval-Augmented Generation如何从架构层面缓解但无法彻底解决幻觉问题。还可以提到训练时引入factuality reward的前沿研究。

常见踩坑

简单归因于训练数据不足或数据质量差;未认识到幻觉是语言建模范式的固有限制而非可以完全消除的bug;混淆了模型不知道和模型知道但表达错误两种不同类型的幻觉。