Interview: LLM的Planning能力:涌现还是学到的?


题目解析

这是一个偏学术性的深度问题。Planning是Agent的核心能力之一,但LLM是否真正具备规划能力还是仅在模仿训练数据中的规划模式,学术界有激烈争论。

解答思路

支持”学到的”阵营认为:LLM在训练数据中见过大量计划和方案文本(代码注释、教程、项目规划等),通过next token prediction学会了规划的语言模式。支持”涌现”阵营认为:LLM能解决训练数据中未出现过的新颖规划问题,表现出组合泛化能力。实验证据方面,Valmeekam et al.(2023)在经典规划任务(如Blocksworld)上测试,发现LLM的规划成功率很低且无法稳定泛化;但Huang et al.的SayCan等工作表明LLM在与环境交互时能展现出有效的高层规划能力。

关键要点

更准确的说法是:LLM具备”弱规划”能力——能生成看似合理的计划框架但缺乏保证正确性的机制。LLM不具备经典AI规划器的系统性搜索和一致性检查能力。其规划能力在熟悉领域(训练数据覆盖的)强,在陌生领域弱,这更符合”学到的”假说而非真正的涌现。

加分回答

可以提出一个实验设计:使用程序化生成的、确保不在任何训练数据中出现的全新规划问题来测试LLM。如果性能随问题规模线性下降则更像模式匹配;如果存在性能悬崖(某个复杂度阈值后骤降)则可能暗示某种涌现机制的能力边界。还可以引用Kambhampati教授的LLM+经典规划器混合方案。

常见踩坑

最常见的错误是将”能生成计划文本”等同于”能规划”——模型生成的计划可能逻辑不一致或物理上不可行。另一个陷阱是将Few-shot中给出的规划示例的效果误认为是模型自身的规划能力。