Paper: Let's Verify Step by Step
一句话概括
OpenAI提出过程奖励模型PRM,通过对推理的每一步进行评分验证,显著优于只看最终结果的结果奖励模型ORM。
核心思想
结果奖励模型只关注最终答案是否正确,无法区分”正确推理得到正确答案”和”错误推理碰巧得到正确答案”。过程奖励模型则对推理链的每一步进行评分,判断该步骤是否正确。研究团队人工标注了约75K个推理步骤的正确性,训练PRM,然后用PRM在多个候选推理链中选择最优解,大幅提升了数学问题的求解准确率。
关键创新
1) 系统证明了过程监督优于结果监督;2) 构建了大规模的逐步推理标注数据集PRM800K;3) PRM可以有效指导best-of-N搜索策略;4) 揭示了推理过程中间步骤的监督信号具有独特价值。
深远影响
PRM的思想直接影响了OpenAI o1模型的训练策略。过程监督成为提升LLM推理能力的关键技术方向,推动了整个领域对推理过程质量(而非仅结果)的关注。
启发与思考
“过程比结果重要”在教育中是常识,现在也成为AI训练的重要原则。未来的挑战在于如何高效获取过程监督信号——人工标注成本极高,自动化的过程验证方法至关重要。