Paper: STaR: Self-Taught Reasoner - Bootstrapping Reasoning With Reasoning
一句话概括
STaR通过让模型生成推理链、保留导致正确答案的推理链进行自训练,实现了推理能力的自举式提升,无需大量人工标注推理过程。
核心思想
STaR的训练循环包含三步:1) 让模型尝试生成推理链并回答问题;2) 保留那些得出正确最终答案的推理链作为训练数据;3) 对于模型答错的问题,给出正确答案让模型”合理化”——即在知道答案的情况下生成能推导出该答案的推理链。用这些数据微调模型后重复整个过程。随着迭代,模型生成正确推理链的能力不断提升。
关键创新
1) 利用正确答案作为信号自动筛选高质量推理链;2) Rationalization技巧让模型从困难样本中也能学习;3) 实现了推理能力的自举式迭代提升;4) 大幅减少了对人工标注推理过程的依赖。
深远影响
STaR开创了推理能力自训练的范式,直接启发了后续的ReST、ReST-EM等方法。其”用推理来引导推理”的自举思想也影响了o1和DeepSeek-R1等模型的训练策略。
启发与思考
STaR展示了一种令人兴奋的可能性:AI系统可以通过自身的探索和验证来提升推理能力,不完全依赖人类提供的思维模板。这种自我改进的能力是通向更强AI的重要路径。