Interview: o1式推理模型的训练方法论:为什么RL优于SFT?


题目解析

o1系列模型证明了RL在训练推理能力方面的优势。此题深入考察为什么监督微调(SFT)不足以训练强推理能力,以及RL的具体优势是什么。

解答思路

SFT训练推理的局限性:(1)SFT只能模仿训练数据中的推理模式,无法超越标注者的推理水平;(2)SFT要求每一步推理都有正确标注,数据获取成本极高;(3)SFT倾向于走”捷径”——学会表面模式而非真正推理。RL的优势:(1)只需结果信号(答案是否正确)而非过程标注;(2)模型可以自主探索新的推理路径,发现人类标注者没想到的解法;(3)RL天然优化的是最终结果而非中间步骤的似然度。

关键要点

o1的训练核心是大规模RL(据推测使用了PPO或类似算法),reward信号来自数学和代码等可自动验证的领域。关键创新在于让模型学会”如何思考”而非”思考的内容”——训练后模型能自主生成长链推理、自我纠错和回溯。这种能力通过SFT很难获得,因为SFT本质是在优化teacher forcing下的条件概率。

加分回答

可以讨论SFT和RL的结合策略——先用SFT让模型学会基本推理格式,再用RL优化推理质量,这类似RLHF的SFT+PPO两阶段范式。还可以提到Rejection Sampling Fine-tuning作为SFT和RL之间的折中方案。以及DeepSeek-R1证明了纯RL(不经过SFT)也能训练出推理能力。

常见踩坑

常见错误是将”RL优于SFT”绝对化——在数据充足且推理模式固定的场景中,SFT的效率和稳定性优于RL。另一个坑是认为只要用RL就能获得推理能力——RL的reward设计和训练稳定性是巨大的工程挑战。