推理模型技术报告解读:强化学习如何教会模型思考
从技术报告看推理模型的训练配方:可验证奖励、思考长度增长与涌现的自我修正。
训练配方的公开化
头部推理模型的技术报告首次完整披露了训练路径:以可验证奖励(数学与代码的正确性)驱动的强化学习,让模型自发学会延长思考、回溯与自我验证。这个配方已经成为行业标配。
涌现的能力
报告中最有趣的观察是能力的涌现:模型没有被显式教会反思,但训练后期自发出现了回头检查与换路重试的行为。这是强化学习对探索行为的自然奖励。
对开源生态的影响
开源推理模型的快速跟进证明了配方的可复制性。训练成本虽高,但相比预训练仍是数量级的下降——这也是推理能力快速平民化的原因。
DISCUSSION
文章讨论
0 条评论
