技术与工程已解决
RLHF 是什么?
人类反馈强化学习如何让会说话的模型变成有用且无害的助手。
问题正文
它是什么
RLHF(人类反馈强化学习)分三步:人类对模型的多个输出排序,用排序数据训练一个偏好模型,再用强化学习让模型生成更受偏好的回答。
它带来什么
预训练模型只会续写,RLHF 之后模型学会听指令、拒答不当请求、承认错误、保持礼貌。对话产品体验的飞跃就来自这一步。
后续演进
DPO 等简化算法绕开了强化学习的复杂训练过程,成为开源社区的主流对齐方案。
人类反馈强化学习如何让会说话的模型变成有用且无害的助手。
问题正文
RLHF(人类反馈强化学习)分三步:人类对模型的多个输出排序,用排序数据训练一个偏好模型,再用强化学习让模型生成更受偏好的回答。
预训练模型只会续写,RLHF 之后模型学会听指令、拒答不当请求、承认错误、保持礼貌。对话产品体验的飞跃就来自这一步。
DPO 等简化算法绕开了强化学习的复杂训练过程,成为开源社区的主流对齐方案。
ANSWERS
回答内容
RLHF 用人类的偏好排序训练奖励模型,再以强化学习对齐模型行为,是模型从能说话到说话得体的关键一步。
纯预训练模型会续写出有害内容、无视指令。对齐技术让模型有用、诚实、无害——这是产品化的前提。
推理模型把 RLHF 进一步扩展为以正确答案为奖励的强化学习,催生了强大的推理能力。