首页 / AI 百科 / RLHF 与对齐

RLHF 与对齐RLHF and Alignment

训练方法

用人类的偏好反馈来调教模型,让它输出更有帮助、更诚实、更安全,而不是只追求「猜对下一个词」。

一个只会续写文本的模型,可能很有本事但很不听话:答非所问、拒答不当、语气生硬,甚至顺着用户的诱导说不该说的话。对齐要解决的就是——如何让模型的行为符合人的期望。

RLHF 的流程

它的核心困难是:「什么样的回答更好」很难写成一条可计算的公式,但人一眼就能比较出两个回答哪个更顺眼。于是把它转化为「让人排序」。 - 收集偏好数据:对同一个问题让模型给出多个回答,由人(或较强模型辅助)排序,标出哪个更好。 - 训练奖励模型:用一个模型去学习这种排序,学会给回答打分,替代人来当裁判。 - 强化学习优化:让生成模型去产出回答,按奖励模型的分数调整自己,同时用一个约束项防止它跑得太远、把语言能力练坏。 后来的简化版本(如直接偏好优化一类方法)跳过了显式强化学习环节,直接用偏好数据训练,流程更短,在小规模场景下更易实施。

对齐不只是「做好人」

它同时包括三个目标:有用(真的帮上忙)、诚实(不编造、承认不确定)、无害(拒绝明显有害的请求)。这三者常有冲突,需要在取舍中找平衡。而且价值观因文化而异,所以对齐也是一个持续修订的过程,而不是一次训练就结束。

常见误区

相关词条
微调与指令微调 思维链与推理模型 大语言模型(LLM)
本词条为原创科普整理,用于帮助理解,不替代论文与官方文档。如有技术性错漏,欢迎指正。
← 返回 AI 百科 · 返回首页