推荐星级:
  • 1
  • 2
  • 3
  • 4
  • 5

人类反馈强化学习-RFHF核心流程

更新时间:2026-07-22 08:33:51 大小:14K 上传用户:潇潇江南查看TA发布的资源 标签:强化学习 下载积分:2分 评价赚积分 (如何评价?) 打赏 收藏 评论(0) 举报

资料介绍

一、RLHF的核心定义

人类反馈强化学习(Reinforcement Learning from Human FeedbackRLHF是一种将人类偏好与反馈融入强化学习训练流程的人工智能训练方法,核心目标是让大语言模型等AI系统的输出结果更符合人类的价值观、使用习惯与内容要求,解决传统大模型训练中"模型生成内容符合语法逻辑,但不符合人类真实需求"的匹配偏差问题。

二、RLHF的核心训练流程

当前主流的RLHF训练分为三个核心阶段:

1. 监督微调(Supervised Fine-Tuning, SFT)阶段

这个阶段是RLHF训练的基础准备阶段:首先会采集人类标注员对不同任务prompt对应的高质量回答样本,用这些标注数据对已经预训练好的基础大模型进行有监督微调,得到SFT模型。这个阶段的作用是让基础预训练模型学会理解人类的指令格式,适应人类任务的输出要求,为后续的奖励模型训练和强化学习训练提供基础载体。

2. 奖励模型(Reward Model, RM)训练阶段

这个阶段的核心目标是把人类的偏好转化为可以被模型计算的数值化奖励信号:

1. 对于同一个输入prompt,让第一步得到的SFT模型生成多个不同的输出结果;

2. 邀请人类标注员对这些输出结果按照符合人类偏好的程度进行排序,排序维度通常包括内容准确性、无害性、有用性、符合人类表达习惯等多个维度;

3. 用人类标注的排序结果训练奖励模型,让奖励模型学会对任意一组"prompt+模型输出"给出对应奖励分数,分数越高代表输出越符合人类偏好。


部分文件列表

文件名 大小
人类反馈强化学习-RFHF核心流程.docx 14K

全部评论(0)

暂无评论

上传资源 上传优质资源有赏金

  • 打赏
  • 30日榜单

推荐下载