Skip to content

强化学习与 RLHF

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

一、强化学习基础

强化学习(Reinforcement Learning, RL):一种机器学习方法,通过从外部获得激励来校正学习方向,从而获得自适应的学习能力。


二、RLHF 核心概念

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):构建人类反馈数据集,训练一个激励模型来模仿人类偏好对结果打分。这是 GPT-3 后时代大语言模型越来越像人类对话的核心技术。

三阶段训练流程

SFT(监督微调) → RM(奖励模型训练) → PPO(近端策略优化)

Q: 奖励模型需要和基础模型一致吗?

不同实现方式限制不同。Colossal-AI 的 Coati 中需要模型有相同的 tokenizer,因此只能从同系列中选模型。PPO 算法实现方式上 trlx 被认为最符合论文。


三、RLHF 的三大不足

不足描述
数据成本高人工产生的偏好数据集成本高,难以批量生产
训练周期长三阶段训练(SFT→RM→PPO)过程较长,更新迭代慢
资源要求高PPO 训练同时存在 4 个模型(2 个训练,2 个推理),计算资源要求高

四、改进方案

4.1 AI 专家替代派 —— 解决数据成本

RLAIF(RL from AI Feedback)

  • 核心思路:用 AI 模型监督其他 AI 模型
  • SFT 阶段:从初始模型采样,生成自我批评和修正,根据修正后反应微调原始模型
  • RL 阶段:从微调模型采样,用模型评估生成样本,构建 AI 偏好数据集训练偏好模型,用偏好模型作为奖励信号

RRHF(Rank Response from Human Feedback)

  • 不需要强化学习,利用不同语言模型生成的回复(包括 ChatGPT、GPT-4 或当前训练模型)
  • 通过对回复进行评分,使用排名损失使回复与人类偏好对齐
  • 训练好的模型可同时作为生成语言模型和奖励模型使用

4.2 微调数据优化派 —— 简化训练流程

LIMA(Less Is More for Alignment)

  • 浅层对齐假说:模型的知识和能力几乎完全在预训练中学习,对齐只是教会它与用户交互时如何选择子分布
  • 推论:可以用相当少的样本充分调整预训练语言模型
  • 核心思路:从现有数据中识别最有价值的核心样本,仅用少量数据实现可比甚至更好的性能

核心数据筛选:有研究表明可能仅需 0.5% 的数据即可达到较好效果

4.3 训练过程改造派 —— 替代 PPO

RAFT(Reward rAnked FineTuning)

  • 基于奖励和监督微调对样本进行排序组合的方式

DPO(Direct Preference Optimization)

  • 提出使用二进制交叉熵目标来精确优化 LLM 的方法
  • 替代基于 RLHF 的优化目标,大大简化偏好学习 pipeline
  • 无需显式训练奖励模型,直接从偏好数据中学习

五、RLHF 方法对比总结

方法类型核心思想是否需要 RL
RLHF经典SFT→RM→PPO 三阶段
RLAIFAI 替代AI 生成偏好数据替代人工
RRHFAI 替代排名损失对齐,无需 RL
LIMA数据优化少量高质量数据即可对齐否(仅 SFT)
RAFT流程改造奖励排序 + SFT
DPO流程改造直接偏好优化,替代 PPO