外观
强化学习与 RLHF
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
一、强化学习基础
强化学习(Reinforcement Learning, RL):一种机器学习方法,通过从外部获得激励来校正学习方向,从而获得自适应的学习能力。
二、RLHF 核心概念
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):构建人类反馈数据集,训练一个激励模型来模仿人类偏好对结果打分。这是 GPT-3 后时代大语言模型越来越像人类对话的核心技术。
三阶段训练流程
SFT(监督微调) → RM(奖励模型训练) → PPO(近端策略优化)Q: 奖励模型需要和基础模型一致吗?
不同实现方式限制不同。Colossal-AI 的 Coati 中需要模型有相同的 tokenizer,因此只能从同系列中选模型。PPO 算法实现方式上 trlx 被认为最符合论文。
三、RLHF 的三大不足
| 不足 | 描述 |
|---|---|
| 数据成本高 | 人工产生的偏好数据集成本高,难以批量生产 |
| 训练周期长 | 三阶段训练(SFT→RM→PPO)过程较长,更新迭代慢 |
| 资源要求高 | PPO 训练同时存在 4 个模型(2 个训练,2 个推理),计算资源要求高 |
四、改进方案
4.1 AI 专家替代派 —— 解决数据成本
RLAIF(RL from AI Feedback)
- 核心思路:用 AI 模型监督其他 AI 模型
- SFT 阶段:从初始模型采样,生成自我批评和修正,根据修正后反应微调原始模型
- RL 阶段:从微调模型采样,用模型评估生成样本,构建 AI 偏好数据集训练偏好模型,用偏好模型作为奖励信号
RRHF(Rank Response from Human Feedback)
- 不需要强化学习,利用不同语言模型生成的回复(包括 ChatGPT、GPT-4 或当前训练模型)
- 通过对回复进行评分,使用排名损失使回复与人类偏好对齐
- 训练好的模型可同时作为生成语言模型和奖励模型使用
4.2 微调数据优化派 —— 简化训练流程
LIMA(Less Is More for Alignment)
- 浅层对齐假说:模型的知识和能力几乎完全在预训练中学习,对齐只是教会它与用户交互时如何选择子分布
- 推论:可以用相当少的样本充分调整预训练语言模型
- 核心思路:从现有数据中识别最有价值的核心样本,仅用少量数据实现可比甚至更好的性能
核心数据筛选:有研究表明可能仅需 0.5% 的数据即可达到较好效果
4.3 训练过程改造派 —— 替代 PPO
RAFT(Reward rAnked FineTuning)
- 基于奖励和监督微调对样本进行排序组合的方式
DPO(Direct Preference Optimization)
- 提出使用二进制交叉熵目标来精确优化 LLM 的方法
- 替代基于 RLHF 的优化目标,大大简化偏好学习 pipeline
- 无需显式训练奖励模型,直接从偏好数据中学习
五、RLHF 方法对比总结
| 方法 | 类型 | 核心思想 | 是否需要 RL |
|---|---|---|---|
| RLHF | 经典 | SFT→RM→PPO 三阶段 | 是 |
| RLAIF | AI 替代 | AI 生成偏好数据替代人工 | 是 |
| RRHF | AI 替代 | 排名损失对齐,无需 RL | 否 |
| LIMA | 数据优化 | 少量高质量数据即可对齐 | 否(仅 SFT) |
| RAFT | 流程改造 | 奖励排序 + SFT | 否 |
| DPO | 流程改造 | 直接偏好优化,替代 PPO | 否 |