外观
强化学习与RLHF对齐技术概览
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 什么是强化学习?
强化学习(Reinforcement Learning)是一种机器学习方法,通过从外部获得激励信号来校正学习方向,从而获得一种自适应的学习能力。其核心在于智能体与环境的交互,通过试错来优化策略。
2. 什么是 RLHF?
基于人工反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF):
- 核心思路:构建人类反馈数据集,训练一个奖励模型(Reward Model),模仿人类偏好对结果打分
- 意义:这是 GPT-3 后时代大语言模型越来越像人类对话的核心技术
- 流程:SFT(有监督微调) → RM(奖励模型) → PPO(强化学习)
3. 奖励模型需要和基础模型一致吗?
不同实现方式的限制不同:
| 实现框架 | 限制说明 |
|---|---|
| Colossal-AI(Coati) | 需要模型有相同的 tokenizer,只能从同系列中选模型 |
| TRLX | 据说是最符合论文 PPO 算法实现的方式 |
4. RLHF 在实践中有哪些不足?
RLHF 存在三大核心不足:
| 编号 | 不足点 | 说明 |
|---|---|---|
| 1 | 人工偏好数据集成本高 | 人工产生的偏好数据集成本较高,很难量产 |
| 2 | 三阶段训练过程长 | SFT → RM → PPO 三个阶段,更新迭代较慢 |
| 3 | 计算资源需求高 | PPO 训练同时存在 4 个模型(2 训练 + 2 推理) |
5. 如何解决偏好数据集成本高的问题?
解决方案:AI 专家替代派
核心思路是通过 AI 模型监督其他 AI 模型。
代表方法
RLAIF
- 在 SFT 阶段:从初始模型中采样,生成自我批评和修正,然后根据修正后的反应微调原始模型
- 在 RL 阶段:从微调模型中采样,使用一个模型来评估生成的样本,并从 AI 偏好数据集训练一个偏好模型
- 使用偏好模型作为奖励信号对 RL 进行训练,即 RL from AI Feedback(RLAIF)
RRHF(Rank Response from Human Feedback)
- 不需要强化学习,可利用不同语言模型生成的回复(包括 ChatGPT、GPT-4 或当前训练模型)
- 通过对回复进行评分,通过排名损失使回复与人类偏好对齐
- 训练好的模型可同时作为生成语言模型和奖励模型使用
6. 如何解决三阶段训练过程长的问题?
解决方案:微调数据优化派
核心思路:仅通过优质数据集的获取和产生,训练得到效果较好的 SFT 模型,无需进行 RM 和 PPO 训练。
代表方法
LIMA(Less Is More for Alignment)
- 浅层对齐假说:模型的知识和能力几乎完全在预训练中学习,对齐则是教会它与用户交互时如何选择子分布
- 如果假说正确,人们可以用相当少的样本充分调整预训练的语言模型
- 对齐可以是一个简单的过程,模型学习与用户互动的风格或格式,以揭示预训练中已获得的知识和能力
Maybe Only 0.5% Data Is Needed
- 从数据角度探讨如何降低 LLM 训练阶段的成本,提高数据效率
- 通过从现有数据中识别出最有价值的核心样本来帮助模型获取下游任务的知识
- 仅用少量数据实现可比甚至更好的性能
7. 如何解决 PPO 计算资源需求高的问题?
解决方案:训练过程改造派
核心思路:通过改造模型的训练方式(如只保留 SFT 和 RM),以提高训练效率并减少训练成本。
代表方法
| 方法 | 核心思路 |
|---|---|
| RAFT(Reward rAnked FineTuning) | 基于通过奖励和监督微调对样本进行排序的组合形式 |
| DPO(Direct Preference Optimization) | 使用二进制交叉熵目标精确优化 LLM,替代基于 RLHF 的优化目标,大大简化偏好学习 pipeline |
8. RLHF 不足与解决方案总结
| 不足点 | 解决派系 | 代表方法 | 核心思路 |
|---|---|---|---|
| 偏好数据集成本高 | AI 专家替代派 | RLAIF, RRHF | AI 模型监督 AI 模型 |
| 三阶段训练过程长 | 微调数据优化派 | LIMA, 0.5% Data | 优质数据替代复杂训练 |
| PPO 计算资源需求高 | 训练过程改造派 | RAFT, DPO | 改造训练方式减少模型数量 |