外观
强化学习在NLP中的基础与应用
内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。
1. 强化学习基础
1.1 什么是强化学习?
强化学习(Reinforcement Learning)是一种时序决策学习框架,通过智能体和环境交互得到的奖励来优化策略 π,使其能够在环境中自主学习。
┌──────────────┐
│ 环境 Env │
└──────┬───────┘
状态 s │ ↑ 动作 a
↓ │ │
┌────────┴───────┐
│ 智能体 Agent │
│ 策略 π(a|s) │
└────────────────┘
↑
奖励 r1.2 状态(States)和观测(Observations)
| 概念 | 定义 | 信息完整度 |
|---|---|---|
| 状态(States) | 对世界状态的完整描述 | 完整 |
| 观测(Observations) | 对状态的部分描述,可能缺失信息 | 部分 |
- 当 O = S 时,称为完美信息(fully observed)
- 当 O < S 时,称为非完美信息(partially observed)
1.3 动作空间(Action Spaces)
| 类型 | 定义 | 示例 |
|---|---|---|
| 离散动作空间 | 智能体只能采取有限的动作 | 下棋、文本生成 |
| 连续动作空间 | 智能体的动作是实数向量 | 机械臂转动角度 |
动作空间的区别会影响 policy 网络的实现方式。
1.4 Policy 策略
| 类型 | 公式 | 适用空间 |
|---|---|---|
| 确定性策略(Deterministic Policy) | a_t = u(s_t) | 连续动作空间 |
| 随机性策略(Stochastic Policy) | a_t ~ π(·|s_t) | 离散动作空间 |
1.5 轨迹(Trajectory)
轨迹指的是状态和行动的序列:
- 状态转换函数(transition function):描述状态如何随动作变化
- 初始状态从初始状态分布中采样
1.6 奖赏函数(Reward Function)
智能体的目标是最大化行动轨迹的累计奖励。
1.7 强化学习问题
| 层面 | 说明 |
|---|---|
| 核心问题 | 选择一种策略从而最大化预期收益 |
| 轨迹概率 | 假设环境转换和策略都是随机的,T 步行动轨迹概率由策略和环境决定 |
| 预期收益 | 轨迹奖励的期望 |
| 核心优化 | 找到最优策略 |
2. RL 发展路径(至 PPO)
2.1 Value-based 优化方法
| 概念 | 说明 |
|---|---|
| value-based | 状态的值 V(s) 或状态行动对 Q(s,a) 作为累积奖赏的估计,通过最大化值函数优化最优策略 |
| 最优值函数(Optimal Value Function) | V*(s) = max_π V^π(s) |
| 最优动作-值函数(Optimal Action-Value Function) | Q*(s,a) = max_π Q^π(s,a) |
| 两者关系 | 最优动作可通过值函数推导 |
最优动作:a*(s) = argmax_a Q*(s,a)
2.2 贝尔曼方程(Bellman Equation)
中心思想:当前值估计 = 当前奖赏 + 未来值估计
最优值函数的贝尔曼公式描述了值函数的递推关系:
| 符号 | 含义 |
|---|---|
| V*(s) | 状态 s 的最优值 |
| Q*(s,a) | 状态-动作对的最优值 |
| R(s,a) | 即时奖励 |
| γ | 折扣因子 |
| P | 状态转移概率 |
| s' | 下一状态 |
2.3 优势函数(Advantage Functions)
强化学习中,有时不需要知道一个行动的绝对好坏,而只需要知道它相对于其他 action 的相对优势。
| 概念 | 说明 |
|---|---|
| Q(s,a) | 状态-动作对的实际值 |
| V(s) | 状态的平均值(基线) |
| A(s,a) | 优势函数:动作 a 相对于平均水平的优势程度 |
优势函数的核心价值:当 A(s,a) > 0 时,说明该动作优于平均;A(s,a) < 0 时,说明劣于平均。这在 PPO 算法中被广泛使用。
3. 强化学习与 NLP 的联系
| RL 概念 | NLP 对应 |
|---|---|
| 环境(Environment) | 语言模型面临的文本上下文 |
| 智能体(Agent) | 语言模型本身 |
| 动作(Action) | 生成下一个 token |
| 动作空间 | 词表(离散动作空间) |
| 策略(Policy) | 语言模型的生成概率分布 |
| 奖励(Reward) | Reward Model 的打分 / 人类偏好 |
| 轨迹(Trajectory) | 生成的完整回答序列 |
在大模型 RLHF 场景下,文本生成被建模为离散动作空间的强化学习问题,每个 token 的选择就是一个动作,策略即为语言模型输出 token 概率分布。