Skip to content

强化学习在NLP中的基础与应用

内容整理自学习笔记,仅供面试备考参考;不构成录用、培训或考试承诺。

1. 强化学习基础

1.1 什么是强化学习?

强化学习(Reinforcement Learning)是一种时序决策学习框架,通过智能体和环境交互得到的奖励来优化策略 π,使其能够在环境中自主学习。

        ┌──────────────┐
        │   环境 Env    │
        └──────┬───────┘
     状态 s   │     ↑  动作 a
        ↓     │     │
     ┌────────┴───────┐
     │  智能体 Agent  │
     │   策略 π(a|s)  │
     └────────────────┘

           奖励 r

1.2 状态(States)和观测(Observations)

概念定义信息完整度
状态(States)对世界状态的完整描述完整
观测(Observations)对状态的部分描述,可能缺失信息部分
  • 当 O = S 时,称为完美信息(fully observed)
  • 当 O < S 时,称为非完美信息(partially observed)

1.3 动作空间(Action Spaces)

类型定义示例
离散动作空间智能体只能采取有限的动作下棋、文本生成
连续动作空间智能体的动作是实数向量机械臂转动角度

动作空间的区别会影响 policy 网络的实现方式。

1.4 Policy 策略

类型公式适用空间
确定性策略(Deterministic Policy)a_t = u(s_t)连续动作空间
随机性策略(Stochastic Policy)a_t ~ π(·|s_t)离散动作空间

1.5 轨迹(Trajectory)

轨迹指的是状态和行动的序列

  • 状态转换函数(transition function):描述状态如何随动作变化
  • 初始状态从初始状态分布中采样

1.6 奖赏函数(Reward Function)

智能体的目标是最大化行动轨迹的累计奖励

1.7 强化学习问题

层面说明
核心问题选择一种策略从而最大化预期收益
轨迹概率假设环境转换和策略都是随机的,T 步行动轨迹概率由策略和环境决定
预期收益轨迹奖励的期望
核心优化找到最优策略

2. RL 发展路径(至 PPO)

2.1 Value-based 优化方法

概念说明
value-based状态的值 V(s) 或状态行动对 Q(s,a) 作为累积奖赏的估计,通过最大化值函数优化最优策略
最优值函数(Optimal Value Function)V*(s) = max_π V^π(s)
最优动作-值函数(Optimal Action-Value Function)Q*(s,a) = max_π Q^π(s,a)
两者关系最优动作可通过值函数推导

最优动作:a*(s) = argmax_a Q*(s,a)

2.2 贝尔曼方程(Bellman Equation)

中心思想:当前值估计 = 当前奖赏 + 未来值估计

最优值函数的贝尔曼公式描述了值函数的递推关系:

V(s)=maxa[R(s,a)+γEsP[V(s)]]Q(s,a)=R(s,a)+γEsP[maxaQ(s,a)]
符号含义
V*(s)状态 s 的最优值
Q*(s,a)状态-动作对的最优值
R(s,a)即时奖励
γ折扣因子
P状态转移概率
s'下一状态

2.3 优势函数(Advantage Functions)

强化学习中,有时不需要知道一个行动的绝对好坏,而只需要知道它相对于其他 action 的相对优势

A(s,a)=Q(s,a)V(s)
概念说明
Q(s,a)状态-动作对的实际值
V(s)状态的平均值(基线)
A(s,a)优势函数:动作 a 相对于平均水平的优势程度

优势函数的核心价值:当 A(s,a) > 0 时,说明该动作优于平均;A(s,a) < 0 时,说明劣于平均。这在 PPO 算法中被广泛使用。

3. 强化学习与 NLP 的联系

RL 概念NLP 对应
环境(Environment)语言模型面临的文本上下文
智能体(Agent)语言模型本身
动作(Action)生成下一个 token
动作空间词表(离散动作空间)
策略(Policy)语言模型的生成概率分布
奖励(Reward)Reward Model 的打分 / 人类偏好
轨迹(Trajectory)生成的完整回答序列

在大模型 RLHF 场景下,文本生成被建模为离散动作空间的强化学习问题,每个 token 的选择就是一个动作,策略即为语言模型输出 token 概率分布。