返回笔记
深度学习

强化学习入门:从 Q-Learning 到 PPO

强化学习 PPO Q-Learning DQN RLHF AlphaGo

强化学习是 AI 三大学派之一。AlphaGo、ChatGPT 的 RLHF 对齐都依赖强化学习。理解它需要换个思维。

强化学习和监督学习的区别

监督学习:给你数据和标签,告诉你什么是对的。强化学习:不告诉你答案,只给你奖励/惩罚信号,你自己去试。就像教狗做动作——做对了给零食(奖励),做错了不理(惩罚),狗自己会找出什么行为能拿到零食。

核心概念

  • Agent(智能体):做决策的主体
  • Environment(环境):Agent 所处的外部世界
  • State(状态):环境在某个时刻完整描述
  • Action(动作):Agent 可以做哪些操作
  • Reward(奖励):环境对动作的即时反馈
  • Policy(策略):从状态到动作的映射,Agent 的"大脑"

Q-Learning

最经典的算法。维护一张 Q 表,记录"在状态 S 做动作 A 能得到的期望收益"。通过不断尝试和更新这张表,Agent 学会最优决策。Q 表类似于一条经验的总结。

Deep Q-Network(DQN)

Q 表在状态空间很大时(比如围棋有 3^361 种状态)用不了。DQN 用神经网络替代 Q 表,直接从图像像素输入,输出每个动作的 Q 值。DeepMind 2013 年用它玩 Atari 游戏超越人类。

Policy Gradient

不学 Q 值,直接学策略函数。好的动作提高概率,坏的动作降低概率。更直接但在高方差场景下不稳定。

PPO

Proximal Policy Optimization 是目前最主流的强化学习算法。核心创新是限制每次更新策略的幅度,防止一次更新太大导致训练崩溃。RLHF 用的就是 PPO。

与大模型的关系

RLHF 让大模型学会了:什么样的回答是人类偏好的。奖励模型就是"打分器",PPO 优化语言模型让得分越来越高。这就是 ChatGPT 变聪明背后的强化学习。