返回笔记
深度学习
强化学习入门:从 Q-Learning 到 PPO
强化学习
PPO
Q-Learning
DQN
RLHF
AlphaGo
强化学习是 AI 三大学派之一。AlphaGo、ChatGPT 的 RLHF 对齐都依赖强化学习。理解它需要换个思维。
强化学习和监督学习的区别
监督学习:给你数据和标签,告诉你什么是对的。强化学习:不告诉你答案,只给你奖励/惩罚信号,你自己去试。就像教狗做动作——做对了给零食(奖励),做错了不理(惩罚),狗自己会找出什么行为能拿到零食。
核心概念
- Agent(智能体):做决策的主体
- Environment(环境):Agent 所处的外部世界
- State(状态):环境在某个时刻完整描述
- Action(动作):Agent 可以做哪些操作
- Reward(奖励):环境对动作的即时反馈
- Policy(策略):从状态到动作的映射,Agent 的"大脑"
Q-Learning
最经典的算法。维护一张 Q 表,记录"在状态 S 做动作 A 能得到的期望收益"。通过不断尝试和更新这张表,Agent 学会最优决策。Q 表类似于一条经验的总结。
Deep Q-Network(DQN)
Q 表在状态空间很大时(比如围棋有 3^361 种状态)用不了。DQN 用神经网络替代 Q 表,直接从图像像素输入,输出每个动作的 Q 值。DeepMind 2013 年用它玩 Atari 游戏超越人类。
Policy Gradient
不学 Q 值,直接学策略函数。好的动作提高概率,坏的动作降低概率。更直接但在高方差场景下不稳定。
PPO
Proximal Policy Optimization 是目前最主流的强化学习算法。核心创新是限制每次更新策略的幅度,防止一次更新太大导致训练崩溃。RLHF 用的就是 PPO。
与大模型的关系
RLHF 让大模型学会了:什么样的回答是人类偏好的。奖励模型就是"打分器",PPO 优化语言模型让得分越来越高。这就是 ChatGPT 变聪明背后的强化学习。