动手学强化学习-算法整理表格-图片版+表格版
·
动手学强化学习,算法整理表格,由豆包梳理。
动手学强化学习
图片版:



表格版:
以下是整合后的强化学习分类及对应算法梳理表格,覆盖你提到的内容,清晰呈现分类依据、算法名称、核心思想,帮你系统理解:
| 知识板块/分类维度 | 具体分类/子领域 | 算法名称 | 核心思想/特点 |
|---|---|---|---|
| 基础理论 | 多臂老虎机(Bandit) | 多臂老虎机 | 无状态转移,仅从动作奖励中选最优臂。如 ϵ \epsilon ϵ-贪心:以 ϵ \epsilon ϵ 概率探索新臂, 1 − ϵ 1-\epsilon 1−ϵ 概率选当前最优臂,平衡探索与利用 |
| 马尔可夫决策过程(MDP) | - | 定义强化学习框架:状态 S S S、动作 A A A、转移概率 P P P、奖励 R R R、折扣 γ \gamma γ,智能体通过交互最大化累计奖励,是后续算法的理论基础 | |
| 基础算法(Model Free 为主,含 Model Based 经典) | 动态规划(DP) | 策略迭代(PI) | 先“策略评估”(用贝尔曼期望方程算值函数),再“策略改进”( greedily 选最优动作),交替优化,需环境模型(转移概率、奖励) |
| 价值迭代(VI) | 直接用贝尔曼最优方程更新值函数,迭代至收敛,推导最优策略,需环境模型,适合小规模、模型已知场景 | ||
| 时序差分(TD) | TD(0) | 在线学习,用当前奖励 + 下一状态估计值更新当前值函数( V ( S t ) ← V ( S t ) + α [ R t + 1 + γ V ( S t + 1 ) − V ( S t ) ] V(S_t) \leftarrow V(S_t) + \alpha[R_{t+1} + \gamma V(S_{t+1}) - V(S_t)] V(St)←V(St)+α[Rt+1+γV(St+1)−V(St)] ),无需环境模型,高效灵活 | |
| Sarsa | 同策略时序差分,用当前策略生成的“状态 - 动作 - 奖励 - 下一状态 - 下一动作”( S , A , R , S ′ , A ′ S,A,R,S',A' S,A,R,S′,A′ )更新Q值,遵循当前策略探索 | ||
| Q - Learning | 异策略时序差分,用“ S , A , R , S ′ S,A,R,S' S,A,R,S′”和下一状态最优Q值更新( Q ( S , A ) ← Q ( S , A ) + α [ R + γ max A ′ Q ( S ′ , A ′ ) − Q ( S , A ) ] Q(S,A) \leftarrow Q(S,A) + \alpha[R + \gamma \max_{A'} Q(S',A') - Q(S,A)] Q(S,A)←Q(S,A)+α[R+γmaxA′Q(S′,A′)−Q(S,A)] ),脱离当前策略,更易收敛到最优 | ||
| Model Based | Dyna - Q | 结合模型:先学环境转移($P(S’ | |
| 进阶算法(深度强化学习为主) | DQN 及改进 | DQN | 用深度神经网络(CNN等)代替Q表,处理高维状态(如图像)。引入经验回放(打破数据相关性)、目标网络(稳定训练),学习Q值函数 |
| Double DQN | 解决DQN过估计问题,用“当前网络选动作、目标网络算价值”,拆分动作选择与价值评估,让Q值更准确 | ||
| Dueling DQN | 网络拆分为“价值流”(评状态价值)和“优势流”(评动作相对优势),联合输出Q值,更高效学习状态与动作价值差异 | ||
| 策略梯度(Policy Gradient, PG) | REINFORCE | 直接优化策略网络,用奖励的梯度更新参数($\nabla_\theta J(\theta) \approx \frac{1}{N}\sum_{n=1}^N \sum_{t=1}^{T_n} R(\tau^n) \nabla_\theta \log \pi_\theta(a_t^n | |
| Actor - Critic(AC) | A2C(同步) | Actor 输出策略(选动作),Critic 用值函数(如优势函数 A = R + γ V ( S ′ ) − V ( S ) A = R + \gamma V(S') - V(S) A=R+γV(S′)−V(S) )评动作价值,多线程同步更新,平衡探索与利用,比纯PG高效 | |
| A3C(异步) | 多智能体异步并行训练A2C,不同线程在独立环境采样、更新,加速收敛,利用多环境多样性提升鲁棒性 | ||
| 基于策略梯度的改进(信任域) | TRPO | 用“信任域”限制策略更新幅度($\max_\theta \mathbb{E}[\frac{\pi_\theta}{\pi_{\theta_old}} A] $ ,约束 KL ( π θ , π θ o l d ) ≤ δ \text{KL}(\pi_\theta,\pi_{\theta_old}) \leq \delta KL(πθ,πθold)≤δ ),避免策略更新过猛导致性能下降,训练更稳定但计算复杂 | |
| PPO | 简化TRPO,用“剪辑目标函数”( clip ( π θ π θ o l d , 1 − ϵ , 1 + ϵ ) A \text{clip}(\frac{\pi_\theta}{\pi_{\theta_old}}, 1-\epsilon, 1+\epsilon) A clip(πθoldπθ,1−ϵ,1+ϵ)A )替代信任域约束,计算高效,兼顾稳定与性能,是最常用的策略梯度算法之一 | ||
| 连续动作空间(深度AC扩展) | DDPG | 基于AC框架,为连续动作设计:Actor 输出确定性动作($\mu(s | |
| SAC | 基于能量的策略学习,引入熵正则化($\mathcal{L} = \mathbb{E}{s,a \sim \rho\pi} [Q(s,a) - \alpha \log \pi(a | ||
| 前沿方向 | 模仿学习(Imitation Learning) | 行为克隆(BC) | 直接用专家演示数据训练策略网络(如监督学习,让策略模仿专家动作),简单但易过拟合、泛化差 |
| 逆强化学习(IRL) | 先学专家行为隐含的奖励函数(从专家轨迹反推 R R R ),再用强化学习优化策略,适合专家难显式描述奖励的场景(如自动驾驶) | ||
| 模型预测控制(MPC) | - | 在线建模环境(或用已知模型),滚动优化:预测未来多步状态/奖励,选使累计奖励最大的动作序列,执行第一步后重新规划,依赖模型精度 | |
| 基于模型的策略优化(MBPO) | MBPO | 用深度模型学习环境动力学(近似 $P(S’,R | |
| 离线强化学习(Offline RL) | - | 仅用静态数据集(如历史经验、专家数据)训练,无需在线交互。需解决分布偏移问题(数据与策略不匹配),常用正则化、保守Q学习(CQL)等方法,适合安全关键、数据难获取场景 | |
| 目标导向的强化学习 | - | 聚焦复杂任务分解(如分层强化学习,分高层“选目标”、低层“执行动作” ),或用内在动机(如好奇心驱动),让智能体主动探索、高效完成长程目标,应对稀疏奖励、多阶段任务 | |
| 多智能体强化学习(MARL) | 入门 - 基础框架 | 独立Q学习(IQL) | 多智能体各自独立用Q - Learning,假设其他智能体行为固定,简单但难应对动态环境(其他智能体策略变化时失效) |
| 进阶 - 协作/竞争 | MADDPG | 基于DDPG的多智能体扩展,Critic 能感知其他智能体状态/动作,Actor 独立学习,支持协作(如多机器人搬运)或竞争(如对抗游戏)场景 | |
| COMA | 用“反事实基线”解决多智能体信用分配问题(谁对团队奖励贡献大),优化策略梯度,提升协作效率,适合团队任务 |
说明:
- 分类有交叉(如 Dyna - Q 同时属“基础算法 - Model Based”和“前沿 - 基于模型” ),重点看算法适配的核心场景;
- 部分理论(如 MDP、多臂老虎机 )是算法基石,无单独“算法名”但需理解其框架作用;
- 前沿方向(如多智能体、离线 RL )算法多样,表格选最具代表性的,可按需深入拓展~
更多推荐
所有评论(0)