动手学强化学习,算法整理表格,由豆包梳理。
动手学强化学习

图片版:

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

表格版:

以下是整合后的强化学习分类及对应算法梳理表格,覆盖你提到的内容,清晰呈现分类依据、算法名称、核心思想,帮你系统理解:

知识板块/分类维度具体分类/子领域算法名称核心思想/特点
基础理论多臂老虎机(Bandit)多臂老虎机无状态转移,仅从动作奖励中选最优臂。如 ϵ \epsilon ϵ-贪心:以 ϵ \epsilon ϵ 概率探索新臂, 1 − ϵ 1-\epsilon 1ϵ 概率选当前最优臂,平衡探索与利用
马尔可夫决策过程(MDP)-定义强化学习框架:状态 S S S、动作 A A A、转移概率 P P P、奖励 R R R、折扣 γ \gamma γ,智能体通过交互最大化累计奖励,是后续算法的理论基础
基础算法(Model Free 为主,含 Model Based 经典)动态规划(DP)策略迭代(PI)先“策略评估”(用贝尔曼期望方程算值函数),再“策略改进”( greedily 选最优动作),交替优化,需环境模型(转移概率、奖励)
价值迭代(VI)直接用贝尔曼最优方程更新值函数,迭代至收敛,推导最优策略,需环境模型,适合小规模、模型已知场景
时序差分(TD)TD(0)在线学习,用当前奖励 + 下一状态估计值更新当前值函数( V ( S t ) ← V ( S t ) + α [ R t + 1 + γ V ( S t + 1 ) − V ( S t ) ] V(S_t) \leftarrow V(S_t) + \alpha[R_{t+1} + \gamma V(S_{t+1}) - V(S_t)] V(St)V(St)+α[Rt+1+γV(St+1)V(St)] ),无需环境模型,高效灵活
Sarsa同策略时序差分,用当前策略生成的“状态 - 动作 - 奖励 - 下一状态 - 下一动作”( S , A , R , S ′ , A ′ S,A,R,S',A' S,A,R,S,A )更新Q值,遵循当前策略探索
Q - Learning异策略时序差分,用“ S , A , R , S ′ S,A,R,S' S,A,R,S”和下一状态最优Q值更新( Q ( S , A ) ← Q ( S , A ) + α [ R + γ max ⁡ A ′ Q ( S ′ , A ′ ) − Q ( S , A ) ] Q(S,A) \leftarrow Q(S,A) + \alpha[R + \gamma \max_{A'} Q(S',A') - Q(S,A)] Q(S,A)Q(S,A)+α[R+γmaxAQ(S,A)Q(S,A)] ),脱离当前策略,更易收敛到最优
Model BasedDyna - Q结合模型:先学环境转移($P(S’
进阶算法(深度强化学习为主)DQN 及改进DQN用深度神经网络(CNN等)代替Q表,处理高维状态(如图像)。引入经验回放(打破数据相关性)、目标网络(稳定训练),学习Q值函数
Double DQN解决DQN过估计问题,用“当前网络选动作、目标网络算价值”,拆分动作选择与价值评估,让Q值更准确
Dueling DQN网络拆分为“价值流”(评状态价值)和“优势流”(评动作相对优势),联合输出Q值,更高效学习状态与动作价值差异
策略梯度(Policy Gradient, PG)REINFORCE直接优化策略网络,用奖励的梯度更新参数($\nabla_\theta J(\theta) \approx \frac{1}{N}\sum_{n=1}^N \sum_{t=1}^{T_n} R(\tau^n) \nabla_\theta \log \pi_\theta(a_t^n
Actor - Critic(AC)A2C(同步)Actor 输出策略(选动作),Critic 用值函数(如优势函数 A = R + γ V ( S ′ ) − V ( S ) A = R + \gamma V(S') - V(S) A=R+γV(S)V(S) )评动作价值,多线程同步更新,平衡探索与利用,比纯PG高效
A3C(异步)多智能体异步并行训练A2C,不同线程在独立环境采样、更新,加速收敛,利用多环境多样性提升鲁棒性
基于策略梯度的改进(信任域)TRPO用“信任域”限制策略更新幅度($\max_\theta \mathbb{E}[\frac{\pi_\theta}{\pi_{\theta_old}} A] $ ,约束 KL ( π θ , π θ o l d ) ≤ δ \text{KL}(\pi_\theta,\pi_{\theta_old}) \leq \delta KL(πθ,πθold)δ ),避免策略更新过猛导致性能下降,训练更稳定但计算复杂
PPO简化TRPO,用“剪辑目标函数”( clip ( π θ π θ o l d , 1 − ϵ , 1 + ϵ ) A \text{clip}(\frac{\pi_\theta}{\pi_{\theta_old}}, 1-\epsilon, 1+\epsilon) A clip(πθoldπθ,1ϵ,1+ϵ)A )替代信任域约束,计算高效,兼顾稳定与性能,是最常用的策略梯度算法之一
连续动作空间(深度AC扩展)DDPG基于AC框架,为连续动作设计:Actor 输出确定性动作($\mu(s
SAC基于能量的策略学习,引入熵正则化($\mathcal{L} = \mathbb{E}{s,a \sim \rho\pi} [Q(s,a) - \alpha \log \pi(a
前沿方向模仿学习(Imitation Learning)行为克隆(BC)直接用专家演示数据训练策略网络(如监督学习,让策略模仿专家动作),简单但易过拟合、泛化差
逆强化学习(IRL)先学专家行为隐含的奖励函数(从专家轨迹反推 R R R ),再用强化学习优化策略,适合专家难显式描述奖励的场景(如自动驾驶)
模型预测控制(MPC)-在线建模环境(或用已知模型),滚动优化:预测未来多步状态/奖励,选使累计奖励最大的动作序列,执行第一步后重新规划,依赖模型精度
基于模型的策略优化(MBPO)MBPO用深度模型学习环境动力学(近似 $P(S’,R
离线强化学习(Offline RL)-仅用静态数据集(如历史经验、专家数据)训练,无需在线交互。需解决分布偏移问题(数据与策略不匹配),常用正则化、保守Q学习(CQL)等方法,适合安全关键、数据难获取场景
目标导向的强化学习-聚焦复杂任务分解(如分层强化学习,分高层“选目标”、低层“执行动作” ),或用内在动机(如好奇心驱动),让智能体主动探索、高效完成长程目标,应对稀疏奖励、多阶段任务
多智能体强化学习(MARL)入门 - 基础框架独立Q学习(IQL)多智能体各自独立用Q - Learning,假设其他智能体行为固定,简单但难应对动态环境(其他智能体策略变化时失效)
进阶 - 协作/竞争MADDPG基于DDPG的多智能体扩展,Critic 能感知其他智能体状态/动作,Actor 独立学习,支持协作(如多机器人搬运)或竞争(如对抗游戏)场景
COMA用“反事实基线”解决多智能体信用分配问题(谁对团队奖励贡献大),优化策略梯度,提升协作效率,适合团队任务

说明

  1. 分类有交叉(如 Dyna - Q 同时属“基础算法 - Model Based”和“前沿 - 基于模型” ),重点看算法适配的核心场景;
  2. 部分理论(如 MDP、多臂老虎机 )是算法基石,无单独“算法名”但需理解其框架作用;
  3. 前沿方向(如多智能体、离线 RL )算法多样,表格选最具代表性的,可按需深入拓展~
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐