https://www.bilibili.com/list/watchlater/?bvid=BV1CdGrzuEJU

逆强化学习(Inverse Reinforcement Learning, IRL)是机器学习中的一个分支,与传统的强化学习(Reinforcement Learning, RL)相反。

核心思想

标准强化学习中:

  • 已知:环境的动态(状态转移)、奖励函数(Reward Function)
  • 目标:学习一个最优策略(Policy),即在什么状态下采取什么动作可以获得最大累积奖励。

而在逆强化学习中:

  • 已知:环境的动态、专家的示范行为(即观察到的策略或轨迹)
  • 目标:推断出潜在的奖励函数,即找出是什么样的奖励机制使得专家会采取这些行为。

换句话说,IRL 回答的问题是:“为什么这个专家会这么做?他/她/它在追求什么样的目标?


为什么需要逆强化学习?

  1. 奖励函数难以设计: 在许多复杂任务中(如自动驾驶、机器人操作),设计一个准确的奖励函数非常困难。例如,“安全驾驶”包含太多隐含规则,难以用数学公式精确表达。

  2. 从示范中学习: 人类专家可以轻松演示一个任务(如开车、走路),但很难明确说出每一步的奖励是多少。IRL 可以从这些示范中自动学习背后的“意图”或“价值”。

  3. 模仿学习的延伸: IRL 是模仿学习(Imitation Learning)的一种高级形式。相比于直接复制专家动作(行为克隆),IRL 试图理解专家的“动机”,从而在新环境中也能做出合理决策。


逆强化学习的基本流程

  1. 收集专家在环境中的行为轨迹(状态-动作序列)。
  2. 假设专家是在最大化某个未知的奖励函数。
  3. 通过优化算法,寻找一个奖励函数,使得在该奖励下,专家的策略是最优的(或接近最优)。
  4. 使用学习到的奖励函数,通过标准强化学习训练一个新的策略
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐