• NeurIPS 2020: “Error Bounds of Imitating Policies and Environments”
  • IEEE TPAMI 2022: “Error Bounds of Imitating Policies and Environments for Reinforcement Learning”, Vol.44, No.10
  • 注:文中提到的图片序号均指原论文中图片

这篇文章研究**模仿学习(Imitation Learning, IL)中的误差传播(compounding error)**问题。核心发现是:

  • 行为克隆(BC)的策略价值差距随有效规划 horizon 的平方增长: O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2)
  • 生成对抗模仿学习(GAIL) 的策略价值差距仅随有效规划 horizon 线性增长: O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ))
  • 这一优势同样适用于环境模仿:用 GAIL 学习环境模型可将策略评估误差从二次降为线性

一个直观例子

  • 想象一个自动驾驶场景:车辆在道路上行驶,专家策略在 99% 的情况下都能正确决策。但 BC 训练出的策略有 1% 的概率会犯错——比如稍微偏离车道。一旦偏离,车辆进入了训练时很少见过的状态,错误概率急剧上升,最终可能撞车。这就是误差累积(compounding error):单步的小误差在多步决策中被不断放大。
  • GAIL 的优势在于它全局匹配专家的状态-动作分布,而不是像 BC 那样只在专家访问过的状态上匹配动作。即使策略犯了小错误,GAIL 仍能保证整体行为分布与专家相似,从而控制误差累积。

一、研究背景与动机

1.1 模仿学习简介

模仿学习的目标是让智能体通过观察专家的示范来学习策略,而不需要与环境交互获得奖励信号。相比强化学习(RL)需要从延迟反馈中学习,IL 利用专家提供的即时反馈,学习效率更高。

两种主要的模仿学习方法:

方法核心思想是否需要环境交互
行为克隆(BC)监督学习:最小化动作概率差异否(离线)
生成对抗模仿学习(GAIL)对抗学习:匹配状态-动作分布是(在线)

1.2 无限 horizon MDP 设定

本文考虑无限 horizon 折扣马尔可夫决策过程(MDP)

M = ( S , A , M ∗ , R , γ , d 0 ) \mathcal{M} = (\mathcal{S}, \mathcal{A}, M^*, R, \gamma, d_0) M=(S,A,M,R,γ,d0)

其中:

  • S \mathcal{S} S:有限状态空间
  • A \mathcal{A} A:有限动作空间
  • M ∗ ( ⋅ ∣ s , a ) M^*(\cdot|s,a) M(s,a):真实环境转移模型
  • R R R:奖励函数,满足 ∣ r ( s , a ) ∣ ≤ R max ⁡ |r(s,a)| \leq R_{\max} r(s,a)Rmax
  • γ ∈ [ 0 , 1 ) \gamma \in [0,1) γ[0,1):折扣因子
  • d 0 d_0 d0:初始状态分布

策略价值函数定义为折扣累积奖励的期望:

V π = E [ ∑ t = 0 ∞ γ t r ( s t , a t ) ∣ s 0 ∼ d 0 , a t ∼ π ( ⋅ ∣ s t ) , s t + 1 ∼ M ∗ ( ⋅ ∣ s t , a t ) ] V_{\pi} = \mathbb{E}\left[\sum_{t=0}^{\infty} \gamma^t r(s_t, a_t) \Big| s_0 \sim d_0, a_t \sim \pi(\cdot|s_t), s_{t+1} \sim M^*(\cdot|s_t, a_t)\right] Vπ=E[t=0γtr(st,at) s0d0,atπ(st),st+1M(st,at)]

1.3 关键概念:有效规划 horizon

在无限 horizon MDP 中,由于折扣因子的存在, distant future 的奖励贡献很小。可以证明,要获得 ϵ \epsilon ϵ-近似的策略价值,只需考虑前 H H H 步:

H = ⌈ log ⁡ ( R max ⁡ / ϵ ( 1 − γ ) ) 1 − γ ⌉ H = \left\lceil \frac{\log(R_{\max}/\epsilon(1-\gamma))}{1-\gamma} \right\rceil H=1γlog(Rmax/ϵ(1γ))

忽略对数项后,有效规划 horizon 定义为:

H eff = 1 1 − γ H_{\text{eff}} = \frac{1}{1-\gamma} Heff=1γ1

这个量将贯穿全文的所有误差界,是衡量误差累积程度的核心指标。

1.4 折扣稳态分布

为了分析策略的长期行为,引入折扣稳态状态分布

d π ( s ) = ( 1 − γ ) ∑ t = 0 ∞ γ t Pr ⁡ ( s t = s ; π ) d_{\pi}(s) = (1-\gamma) \sum_{t=0}^{\infty} \gamma^t \Pr(s_t = s; \pi) dπ(s)=(1γ)t=0γtPr(st=s;π)

以及折扣稳态状态-动作分布

ρ π ( s , a ) = ( 1 − γ ) ∑ t = 0 ∞ γ t Pr ⁡ ( s t = s , a t = a ; π ) \rho_{\pi}(s,a) = (1-\gamma) \sum_{t=0}^{\infty} \gamma^t \Pr(s_t = s, a_t = a; \pi) ρπ(s,a)=(1γ)t=0γtPr(st=s,at=a;π)

直观上,这些分布度量了在策略 π \pi π 下访问某个状态(或状态-动作对)的"总体频率"。

二、主要研究问题

2.1 核心问题:策略价值差距如何随 horizon 缩放?

模仿学习的性能由策略价值差距衡量:

V π E − V π I V_{\pi_E} - V_{\pi_I} VπEVπI

其中 π E \pi_E πE 是专家策略, π I \pi_I πI 是模仿策略。差距越小,说明模仿策略越接近专家。

关键问题:当有效规划 horizon 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ) 增大时(即 γ → 1 \gamma \to 1 γ1),这个差距如何增长?

2.2 误差累积(Compounding Error)

BC 的一个著名问题是误差累积[Ross et al., 2011]:

即使训练误差很小,模仿策略也可能访问训练时未见过的状态。在这些状态下,策略的错误率更高,导致转移到更多未见状态,形成恶性循环。

在有限 horizon MDP 中,已有工作证明 BC 的误差界是 O ( T 2 ) O(T^2) O(T2),其中 T T T 是规划 horizon。DAgger [Ross et al., 2011] 通过在线查询专家将误差降为 O ( T ) O(T) O(T),但需要额外的专家交互。

本文将这一分析扩展到无限 horizon MDP,并回答以下问题:

  1. BC 在无限 horizon 设定下的误差界是什么?
  2. GAIL 是否能缓解误差累积?如果能,误差界是什么?
  3. 这些上界是否紧?(即是否存在匹配的下界)
  4. 这些分析能否推广到环境模仿(模型学习)?

三、策略模仿的误差界

3.1 行为克隆(BC)

BC 通过最小化专家策略与模仿策略之间的 KL 散度来训练:

min ⁡ π ∈ Π E s ∼ d π E [ D KL ( π E ( ⋅ ∣ s ) , π ( ⋅ ∣ s ) ) ] = E ( s , a ) ∼ ρ π E [ log ⁡ ( π E ( a ∣ s ) π ( a ∣ s ) ) ] \min_{\pi \in \Pi} \mathbb{E}_{s \sim d_{\pi_E}}\left[D_{\text{KL}}(\pi_E(\cdot|s), \pi(\cdot|s))\right] = \mathbb{E}_{(s,a) \sim \rho_{\pi_E}}\left[\log\left(\frac{\pi_E(a|s)}{\pi(a|s)}\right)\right] πΠminEsdπE[DKL(πE(s),π(s))]=E(s,a)ρπE[log(π(as)πE(as))]

实践中,我们只有有限样本 D = { ( s π E ( i ) , a π E ( i ) ) } i = 1 m D = \{(s_{\pi_E}^{(i)}, a_{\pi_E}^{(i)})\}_{i=1}^m D={(sπE(i),aπE(i))}i=1m i.i.d. 从 ρ π E \rho_{\pi_E} ρπE 采样,因此优化:

min ⁡ π ∈ Π ∑ ( s , a ) ∈ D − log ⁡ ( π ( a ∣ s ) ) \min_{\pi \in \Pi} \sum_{(s,a) \in D} -\log(\pi(a|s)) πΠmin(s,a)Dlog(π(as))

定理 1(BC 的误差界)

给定随机专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若满足 E s ∼ d π E [ D KL ( π E ( ⋅ ∣ s ) , π I ( ⋅ ∣ s ) ) ] ≤ ϵ \mathbb{E}_{s \sim d_{\pi_E}}[D_{\text{KL}}(\pi_E(\cdot|s), \pi_I(\cdot|s))] \leq \epsilon EsdπE[DKL(πE(s),πI(s))]ϵ,则:

V π E − V π I ≤ 2 R max ⁡ ( 1 − γ ) 2 ϵ V_{\pi_E} - V_{\pi_I} \leq \frac{\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon} VπEVπI(1γ)22 Rmaxϵ

解读

  • 策略价值差距与有效规划 horizon 的平方成正比: O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2)
  • 这就是误差累积的数学体现:单步误差 ϵ \sqrt{\epsilon} ϵ 在多步决策中被平方放大
  • 系数 2 R max ⁡ \sqrt{2} R_{\max} 2 Rmax 来自奖励有界性和误差传播的线性性质
证明思路(误差传播框架)

证明的核心是建立策略价值差距状态-动作分布差异之间的联系:

  1. 利用性能差引理(Performance Difference Lemma):
    V π E − V π I = 1 1 − γ E s ∼ d π I [ ∑ a ( π E ( a ∣ s ) − π I ( a ∣ s ) ) Q π E ( s , a ) ] V_{\pi_E} - V_{\pi_I} = \frac{1}{1-\gamma} \mathbb{E}_{s \sim d_{\pi_I}}\left[\sum_a (\pi_E(a|s) - \pi_I(a|s)) Q_{\pi_E}(s,a)\right] VπEVπI=1γ1EsdπI[a(πE(as)πI(as))QπE(s,a)]

  2. 将状态分布从 d π I d_{\pi_I} dπI 转移到 d π E d_{\pi_E} dπE(这是关键步骤,会引入 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ) 因子)

  3. 利用 Pinsker 不等式将策略差异与 KL 散度联系起来

  4. 综合得到 1 / ( 1 − γ ) 2 1/(1-\gamma)^2 1/(1γ)2 的依赖

有限样本复杂度(推论 1)

设专家演示 D D D m m m 个 i.i.d. 样本, π E \pi_E πE π I \pi_I πI 是确定性策略,策略类 Π \Pi Π 满足可实现性( π E ∈ Π \pi_E \in \Pi πEΠ)且有限。则对 ∀ δ ∈ ( 0 , 1 ) \forall \delta \in (0,1) δ(0,1),以概率至少 1 − δ 1-\delta 1δ

V π E − V π I ≤ 2 R max ⁡ ( 1 − γ ) 2 ( 1 m log ⁡ ∣ Π ∣ + 1 m log ⁡ 1 δ ) V_{\pi_E} - V_{\pi_I} \leq \frac{2 R_{\max}}{(1-\gamma)^2} \left(\frac{1}{m}\log|\Pi| + \frac{1}{m}\log\frac{1}{\delta}\right) VπEVπI(1γ)22Rmax(m1log∣Π∣+m1logδ1)

这说明 BC 的样本复杂度为 O ~ ( ∣ Π ∣ / ( ϵ ( 1 − γ ) 2 ) ) \tilde{O}(|\Pi|/(\epsilon(1-\gamma)^2)) O~(∣Π∣/(ϵ(1γ)2)),与 horizon 的平方成反比—— horizon 越长,需要的样本越多。

3.2 生成对抗模仿学习(GAIL)

GAIL 的优化目标是一个 minimax 问题:

min ⁡ π ∈ Π max ⁡ D ∈ ( 0 , 1 ) S × A E ( s , a ) ∼ ρ π [ log ⁡ D ( s , a ) ] + E ( s , a ) ∼ ρ π E [ log ⁡ ( 1 − D ( s , a ) ) ] \min_{\pi \in \Pi} \max_{D \in (0,1)^{\mathcal{S} \times \mathcal{A}}} \mathbb{E}_{(s,a) \sim \rho_{\pi}}[\log D(s,a)] + \mathbb{E}_{(s,a) \sim \rho_{\pi_E}}[\log(1-D(s,a))] πΠminD(0,1)S×AmaxE(s,a)ρπ[logD(s,a)]+E(s,a)ρπE[log(1D(s,a))]

当判别器达到最优 D ∗ ( s , a ) = ρ π ( s , a ) ρ π ( s , a ) + ρ π E ( s , a ) D^*(s,a) = \frac{\rho_{\pi}(s,a)}{\rho_{\pi}(s,a) + \rho_{\pi_E}(s,a)} D(s,a)=ρπ(s,a)+ρπE(s,a)ρπ(s,a) 时,这等价于最小化状态-动作分布之间的 Jensen-Shannon(JS)散度

min ⁡ π ∈ Π D JS ( ρ π E , ρ π ) \min_{\pi \in \Pi} D_{\text{JS}}(\rho_{\pi_E}, \rho_{\pi}) πΠminDJS(ρπE,ρπ)

更一般地,可以使用 f-散度 族:

D f ( μ , ν ) = ∫ μ ( x ) f ( μ ( x ) ν ( x ) ) d x D_f(\mu, \nu) = \int \mu(x) f\left(\frac{\mu(x)}{\nu(x)}\right) dx Df(μ,ν)=μ(x)f(ν(x)μ(x))dx

其中 f ( ⋅ ) f(\cdot) f() 是满足 f ( 1 ) = 0 f(1) = 0 f(1)=0 的凸函数。

引理 1(GAIL 的误差界)

给定专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若 D f ( ρ π I , ρ π E ) ≤ ϵ D_f(\rho_{\pi_I}, \rho_{\pi_E}) \leq \epsilon Df(ρπI,ρπE)ϵ(可通过 GAIL 实现),则:

V π E − V π I ≤ O ( 1 1 − γ ϵ ) V_{\pi_E} - V_{\pi_I} \leq \mathcal{O}\left(\frac{1}{1-\gamma} \sqrt{\epsilon}\right) VπEVπIO(1γ1ϵ )

解读

  • 策略价值差距仅与有效规划 horizon 线性成正比: O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ))
  • 相比 BC 的 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2),这是一个质的改进
  • 原因在于 GAIL 直接匹配全局状态-动作分布,而不是像 BC 那样只在专家状态上匹配动作
为什么 GAIL 更好?

BC 的问题在于:训练分布 ≠ \neq = 测试分布。BC 在专家状态分布 d π E d_{\pi_E} dπE 上训练,但执行时访问的是 d π I d_{\pi_I} dπI。当 π I \pi_I πI 犯错时,它会进入 d π E d_{\pi_E} dπE 未覆盖的状态,导致更大的错误。

GAIL 通过匹配 ρ π I \rho_{\pi_I} ρπI ρ π E \rho_{\pi_E} ρπE,确保了整体行为分布的相似性。即使单步有误差,全局分布的匹配控制了误差的累积。

3.3 GAIL 的泛化能力分析

实际中 GAIL 使用神经网络作为判别器,需要分析其泛化能力。引入神经网络距离

定义 1(神经网络距离)

对于神经网络类 D \mathcal{D} D,两个分布 μ \mu μ ν \nu ν 之间的神经网络距离为:

d D ( μ , ν ) = sup ⁡ D ∈ D { E ( s , a ) ∼ μ [ D ( s , a ) ] − E ( s , a ) ∼ ν [ D ( s , a ) ] } d_{\mathcal{D}}(\mu, \nu) = \sup_{D \in \mathcal{D}} \left\{ \mathbb{E}_{(s,a) \sim \mu}[D(s,a)] - \mathbb{E}_{(s,a) \sim \nu}[D(s,a)] \right\} dD(μ,ν)=DDsup{E(s,a)μ[D(s,a)]E(s,a)ν[D(s,a)]}

这与 f-散度的变分表示相关:

d f , D ( μ , ν ) = sup ⁡ D ∈ D { E μ [ D ] − E ν [ D ] − E μ [ ϕ ∗ ( f ) ] } d_{f,\mathcal{D}}(\mu, \nu) = \sup_{D \in \mathcal{D}} \left\{ \mathbb{E}_{\mu}[D] - \mathbb{E}_{\nu}[D] - \mathbb{E}_{\mu}[\phi^*(f)] \right\} df,D(μ,ν)=DDsup{Eμ[D]Eν[D]Eμ[ϕ(f)]}

ϕ ∗ = 0 \phi^* = 0 ϕ=0 且最后一层用 sigmoid 激活时,就恢复了原始 GAIL 目标。

引理 2(神经网络距离的泛化)

考虑值函数 Δ \Delta Δ-有界的判别器类 D \mathcal{D} D。给定专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若:

d D ( ρ ^ π E , ρ ^ π I ) − inf ⁡ π ∈ Π d D ( ρ ^ π E , ρ ^ π ) ≤ ϵ ^ d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi_I}) - \inf_{\pi \in \Pi} d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi}) \leq \hat{\epsilon} dD(ρ^πE,ρ^πI)πΠinfdD(ρ^πE,ρ^π)ϵ^

则对 ∀ δ ∈ ( 0 , 1 ) \forall \delta \in (0,1) δ(0,1),以概率至少 1 − δ 1-\delta 1δ

d D ( ρ π E , ρ π I ) ≤ ϵ ^ ⏟ 优化误差 + inf ⁡ π ∈ Π d D ( ρ ^ π E , ρ ^ π ) ⏟ 逼近误差 Appr ( Π ) + 2 R ^ ρ π E ( m ) ( D ) + 2 R ^ ρ π I ( m ) ( D ) + 12 Δ log ⁡ ( 2 / δ ) m ⏟ 估计误差 Estm ( D , m , δ ) d_{\mathcal{D}}(\rho_{\pi_E}, \rho_{\pi_I}) \leq \underbrace{\hat{\epsilon}}_{\text{优化误差}} + \underbrace{\inf_{\pi \in \Pi} d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi})}_{\text{逼近误差 } \text{Appr}(\Pi)} + \underbrace{2\hat{\mathcal{R}}_{\rho_{\pi_E}}^{(m)}(\mathcal{D}) + 2\hat{\mathcal{R}}_{\rho_{\pi_I}}^{(m)}(\mathcal{D}) + 12\Delta\sqrt{\frac{\log(2/\delta)}{m}}}_{\text{估计误差 } \text{Estm}(\mathcal{D},m,\delta)} dD(ρπE,ρπI)优化误差 ϵ^+逼近误差 Appr(Π) πΠinfdD(ρ^πE,ρ^π)+估计误差 Estm(D,m,δ) 2R^ρπE(m)(D)+2R^ρπI(m)(D)+12Δmlog(2/δ)

其中 R ^ ( m ) ( D ) \hat{\mathcal{R}}^{(m)}(\mathcal{D}) R^(m)(D) 是经验 Rademacher 复杂度。

解读

  • 总误差 = 优化误差 + 逼近误差 + 估计误差
  • 估计误差与判别器类的复杂度正相关:更简单的判别器类 → \to 更小的估计误差
  • 但判别器类也不能太简单(见下)
兼容系数

为了确保神经网络距离小能推出策略价值差距小,需要判别器类有足够表达能力。定义判别器类的线性张成

span ( D ) = { c 0 + ∑ i = 1 n c i D i : c 0 , c i ∈ R , D i ∈ D , n ∈ N } \text{span}(\mathcal{D}) = \left\{c_0 + \sum_{i=1}^n c_i D_i : c_0, c_i \in \mathbb{R}, D_i \in \mathcal{D}, n \in \mathbb{N}\right\} span(D)={c0+i=1nciDi:c0,ciR,DiD,nN}

假设真实奖励函数 r r r 落在 span ( D ) \text{span}(\mathcal{D}) span(D) 中,定义兼容系数

∥ r ∥ D = inf ⁡ { ∑ i = 1 n ∣ c i ∣ : r = ∑ i = 1 n c i D i + c 0 } \|r\|_{\mathcal{D}} = \inf\left\{\sum_{i=1}^n |c_i| : r = \sum_{i=1}^n c_i D_i + c_0\right\} rD=inf{i=1nci:r=i=1nciDi+c0}

这度量了用 D \mathcal{D} D 中函数表示 r r r 所需的最少"基函数数量"。

定理 2(GAIL 泛化)

在引理 2 的假设下,若真实奖励 r ∈ span ( D ) r \in \text{span}(\mathcal{D}) rspan(D),则以概率至少 1 − δ 1-\delta 1δ

V π E − V π I ≤ ∥ r ∥ D 1 − γ ( Appr ( Π ) + Estm ( D , m , δ ) + ϵ ^ ) V_{\pi_E} - V_{\pi_I} \leq \frac{\|r\|_{\mathcal{D}}}{1-\gamma} \left(\text{Appr}(\Pi) + \text{Estm}(\mathcal{D},m,\delta) + \hat{\epsilon}\right) VπEVπI1γrD(Appr(Π)+Estm(D,m,δ)+ϵ^)

关键洞察

  • 策略价值差距线性依赖于 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ)
  • 存在判别器复杂度的权衡
    • 更简单的 D \mathcal{D} D → \to 更小的估计误差,但更大的 ∥ r ∥ D \|r\|_{\mathcal{D}} rD
    • 更丰富的 D \mathcal{D} D → \to 更小的 ∥ r ∥ D \|r\|_{\mathcal{D}} rD,但更大的估计误差
  • 这解释了实践中梯度惩罚(控制 Lipschitz 常数)和信息瓶颈等技术为何有效

四、下界分析(TPAMI 版论文)

NeurIPS 2020 版本主要给出了上界,IEEE TPAMI 2022 扩展版补充了信息论下界,证明这些上界在 minimax 意义下是紧的。

4.1 不允许环境交互的下界

考虑一类名为 “Reset Cliff” 的 MDP(见图 2):

  • 状态空间 S \mathcal{S} S 包含多个状态和一个"坏状态" b b b
  • 初始分布 d 0 = ( η , … , η , 1 − ( ∣ S ∣ − 2 ) η , 0 ) d_0 = (\eta, \ldots, \eta, 1-(|\mathcal{S}|-2)\eta, 0) d0=(η,,η,1(S2)η,0),其中 η = 1 m + 1 \eta = \frac{1}{m+1} η=m+11
  • 在任何非坏状态,执行专家动作获得 +1 奖励并按 d 0 d_0 d0 重置;执行非专家动作转移到坏状态 b b b 并永远获得 0 奖励

直觉:一旦犯错进入坏状态,之后所有奖励都是 0。这放大了误差的累积效应。

命题 1(无交互下界)

给定 m m m 个 i.i.d. 专家演示,对任意算法 Alg : D → π I \text{Alg}: D \to \pi_I Alg:DπI,存在常数 δ ^ 0 ∈ ( 0 , 1 / 10 ] \hat{\delta}_0 \in (0, 1/10] δ^0(0,1/10] 和某个 MDP M \mathcal{M} M、确定性专家策略 π E \pi_E πE,使得对 ∀ δ ∈ ( 0 , δ ^ 0 ) \forall \delta \in (0, \hat{\delta}_0) δ(0,δ^0),以概率至少 1 − δ 1-\delta 1δ

V π E M − V π I M ≳ min ⁡ ( 1 1 − γ , ∣ S ∣ ( 1 − γ ) 2 m ) V_{\pi_E}^{\mathcal{M}} - V_{\pi_I}^{\mathcal{M}} \gtrsim \min\left(\frac{1}{1-\gamma}, \frac{|\mathcal{S}|}{(1-\gamma)^2 m}\right) VπEMVπIMmin(1γ1,(1γ)2mS)

解读

  • m m m 足够大时,下界为 Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1γ))
  • m m m 较小时,下界为 Ω ( ∣ S ∣ / ( ( 1 − γ ) 2 m ) ) \Omega(|\mathcal{S}|/((1-\gamma)^2 m)) Ω(S∣/((1γ)2m))
  • 这与 BC 的上界 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2) 匹配(忽略对数项),说明 BC 在无交互设定下是 nearly minimax 最优的
  • 二次依赖不可避免!

4.2 允许环境交互的下界

考虑另一类名为 “Standard Imitation” 的 MDP(见图 3):

  • 每个状态都是吸收态
  • 执行专家动作获得 +1 奖励,否则获得 0
  • 由于状态不转移,环境交互不能提供额外信息
命题 2(有交互下界)

在允许环境交互的设定下,对任意算法 Alg : D → π I \text{Alg}: D \to \pi_I Alg:DπI

V π E M − V π I M ≳ min ⁡ ( 1 1 − γ , ∣ S ∣ ( 1 − γ ) m ) V_{\pi_E}^{\mathcal{M}} - V_{\pi_I}^{\mathcal{M}} \gtrsim \min\left(\frac{1}{1-\gamma}, \frac{|\mathcal{S}|}{(1-\gamma) m}\right) VπEMVπIMmin(1γ1,(1γ)mS)

解读

  • 下界仅线性依赖于 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ)
  • 这与 GAIL 的上界 O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ)) 匹配
  • 环境交互的重要性:交互提供了转移函数的信息,缓解了误差累积

4.3 上下界对比总结

设定方法上界下界是否紧
无交互BC O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2) Ω ( 1 / ( 1 − γ ) 2 ) \Omega(1/(1-\gamma)^2) Ω(1/(1γ)2)(小 m m m✓ Nearly tight
有交互GAIL O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ)) Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1γ))✓ Tight

五、环境模仿的误差界

5.1 动机:模型-based RL 中的模型偏差

模型-based 强化学习(MBRL) 的核心是学习一个环境转移模型 M θ M_\theta Mθ,然后在该模型上优化策略。评估学习模型质量的标准是策略评估误差

∣ V π M ∗ − V π M θ ∣ |V_{\pi}^{M^*} - V_{\pi}^{M_\theta}| VπMVπMθ

现有 MBRL 方法大多用 BC 原则学习环境(即最小化单步转移预测误差):

min ⁡ θ E ( s , a ) ∼ ρ π D M ∗ [ D KL ( M ∗ ( ⋅ ∣ s , a ) , M θ ( ⋅ ∣ s , a ) ) ] \min_\theta \mathbb{E}_{(s,a) \sim \rho_{\pi_D}^{M^*}}\left[D_{\text{KL}}(M^*(\cdot|s,a), M_\theta(\cdot|s,a))\right] θminE(s,a)ρπDM[DKL(M(s,a),Mθ(s,a))]

这导致 模型偏差(model bias) 的二次累积。

5.2 用 BC 模仿环境

引理 3(BC 环境模仿)

给定真实 MDP M ∗ M^* M、数据收集策略 π D \pi_D πD、学习模型 M θ M_\theta Mθ 满足 E ( s , a ) ∼ ρ π D M ∗ [ D KL ( M ∗ ( ⋅ ∣ s , a ) , M θ ( ⋅ ∣ s , a ) ) ] ≤ ϵ m \mathbb{E}_{(s,a) \sim \rho_{\pi_D}^{M^*}}[D_{\text{KL}}(M^*(\cdot|s,a), M_\theta(\cdot|s,a))] \leq \epsilon_m E(s,a)ρπDM[DKL(M(s,a),Mθ(s,a))]ϵm。对任意策略 π \pi π 满足 max ⁡ s D KL ( π ( ⋅ ∣ s ) , π D ( ⋅ ∣ s ) ) ≤ ϵ π \max_s D_{\text{KL}}(\pi(\cdot|s), \pi_D(\cdot|s)) \leq \epsilon_\pi maxsDKL(π(s),πD(s))ϵπ

∣ V π M ∗ − V π M θ ∣ ≤ 2 R max ⁡ γ ( 1 − γ ) 2 ϵ m + 2 2 R max ⁡ ( 1 − γ ) 2 ϵ π \left|V_{\pi}^{M^*} - V_{\pi}^{M_\theta}\right| \leq \frac{\sqrt{2} R_{\max} \gamma}{(1-\gamma)^2} \sqrt{\epsilon_m} + \frac{2\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon_\pi} VπMVπMθ (1γ)22 Rmaxγϵm +(1γ)222 Rmaxϵπ

解读

  • 模型偏差项(第一项)与 ( 1 − γ ) 2 (1-\gamma)^2 (1γ)2 成反比——二次累积!
  • 策略分歧项(第二项)同样二次依赖
  • 策略分歧项不可避免(参见 TRPO [Schulman et al., 2015] 的定理 1)
  • 我们的目标是减小模型偏差项

5.3 用 GAIL 模仿环境

将环境转移模型视为一个"对偶智能体":输入 ( s t , a t ) (s_t, a_t) (st,at),输出 s t + 1 s_{t+1} st+1 的分布。这样可以用 GAIL 来模仿:

  • 状态空间:原始状态-动作对 ( s , a ) (s, a) (s,a)
  • 动作空间:下一状态 s ′ s' s
  • 专家演示:从真实环境 M ∗ M^* M 中收集的转移 ( s , a , s ′ ) (s, a, s') (s,a,s)

定义状态-动作-下一状态分布:

μ M θ ( s , a , s ′ ) = ρ π D M θ ( s , a ) M θ ( s ′ ∣ s , a ) \mu^{M_\theta}(s,a,s') = \rho_{\pi_D}^{M_\theta}(s,a) M_\theta(s'|s,a) μMθ(s,a,s)=ρπDMθ(s,a)Mθ(ss,a)

μ M ∗ ( s , a , s ′ ) = ρ π D M ∗ ( s , a ) M ∗ ( s ′ ∣ s , a ) \mu^{M^*}(s,a,s') = \rho_{\pi_D}^{M^*}(s,a) M^*(s'|s,a) μM(s,a,s)=ρπDM(s,a)M(ss,a)

GAIL 目标是最小化 D JS ( μ M θ , μ M ∗ ) D_{\text{JS}}(\mu^{M_\theta}, \mu^{M^*}) DJS(μMθ,μM)

定理 3(GAIL 环境模仿)

给定真实 MDP M ∗ M^* M、数据收集策略 π D \pi_D πD、学习模型 M θ M_\theta Mθ 满足 D JS ( μ M θ , μ M ∗ ) ≤ ϵ m D_{\text{JS}}(\mu^{M_\theta}, \mu^{M^*}) \leq \epsilon_m DJS(μMθ,μM)ϵm。对任意策略 π \pi π 满足 max ⁡ s D KL ( π ( ⋅ ∣ s ) , π D ( ⋅ ∣ s ) ) ≤ ϵ π \max_s D_{\text{KL}}(\pi(\cdot|s), \pi_D(\cdot|s)) \leq \epsilon_\pi maxsDKL(π(s),πD(s))ϵπ

∣ V π M ∗ − V π M θ ∣ ≤ 2 2 R max ⁡ 1 − γ ϵ m + 2 2 R max ⁡ ( 1 − γ ) 2 ϵ π \left|V_{\pi}^{M^*} - V_{\pi}^{M_\theta}\right| \leq \frac{2\sqrt{2} R_{\max}}{1-\gamma} \sqrt{\epsilon_m} + \frac{2\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon_\pi} VπMVπMθ 1γ22 Rmaxϵm +(1γ)222 Rmaxϵπ

解读

  • 模型偏差项(第一项)仅与 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ) 线性依赖!
  • 相比 BC 的 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2),这是质的改进
  • 策略分歧项(第二项)仍保持 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2),但这与模型学习无关
  • 无需主动查询"专家"(即无需额外从真实环境采样)

5.4 环境模仿的核心洞察

方法模型偏差项关键区别
BC O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2)仅匹配单步转移
GAIL O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ))匹配状态-动作-下一状态分布

GAIL 的优势在于:全局分布匹配捕获了序列结构,而 BC 的单步匹配忽略了长期影响。


六、实验验证

6.1 策略模仿实验

实验 1:有效规划 horizon 依赖

在"Reset Cliff"和"Standard Imitation"两个表格环境上测试:

Reset Cliff 结果(见图 4 上):

  • BC(红线):策略价值差距随 1 / ( 1 − γ ) 2 1/(1-\gamma)^2 1/(1γ)2 线性增长 → \to 确认二次依赖
  • GAIL(黄线)、DAgger(绿线)、FEM(黑线)、GTAL(蓝线):差距基本平坦 → \to 确认线性依赖

Standard Imitation 结果(见图 4 下):

  • 所有方法的差距都随 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1γ) 线性增长
  • 这是因为每个状态都是吸收态,犯错不会导致状态转移 → \to 无误差累积
MuJoCo 实验

在 HalfCheetah-v2、Hopper-v2、Walker2d-v2 上测试(见图 5):

  • 仅提供 3 条专家轨迹(少量样本)
  • γ \gamma γ 增大(horizon 变长)时,BC 性能显著下降
  • GAIL、AIRL、FEM、GTAL 在长 horizon 下表现更稳定
实验 2:判别器复杂度权衡

通过梯度惩罚系数 λ \lambda λ 控制判别器复杂度:

λ \lambda λHalfCheetahHopperWalker2d
0.0335019502591
0.01351221792926
1.0351021372899
100.0270218692778
  • 适度的 λ \lambda λ(0.01 或 1.0) 效果最好
  • λ = 0 \lambda = 0 λ=0(无正则化):估计误差大
  • λ = 100 \lambda = 100 λ=100(过度正则化):判别器太简单,兼容系数大
  • 验证了定理 2 中的复杂度权衡

6.2 环境模仿实验

在 MuJoCo 上比较 BC 和 GAIL 学习环境模型:

结果(见图 6):

  • MB-GAIL(红线)的策略评估误差显著小于 MB-BC(绿线)
  • 在 Walker2d-v2 上,MB-BC 的误差是 MB-GAIL 的 2-3 倍

Episode 长度分析(见图 7):

  • 初始阶段:两种方法都能较好模拟
  • 训练中期:MB-BC 出现"坏吸收态"(模拟中智能体摔倒),导致 episode 长度骤降
  • MB-GAIL 保持稳定,说明全局分布匹配缓解了 compounding error

七、两篇文章的关联与差异

维度NeurIPS 2020IEEE TPAMI 2022
发表时间2020年12月2022年10月
篇幅9页(正文)+ 4页(参考文献)12页
核心内容上界分析 + 基础实验扩展:下界 + 更完整实验 + 更详细讨论

NeurIPS 2020 版本包含

  • BC 和 GAIL 的策略模仿上界(定理 1、引理 1)
  • GAIL 的泛化分析(引理 2、定理 2)
  • BC 和 GAIL 的环境模仿界(引理 3、定理 3)
  • MuJoCo 上的策略模仿和环境模仿实验

TPAMI 2022 扩展版新增

  • 下界分析(第 4.3 节):
    • 命题 1:无交互设定下的 Ω ( 1 / ( 1 − γ ) 2 ) \Omega(1/(1-\gamma)^2) Ω(1/(1γ)2) 下界
    • 命题 2:有交互设定下的 Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1γ)) 下界
    • "Reset Cliff"和"Standard Imitation"两个构造
  • 更详细的实验
    • 表格环境(Reset Cliff、Standard Imitation)上的 horizon 依赖实验
    • 更多基线方法(DAgger、FEM、GTAL、AIRL、WGAIL)
    • 梯度惩罚的系统性研究
    • Episode 长度分析解释环境模仿结果
  • WGAIL(Wasserstein GAIL):基于 Wasserstein 距离的 GAIL 变体
  • 更完整的讨论:神经网络距离、f-散度、信息瓶颈等

TPAMI 版是 NeurIPS 版的完整扩展

  • 保留所有核心定理和实验
  • 补充了下界证明,使上界的紧性得到验证
  • 增加了更多实验场景和基线对比
  • 理论分析更加深入和完整

八、结论与启示

8.1 核心结论

  1. BC 的误差界 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2),二次依赖不可避免(无交互下界匹配)
  2. GAIL 的误差界 O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ)),线性依赖,环境交互是关键
  3. 环境模仿:GAIL 可将模型偏差的策略评估误差从 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1γ)2) 降为 O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1γ))
  4. 判别器复杂度权衡:需要平衡估计误差和兼容系数

8.2 对 MBRL 的启示

传统 MBRL 方法使用 BC 学习环境模型,导致模型偏差的二次累积。本文建议:

用 GAIL-style 转移学习器替代 BC-style 学习器,可改善泛化能力,降低模型偏差。

这解释了为什么 [Shi et al., 2019](Virtual-Taobao)和 [Shang et al., 2019](环境重建)中的对抗式环境学习方法能取得好效果。

8.3 开放问题

  • GAIL 的策略类逼近能力和计算性质(如随机策略梯度下降的收敛性)
  • 更紧的常数因子
  • 连续状态/动作空间的扩展
  • 与其他 MBRL 技术(如模型集成、规划)的结合
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐