【论文阅读笔记】模仿学习中的误差界:从策略模仿到环境模仿
- NeurIPS 2020: “Error Bounds of Imitating Policies and Environments”
- IEEE TPAMI 2022: “Error Bounds of Imitating Policies and Environments for Reinforcement Learning”, Vol.44, No.10
- 注:文中提到的图片序号均指原论文中图片
这篇文章研究**模仿学习(Imitation Learning, IL)中的误差传播(compounding error)**问题。核心发现是:
- 行为克隆(BC)的策略价值差距随有效规划 horizon 的平方增长: O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2)
- 生成对抗模仿学习(GAIL) 的策略价值差距仅随有效规划 horizon 线性增长: O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ))
- 这一优势同样适用于环境模仿:用 GAIL 学习环境模型可将策略评估误差从二次降为线性
一个直观例子
- 想象一个自动驾驶场景:车辆在道路上行驶,专家策略在 99% 的情况下都能正确决策。但 BC 训练出的策略有 1% 的概率会犯错——比如稍微偏离车道。一旦偏离,车辆进入了训练时很少见过的状态,错误概率急剧上升,最终可能撞车。这就是误差累积(compounding error):单步的小误差在多步决策中被不断放大。
- GAIL 的优势在于它全局匹配专家的状态-动作分布,而不是像 BC 那样只在专家访问过的状态上匹配动作。即使策略犯了小错误,GAIL 仍能保证整体行为分布与专家相似,从而控制误差累积。
一、研究背景与动机
1.1 模仿学习简介
模仿学习的目标是让智能体通过观察专家的示范来学习策略,而不需要与环境交互获得奖励信号。相比强化学习(RL)需要从延迟反馈中学习,IL 利用专家提供的即时反馈,学习效率更高。
两种主要的模仿学习方法:
| 方法 | 核心思想 | 是否需要环境交互 |
|---|---|---|
| 行为克隆(BC) | 监督学习:最小化动作概率差异 | 否(离线) |
| 生成对抗模仿学习(GAIL) | 对抗学习:匹配状态-动作分布 | 是(在线) |
1.2 无限 horizon MDP 设定
本文考虑无限 horizon 折扣马尔可夫决策过程(MDP):
M = ( S , A , M ∗ , R , γ , d 0 ) \mathcal{M} = (\mathcal{S}, \mathcal{A}, M^*, R, \gamma, d_0) M=(S,A,M∗,R,γ,d0)
其中:
- S \mathcal{S} S:有限状态空间
- A \mathcal{A} A:有限动作空间
- M ∗ ( ⋅ ∣ s , a ) M^*(\cdot|s,a) M∗(⋅∣s,a):真实环境转移模型
- R R R:奖励函数,满足 ∣ r ( s , a ) ∣ ≤ R max |r(s,a)| \leq R_{\max} ∣r(s,a)∣≤Rmax
- γ ∈ [ 0 , 1 ) \gamma \in [0,1) γ∈[0,1):折扣因子
- d 0 d_0 d0:初始状态分布
策略价值函数定义为折扣累积奖励的期望:
V π = E [ ∑ t = 0 ∞ γ t r ( s t , a t ) ∣ s 0 ∼ d 0 , a t ∼ π ( ⋅ ∣ s t ) , s t + 1 ∼ M ∗ ( ⋅ ∣ s t , a t ) ] V_{\pi} = \mathbb{E}\left[\sum_{t=0}^{\infty} \gamma^t r(s_t, a_t) \Big| s_0 \sim d_0, a_t \sim \pi(\cdot|s_t), s_{t+1} \sim M^*(\cdot|s_t, a_t)\right] Vπ=E[t=0∑∞γtr(st,at) s0∼d0,at∼π(⋅∣st),st+1∼M∗(⋅∣st,at)]
1.3 关键概念:有效规划 horizon
在无限 horizon MDP 中,由于折扣因子的存在, distant future 的奖励贡献很小。可以证明,要获得 ϵ \epsilon ϵ-近似的策略价值,只需考虑前 H H H 步:
H = ⌈ log ( R max / ϵ ( 1 − γ ) ) 1 − γ ⌉ H = \left\lceil \frac{\log(R_{\max}/\epsilon(1-\gamma))}{1-\gamma} \right\rceil H=⌈1−γlog(Rmax/ϵ(1−γ))⌉
忽略对数项后,有效规划 horizon 定义为:
H eff = 1 1 − γ H_{\text{eff}} = \frac{1}{1-\gamma} Heff=1−γ1
这个量将贯穿全文的所有误差界,是衡量误差累积程度的核心指标。
1.4 折扣稳态分布
为了分析策略的长期行为,引入折扣稳态状态分布:
d π ( s ) = ( 1 − γ ) ∑ t = 0 ∞ γ t Pr ( s t = s ; π ) d_{\pi}(s) = (1-\gamma) \sum_{t=0}^{\infty} \gamma^t \Pr(s_t = s; \pi) dπ(s)=(1−γ)t=0∑∞γtPr(st=s;π)
以及折扣稳态状态-动作分布:
ρ π ( s , a ) = ( 1 − γ ) ∑ t = 0 ∞ γ t Pr ( s t = s , a t = a ; π ) \rho_{\pi}(s,a) = (1-\gamma) \sum_{t=0}^{\infty} \gamma^t \Pr(s_t = s, a_t = a; \pi) ρπ(s,a)=(1−γ)t=0∑∞γtPr(st=s,at=a;π)
直观上,这些分布度量了在策略 π \pi π 下访问某个状态(或状态-动作对)的"总体频率"。
二、主要研究问题
2.1 核心问题:策略价值差距如何随 horizon 缩放?
模仿学习的性能由策略价值差距衡量:
V π E − V π I V_{\pi_E} - V_{\pi_I} VπE−VπI
其中 π E \pi_E πE 是专家策略, π I \pi_I πI 是模仿策略。差距越小,说明模仿策略越接近专家。
关键问题:当有效规划 horizon 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ) 增大时(即 γ → 1 \gamma \to 1 γ→1),这个差距如何增长?
2.2 误差累积(Compounding Error)
BC 的一个著名问题是误差累积[Ross et al., 2011]:
即使训练误差很小,模仿策略也可能访问训练时未见过的状态。在这些状态下,策略的错误率更高,导致转移到更多未见状态,形成恶性循环。
在有限 horizon MDP 中,已有工作证明 BC 的误差界是 O ( T 2 ) O(T^2) O(T2),其中 T T T 是规划 horizon。DAgger [Ross et al., 2011] 通过在线查询专家将误差降为 O ( T ) O(T) O(T),但需要额外的专家交互。
本文将这一分析扩展到无限 horizon MDP,并回答以下问题:
- BC 在无限 horizon 设定下的误差界是什么?
- GAIL 是否能缓解误差累积?如果能,误差界是什么?
- 这些上界是否紧?(即是否存在匹配的下界)
- 这些分析能否推广到环境模仿(模型学习)?
三、策略模仿的误差界
3.1 行为克隆(BC)
BC 通过最小化专家策略与模仿策略之间的 KL 散度来训练:
min π ∈ Π E s ∼ d π E [ D KL ( π E ( ⋅ ∣ s ) , π ( ⋅ ∣ s ) ) ] = E ( s , a ) ∼ ρ π E [ log ( π E ( a ∣ s ) π ( a ∣ s ) ) ] \min_{\pi \in \Pi} \mathbb{E}_{s \sim d_{\pi_E}}\left[D_{\text{KL}}(\pi_E(\cdot|s), \pi(\cdot|s))\right] = \mathbb{E}_{(s,a) \sim \rho_{\pi_E}}\left[\log\left(\frac{\pi_E(a|s)}{\pi(a|s)}\right)\right] π∈ΠminEs∼dπE[DKL(πE(⋅∣s),π(⋅∣s))]=E(s,a)∼ρπE[log(π(a∣s)πE(a∣s))]
实践中,我们只有有限样本 D = { ( s π E ( i ) , a π E ( i ) ) } i = 1 m D = \{(s_{\pi_E}^{(i)}, a_{\pi_E}^{(i)})\}_{i=1}^m D={(sπE(i),aπE(i))}i=1m i.i.d. 从 ρ π E \rho_{\pi_E} ρπE 采样,因此优化:
min π ∈ Π ∑ ( s , a ) ∈ D − log ( π ( a ∣ s ) ) \min_{\pi \in \Pi} \sum_{(s,a) \in D} -\log(\pi(a|s)) π∈Πmin(s,a)∈D∑−log(π(a∣s))
定理 1(BC 的误差界)
给定随机专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若满足 E s ∼ d π E [ D KL ( π E ( ⋅ ∣ s ) , π I ( ⋅ ∣ s ) ) ] ≤ ϵ \mathbb{E}_{s \sim d_{\pi_E}}[D_{\text{KL}}(\pi_E(\cdot|s), \pi_I(\cdot|s))] \leq \epsilon Es∼dπE[DKL(πE(⋅∣s),πI(⋅∣s))]≤ϵ,则:
V π E − V π I ≤ 2 R max ( 1 − γ ) 2 ϵ V_{\pi_E} - V_{\pi_I} \leq \frac{\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon} VπE−VπI≤(1−γ)22Rmaxϵ
解读:
- 策略价值差距与有效规划 horizon 的平方成正比: O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2)
- 这就是误差累积的数学体现:单步误差 ϵ \sqrt{\epsilon} ϵ 在多步决策中被平方放大
- 系数 2 R max \sqrt{2} R_{\max} 2Rmax 来自奖励有界性和误差传播的线性性质
证明思路(误差传播框架)
证明的核心是建立策略价值差距与状态-动作分布差异之间的联系:
-
利用性能差引理(Performance Difference Lemma):
V π E − V π I = 1 1 − γ E s ∼ d π I [ ∑ a ( π E ( a ∣ s ) − π I ( a ∣ s ) ) Q π E ( s , a ) ] V_{\pi_E} - V_{\pi_I} = \frac{1}{1-\gamma} \mathbb{E}_{s \sim d_{\pi_I}}\left[\sum_a (\pi_E(a|s) - \pi_I(a|s)) Q_{\pi_E}(s,a)\right] VπE−VπI=1−γ1Es∼dπI[a∑(πE(a∣s)−πI(a∣s))QπE(s,a)] -
将状态分布从 d π I d_{\pi_I} dπI 转移到 d π E d_{\pi_E} dπE(这是关键步骤,会引入 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ) 因子)
-
利用 Pinsker 不等式将策略差异与 KL 散度联系起来
-
综合得到 1 / ( 1 − γ ) 2 1/(1-\gamma)^2 1/(1−γ)2 的依赖
有限样本复杂度(推论 1)
设专家演示 D D D 有 m m m 个 i.i.d. 样本, π E \pi_E πE 和 π I \pi_I πI 是确定性策略,策略类 Π \Pi Π 满足可实现性( π E ∈ Π \pi_E \in \Pi πE∈Π)且有限。则对 ∀ δ ∈ ( 0 , 1 ) \forall \delta \in (0,1) ∀δ∈(0,1),以概率至少 1 − δ 1-\delta 1−δ:
V π E − V π I ≤ 2 R max ( 1 − γ ) 2 ( 1 m log ∣ Π ∣ + 1 m log 1 δ ) V_{\pi_E} - V_{\pi_I} \leq \frac{2 R_{\max}}{(1-\gamma)^2} \left(\frac{1}{m}\log|\Pi| + \frac{1}{m}\log\frac{1}{\delta}\right) VπE−VπI≤(1−γ)22Rmax(m1log∣Π∣+m1logδ1)
这说明 BC 的样本复杂度为 O ~ ( ∣ Π ∣ / ( ϵ ( 1 − γ ) 2 ) ) \tilde{O}(|\Pi|/(\epsilon(1-\gamma)^2)) O~(∣Π∣/(ϵ(1−γ)2)),与 horizon 的平方成反比—— horizon 越长,需要的样本越多。
3.2 生成对抗模仿学习(GAIL)
GAIL 的优化目标是一个 minimax 问题:
min π ∈ Π max D ∈ ( 0 , 1 ) S × A E ( s , a ) ∼ ρ π [ log D ( s , a ) ] + E ( s , a ) ∼ ρ π E [ log ( 1 − D ( s , a ) ) ] \min_{\pi \in \Pi} \max_{D \in (0,1)^{\mathcal{S} \times \mathcal{A}}} \mathbb{E}_{(s,a) \sim \rho_{\pi}}[\log D(s,a)] + \mathbb{E}_{(s,a) \sim \rho_{\pi_E}}[\log(1-D(s,a))] π∈ΠminD∈(0,1)S×AmaxE(s,a)∼ρπ[logD(s,a)]+E(s,a)∼ρπE[log(1−D(s,a))]
当判别器达到最优 D ∗ ( s , a ) = ρ π ( s , a ) ρ π ( s , a ) + ρ π E ( s , a ) D^*(s,a) = \frac{\rho_{\pi}(s,a)}{\rho_{\pi}(s,a) + \rho_{\pi_E}(s,a)} D∗(s,a)=ρπ(s,a)+ρπE(s,a)ρπ(s,a) 时,这等价于最小化状态-动作分布之间的 Jensen-Shannon(JS)散度:
min π ∈ Π D JS ( ρ π E , ρ π ) \min_{\pi \in \Pi} D_{\text{JS}}(\rho_{\pi_E}, \rho_{\pi}) π∈ΠminDJS(ρπE,ρπ)
更一般地,可以使用 f-散度 族:
D f ( μ , ν ) = ∫ μ ( x ) f ( μ ( x ) ν ( x ) ) d x D_f(\mu, \nu) = \int \mu(x) f\left(\frac{\mu(x)}{\nu(x)}\right) dx Df(μ,ν)=∫μ(x)f(ν(x)μ(x))dx
其中 f ( ⋅ ) f(\cdot) f(⋅) 是满足 f ( 1 ) = 0 f(1) = 0 f(1)=0 的凸函数。
引理 1(GAIL 的误差界)
给定专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若 D f ( ρ π I , ρ π E ) ≤ ϵ D_f(\rho_{\pi_I}, \rho_{\pi_E}) \leq \epsilon Df(ρπI,ρπE)≤ϵ(可通过 GAIL 实现),则:
V π E − V π I ≤ O ( 1 1 − γ ϵ ) V_{\pi_E} - V_{\pi_I} \leq \mathcal{O}\left(\frac{1}{1-\gamma} \sqrt{\epsilon}\right) VπE−VπI≤O(1−γ1ϵ)
解读:
- 策略价值差距仅与有效规划 horizon 线性成正比: O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ))
- 相比 BC 的 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2),这是一个质的改进
- 原因在于 GAIL 直接匹配全局状态-动作分布,而不是像 BC 那样只在专家状态上匹配动作
为什么 GAIL 更好?
BC 的问题在于:训练分布 ≠ \neq = 测试分布。BC 在专家状态分布 d π E d_{\pi_E} dπE 上训练,但执行时访问的是 d π I d_{\pi_I} dπI。当 π I \pi_I πI 犯错时,它会进入 d π E d_{\pi_E} dπE 未覆盖的状态,导致更大的错误。
GAIL 通过匹配 ρ π I \rho_{\pi_I} ρπI 和 ρ π E \rho_{\pi_E} ρπE,确保了整体行为分布的相似性。即使单步有误差,全局分布的匹配控制了误差的累积。
3.3 GAIL 的泛化能力分析
实际中 GAIL 使用神经网络作为判别器,需要分析其泛化能力。引入神经网络距离:
定义 1(神经网络距离)
对于神经网络类 D \mathcal{D} D,两个分布 μ \mu μ 和 ν \nu ν 之间的神经网络距离为:
d D ( μ , ν ) = sup D ∈ D { E ( s , a ) ∼ μ [ D ( s , a ) ] − E ( s , a ) ∼ ν [ D ( s , a ) ] } d_{\mathcal{D}}(\mu, \nu) = \sup_{D \in \mathcal{D}} \left\{ \mathbb{E}_{(s,a) \sim \mu}[D(s,a)] - \mathbb{E}_{(s,a) \sim \nu}[D(s,a)] \right\} dD(μ,ν)=D∈Dsup{E(s,a)∼μ[D(s,a)]−E(s,a)∼ν[D(s,a)]}
这与 f-散度的变分表示相关:
d f , D ( μ , ν ) = sup D ∈ D { E μ [ D ] − E ν [ D ] − E μ [ ϕ ∗ ( f ) ] } d_{f,\mathcal{D}}(\mu, \nu) = \sup_{D \in \mathcal{D}} \left\{ \mathbb{E}_{\mu}[D] - \mathbb{E}_{\nu}[D] - \mathbb{E}_{\mu}[\phi^*(f)] \right\} df,D(μ,ν)=D∈Dsup{Eμ[D]−Eν[D]−Eμ[ϕ∗(f)]}
当 ϕ ∗ = 0 \phi^* = 0 ϕ∗=0 且最后一层用 sigmoid 激活时,就恢复了原始 GAIL 目标。
引理 2(神经网络距离的泛化)
考虑值函数 Δ \Delta Δ-有界的判别器类 D \mathcal{D} D。给定专家策略 π E \pi_E πE 和模仿策略 π I \pi_I πI,若:
d D ( ρ ^ π E , ρ ^ π I ) − inf π ∈ Π d D ( ρ ^ π E , ρ ^ π ) ≤ ϵ ^ d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi_I}) - \inf_{\pi \in \Pi} d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi}) \leq \hat{\epsilon} dD(ρ^πE,ρ^πI)−π∈ΠinfdD(ρ^πE,ρ^π)≤ϵ^
则对 ∀ δ ∈ ( 0 , 1 ) \forall \delta \in (0,1) ∀δ∈(0,1),以概率至少 1 − δ 1-\delta 1−δ:
d D ( ρ π E , ρ π I ) ≤ ϵ ^ ⏟ 优化误差 + inf π ∈ Π d D ( ρ ^ π E , ρ ^ π ) ⏟ 逼近误差 Appr ( Π ) + 2 R ^ ρ π E ( m ) ( D ) + 2 R ^ ρ π I ( m ) ( D ) + 12 Δ log ( 2 / δ ) m ⏟ 估计误差 Estm ( D , m , δ ) d_{\mathcal{D}}(\rho_{\pi_E}, \rho_{\pi_I}) \leq \underbrace{\hat{\epsilon}}_{\text{优化误差}} + \underbrace{\inf_{\pi \in \Pi} d_{\mathcal{D}}(\hat{\rho}_{\pi_E}, \hat{\rho}_{\pi})}_{\text{逼近误差 } \text{Appr}(\Pi)} + \underbrace{2\hat{\mathcal{R}}_{\rho_{\pi_E}}^{(m)}(\mathcal{D}) + 2\hat{\mathcal{R}}_{\rho_{\pi_I}}^{(m)}(\mathcal{D}) + 12\Delta\sqrt{\frac{\log(2/\delta)}{m}}}_{\text{估计误差 } \text{Estm}(\mathcal{D},m,\delta)} dD(ρπE,ρπI)≤优化误差 ϵ^+逼近误差 Appr(Π) π∈ΠinfdD(ρ^πE,ρ^π)+估计误差 Estm(D,m,δ) 2R^ρπE(m)(D)+2R^ρπI(m)(D)+12Δmlog(2/δ)
其中 R ^ ( m ) ( D ) \hat{\mathcal{R}}^{(m)}(\mathcal{D}) R^(m)(D) 是经验 Rademacher 复杂度。
解读:
- 总误差 = 优化误差 + 逼近误差 + 估计误差
- 估计误差与判别器类的复杂度正相关:更简单的判别器类 → \to → 更小的估计误差
- 但判别器类也不能太简单(见下)
兼容系数
为了确保神经网络距离小能推出策略价值差距小,需要判别器类有足够表达能力。定义判别器类的线性张成:
span ( D ) = { c 0 + ∑ i = 1 n c i D i : c 0 , c i ∈ R , D i ∈ D , n ∈ N } \text{span}(\mathcal{D}) = \left\{c_0 + \sum_{i=1}^n c_i D_i : c_0, c_i \in \mathbb{R}, D_i \in \mathcal{D}, n \in \mathbb{N}\right\} span(D)={c0+i=1∑nciDi:c0,ci∈R,Di∈D,n∈N}
假设真实奖励函数 r r r 落在 span ( D ) \text{span}(\mathcal{D}) span(D) 中,定义兼容系数:
∥ r ∥ D = inf { ∑ i = 1 n ∣ c i ∣ : r = ∑ i = 1 n c i D i + c 0 } \|r\|_{\mathcal{D}} = \inf\left\{\sum_{i=1}^n |c_i| : r = \sum_{i=1}^n c_i D_i + c_0\right\} ∥r∥D=inf{i=1∑n∣ci∣:r=i=1∑nciDi+c0}
这度量了用 D \mathcal{D} D 中函数表示 r r r 所需的最少"基函数数量"。
定理 2(GAIL 泛化)
在引理 2 的假设下,若真实奖励 r ∈ span ( D ) r \in \text{span}(\mathcal{D}) r∈span(D),则以概率至少 1 − δ 1-\delta 1−δ:
V π E − V π I ≤ ∥ r ∥ D 1 − γ ( Appr ( Π ) + Estm ( D , m , δ ) + ϵ ^ ) V_{\pi_E} - V_{\pi_I} \leq \frac{\|r\|_{\mathcal{D}}}{1-\gamma} \left(\text{Appr}(\Pi) + \text{Estm}(\mathcal{D},m,\delta) + \hat{\epsilon}\right) VπE−VπI≤1−γ∥r∥D(Appr(Π)+Estm(D,m,δ)+ϵ^)
关键洞察:
- 策略价值差距线性依赖于 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ)
- 存在判别器复杂度的权衡:
- 更简单的 D \mathcal{D} D → \to → 更小的估计误差,但更大的 ∥ r ∥ D \|r\|_{\mathcal{D}} ∥r∥D
- 更丰富的 D \mathcal{D} D → \to → 更小的 ∥ r ∥ D \|r\|_{\mathcal{D}} ∥r∥D,但更大的估计误差
- 这解释了实践中梯度惩罚(控制 Lipschitz 常数)和信息瓶颈等技术为何有效
四、下界分析(TPAMI 版论文)
NeurIPS 2020 版本主要给出了上界,IEEE TPAMI 2022 扩展版补充了信息论下界,证明这些上界在 minimax 意义下是紧的。
4.1 不允许环境交互的下界
考虑一类名为 “Reset Cliff” 的 MDP(见图 2):
- 状态空间 S \mathcal{S} S 包含多个状态和一个"坏状态" b b b
- 初始分布 d 0 = ( η , … , η , 1 − ( ∣ S ∣ − 2 ) η , 0 ) d_0 = (\eta, \ldots, \eta, 1-(|\mathcal{S}|-2)\eta, 0) d0=(η,…,η,1−(∣S∣−2)η,0),其中 η = 1 m + 1 \eta = \frac{1}{m+1} η=m+11
- 在任何非坏状态,执行专家动作获得 +1 奖励并按 d 0 d_0 d0 重置;执行非专家动作转移到坏状态 b b b 并永远获得 0 奖励
直觉:一旦犯错进入坏状态,之后所有奖励都是 0。这放大了误差的累积效应。
命题 1(无交互下界)
给定 m m m 个 i.i.d. 专家演示,对任意算法 Alg : D → π I \text{Alg}: D \to \pi_I Alg:D→πI,存在常数 δ ^ 0 ∈ ( 0 , 1 / 10 ] \hat{\delta}_0 \in (0, 1/10] δ^0∈(0,1/10] 和某个 MDP M \mathcal{M} M、确定性专家策略 π E \pi_E πE,使得对 ∀ δ ∈ ( 0 , δ ^ 0 ) \forall \delta \in (0, \hat{\delta}_0) ∀δ∈(0,δ^0),以概率至少 1 − δ 1-\delta 1−δ:
V π E M − V π I M ≳ min ( 1 1 − γ , ∣ S ∣ ( 1 − γ ) 2 m ) V_{\pi_E}^{\mathcal{M}} - V_{\pi_I}^{\mathcal{M}} \gtrsim \min\left(\frac{1}{1-\gamma}, \frac{|\mathcal{S}|}{(1-\gamma)^2 m}\right) VπEM−VπIM≳min(1−γ1,(1−γ)2m∣S∣)
解读:
- 当 m m m 足够大时,下界为 Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1−γ))
- 当 m m m 较小时,下界为 Ω ( ∣ S ∣ / ( ( 1 − γ ) 2 m ) ) \Omega(|\mathcal{S}|/((1-\gamma)^2 m)) Ω(∣S∣/((1−γ)2m))
- 这与 BC 的上界 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2) 匹配(忽略对数项),说明 BC 在无交互设定下是 nearly minimax 最优的
- 二次依赖不可避免!
4.2 允许环境交互的下界
考虑另一类名为 “Standard Imitation” 的 MDP(见图 3):
- 每个状态都是吸收态
- 执行专家动作获得 +1 奖励,否则获得 0
- 由于状态不转移,环境交互不能提供额外信息
命题 2(有交互下界)
在允许环境交互的设定下,对任意算法 Alg : D → π I \text{Alg}: D \to \pi_I Alg:D→πI:
V π E M − V π I M ≳ min ( 1 1 − γ , ∣ S ∣ ( 1 − γ ) m ) V_{\pi_E}^{\mathcal{M}} - V_{\pi_I}^{\mathcal{M}} \gtrsim \min\left(\frac{1}{1-\gamma}, \frac{|\mathcal{S}|}{(1-\gamma) m}\right) VπEM−VπIM≳min(1−γ1,(1−γ)m∣S∣)
解读:
- 下界仅线性依赖于 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ)
- 这与 GAIL 的上界 O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ)) 匹配
- 环境交互的重要性:交互提供了转移函数的信息,缓解了误差累积
4.3 上下界对比总结
| 设定 | 方法 | 上界 | 下界 | 是否紧 |
|---|---|---|---|---|
| 无交互 | BC | O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2) | Ω ( 1 / ( 1 − γ ) 2 ) \Omega(1/(1-\gamma)^2) Ω(1/(1−γ)2)(小 m m m) | ✓ Nearly tight |
| 有交互 | GAIL | O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ)) | Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1−γ)) | ✓ Tight |
五、环境模仿的误差界
5.1 动机:模型-based RL 中的模型偏差
模型-based 强化学习(MBRL) 的核心是学习一个环境转移模型 M θ M_\theta Mθ,然后在该模型上优化策略。评估学习模型质量的标准是策略评估误差:
∣ V π M ∗ − V π M θ ∣ |V_{\pi}^{M^*} - V_{\pi}^{M_\theta}| ∣VπM∗−VπMθ∣
现有 MBRL 方法大多用 BC 原则学习环境(即最小化单步转移预测误差):
min θ E ( s , a ) ∼ ρ π D M ∗ [ D KL ( M ∗ ( ⋅ ∣ s , a ) , M θ ( ⋅ ∣ s , a ) ) ] \min_\theta \mathbb{E}_{(s,a) \sim \rho_{\pi_D}^{M^*}}\left[D_{\text{KL}}(M^*(\cdot|s,a), M_\theta(\cdot|s,a))\right] θminE(s,a)∼ρπDM∗[DKL(M∗(⋅∣s,a),Mθ(⋅∣s,a))]
这导致 模型偏差(model bias) 的二次累积。
5.2 用 BC 模仿环境
引理 3(BC 环境模仿)
给定真实 MDP M ∗ M^* M∗、数据收集策略 π D \pi_D πD、学习模型 M θ M_\theta Mθ 满足 E ( s , a ) ∼ ρ π D M ∗ [ D KL ( M ∗ ( ⋅ ∣ s , a ) , M θ ( ⋅ ∣ s , a ) ) ] ≤ ϵ m \mathbb{E}_{(s,a) \sim \rho_{\pi_D}^{M^*}}[D_{\text{KL}}(M^*(\cdot|s,a), M_\theta(\cdot|s,a))] \leq \epsilon_m E(s,a)∼ρπDM∗[DKL(M∗(⋅∣s,a),Mθ(⋅∣s,a))]≤ϵm。对任意策略 π \pi π 满足 max s D KL ( π ( ⋅ ∣ s ) , π D ( ⋅ ∣ s ) ) ≤ ϵ π \max_s D_{\text{KL}}(\pi(\cdot|s), \pi_D(\cdot|s)) \leq \epsilon_\pi maxsDKL(π(⋅∣s),πD(⋅∣s))≤ϵπ:
∣ V π M ∗ − V π M θ ∣ ≤ 2 R max γ ( 1 − γ ) 2 ϵ m + 2 2 R max ( 1 − γ ) 2 ϵ π \left|V_{\pi}^{M^*} - V_{\pi}^{M_\theta}\right| \leq \frac{\sqrt{2} R_{\max} \gamma}{(1-\gamma)^2} \sqrt{\epsilon_m} + \frac{2\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon_\pi} VπM∗−VπMθ ≤(1−γ)22Rmaxγϵm+(1−γ)222Rmaxϵπ
解读:
- 模型偏差项(第一项)与 ( 1 − γ ) 2 (1-\gamma)^2 (1−γ)2 成反比——二次累积!
- 策略分歧项(第二项)同样二次依赖
- 策略分歧项不可避免(参见 TRPO [Schulman et al., 2015] 的定理 1)
- 我们的目标是减小模型偏差项
5.3 用 GAIL 模仿环境
将环境转移模型视为一个"对偶智能体":输入 ( s t , a t ) (s_t, a_t) (st,at),输出 s t + 1 s_{t+1} st+1 的分布。这样可以用 GAIL 来模仿:
- 状态空间:原始状态-动作对 ( s , a ) (s, a) (s,a)
- 动作空间:下一状态 s ′ s' s′
- 专家演示:从真实环境 M ∗ M^* M∗ 中收集的转移 ( s , a , s ′ ) (s, a, s') (s,a,s′)
定义状态-动作-下一状态分布:
μ M θ ( s , a , s ′ ) = ρ π D M θ ( s , a ) M θ ( s ′ ∣ s , a ) \mu^{M_\theta}(s,a,s') = \rho_{\pi_D}^{M_\theta}(s,a) M_\theta(s'|s,a) μMθ(s,a,s′)=ρπDMθ(s,a)Mθ(s′∣s,a)
μ M ∗ ( s , a , s ′ ) = ρ π D M ∗ ( s , a ) M ∗ ( s ′ ∣ s , a ) \mu^{M^*}(s,a,s') = \rho_{\pi_D}^{M^*}(s,a) M^*(s'|s,a) μM∗(s,a,s′)=ρπDM∗(s,a)M∗(s′∣s,a)
GAIL 目标是最小化 D JS ( μ M θ , μ M ∗ ) D_{\text{JS}}(\mu^{M_\theta}, \mu^{M^*}) DJS(μMθ,μM∗)。
定理 3(GAIL 环境模仿)
给定真实 MDP M ∗ M^* M∗、数据收集策略 π D \pi_D πD、学习模型 M θ M_\theta Mθ 满足 D JS ( μ M θ , μ M ∗ ) ≤ ϵ m D_{\text{JS}}(\mu^{M_\theta}, \mu^{M^*}) \leq \epsilon_m DJS(μMθ,μM∗)≤ϵm。对任意策略 π \pi π 满足 max s D KL ( π ( ⋅ ∣ s ) , π D ( ⋅ ∣ s ) ) ≤ ϵ π \max_s D_{\text{KL}}(\pi(\cdot|s), \pi_D(\cdot|s)) \leq \epsilon_\pi maxsDKL(π(⋅∣s),πD(⋅∣s))≤ϵπ:
∣ V π M ∗ − V π M θ ∣ ≤ 2 2 R max 1 − γ ϵ m + 2 2 R max ( 1 − γ ) 2 ϵ π \left|V_{\pi}^{M^*} - V_{\pi}^{M_\theta}\right| \leq \frac{2\sqrt{2} R_{\max}}{1-\gamma} \sqrt{\epsilon_m} + \frac{2\sqrt{2} R_{\max}}{(1-\gamma)^2} \sqrt{\epsilon_\pi} VπM∗−VπMθ ≤1−γ22Rmaxϵm+(1−γ)222Rmaxϵπ
解读:
- 模型偏差项(第一项)仅与 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ) 线性依赖!
- 相比 BC 的 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2),这是质的改进
- 策略分歧项(第二项)仍保持 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2),但这与模型学习无关
- 无需主动查询"专家"(即无需额外从真实环境采样)
5.4 环境模仿的核心洞察
| 方法 | 模型偏差项 | 关键区别 |
|---|---|---|
| BC | O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2) | 仅匹配单步转移 |
| GAIL | O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ)) | 匹配状态-动作-下一状态分布 |
GAIL 的优势在于:全局分布匹配捕获了序列结构,而 BC 的单步匹配忽略了长期影响。
六、实验验证
6.1 策略模仿实验
实验 1:有效规划 horizon 依赖
在"Reset Cliff"和"Standard Imitation"两个表格环境上测试:
Reset Cliff 结果(见图 4 上):
- BC(红线):策略价值差距随 1 / ( 1 − γ ) 2 1/(1-\gamma)^2 1/(1−γ)2 线性增长 → \to → 确认二次依赖
- GAIL(黄线)、DAgger(绿线)、FEM(黑线)、GTAL(蓝线):差距基本平坦 → \to → 确认线性依赖
Standard Imitation 结果(见图 4 下):
- 所有方法的差距都随 1 / ( 1 − γ ) 1/(1-\gamma) 1/(1−γ) 线性增长
- 这是因为每个状态都是吸收态,犯错不会导致状态转移 → \to → 无误差累积
MuJoCo 实验
在 HalfCheetah-v2、Hopper-v2、Walker2d-v2 上测试(见图 5):
- 仅提供 3 条专家轨迹(少量样本)
- 当 γ \gamma γ 增大(horizon 变长)时,BC 性能显著下降
- GAIL、AIRL、FEM、GTAL 在长 horizon 下表现更稳定
实验 2:判别器复杂度权衡
通过梯度惩罚系数 λ \lambda λ 控制判别器复杂度:
| λ \lambda λ | HalfCheetah | Hopper | Walker2d |
|---|---|---|---|
| 0.0 | 3350 | 1950 | 2591 |
| 0.01 | 3512 | 2179 | 2926 |
| 1.0 | 3510 | 2137 | 2899 |
| 100.0 | 2702 | 1869 | 2778 |
- 适度的 λ \lambda λ(0.01 或 1.0) 效果最好
- λ = 0 \lambda = 0 λ=0(无正则化):估计误差大
- λ = 100 \lambda = 100 λ=100(过度正则化):判别器太简单,兼容系数大
- 验证了定理 2 中的复杂度权衡
6.2 环境模仿实验
在 MuJoCo 上比较 BC 和 GAIL 学习环境模型:
结果(见图 6):
- MB-GAIL(红线)的策略评估误差显著小于 MB-BC(绿线)
- 在 Walker2d-v2 上,MB-BC 的误差是 MB-GAIL 的 2-3 倍
Episode 长度分析(见图 7):
- 初始阶段:两种方法都能较好模拟
- 训练中期:MB-BC 出现"坏吸收态"(模拟中智能体摔倒),导致 episode 长度骤降
- MB-GAIL 保持稳定,说明全局分布匹配缓解了 compounding error
七、两篇文章的关联与差异
| 维度 | NeurIPS 2020 | IEEE TPAMI 2022 |
|---|---|---|
| 发表时间 | 2020年12月 | 2022年10月 |
| 篇幅 | 9页(正文)+ 4页(参考文献) | 12页 |
| 核心内容 | 上界分析 + 基础实验 | 扩展:下界 + 更完整实验 + 更详细讨论 |
NeurIPS 2020 版本包含:
- BC 和 GAIL 的策略模仿上界(定理 1、引理 1)
- GAIL 的泛化分析(引理 2、定理 2)
- BC 和 GAIL 的环境模仿界(引理 3、定理 3)
- MuJoCo 上的策略模仿和环境模仿实验
TPAMI 2022 扩展版新增:
- 下界分析(第 4.3 节):
- 命题 1:无交互设定下的 Ω ( 1 / ( 1 − γ ) 2 ) \Omega(1/(1-\gamma)^2) Ω(1/(1−γ)2) 下界
- 命题 2:有交互设定下的 Ω ( 1 / ( 1 − γ ) ) \Omega(1/(1-\gamma)) Ω(1/(1−γ)) 下界
- "Reset Cliff"和"Standard Imitation"两个构造
- 更详细的实验:
- 表格环境(Reset Cliff、Standard Imitation)上的 horizon 依赖实验
- 更多基线方法(DAgger、FEM、GTAL、AIRL、WGAIL)
- 梯度惩罚的系统性研究
- Episode 长度分析解释环境模仿结果
- WGAIL(Wasserstein GAIL):基于 Wasserstein 距离的 GAIL 变体
- 更完整的讨论:神经网络距离、f-散度、信息瓶颈等
TPAMI 版是 NeurIPS 版的完整扩展:
- 保留所有核心定理和实验
- 补充了下界证明,使上界的紧性得到验证
- 增加了更多实验场景和基线对比
- 理论分析更加深入和完整
八、结论与启示
8.1 核心结论
- BC 的误差界: O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2),二次依赖不可避免(无交互下界匹配)
- GAIL 的误差界: O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ)),线性依赖,环境交互是关键
- 环境模仿:GAIL 可将模型偏差的策略评估误差从 O ( 1 / ( 1 − γ ) 2 ) O(1/(1-\gamma)^2) O(1/(1−γ)2) 降为 O ( 1 / ( 1 − γ ) ) O(1/(1-\gamma)) O(1/(1−γ))
- 判别器复杂度权衡:需要平衡估计误差和兼容系数
8.2 对 MBRL 的启示
传统 MBRL 方法使用 BC 学习环境模型,导致模型偏差的二次累积。本文建议:
用 GAIL-style 转移学习器替代 BC-style 学习器,可改善泛化能力,降低模型偏差。
这解释了为什么 [Shi et al., 2019](Virtual-Taobao)和 [Shang et al., 2019](环境重建)中的对抗式环境学习方法能取得好效果。
8.3 开放问题
- GAIL 的策略类逼近能力和计算性质(如随机策略梯度下降的收敛性)
- 更紧的常数因子
- 连续状态/动作空间的扩展
- 与其他 MBRL 技术(如模型集成、规划)的结合
更多推荐

所有评论(0)