温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

作者:赵俊 (南开大学)
邮箱m16531438093_1@163.com

  • Title: 静态面板数据下的双重机器学习模型(上)————理论
  • Keywords: 双重机器学习模型, 双重稳健, 面板数据, 固定效应, 相关的随机效应, 一阶差分

1. 引言

近年来计量经济学中关于机器学习(ML)的文献进展表明,数据科学中广泛用于预测问题的机器学习算法也可以用于提升对处理效应和其他类型因果效应的估计方法。值得注意的发展包括 Athey 和 Imbens (2016) 提出的因果树(Causal Trees)、Wager 和 Athey (2018) 提出的因果森林(Causal Forests),以及 Athey et al. (2019) 提出的广义随机森林(Generalised Random Forests)。然而,就本文而言,最关键的发展是 Chernozhukov et al. (2018) 提出的双重/去偏机器学习(Double/Debiased Machine Learning, DML)框架,该框架使用机器学习来估计事前未知函数形式的“无关函数”(nuisance functions),并将这些函数的预测值用于构造(正交化的)得分函数,以估计感兴趣的参数,从而获得一致且渐近正态的估计量。

DML 是一个非常通用的估计框架,但在面板数据中的应用仍较为有限。在本文中,我们开发并评估了用于估计带有固定效应面板数据中处理效应(或因果效应)的新型 DML 方法。我们提出的方法是将通常用于线性模型的相关随机效应(CRE)、组内去均值(WG)和一阶差分(FD)估计器扩展到非线性场景下的版本。具体来说,这些方法基于 Robinson (1988) 提出的部分线性回归模型(Partially Linear Regression, PLR)的扩展版本,后者被推广到面板数据中以引入时变预测变量和不可观测的个体异质性(即个体固定效应)。

我们的方法论贡献包括两个方面,第一个贡献是,我们开发的估计方法并不假定无关函数或固定效应可以由高维稀疏函数准确逼近。因此,我们在 DML 的第一阶段并不局限于使用最小绝对收缩和选择算子(LASSO)。尽管我们并不排除使用 LASSO(事实上在我们的模拟研究和实证应用中均有使用),但我们的方法仅对无关函数做出最小的假设(如 Lipschitz 连续性)。这与 Chang (2020) 的理念一致,鼓励研究人员采用结合多种机器学习算法的估计策略。

这种方法主要包括集成学习(ensemble learning),如 Breiman (1996) 提出的 stacking,van der Laan et al. (2007) 提出的 super-learner(即在不同机器学习算法上得到的最佳预测值加权平均),或在实际应用中选择表现最佳的学习器,以确保基于最准确预测结果的推断。因为在实践中,许多机器学习算法难以调参,且在不同数据和上下文中表现差异很大。

第二,在计算实现方面,我们采用了块式 k 折交叉拟合(block-k-fold cross-fitting),即将每一个样本单位的整段时间序列分配给一个折。这允许处理单位内时间序列可能存在的自相关性,这在面板数据中是普遍存在的。我们在这一点上与 Klosin 和 Vilgalys (2023) 的并行工作保持一致,避免依赖弱依赖性(weak dependence)假设来处理相关数据,而后者是 Semenova et al. (2023) 所需的。相比之下,Chang (2020) 不需要额外的假设或更改数据划分算法,因为他们在处理后每个单位只使用一个观测值,从而排除了固定效应的存在。

我们提出的针对带有个体固定效应的面板数据模型的方法是通用的,尤其适用于实证研究人员。我们在现有的 DML 框架中提供了新的估计工具以适用于面板数据,从而拓展了 DML 在必须处理时间维度的实际问题中的适用范围。

2.部分线性面板回归模型

2.1 符号约定

假设面板研究在每个 tt 时期对 NN 个个体收集了观测信息。记

{(Yit,Dit,Xit):t=1,…,T}i=1N{(Yit​,Dit​,Xit​):t=1,…,T}i=1N​

为 NN 个在所有 TT 个时期上相互独立同分布的随机向量,其中

  • Yit∈YYit​∈Y 为结果变量;
  • Dit∈DDit​∈D 为连续或二元处理变量;
  • Xit=(Xit,1,…,Xit,p)′Xit​=(Xit,1​,…,Xit,p​)′ 为 p×1p×1 的控制变量向量,通常包括常数项,以捕捉由非随机处理引起的时变混淆因素。

将这些随机变量的观测值分别记作 {(yit,dit,xit)}{(yit​,dit​,xit​)}。若 Dit∈RDit​∈R 且 dit≥0dit​≥0,则假定存在剂量—反应关系,dit=0dit​=0 表示无处理;否则用去均值变换 Dit=Dit−μDDit​=Dit​−μD​。对于二元处理 Dit∈{0,1}Dit​∈{0,1},dit=0dit​=0 表示未处理,dit=1dit​=1 表示已处理。

我们提出的非线性模型是将 Robinson (1988) 的部分线性模型推广到面板数据的情况。采用潜在结果框架,在一系列假设下使其参数具有因果解释。如 Lechner (2015) 所指出的,这允许我们将所得部分线性面板模型视为一个简化形式(reduced-form),而无需对数据生成过程做具体的参数化假定。为此,进一步定义潜在结果为

Yit(⋅)={Yit(d):d∈D},Yit​(⋅)={Yit​(d):d∈D},

其中 Yit(d)Yit​(d) 表示若第 tt 期处理水平设为 dd 时,个体 ii 的结果。所有潜在结果均在处理选择前实现,并通过一致性假设 Yit(dit)=YitYit​(dit​)=Yit​ 将观测结果与相应潜在结果对应,其余潜在结果为潜在反事实。XitXit​ 的实现也假定发生在 (Yit,Dit)(Yit​,Dit​) 之前。

最后,定义影响 (Yit,Dit)(Yit​,Dit​) 的不随时间变化的异质性项集合为 ξiξi​,以及任意随机变量 WitWit​ 在第 tt 波次可用的滞后值集合

Lt−1(Wi)={Wi1,…,Wi,t−1},L0(Wi)=∅.Lt−1​(Wi​)={Wi1​,…,Wi,t−1​},L0​(Wi​)=∅.

2.2 模型与假设

我们将 Robinson (1988) 提出的部分线性模型扩展到面板数据,引入固定效应 αi∗αi∗​,得到部分线性面板回归 (PLPR) 模型

Yit=Dit θ0+g1(Xit)+αi∗+Uit,(3.1)Yit​=Dit​θ0​+g1​(Xit​)+αi∗​+Uit​,(3.1)

其中 g1g1​ 是关于 XitXit​ 的非线性无关函数,且 E[Uit∣Dit,Xit,αi∗]=0E[Uit​∣Dit​,Xit​,αi∗​]=0,但 E[αi∗∣Dit,Xit]≠0E[αi∗​∣Dit​,Xit​]=0。目标参数 θ0θ0​ 对于连续处理 DitDit​ 而言表示平均偏效应,即 dθ0=E[Yit(d)−Yit(0)]dθ0​=E[Yit​(d)−Yit​(0)];对于二元处理,则为平均处理效应 E[Yit(1)−Yit(0)]E[Yit​(1)−Yit​(0)]。

按照 Chernozhukov et al.(2018),我们更关心部分残差化 PLPR (PO-PLPR) 模型

Yit=Vit θ0+ℓ1(Xit)+αi+Uit,(3.2)Yit​=Vit​θ0​+ℓ1​(Xit​)+αi​+Uit​,(3.2)

Vit=Dit−m1(Xit)−γi,(3.3)Vit​=Dit​−m1​(Xit​)−γi​,(3.3)

其中 ℓ1ℓ1​ 和 m1m1​ 是无关函数,αiαi​、γiγi​ 为固定效应,满足 E[Uit∣Vit,Xit,αi]=0E[Uit​∣Vit​,Xit​,αi​]=0 及 E[Vit∣Xit,γi]=0E[Vit​∣Xit​,γi​]=0。使用 PO-PLPR 的原因在于 ℓ1(Xit)=E[Yit∣Xit,ξi]ℓ1​(Xit​)=E[Yit​∣Xit​,ξi​] 易于估计,而 g1g1​ 则涉及对反事实 Yit(0)Yit​(0) 的迭代学习。此外,无论源自 PLPR 还是 PO-PLPR,DML 对 θ0θ0​ 的正交化得分都包含 VitVit​。

下面列出为使 θ0θ0​ 具有因果解释所需的随机独立性和可识别假设。记 ξiξi​ 为遗漏的不随时间变化的混杂变量,使用 “⊥ ⁣ ⁣ ⁣⊥⊥⊥” 表示条件独立。

Assumption 3.1 (无反馈):

Xit  ⊥ ⁣ ⁣ ⁣⊥  Lt−1(Yi,Di)  ∣  Lt−1(Xi),  ξi.Xit​⊥⊥Lt−1​(Yi​,Di​)​Lt−1​(Xi​),ξi​.

Assumption 3.2 (静态面板):

(Yit,Dit)  ⊥ ⁣ ⁣ ⁣⊥  Lt−1(Yi,Xi,Di)  ∣  Xit,  ξi.(Yit​,Dit​)⊥⊥Lt−1​(Yi​,Xi​,Di​)​Xit​,ξi​.

这两条保证任何滞后依赖仅源自非因果自相关,且

p(Yi1,Di1,…,YiT,DiT∣LT(Xi),ξi)=∏t=1Tp(Yit,Dit∣Xit,ξi).p(Yi1​,Di1​,…,YiT​,DiT​∣LT​(Xi​),ξi​)=t=1∏T​p(Yit​,Dit​∣Xit​,ξi​).

无需对时变预测变量的分布建模,也避免了若面板开始于系统运行之后所产生的初始条件问题。

为赋予 θ0θ0​ 因果含义,还需以下潜在结果与处理生成机制假设:

Assumption 3.3 (可忽略性):

Yit(⋅)  ⊥ ⁣ ⁣ ⁣⊥  Dit  ∣  Xit,  ξi.Yit​(⋅)⊥⊥Dit​​Xit​,ξi​.

Assumption 3.4 (同质线性效应):

E[Yit(d)−Yit(0)∣Xit,ξi]=d θ0.E[Yit​(d)−Yit​(0)∣Xit​,ξi​]=dθ0​.

假设3.3表明在给定 XitXit​ 和 ξiξi​ 下,处理分配是可忽略的;假设3.4要求处置变量对结果的效应在个体间不依赖于 XitXit​ 或 ξiξi​。在弱可忽略性(仅 Yit(0)⊥ ⁣ ⁣ ⁣⊥Dit∣Xit,ξiYit​(0)⊥⊥Dit​∣Xit​,ξi​)下,θ0θ0​ 同样可定义为 E[Yit(d)−Yit(0)∣Dit=d]E[Yit​(d)−Yit​(0)∣Dit​=d],但本文假定强可忽略性成立。

最后,需要混杂效应可加分离:

Assumption 3.5 (可加分离)
(a) E[Yit(0)∣Xit,ξi]=g1(Xit)+αi∗E[Yit​(0)∣Xit​,ξi​]=g1​(Xit​)+αi∗​;
(b) E[Dit∣Xit,ξi]=m1(Xit)+γiE[Dit​∣Xit​,ξi​]=m1​(Xit​)+γi​.

由假设 3.3、3.4可得

E[Yit∣Dit,Xit,ξi]=E[Yit(0)∣Xit,ξi]+Dit θ0,E[Yit​∣Dit​,Xit​,ξi​]=E[Yit​(0)∣Xit​,ξi​]+Dit​θ0​,

再结合假设3.5(a)-(b)可导出 PO-PLPR 模型 (3.2)-(3.3),其中

ℓ1(Xit)=g1(Xit)+m1(Xit) θ0,αi=αi∗+γi θ0.ℓ1​(Xit​)=g1​(Xit​)+m1​(Xit​)θ0​,αi​=αi∗​+γi​θ0​.

温馨提示:若页面不能正常显示数学公式和代码,请阅读原文获得更好的阅读体验。

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐