18、隐藏变量与时间序列中的因果推理
隐藏变量与时间序列中的因果推理
1. 隐藏变量问题探讨
1.1 不同环境下的因果结构重建
在不同环境中,我们可以通过一些方法来处理隐藏变量,从而重建因果结构。假设在不同环境 (e \in E) 下观察到 (d) 个随机变量组成的向量 (X_e),环境由独立的转移变量 (C_e = (C_{e1}, \cdots, C_{ed})) 生成,且与噪声变量相互独立。对于每个环境 (e),有 (X_e = BX_e + C_e + N_e),其中 (N_e) 的分布不依赖于 (e)。
通过一系列推导,可以得到 ((I - B)(\Sigma_{X,e} - \Sigma_{X,f})(I - B)^T = \Sigma_{C,e} - \Sigma_{C,f})。由于等式右边是对角矩阵,在至少有三个环境的情况下,通过对 (\Sigma_{X,e} - \Sigma_{X,f}) 进行联合对角化,在较弱的假设下可以识别出因果结构 (B)。这表明,在不同环境中施加线性模型和独立转移干预等规则条件,即使存在隐藏变量,也能重建潜在的因果结构。
1.2 相关问题
- 问题 9.10(充分性) :证明某个相关备注。
- 问题 9.11(辛普森悖论) :构建一个结构因果模型(SCM)(C),包含二元随机变量 (X)、(Y) 和一系列变量 (Z_1, Z_2, \cdots),使得在特定条件下出现辛普森悖论的极端情况。即对于所有偶数 (d \geq 0) 和所有 (z_1, \cdots, z_{d + 1}),有 (P_C(Y = 1|X = 1, Z_1 = z_1, \cdots, Z_d = z_d) > P_C(Y = 1|X = 0, Z_1 = z_1, \cdots, Z_d = z_d)),但 (P_C(Y = 1|X = 1, Z_1 = z_1, \cdots, Z_d = z_d, Z_{d + 1} = z_{d + 1}) < P_C(Y = 1|X = 0, Z_1 = z_1, \cdots, Z_d = z_d, Z_{d + 1} = z_{d + 1}))。
- 问题 9.12(工具变量) :考虑一个 SCM,已知相关变量的关系和联合分布,通过非参数回归得到条件均值作为回归函数,写出两阶段最小二乘法并证明其能识别参数 (\alpha)。
2. 时间序列中的因果推理
2.1 时间序列的基本概念
在时间序列中,我们处理的是 (d) 维时间序列 ((X_t)
{t \in Z}),每个 (X_t) 是一个向量 ((X
{1t}, \cdots, X_{dt})),且假设其描述的是严格平稳的随机过程。因果影响不能从未来指向过去,因此在多元时间序列中有两种因果关系:
-
无瞬时效应
:因果图中只有从 (X_{jt}) 到 (X_{ks})((t < s))的箭头,不存在 (t = s) 时的箭头。
-
有瞬时效应
:因果图中除了有从 (X_{mt}) 到 (X_{\ell s})((t < s))的箭头外,还有从 (X_{jt}) 到 (X_{kt}) 的箭头。
我们定义了全时间图和摘要图,全时间图是以 (X_{it}) 为节点的有向无环图(DAG),摘要图是包含节点 (X_1, \cdots, X_d) 的有向图,当存在从 (X_{jt}) 到 (X_{ks})((t \leq s))的箭头时,摘要图中从 (X_j) 到 (X_k) 有箭头。
2.2 结构因果模型与干预
假设随机过程 ((X_t)
{t \in Z}) 可以用一个 SCM 描述,其中每个变量 (X
{jt}) 最多依赖于过去 (q) 个值:
[X_{jt} := f_j((PA_{jq})
{t - q}, \cdots, (PA
{j1})
{t - 1}, (PA
{j0})
t, N
{jt})]
其中噪声项 (N_{it}) 相互独立。一个常见的特殊情况是向量自回归模型(VAR):
[X_{jt} := \sum_{i = 1}^{q} A_{ji}X_{t - i} + N_{jt}]
其中 (A_{ji}) 是 (1 \times d) 矩阵。
干预在 SCM 中对应于替换某些结构赋值,可以是对某个变量在所有时间点的值进行设定,也可以只在特定时间点进行干预。
2.3 子采样
在许多应用中,采样过程可能比因果过程的时间尺度慢。子采样时,需要考虑允许的干预类型:
-
仅对观测时间点进行干预
:在这种情况下,可能不存在从 (X_1) 到 (X_2) 的因果影响,且子采样不会产生原本不存在的虚假瞬时效应。可以通过将隐藏时间步的因果机制代入其他机制,对模型进行边缘化,得到的模型能正确描述干预效果。
-
考虑对隐藏变量进行干预
:此时可能需要恢复原始的摘要图,相关问题已有一些研究。
然而,子采样并不总是适合所有数据生成过程,对于一些物理测量,将观测值建模为连续时间点的平均值可能更合适,但这会使模型假设变得复杂,且在建模干预时需要更加谨慎。
2.4 学习因果时间序列模型
2.4.1 马尔可夫条件与忠实性
- 无瞬时效应情况 :如果两个全时间图由无瞬时效应的 SCM 诱导,且它们是马尔可夫等价的,那么它们是相等的。在马尔可夫条件和忠实性成立的情况下,可以从条件独立性唯一地识别全时间图。
- 有瞬时效应情况 :马尔可夫等价的图最多在瞬时效应的方向上有所不同,但在很多情况下,不同方向的瞬时效应会导致不同的 v - 结构,从而可以识别瞬时效应的方向。例如,当摘要图是无环的,且每个变量 (X_{jt}) 受到其过去某个值的影响时,如果两个全时间图是马尔可夫等价的,那么它们是相等的。
此外,摘要图中是否存在箭头可以通过单个条件独立性测试来判断。
2.4.2 无需忠实性的因果结论
在时间序列中,由于不存在反向时间的箭头,仅使用马尔可夫条件就可以推断摘要图是 (X \to Y) 还是 (Y \to X)。对于二元时间序列 ((X_t, Y_t)
{t \in Z}):
- 如果存在 (t \in Z) 使得 (Y_t \not\perp!!!\perp X
{past}(t) | Y_{past}(t)),则摘要图中包含从 (X) 到 (Y) 的箭头。
- 假设无瞬时效应且任何有限子集变量的联合密度严格为正,如果对于所有 (t \in Z),有 (Y_t \perp!!!\perp X_{past}(t) | Y_{past}(t)),则摘要图中不包含从 (X) 到 (Y) 的箭头。
2.4.3 格兰杰因果关系
- 二元格兰杰因果关系 :如果 (Y_t \not\perp!!!\perp X_{past}(t) | Y_{past}(t)),则称 (X) 格兰杰导致 (Y)。通常,格兰杰因果关系在线性预测中,通过比较两个线性回归模型的噪声项方差来判断。也可以使用非线性回归进行扩展,还可以通过转移熵来衡量 (Y_t) 与 (X_{past}(t)) 在给定 (Y_{past}(t)) 下的依赖关系。
- 多元格兰杰因果关系 :如果 (X_{kt} \not\perp!!!\perp X_{jpast}(t) | X_{-jpast}(t)),则称 (X_j) 格兰杰导致 (X_k)。但格兰杰因果关系在使用时需要注意因果充分性的问题,否则可能会得出误导性的结论。
-
格兰杰因果关系的局限性
:
- 因果不充分性 :当存在隐藏的共同原因时,格兰杰因果关系可能会错误地推断因果影响。例如,两个变量都受到一个隐藏时间序列的影响,可能会导致错误的因果推断。
- 确定性关系 :确定性关系会导致额外的独立性,使得格兰杰因果关系在某些情况下无法正确检测因果影响。
- 瞬时效应 :在存在瞬时效应的情况下,格兰杰因果关系可能在定量上产生误导,虽然定性结论在不违反忠实性的情况下可能仍然正确,但对其进行修改以考虑瞬时效应时,可能会导致可识别性问题。
2.4.4 受限函数类模型
为了解决格兰杰因果关系的局限性,一些研究提出了使用受限函数类的模型。例如,将加性噪声模型(ANMs)应用于时间序列,使用 (X_{jt} := f_j((PA_{jq}) {t - q}, \cdots, (PA {j1}) {t - 1}, (PA {j0}) t) + N {jt}) 的形式。这样的模型不仅可以在马尔可夫等价类中识别因果结构,还有经验证据表明,允许使用受限函数类模型的时间序列不太可能受到混淆。
2.4.5 谱独立性准则
谱独立性准则(SIC)基于原因和机制之间的独立性思想。对于一个弱平稳的二元时间序列 ((X_t, Y_t) {t \in Z}),假设 (X) 通过线性时不变滤波器影响 (Y),有 (Y_t = \sum {k = 1}^{\infty} h(k)X_{t - k})。在频域中,通过功率谱密度和滤波器的傅里叶变换,可以得到 (S_{YY}(\nu) = |\tilde{h}(\nu)|^2 \cdot S_{XX}(\nu))。
定义 SIC 为时间序列 (X) 和滤波器 (h) 满足 (S_{XX}) 和 (\tilde{h}) 不相关,即 (\langle S_{XX} \cdot |\tilde{h}|^2 \rangle = \langle S_{XX} \rangle \cdot \langle |\tilde{h}|^2 \rangle)。通过这个准则可以判断因果方向。
3. 总结
本文主要探讨了隐藏变量和时间序列中的因果推理问题。在隐藏变量方面,介绍了不同环境下重建因果结构的方法,并提出了相关问题。在时间序列中,详细阐述了基本概念、结构因果模型、干预、子采样以及多种学习因果时间序列模型的方法,包括格兰杰因果关系、受限函数类模型和谱独立性准则等,并分析了这些方法的优缺点和适用场景。
以下是一些关键信息的表格总结:
| 类别 | 内容 |
| — | — |
| 隐藏变量 | 不同环境下通过联合对角化重建因果结构,存在相关问题如辛普森悖论和工具变量问题 |
| 时间序列基本概念 | 全时间图、摘要图,无瞬时效应和有瞬时效应的因果关系 |
| 结构因果模型 | 一般形式和 VAR 模型,干预对应结构赋值替换 |
| 子采样 | 考虑不同干预类型,子采样不一定适用于所有数据生成过程 |
| 学习方法 | 马尔可夫条件与忠实性、无需忠实性的因果结论、格兰杰因果关系、受限函数类模型、谱独立性准则 |
下面是一个简单的 mermaid 流程图,展示时间序列因果推理的主要步骤:
graph LR
A[时间序列数据] --> B{是否有瞬时效应}
B -- 无 --> C[基于马尔可夫条件和忠实性识别全时间图]
B -- 有 --> D[考虑瞬时效应方向识别]
C --> E{是否满足因果充分性}
D --> E
E -- 是 --> F[使用格兰杰因果关系等方法]
E -- 否 --> G[考虑其他方法如受限函数类模型]
F --> H[得出因果结论]
G --> H
通过这些方法和准则,我们可以在不同情况下更好地进行因果推理,理解变量之间的因果关系。但在实际应用中,需要根据具体情况选择合适的方法,并注意各种方法的局限性。
4. 深入理解格兰杰因果关系
4.1 格兰杰因果关系的本质
格兰杰因果关系的核心思想是,若一个变量的过去值有助于预测另一个变量,那么就认为存在因果影响。以二元格兰杰因果关系为例,当 (Y_t \not\perp!!!\perp X_{past}(t) | Y_{past}(t)) 时,意味着 (X) 的过去值对预测 (Y_t) 有额外的帮助,从而推断 (X) 格兰杰导致 (Y)。
在实际应用中,线性预测是常见的方式。通过比较两个线性回归模型:
- 模型一:(Y_t = \sum_{i = 1}^{q} a_iY_{t - i} + N_t)
- 模型二:(Y_t = \sum_{i = 1}^{q} a_iY_{t - i} + \sum_{i = 1}^{q} b_iX_{t - i} + \tilde{N}_t)
当包含 (X) 的预测模型(模型二)的噪声项 (\tilde{N} t) 的方差明显小于不包含 (X) 的模型(模型一)的噪声项 (N_t) 的方差时,就表明 (X) 对 (Y) 存在格兰杰因果关系。这实际上等价于 (Y_t) 与 (X {past}(t)) 在给定 (Y_{past}(t)) 下存在非零的偏相关性。
4.2 格兰杰因果关系的应用场景
格兰杰因果关系在经济、金融、生物医学等多个领域都有广泛应用。例如,在经济学中,可以研究宏观经济指标之间的因果关系,如 GDP 增长与通货膨胀率之间的关系;在金融领域,可以分析股票价格、利率等变量之间的因果联系;在生物医学中,可以探究基因表达水平之间的因果影响。
4.3 格兰杰因果关系的局限性再探讨
4.3.1 因果不充分性的影响
因果不充分性是格兰杰因果关系面临的一个重要问题。当存在未观测到的隐藏变量时,可能会导致错误的因果推断。例如,在研究两个经济变量(如商品价格)时,如果忽略了共同的影响因素(如原材料价格),就可能错误地认为这两个商品价格之间存在因果关系。这种情况下,格兰杰因果关系可能会得出误导性的结论,影响决策的准确性。
4.3.2 确定性关系的挑战
确定性关系会给格兰杰因果关系带来挑战。当变量之间存在确定性的函数关系时,会产生额外的独立性,使得基于条件独立性的因果推断失效。例如,在一个简单的因果链 (X \to Y \to Z) 中,如果 (Y) 是 (X) 的确定性函数,那么会出现 (Y \perp!!!\perp Z | X) 的情况,这与正常的因果结构不符,导致格兰杰因果关系无法正确检测因果影响。
4.3.3 瞬时效应的复杂性
瞬时效应使得格兰杰因果关系的应用更加复杂。在存在瞬时效应的情况下,格兰杰因果关系可能在定量上产生误导,虽然定性结论在不违反忠实性的情况下可能仍然正确,但对其进行修改以考虑瞬时效应时,可能会导致可识别性问题。例如,在某些金融市场中,变量之间可能存在瞬时的相互影响,此时直接应用格兰杰因果关系可能无法准确反映真实的因果关系。
4.4 应对格兰杰因果关系局限性的策略
为了应对格兰杰因果关系的局限性,可以采取以下策略:
-
增加观测变量
:尽量收集更多相关变量的信息,提高因果充分性,减少隐藏变量的影响。
-
使用其他方法辅助
:结合其他因果推断方法,如受限函数类模型、谱独立性准则等,进行综合分析。
-
谨慎处理确定性关系
:在遇到确定性关系时,要对数据进行适当处理或采用更合适的模型,避免额外独立性对因果推断的影响。
5. 受限函数类模型的优势与应用
5.1 受限函数类模型的原理
受限函数类模型通过对函数形式进行限制,来提高因果结构的可识别性。例如,将加性噪声模型(ANMs)应用于时间序列,使用 (X_{jt} := f_j((PA_{jq}) {t - q}, \cdots, (PA {j1}) {t - 1}, (PA {j0}) t) + N {jt}) 的形式。这种模型假设每个变量可以表示为其父节点的函数加上独立的噪声项,通过对函数 (f_j) 的形式进行限制,可以在马尔可夫等价类中识别因果结构。
5.2 受限函数类模型的优势
- 提高可识别性 :相比于一般的模型,受限函数类模型可以在更多情况下唯一地确定因果结构,减少了因果推断的不确定性。
- 减少混淆可能性 :有经验证据表明,允许使用受限函数类模型的时间序列不太可能受到混淆,从而提高了因果推断的准确性。
5.3 受限函数类模型的应用案例
在生物医学领域,受限函数类模型可以用于分析基因表达数据中的因果关系。通过对基因表达水平的时间序列数据进行建模,使用受限函数类模型可以更准确地识别基因之间的调控关系,为疾病的诊断和治疗提供有价值的信息。
6. 谱独立性准则的原理与应用
6.1 谱独立性准则的原理
谱独立性准则(SIC)基于原因和机制之间的独立性思想。对于一个弱平稳的二元时间序列 ((X_t, Y_t) {t \in Z}),假设 (X) 通过线性时不变滤波器影响 (Y),有 (Y_t = \sum {k = 1}^{\infty} h(k)X_{t - k})。在频域中,通过功率谱密度和滤波器的傅里叶变换,可以得到 (S_{YY}(\nu) = |\tilde{h}(\nu)|^2 \cdot S_{XX}(\nu))。
定义 SIC 为时间序列 (X) 和滤波器 (h) 满足 (S_{XX}) 和 (\tilde{h}) 不相关,即 (\langle S_{XX} \cdot |\tilde{h}|^2 \rangle = \langle S_{XX} \rangle \cdot \langle |\tilde{h}|^2 \rangle)。通过这个准则可以判断因果方向,当满足 SIC 时,可以认为 (X) 是 (Y) 的原因。
6.2 谱独立性准则的应用场景
谱独立性准则在信号处理、通信等领域有广泛应用。例如,在通信系统中,可以用于分析信号之间的因果关系,确定信号的传输方向和影响机制。在生物电信号处理中,也可以使用谱独立性准则来研究神经元之间的因果关系,为神经科学研究提供支持。
6.3 谱独立性准则的优势与局限性
- 优势 :谱独立性准则基于频域分析,能够捕捉到信号在不同频率上的特征,对于一些具有复杂频率特性的时间序列数据,具有较好的因果推断能力。
- 局限性 :谱独立性准则假设 (X) 通过线性时不变滤波器影响 (Y),对于非线性或时变的系统,其应用可能受到限制。
7. 总结与展望
7.1 方法总结
本文介绍了隐藏变量和时间序列中的因果推理方法,包括不同环境下的因果结构重建、时间序列的基本概念、结构因果模型、干预、子采样以及多种学习因果时间序列模型的方法,如格兰杰因果关系、受限函数类模型和谱独立性准则等。以下是这些方法的对比表格:
| 方法 | 优点 | 缺点 | 适用场景 |
| — | — | — | — |
| 格兰杰因果关系 | 直观易懂,在因果充分性满足时效果较好 | 受因果不充分性、确定性关系和瞬时效应影响 | 因果充分的时间序列数据 |
| 受限函数类模型 | 提高可识别性,减少混淆可能性 | 对函数形式有一定限制 | 因果结构复杂,需要提高可识别性的情况 |
| 谱独立性准则 | 基于频域分析,能捕捉频率特征 | 假设为线性时不变系统,适用范围有限 | 具有复杂频率特性的时间序列数据 |
7.2 未来展望
未来,因果推理在时间序列领域的研究可以朝着以下方向发展:
-
多方法融合
:将不同的因果推断方法进行融合,发挥各自的优势,提高因果推断的准确性和可靠性。
-
处理复杂系统
:研究如何处理非线性、时变等复杂系统中的因果关系,拓展因果推理的应用范围。
-
结合深度学习
:将深度学习技术与因果推理相结合,利用深度学习的强大特征提取能力,提高因果推断的性能。
下面是一个 mermaid 流程图,展示未来因果推理研究的发展方向:
graph LR
A[现有因果推理方法] --> B{多方法融合}
A --> C{处理复杂系统}
A --> D{结合深度学习}
B --> E[提高准确性和可靠性]
C --> E
D --> E
E --> F[拓展应用范围]
通过不断探索和创新,我们有望在时间序列中的因果推理领域取得更深入的研究成果,为各个领域的决策提供更有力的支持。
更多推荐
所有评论(0)