从协方差看卡尔曼滤波与联合高斯的条件分布
摘要
本文从协方差的角度出发,系统梳理了期望、方差、协方差等统计量在预测与估计中的核心作用。通过联合高斯的条件分布与卡尔曼滤波的对比分析,揭示了协方差不仅描述数据的离散程度,更刻画系统对自身状态与外部观测的信任度。文中指出,高斯预测通过协方差比值体现已知量对未知量的影响,而卡尔曼滤波则通过卡尔曼增益实现预测与观测的最优加权融合。两者在本质上可统一为同一协方差逻辑在静态与动态场景下的两种表现形式,说明协方差是连接不确定性、信息更新与信任权重的数学桥梁。
一、前置概念
1.1 期望
“期望”(Expectation)是随机变量平均取值的数学描述,反映了随机现象在概率意义下的中心趋势。
基本定义
设随机变量 XXX 的概率分布为 P(X=xi)=piP(X=x_i)=p_iP(X=xi)=pi,则其数学期望(mathematical expectation)定义为:
- 离散型随机变量:
E[X]=∑ixipi E[X] = \sum_i x_i p_i E[X]=i∑xipi - 连续型随机变量:
E[X]=∫−∞+∞xf(x) dx E[X] = \int_{-\infty}^{+\infty} x f(x)\,dx E[X]=∫−∞+∞xf(x)dx
其中 f(x)f(x)f(x) 是概率密度函数。
直观理解
期望表示若将随机实验重复无数次,结果的平均值将趋近于期望值。
例如:
- 掷一个均匀六面骰子,结果可能是 1–6,期望为
E[X]=(1+2+3+4+5+6)/6=3.5, E[X] = (1+2+3+4+5+6)/6 = 3.5, E[X]=(1+2+3+4+5+6)/6=3.5,
表示长期平均点数为 3.5。
统计意义为
在概率论中,期望可理解为:
- 概率分布的“重心”;
- 各结果的加权平均,其中权重为概率;
- 随机变量的一阶矩(moment)
1.2 协方差
“协方差”(Covariance)描述的是两个随机变量共同变化的程度与方向,即它们之间的线性相关关系强弱与方向。
基本定义
设随机变量 XXX 与 YYY 的期望分别为 E[X]E[X]E[X] 和 E[Y]E[Y]E[Y],则它们的协方差定义为:
Cov(X,Y)=E[(X−E[X])(Y−E[Y])]
\mathrm{Cov}(X, Y) = E[(X - E[X])(Y - E[Y])]
Cov(X,Y)=E[(X−E[X])(Y−E[Y])]
这表示:
- 当 XXX 与 YYY 同时偏离各自均值的方向相同(同增同减)时,协方差为正;
- 当偏离方向相反(一个增一个减)时,协方差为负;
- 当无明显线性关系时,协方差接近零。
离散与连续形式
离散型随机变量:
Cov(X,Y)=∑i∑j(xi−E[X])(yj−E[Y])P(X=xi,Y=yj)
\mathrm{Cov}(X,Y) = \sum_i \sum_j (x_i - E[X])(y_j - E[Y]) P(X=x_i, Y=y_j)
Cov(X,Y)=i∑j∑(xi−E[X])(yj−E[Y])P(X=xi,Y=yj)
连续型随机变量:
Cov(X,Y)=∫−∞+∞ ∫−∞+∞(x−E[X])(y−E[Y])fX,Y(x,y) dx dy
\mathrm{Cov}(X,Y) = \int_{-\infty}^{+\infty}\!\!\int_{-\infty}^{+\infty} (x - E[X])(y - E[Y]) f_{X,Y}(x,y)\,dx\,dy
Cov(X,Y)=∫−∞+∞∫−∞+∞(x−E[X])(y−E[Y])fX,Y(x,y)dxdy
几何与统计意义
-
协方差刻画了两个变量的线性同步性。
-
若 >0:X、Y 趋向同时增大或减小(正相关);
-
若 <0:X 增大时 Y 倾向减小(负相关);
-
若 ≈0:二者变化无关或不存在线性关系。
-
-
它可以看作是 X、Y 在中心化后向量的“内积”的期望。因此协方差在本质上是一种方向相似度度量。此处着重记忆。
方差
两个变量间的为协方差,自身与自身的为方差,方差衡量的是:
随机变量的取值相对于其期望的平均偏离程度。
公式为:
Var(X)=E[(X−E[X])2]
\mathrm{Var}(X) = E[(X - E[X])^2]
Var(X)=E[(X−E[X])2]
也就是说:
- 如果所有样本都非常接近平均值 → 方差小;
- 如果样本分布很分散 → 方差大。
所以它最直接的意义是:
离散程度 / 波动性 / 稳定性。
1.3 基于协方差的预测
所谓“基于协方差的预测”,本质上是利用协方差衡量不确定性传播与变量间相关性,在预测阶段通过它来更新对随机量的估计。这类思想在卡尔曼滤波、高斯预测、最小二乘估计中非常核心。
此处先优先给出卡尔曼滤波与高斯预测的结论:
对于卡尔曼滤波而言,本质是通过卡尔曼增益来确定预测值与观测值的相对可信度,来进行融合,而卡尔曼增益为 (预测值的协方差)/(预测协方差+观测协方差),从理解看为 通过数值稳定性来确定 融合的权重;
而对于高斯预测(此处指联合高斯的条件分布)而言更为直观,从均值预测公式可看出 其是通过 已知与未知的协方差/已知的协方差 来衡量新分布的变化趋势,从理解看为 通过结构相似度来确定 已知量对预测值的影响程度。
后续将从公式方面给出证明,因为主要是从协方差角度看待预测,故会着重从协方差相关公式进行理解,相关推导证明不在此处给出。
二、卡尔曼预测
2.1 核心公式
卡尔曼预测包括 预测与融合两个阶段,前者主要为通过状态转移矩阵得出模型推导的预测值,后者为通过卡尔曼增益来进行 模型推导预测值与实际观测值 的融合,公式说明如下:
系统模型
理想情况下(假定全部真实无误差),整体预测过程如下:
xk=Fk−1xk−1+wk−1,wk−1∼N(0,Qk−1)zk=Hkxk+vk,vk∼N(0,Rk)
\begin{aligned}
x_k &= F_{k-1}x_{k-1} + w_{k-1}, \quad &w_{k-1}\sim \mathcal N(0, Q_{k-1}) \\
z_k &= H_k x_k + v_k, \quad &v_k\sim \mathcal N(0, R_k)
\end{aligned}
xkzk=Fk−1xk−1+wk−1,=Hkxk+vk,wk−1∼N(0,Qk−1)vk∼N(0,Rk)
其中:
- xkx_kxk:系统状态向量
- zkz_kzk:观测向量
- Fk−1F_{k-1}Fk−1:状态转移矩阵
- HkH_kHk:观测矩阵
- Qk−1Q_{k-1}Qk−1、RkR_kRk:过程噪声与观测噪声的协方差矩阵
公式一为模型预测值的推导,主要为 将上一时刻状态作为输入,通过状态转移矩阵(“系统动力学模型”在离散时间下的线性表达)推导得出下一时刻的状态。有些推导还包括外部输入向量,此处不做过多关注;
公式二为观测值的推导,此处需要观测矩阵是因为系统状态包括许多向量,而观测值,也就是传感器可测量值,只是状态向量的一部分,因此需要通过 设定单位向量 来决定谁应该被看见。
但在实际过程中,并不知道真实的 xkx_kxk,因此只能预测一个估计值 x^k∣k−1\hat{x}_{k|k-1}x^k∣k−1,并通过观测进行融合,详细如下。
预测阶段
此处区分与真实xkx_kxk:
状态预测:x^k∣k−1=Fk−1x^k−1∣k−1协方差预测:Pk∣k−1=Fk−1Pk−1∣k−1Fk−1⊤+Qk−1
\begin{aligned}
\text{状态预测:} &\quad \hat{x}_{k|k-1} = F_{k-1}\hat{x}_{k-1|k-1} \\
\text{协方差预测:} &\quad P_{k|k-1} = F_{k-1}P_{k-1|k-1}F_{k-1}^\top + Q_{k-1}
\end{aligned}
状态预测:协方差预测:x^k∣k−1=Fk−1x^k−1∣k−1Pk∣k−1=Fk−1Pk−1∣k−1Fk−1⊤+Qk−1
含义:
根据系统模型,将上一时刻的后验估计推进到当前时刻,得到先验估计(尚未融合观测)。
融合阶段
以 zkz_kzk 作为实际观测值,有如下推导:
(1) 卡尔曼增益
Kk=Pk∣k−1Hk⊤ (HkPk∣k−1Hk⊤+Rk)−1
K_k = P_{k|k-1} H_k^{\top}\,(H_k P_{k|k-1} H_k^{\top} + R_k)^{-1}
Kk=Pk∣k−1Hk⊤(HkPk∣k−1Hk⊤+Rk)−1
此处观测矩阵起到 将状态向量的许多协方差映射到 观测量协方差,也就是前面提到的单位向量,因此整体就变为 预测协方差/(预测协方差 + 观测协方差)。
(2) 状态更新
x^k∣k=x^k∣k−1+Kk(zk−Hkx^k∣k−1)
\hat{x}_{k|k} = \hat{x}_{k|k-1} + K_k (z_k - H_k \hat{x}_{k|k-1})
x^k∣k=x^k∣k−1+Kk(zk−Hkx^k∣k−1)
接着就要使用卡尔曼增益来决定 观测与预测的差值,对观测的影响,直观理解为:预测协方差越大,越不稳定,差值对预测的修正力度就越大;反之则差值对预测修正力度就越小。也就达到了谁稳定就相信谁,而相信的程度是通过 协方差大小的比值 来确定。
三、高斯预测
高斯预测的推导流程不在此处做过多说明,简略给出预测过程如下。
存在联合高斯随机向量:
[xaxb]∼N ([μaμb],[ΣaaΣabΣbaΣbb])
\begin{bmatrix}x_a \\ x_b\end{bmatrix}
\sim
\mathcal N\!\left(
\begin{bmatrix}\mu_a \\ \mu_b\end{bmatrix},
\begin{bmatrix}
\Sigma_{aa} & \Sigma_{ab}\\
\Sigma_{ba} & \Sigma_{bb}
\end{bmatrix}
\right)
[xaxb]∼N([μaμb],[ΣaaΣbaΣabΣbb])
其中:
| 符号 | 含义 |
|---|---|
| xax_axa | 已知变量(观测值、条件变量) |
| xbx_bxb | 未知变量(需要推断的随机变量) |
| μa,μb\mu_a, \mu_bμa,μb | 各自的均值向量 |
| Σaa,Σbb\Sigma_{aa}, \Sigma_{bb}Σaa,Σbb | 各自的协方差矩阵 |
| Σab=Σba⊤\Sigma_{ab} = \Sigma_{ba}^\topΣab=Σba⊤ | 两者之间的协方差 |
要做的事情是:
当我们“知道” xax_axa 的具体取值后,
求“未知” xbx_bxb 在这种已知条件下的分布。
因为前提假设为两者服从同一分布,因此本质为看旧分布对新分布的影响,而条件高斯的结论(核心公式)
xb ∣ xa ∼ N (μb+ΣbaΣaa−1(xa−μa)⏟条件均值,Σbb−ΣbaΣaa−1Σab⏟条件协方差)
x_b \,|\, x_a \;\sim\;
\mathcal N\!\Big(
\underbrace{\mu_b + \Sigma_{ba}\Sigma_{aa}^{-1}(x_a - \mu_a)}_{\text{条件均值}},
\underbrace{\Sigma_{bb} - \Sigma_{ba}\Sigma_{aa}^{-1}\Sigma_{ab}}_{\text{条件协方差}}
\Big)
xb∣xa∼N(条件均值μb+ΣbaΣaa−1(xa−μa),条件协方差Σbb−ΣbaΣaa−1Σab)
仅从均值来看推导,意义为:通过 旧分布与新分布的协方差/旧分布的协方差 来衡量旧分布对新分布的影响程度,直观理解为 通过数据分布的相似程度(协方差/方差)来决定纠正程度,越相似,值越大,纠正程度就越大,反正则越小。

如图所示,蓝色椭圆表示二维联合高斯分布的 95% 等高线,
其倾斜方向体现了 xax_axa 与 xbx_bxb 之间的相关性。
当我们固定 xa=a0x_a=a_0xa=a0(黑色虚线)时,相当于从这片“概率云团”中沿竖线切出一个横截面,
红色标记表示此时 xbx_bxb 的条件分布中心(条件均值)及其 ±1σ 范围。
可以看到,红色竖线的长度明显短于椭圆的竖向宽度,
意味着在已知 xax_axa 的情况下,xbx_bxb 的不确定性显著减小。
这一变化在下图中体现为红色曲线(条件分布)比蓝色曲线(边缘分布)更窄更高,
其方差由 1.3421.34^21.342 缩减至 1.1321.13^21.132,说明通过已知变量 xax_axa 的信息,
系统对 xbx_bxb 的估计更集中、更自信。
这正是条件高斯分布的核心思想:
协方差刻画变量间的关联性,而条件分布体现了“已知信息减少不确定性”的过程。
在这一意义下,协方差不仅描述相关性,更是信息传递与信任更新的数学桥梁。
四、统一协方差视角
无论是高斯预测中的条件分布,还是卡尔曼滤波中的预测—更新过程,其核心机制都可以从“协方差”这一视角实现统一理解。
协方差不仅仅是统计意义上的离散度,它在预测与融合中更代表系统对自身状态的信任程度。
- 当协方差较小,表示系统的内部模型稳定、估计精度高,此时更新时应更相信自身预测;
- 当协方差较大,说明系统模型不确定性强、外界扰动大,此时应更多依赖外部观测进行修正。
这种“信任度”的调节正是通过协方差的比值体现的:
-
在卡尔曼滤波中,卡尔曼增益可写为
K=预测协方差预测协方差+观测协方差, K = \frac{\text{预测协方差}}{\text{预测协方差} + \text{观测协方差}}, K=预测协方差+观测协方差预测协方差,
它决定了预测与观测在融合中的相对权重; -
在条件高斯分布中,
E[xb∣xa]=μb+ΣbaΣaa−1(xa−μa), E[x_b|x_a] = \mu_b + \Sigma_{ba}\Sigma_{aa}^{-1}(x_a - \mu_a), E[xb∣xa]=μb+ΣbaΣaa−1(xa−μa),
这一项同样通过协方差比 ΣbaΣaa−1\Sigma_{ba}\Sigma_{aa}^{-1}ΣbaΣaa−1 表示已知变量对未知变量的影响程度。
从更高层次看,协方差描述了系统对信息的信任结构:
它既体现预测误差的传播规律(在时间轴上),又体现不同数据间的相关性(在变量空间中)。
无论是动态滤波还是静态推断,系统最终的“融合”本质上都是在协方差的度量空间中寻找最优加权点——
即,在多源不确定性之间,依据方差比例实现最优的信息整合。
因此,“协方差”不仅是一种统计量,更是贯穿整个估计理论的信任度语言。
从这个角度看,卡尔曼滤波与条件高斯并非两种不同的算法,而是同一协方差逻辑在动态与静态场景下的两种表现形式。
更多推荐
所有评论(0)