在机器学习领域,高斯过程 (GP) 是一种强大而灵活的复杂数据集建模和预测方法。GP 属于一类概率模型,在预测不仅涉及最可能的结果,还涉及围绕它的不确定性的情况下特别有效。

假设您正在尝试预测温度模式。高斯过程不会只为您提供单一的温度预测;它们将提供一系列可能的温度范围和概率,从而提供未来可能性的完整图景。这一属性使它们在天气预报、股票市场分析以及理解预测的不确定性与预测本身一样重要的任何领域中都非常有用。

高斯过程

sklearn 中的高斯过程建立在两个主要概念之上:mean 函数,表示平均预测,以及协方差函数,也称为内核,它定义数据集中的点如何相互关联。GP 的美妙之处在于它们能够捕获数据中的复杂模式和关系,而无需预先定义刚性结构,就像神经网络中的层数一样。它们根据数据调整其复杂性,使其成为简单和复杂数据集的理想选择。

高斯过程 (GP) 由均值函数 m(x) 和协方差函数或内核 k(x,x′) 定义。在简单形式中,GP 表示为:

f(x)\sim GP(m(x),k(x,x′))

这意味着函数 f(x) 中的任何点集合都遵循均值 m(x) 和协方差 k(x,x′) 的多元高斯分布。

​​​​​​​内核

内核对于高斯进程至关重要,因为它们捕获数据的关系和基础结构。在特征空间中,内核(也称为协方差或相似性函数)量化两对输入点彼此之间的相似程度。它通过定义高斯过程分布的形式和属性来影响过程在各种输入配置中的行为方式。捕获线性关系的线性核和径向基函数 (RBF) (通常称为高斯核,它根据欧几里得距离评估相似性)是常见核函数的示例。

借助核,高斯过程可以处理非线性,对复杂关系进行建模,并通过从观察到的点推断和插值数据来生成预测。正确的核选择对于有意义且有效的高斯过程回归或分类至关重要,因为它反映了以前关于底层数据结构的假设。

在高斯过程 (GP) 的上下文中,内核(也称为协方差函数)测量输入空间中两点之间的相似性或相关性。核函数的选择对 GP 的行为有深远的影响。常见的内核是径向基函数 (RBF) 或高斯内核:

k_{RBF}(x,x') = exp(-\frac{||x-x'||}{2 l^2})

其中,σ2 是方差项,l 是长度尺度,决定了函数的平滑度。

​​​​​​​ 事先分发

先验分布代表了我们对我们正在建模的函数的第一个假设,作为高斯过程的起点。把它想象成一块有弹性的画布,根据我们先入为主的观念,在上面绘制不同的功能及其动作。这种分布通常被认为是高斯分布,具有影响潜在函数属性的参数,例如均值和协方差。

这类似于在任何数据到达之前为函数的性能准备阶段。当我们看到数据时,这个先验分布会发生变化,呈现出更适合所见世界的后验分布。先验分布作为高斯过程模型的基本画板运行,在吸收新数据并提高其对底层功能的理解时对其进行指导。

GP 中的先验分布封装了我们在观察任何数据之前对函数的初始信念。通常假设它是以均值函数 m(x) 为中心的正态分布,协方差由核函数 k(x,x′) 给出:

f(x) \sim N(m(x),k(x,x'))

​​​​​​​后分布

后验分布是高斯过程中的一个基本概念,它表达了我们根据数据观察对我们正在建模的功能的修正观点。首先,我们根据过去的分布假设函数的某些事情。在观察数据点时,借助贝叶斯定理,将先验分布与观察到的数据的可能性相结合,获得后验分布。

因此,我们对底层功能的增强知识被记录在修订和更新的发行版中。由于这个迭代过程,高斯过程能够根据新数据不断调整和增强其预测。后验分布提供了与建模函数相关的不确定性的动态和数据驱动表示,随着数据的增加,后验分布会变得更加清晰和准确。

观察数据后,后验分布更新了我们的信念,并结合了数据提供的证据。后验分布也是高斯分布,均值和协方差更新以反映学习的信息:

p(f_*|X, y, X_*) = N(\mu_*, \Sigma_*)

其中 X 是训练输入,y 是训练输出,X∗ 是测试输入,μ∗ 是后验均值,Σ∗ 是后验协方差。

​​​​​​​.组合内核

在高斯过程中组合核是提高模型表现力和适应性的有效方法。高斯进程中函数的特征和形式由内核决定。我们可以通过合并多个内核来开发一个复合内核,它可以识别数据中的不同模式和结构。这在底层系统显示不同趋势的情况下特别有用。

可以通过乘以或添加不同的内核来实现组合,每个内核都以不同的方式添加到 total 函数中。因此,高斯过程可以适应各种模式,并对数据中发现的关系提供更全面的描述。

可以组合内核以创建一个捕获数据多个方面的新内核。例如,添加两个内核 k1 和 k2 会导致一个内核是各个内核之和的内核:

k_{组合}(x,x') = k_1(x,x') + k_2(x,x')

乘以内核允许对输入之间的交互进行建模。组合核的灵活性是 GP 的一个强大功能,使模型能够拟合各种数据模式。

​​​​​​​分类与回归中的高斯过程

在回归中,GP 预测连续结果。给定训练数据 (X,y),GP 为新输入 X 提供预测分布∗:

p(y_∗∣X_∗,X,y)

在分类中,GP 用于预测离散标签。GP 的输出通过非线性函数(如 Logistic 函数)传递以获得类概率。分类过程涉及近似值,因为后验的积分对于非高斯似然来说很难处理。

​​​​​​​高斯过程的实现

​​​​​​​python

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐