高斯过程是一种随机过程,其中任意有限组带索引的随机变量都服从多元正态分布,包括退化分布。其索引可以表示时间、空间位置或数学模型的输入。高斯过程由均值函数和协方差函数完全确定。在统计学和机器学习中,它提供了一种描述未知函数不确定性的方法,而不只是描述有限个参数的不确定性。(gaussianprocess.org)
数学定义
设 为索引集, 为一组实值随机变量。如果对任意正整数 和任意选取的 ,向量
都服从多元正态分布,则称这组随机变量构成高斯过程。仅要求每个取值分别服从正态分布并不足够:它们的联合分布也必须是高斯分布。(gaussianprocess.org)
均值函数和协方差函数为
这里, 表示期望值,而 描述不同索引处取值之间的协方差。记号
表示任意有限个点上的函数取值组成的向量,其均值分量为 ,协方差矩阵的元素为 。对角线上的值 是 处的方差。(gaussianprocess.org)
有效的协方差核必须对称且半正定:由它构成的每个有限矩阵都满足 。这些条件保证了高斯有限维分布的一致性,从而可以构造出相应的过程。定义本身并不要求样本路径连续或可微;这些性质取决于核以及额外的正则性条件。(gaussianprocess.org)
协方差核与示例
协方差核体现了对函数变化、平滑性、周期性以及不同输入之间依赖关系的假设。一个重要例子是平方指数核,也称径向基函数核:
其幅度参数 控制边际方差,长度尺度 控制依赖关系随距离增大而衰减的速度。由该核产生的过程具有任意阶均方导数。Matérn 核则提供了一个控制有限阶均方可微性的参数,从而可以表达不同的粗糙程度假设。(gaussianprocess.org)
当均值为常数,且核仅依赖于 时,所得高斯过程是平稳过程:将所有输入平移相同的距离,不会改变其有限维分布。有效的核也可以通过求和与相乘来组合。维纳过程是一个非平稳高斯过程的例子,其均值为零,对于非负时间,协方差为 。(gaussianprocess.org)
回归与预测
高斯过程回归利用贝叶斯推断,根据训练数据更新函数空间上的先验分布。一种标准的观测模型为
其中各噪声项相互独立,也与 独立。当噪声服从高斯分布时,通过条件化可以得到潜在函数的精确高斯后验分布。(gaussianprocess.org)
设 、,以及 ,其中 为单位矩阵。对于测试输入 ,定义 。假设 可逆,则后验均值和方差为
多个输入处的联合预测也可用类似的矩阵公式求得。(gaussianprocess.org)
这些方程区分了潜在函数的不确定性与观测噪声。未来含噪观测的预测方差为 。由这一分布得到的可信区间以所假设的核、噪声模型和固定的参数值为条件,并不构成独立于模型的准确性保证。(gaussianprocess.org)
超参数与模型选择
核的幅度、长度尺度和噪声水平都是超参数。可以通过最大化边际似然来估计这些参数;边际似然通过积分消去了潜在函数值。令 ,其对数为
二次项衡量对数据的拟合程度,而行列式项则对协方差模型所允许的结果空间体积施加惩罚。两者之间的平衡为模型选择提供了依据,使选择标准不局限于训练误差。(gaussianprocess.org)
优化过程可能存在多个局部最优解,不同的参数组合也可能对有限的观测给出相近的解释。完全贝叶斯的处理方式则为超参数指定先验,并通过积分纳入其后验不确定性。即使观测噪声服从高斯分布,这种积分通常也会产生多个条件高斯预测分布的混合,而不是单一的高斯过程后验。(gaussianprocess.org)
分类与相关模型
在分类任务中,潜在高斯过程被映射为类别概率,例如通过逻辑斯蒂函数进行映射。由此产生的非高斯似然函数通常使精确的高斯条件化不再可行。可用的方法包括拉普拉斯近似、期望传播和马尔可夫链蒙特卡洛。潜在函数的先验仍为高斯分布,但其后验通常不是高斯分布。(gaussianprocess.org)
高斯过程也与线性回归有关:为线性模型的权重指定高斯先验,会使函数在各点的取值服从高斯分布。核的表述方式将这一视角推广到更丰富的特征空间,而无须显式构造每个特征,从而将高斯过程预测与核方法联系起来。(gaussianprocess.org)
计算需求
对于 个观测,采用稠密协方差矩阵的常规精确回归需要 的存储空间,矩阵分解的时间复杂度约为 。实际实现通常使用Cholesky分解并求解线性方程组,而不是显式计算逆矩阵。这些开销限制了该方法在大型数据集上的直接应用。(gaussianprocess.org)
近似方法包括选取观测子集、采用低秩协方差表示、诱导变量方法以及迭代线性求解器。一些低秩方法使用 个代表性变量,其主要计算开销约为 。计算开销的降低程度取决于具体构造,而且近似可能同时改变预测方差和均值;因此,评价近似质量时不仅要考察点预测,还要考察不确定性估计。(gaussianprocess.org)