NO.30.tip: 线性回归

背景

线性回归(linear regression)是广义线性模型最简单的情况。线性回归指的是以下模型:

其中,是模型的所有参数。(在统计学中,参数通常使用表示。)

我们将简要讨论最大似然估计,然后重点讨论贝叶斯分析。

源与流

普通最小二乘法

根据式(1),我们可以得出数据的负对数似然,如下所示:

其中,我们定义了预测响应 。我们证明了最大似然估计由下式给出:

这被称为普通最小二乘(Ordinary Least Squares, OLS)解。

观测噪声的最大似然估计由下式给出:

这正是残差的均方误差,这是一个直观的结果。

共轭先验

我们使用共轭先验推导参数的后验。首先考虑只有未知的情况(因此观测噪声方差参数是固定的),然后考虑一般情况,其中均是未知的。

噪声方差已知的情况

线性回归的共轭先验具有以下形式:

我们经常使用作为先验均值,作为先验协方差。(假设偏置项包含在权重向量中,但通常使用较弱的先验,因为我们通常不想对输出的总体平均水平进行正则化。)

为了推导后验,让我们首先根据多元高斯分布重写似然,如下所示:

其中,单位矩阵。然后,可以使用高斯的贝叶斯规则来推导出后验,如下所示:

其中,是后验均值,是后验协方差。

现在,假设。在这种情况下,后验均值变为

如果我们定义,就会发现这相当于岭回归,用于优化下式:

其中,RSS是残差平方和:

噪声方差未知的情况

我们假设都是未知的。似然由下式给出:

由于回归权重现在取决于似然中的,因此的共轭先验具有以下形式:

对于噪声方差,共轭先验基于逆伽马分布,其形式为:

将这两者结合在一起,我们发现联合共轭先验是正态逆伽马分布:

这产生以下的后验:

的表达式类似于已知的情况。的表达式也是直观的,因为该表达式只是更新计数。的表达式可以解释如下:该表达式是先验平方和,加上经验平方和,再加上由于上先验误差所得到的项。

后验边缘如下所示。对于方差,我们有:

对于回归权重,可以证明:

15.2.2.3 后验预测分布

在机器学习中,我们通常更关心预测的不确定性(以及准确率),而不是参数估计。幸运的是,我们可以推导出封闭形式的后验预测分布。具体来说,可以证明,给定个新的测试输入,我们有:

后验预测均值相当于"正态"线性回归,但其中我们插入而不是最大似然估计。后验预测方差有两个分量:由于测量噪声导致的,以及由于的不确定性导致的。后一项根据测试输入与训练数据的接近程度而变化。结果类似于使用高斯先验(具有固定的)的情况,只是预测分布更宽,因为我们考虑了的不确定性。

无信息性先验

对贝叶斯推理的一个常见非议是贝叶斯推理需要使用先验知识。这种现象有时被认为"污染"了人们从数据中所得出的推论。我们可以通过使用无信息性先验来最小化先验的影响。下面将讨论线性回归的各种无信息性先验。

Jeffreys先验

我们知道对于位置参数的Jeffreys先验,其形式为。我们知道对于尺度因子的Jeffreys先验,其形式是。我们可以使用不适当的正态逆伽马分布先验来模拟这些先验,其中。对应的后验由下式给出:

因此,权重的后验分布由下式给出:

其中,是最大似然估计。因此,每个权重的边缘概率具有以下形式:

与频率学派统计学的联系

有趣的是,当使用Jeffreys先验时,后验在形式上等价于最大似然估计的频率采样分布,其形式为:

其中,是在给定(固定)输入的情况下,从真实模型生成的假设数据。在关于频率学派统计学的书籍中,这通常被写成以下等价形式:

采样分布在数值上与式(39)中的后验分布相同,因为。然而,采样分布在语义上大不相同,因为采样分布不以观察到的数据为条件,而是基于从模型中提取的假设数据。更多有关使用无信息性先验时简单线性模型的贝叶斯分析和频率学派统计学分析之间等价性的讨论。

Zellner的g-先验

假设上有一个无信息性先验,这通常是合理的假设,因为只是一个对结果没有太大影响的标量,但对使用无信息性先验可能是危险的,正如我们从岭回归中所知的,先验的强度控制着模型的正则化程度。

一个常见的折衷方案是使用正态逆伽马分布先验,(以确保),,其中$g>0$的作用类似于岭回归中的。这被称为Zellner的g-先验。我们发现,先验协方差与成正比,而不是与成正比;这确保了后验对输入的缩放是不变的。

有了这个先验,后验就变成了:

注意,这个先验是以输入为条件的,而不是以输出为条件的;这在条件中是完全有效的,其中所有计算都以为条件,它被视为固定常数输入。

已经提出了各种方法来设置,这些方法包括交叉验证、经验贝叶斯、层次贝叶斯等。

“尖峰和平板”先验

在执行预测时,通常需要能够选择输入特征的子集,以减少过拟合,或者提高模型的可解释性。如果我们确保权重向量是稀疏的(即,具有许多零元素),就可以实现这一点,因为如果,则在内积中就不起作用。

当使用贝叶斯推理时,实现稀疏性的规范方法是使用"尖峰和平板"(spike-and-slab)先验,该方法具有两个分量的混合模型形式,其中一个分量是在0处的"尖峰",另一个分量是之间的均匀"平板":

其中,是每个系数为非零的先验。因此,相应的系数对数先验为:

其中,控制模型的稀疏性,是权重的范数(norm)。

因此,具有"尖峰和平板"先验的最大后验估计等价于正则化(regularization);这惩罚了非零系数的数量。有趣的是,后验样本也是稀疏的。

相比之下,考虑使用拉普拉斯先验。有趣的是,使用具有"尖峰和平板"先验的后验均值比使用具有拉普拉斯先验的后验众数具有更好的预测准确率。

在实践中,我们经常使用宽的高斯分布来近似均匀的"平板",

时,第二项在上接近均匀分布。我们可以通过将二元随机变量与每个系数相关联来实现混合模型,以指示该系数是"打开"还是"关闭"状态。

遗憾的是,具有这种离散混合先验的最大后验估计(更不用说完全贝叶斯推理)在计算上非常困难。研究学者已经提出了各种近似推理方法,包括贪婪搜索或马尔可夫链蒙特卡罗方法。

拉普拉斯先验(贝叶斯套索)

为了实现稀疏性,一种具有较低计算成本的方法是,通过最小化带惩罚项的负对数似然并利用拉普拉斯先验执行最大后验估计:

其中,范数。这种方法被称为套索,代表"最小绝对收缩和选择算子"(least absolute shrinkage and selection operator)。

我们将讨论具有该先验的后验推理;这被称为贝叶斯套索(Bayesian lasso)。具体来说,我们假设以下先验分布:

(注意,为了确保完全后验是单模态的,将先验条件设置为依赖于是很重要的。)

为了简化推理,将拉普拉斯先验表示为高斯缩放的混合。特别地,可以证明拉普拉斯分布是高斯的无限加权和,其中精度来自伽马分布:

因此,我们可以将贝叶斯套索模型表示为一个层次潜在变量模型,如图15-3a所示。对应的联合分布具有以下形式:

我们还可以创建一个高斯缩放的混合模型来匹配组套索先验,该模型同时将多个系数设置为零:

其中,是组的大小。因此,我们看到每个组有一个方差项,每个方差项都来自一个伽马先验,其形状参数取决于组的大小,其速率参数由控制。

给定这些层次模型,我们可以很容易地推导出一个吉布斯采样算法来从后验分布进行采样。遗憾的是,即使最大后验估计是稀疏的,这些后验样本也不是稀疏的。这是因为先验对每个系数为零的事件赋予了无穷小的概率。

“马蹄”先验

拉普拉斯先验不适用于稀疏贝叶斯模型,因为后验样本不是稀疏的。"尖峰和平板"先验则没有这个问题,但这个方法通常速度太慢。幸运的是,可以设计出既稀疏又计算高效的连续先验(没有离散的潜在变量)。这种类型的一个流行先验是"马蹄"先验(horseshoe prior),它因为其密度函数的形状而得名。

在"马蹄"先验中,我们使用以下高斯缩放混合,而不是对每个权重使用拉普拉斯先验:

其中,是半柯西分布(见2.2.2.4节),是局部收缩因子,是全局收缩因子。柯西分布具有非常粗的尾部,因此可能为0或离0很远,这模仿了之前的"尖峰和平板"先验,但采取连续的方式。

自动相关性确定

使用促进稀疏性的先验进行后验推理的另一种选择是,使用高斯先验进行后验推理,但其中我们使用经验贝叶斯来优化精度。也就是说,我们首先计算,然后计算。也许令人惊讶的是,由于在15.2.8.2节中解释的原因,我们发现结果会导致稀疏的估计。

这种技术被称为稀疏贝叶斯学习(sparse Bayesian learning)或自动相关性确定(Automatic Relevance Determination, ARD)。该技术也被称为NUV估计,代表"具有未知方差的正态先验"(normal prior with unknown variance)。这个技术最初是为神经网络开发的(其中,稀疏性应用于第一层权重),但此处我们将其应用于线性模型。

线性模型的自动相关性确定

我们通过将自动相关性确定应用于线性回归来更详细地解释这个概念。似然为,其中。先验是,其中。边缘似然可以解析计算,如下所示:

其中,。这与"尖峰和平板"先验下的边缘似然非常相似,由下式给出:

其中,。(此处,指的是设计矩阵,而我们只选择中满足的那些列。)不同之处在于,我们将二元变量替换为连续变量,这使得优化问题变得更加简单。

目标是对数边缘似然,由下式给出:

可以使用各种优化算法来优化

自动相关性确定可以用作正则化的替代方案。尽管自动相关性确定目标不是凸函数,但它往往会给出更稀疏的结果。此外,可以证明,自动相关性确定目标的局部最优值比正则化目标少得多,因此更容易优化。

为什么自动相关性确定会导致稀疏解

一旦我们估计了,就可以使用高斯的贝叶斯规则来计算参数的后验,得到,其中。如果我们有,那么,因此解向量将是稀疏的。

现在,我们说明在什么情况下这种稀疏解可能是最优的。为了简单起见,我们假设是固定的。考虑具有两个训练样例的一维线性回归,因此。我们可以将绘制为平面中的向量。假设该特征与预测响应无关,因此指向与几乎正交的方向。让我们看看当改变时,边缘似然会发生什么变化。边缘似然由给出,其中。如果是有限的,后验分布将沿着方向拉长。然而,如果,我们有,这是球形的,如果保持不变,后者将更高的概率密度分配给观察到的响应向量,因此这是优选的解。换言之,当较小但不相关时,边缘似然会"惩罚"这些解,因为它们浪费了概率质量。(从贝叶斯奥卡姆剃刀的角度来看)消除冗余维度是更简约的。

理解自动相关性确定稀疏性的另一种方法是在层次贝叶斯模型中进行近似推理。特别是,假设我们将共轭先验放置在每个精度,和观测精度上。由于学生先验的精确推理是难以处理的,我们可以使用变分贝叶斯,使用以下形式的因子后验分布:

自动相关性确定通过点估计来近似。然而,在变分贝叶斯中,我们对进行积分,由此得到的权重上的后验边缘由下式给出:

这是一个高斯缩放的混合模型,可以证明,该混合模型与多变量学生分布相同,具有非对角协方差。需要注意的是,学生分布在0处有一个大尖峰,这直观地解释了为什么后验均值(对于学生分布,等价于后验众数)是稀疏的。

最后,我们还可以将自动相关性确定视为具有非因子先验(non-factorial prior)的最大后验估计问题。直观地说,尽管使用了对角高斯先验分布,但参数之间的依赖性仍然会出现,因为先验精度是在边缘化所有之后估计的,因此依赖于所有特征。有趣的是,我们证明了具有非因子先验的最大后验估计在以下意义上严格优于具有任何可能的因子先验的最大后验估计:非因子目标总是比因子目标具有更少的局部极小值,同时仍然满足非因子目标的全局最优与目标的全局优化相对应的性质——正则化没有局部极小值,因此不具有这种性质。

自动相关性确定算法

可以使用多种算法来优化。一种方法是使用期望最大化,其中我们在期望步骤中计算,然后在最大化步骤中最大化。在变分贝叶斯中,我们同时推理

最近,我们发现,这些方法执行的嵌套迭代计算可以通过循环神经网络来进行模拟(见16.3.4节)。此外,通过训练该模型,可以实现比手动设计的优化算法更快的收敛。

相关向量机

假设我们创建一个形式为的线性回归模型,其中是核函数,并且个训练点。这被称为核基函数展开(kernel basis function expansion),它将输入从转换为。显然,这个模型具有个参数,因此是非参数化模型。然而,我们可以使用自动相关性确定来选择样本的一小部分。这种技术被称为相关向量机(Relevance Vector Machine, RVM)。

多元线性回归

我们将考虑多元线性回归模型,其形式为:

其中,是回归系数的矩阵,是输入特征的矩阵(每行对应一个输入变量,每列对应一种观察值),是响应矩阵(每行对应一个输出变量,每列对应一种观察值),是残差矩阵,其中。从定义中可以看出,如果给定以及,则的列是遵循多元正态分布的独立随机变量。所以观察值的似然为:

其共轭先验是矩阵正态逆威沙特分布:

其中,矩阵正态逆威沙特分布被定义为:

其中,,$\nu_0>N_x-1$是逆威沙特分布的自由度。

的后验分布仍然遵循矩阵正态逆威沙特分布。联合分布的密度为:

我们首先聚合指数中包括的项,使其采用矩阵正态分布的"完成平方"技术。这类似于我们推导多元正态分布的共轭后验时使用的技术。具体来说,即:

其中,

因此,从式(76)可以看出,如果给定,则遵循矩阵正态分布:

通过将边缘化(即去除式(72)中包含的指数项),可以证明的后验分布是逆威沙特分布。实际上,通过将式(76)替换为式(72)中的相应项,可以看出积分出后只剩下,这表明后验逆威沙特分布的标度矩阵是

总之,对于给定的观测值,的联合后验分布为:

的最大后验估计是后验矩阵正态逆威沙特分布的模式。为了推导这一点,请注意,只出现在矩阵正态密度函数的后验分布中,因此最大化后验密度的矩阵,是使的矩阵正态后验最大化的矩阵。因此,的最大后验估计为,这适用于的任何值。通过将插入的联合后验分布,并取的导数,可以发现密度最大化的矩阵是。由于是正定的,因此的最大后验估计。

总之,的最大后验估计为: