NO.10.tip: AIC和BIC准则

背景

  一般来说,训练误差

比真实的预测误差 小,因为同样的数据既被用于拟合,又被用于评估其误差(见习题7.9)。拟合算法往往会对训练数据本身(而不是真实的分布)产生适应性,因此训练误差 将会是对泛化误差 的过于乐观的估计。

  两者产生差异的部分原因是测试观测的位置或评估点发生位置的不一样。 可以认为是样本集外的样本(extra-sample)误差,因为测试样本不必和训练样本一样。 的乐观本质在我们仅关注样本集内的样本(in-sample)误差时最容易理解

这里 表示我们在每个训练样本 获得的 个新响应。我们将(误差估计的)乐观程度(optimism)定义为训练误差 的差

这个值一般都是正的,因为 通常是对预测误差偏小的估计。最后,平均乐观程度是乐观程度在所有训练集上的期望误差

这里,训练集的预测子是固定的,期望是对训练集上响应或结果值上(即 )取的,因此我们的记号是 而不是 。通常,我们可以计算出期望乐观程度 而不是 ,正如我们能够估计期望预测误差 ,而不能估计出条件误差

  对于平方误差、0-1以及其他的损失函数,可以证明如下一般性的结论

其中 是协方差。因此, 低估真实误差的程度依赖于 能以多强的程度影响它自己的预测值。我们对数据的拟合程度越高, 会越大,也将因此而增大乐观程度。

  由此,我们有如下重要的关系

  如果 维输入或基函数的线性拟合结果,此表达式还可简化。例如,对于加性误差模型

因此

式(7)是有效参数个数的基础。乐观程度随着输入维数或者使用的基函数个数 线性增长,但是随训练集样本数目的增加而减少。式(8)对于其他的误差模型,比如二值数据与熵损失函数,也能近似的成立。

  一种估计预测误差的明显方式是估计乐观程度,然后将它加到训练误差 上。在下一节中介绍的方法——、AIC、BIC以及其他的方法——都是这样对一类特殊的估计起作用的,这类估计是它们的参数的线性函数。

源与流

  样本内误差的一般形式为

其中 是对平均乐观程度的估计。

  利用式(8),当 个参数通过平方误差损失函数拟合时,可计算出一个所谓的 统计量:

这里 是对噪声方差的估计,它从低偏差模型的均方误差获得。利用这个准则,我们通过一个正比于使用的基函数数量的因子,来调整训练误差。

  Akaike 信息准则是对 的类似但更一般的估计,如果用的是对数似然损失函数。它依赖于与式(8)类似的关系。该关系

时,渐进的成立。这里 表示一族 的密度(包含"真实"的密度函数), 是对 的最大似然估计,而 是最大化的似然函数

例如,对 logistic 回归模型,使用二项分布的对数似然函数,有

对于线性回归模型,其损失函数为平方误差(其方差 假定已知),对应的 AIC 统计量等价于 ,因此我们将它们统称为 AIC。

  为了将 AIC 用于模型选择,我们就选择给定模型中 AIC 值最小的那个。对于非线性和其他复杂的模型,需要将 替换为其他的能够衡量模型复杂性的数值。

  给定一族模型 ,其中 是可调整的参数,用 表示训练误差以及对应模型的参数个数,则对这族模型,我们定义

函数 提供对测试误差曲线的估计,我们去寻找能最小化该值的可调参数

  尽管 AIC 和 BIC 是非常相似的,BIC 源自一个非常不同的起因,模型选择的贝叶斯方法。

  假定有一族候选模型 且对应的模型参数为 ,我们希望从中选择一个最佳模型。假定每个模型 的参数的先验分布为 ,则给定模型的后验概率为

其中 代表训练数据 。为了比较两个模型 ,我们计算后验概率比

如果比值大于 1,我们就选择模型 ,否则我们选择模型 。最右边的一项

称为贝叶斯因子(Bayes factor),即数据对后验概率比的贡献。

  一般情况下,我们假设模型的先验是均匀分布,这样 是常数。我们需要一些近似 的方法。通过对积分的所谓拉普拉斯近似以及另外一些简化,式(21)化简为

这里 是最大似然估计, 是模型 的自由参数个数。如果损失函数定义为

  因此,选择最小 BIC 的模型等价于选择能够(近似)最大后验概率的模型。但这个框架给了我们更多的东西。如果我们对 个模型计算 BIC,有相应的 ,那么我们可以用它们来估计每个模型 的后验概率

这样我们不仅估计了最好的模型,同时还评估了各个模型的相对好处。

  就模型选择的目的而言,在 AIC 和 BIC 之间并没有明确的倾向。BIC 作为选择的准则是渐进一致的。这也就是说,给定一族模型,包含真实的模型,BIC 选择正确模型的概率会随着样本容量 接近 1。但是对 AIC 却并不是这样,它在 的时候倾向选择过于复杂的模型。另外一方面,对有限样本,BIC 经常由于对复杂模型的严重惩罚而选择过于简单的模型。