NO.4.tip: 贝叶斯估计

背景

  很多情况下,我们都会遇到预测方差过高问题,它的一个常见表现就是过拟合。想要缓解甚至处理方差过高问题,我们要了解的是参数不确定性。以下是参数不确定性的定义以及它对预测方差的影响:

  假设模型参数化线性模型 是基函数(高次多项式、神经网络特征等)待估参数。对固定,预测 是由随机数据集得到的参数估计,本身是随机变量,参数不确定性即为

  有了参数不确定性的定义,我们就可以推导其对预测方差的影响: 是参数协方差矩阵,对角线为各参数方差,刻画了参数整体不确定性。我们发现,预测方差是参数协方差矩阵的二次型:

(1)只要参数存在不确定性(非零,特征值大),预测方差一定上升

(2)参数越不确定(越大),同等特征下预测波动越强,模型方差越高

  注意,是协方差矩阵,对矩阵的不确定性度量一般从以下四个角度入手:

(1)迹,所有参数自身方差想家,仅累加单参数波动,忽略参数间相关程度

(2)行列式,表征参数联合搞死分布置信椭球的体积,数值越大代表整体联合不确定性越高

(3)最大特征值(范数),捕捉参数空间波动最剧烈的单一方向,用来识别不稳定主成分

(4)Frobenious范数,整合全部方差与两两参数协方差,完整度量协方差矩阵整体波动能量

源与流

  现在,我们知道了饿预测方差过高很大程度上来源于参数不确定性,那么我们就可以从这里入手。实际上,我们有两种思路:

(1)一种是缩小参数估计的范围,从而间接降低参数不确定性;

(2)一种是对参数不确定性完整建模,从而直接控制参数不确定性,这种思想源自于统计学的贝叶斯理论,是一种标准贝叶斯方法

  首先,我们来看下第一种,缩小参数估计范围的思路。这种思想的两个典型例子就是Lasso回归和Ridge回归。

Ridge回归: Lasso回归:

  接下来,我们再开看第二种思路,对参数不确定性完整建模--标准贝叶斯方法。我们先给出贝叶斯公式: 其中是关联的先验概率密度函数。我们对于以上狮子不再仅仅是要使分子最大,还要将作为一个整体来使用。这里,秘密大部分在于分母,它基本上是归一化常数:

  正如我们看到的,在中隐藏的信息远远超过了知识为了计算的需要。上式的计算难点在于,一般来说,积分的估计没有解析计算方法。在这种情况下,人们需要借助近似技术来获得所需的信息。为了这个目的,可以使用很多种方法,更具体地说,我们将考虑以下这些方法:

(1)拉普拉斯近似法

(2)变分近似法

(3)蒙特卡洛积分求值技术