NO.4.tip: 贝叶斯估计
背景
很多情况下,我们都会遇到预测方差过高问题,它的一个常见表现就是过拟合。想要缓解甚至处理方差过高问题,我们要了解的是参数不确定性。以下是参数不确定性的定义以及它对预测方差的影响:
假设模型参数化线性模型 是基函数(高次多项式、神经网络特征等)待估参数。对固定,预测 是由随机数据集得到的参数估计,本身是随机变量,参数不确定性即为
有了参数不确定性的定义,我们就可以推导其对预测方差的影响: 是参数协方差矩阵,对角线为各参数方差,刻画了参数整体不确定性。我们发现,预测方差是参数协方差矩阵的二次型:
(1)只要参数存在不确定性(非零,特征值大),预测方差一定上升
(2)参数越不确定(越大),同等特征下预测波动越强,模型方差越高
注意,是协方差矩阵,对矩阵的不确定性度量一般从以下四个角度入手:
(1)迹,所有参数自身方差想家,仅累加单参数波动,忽略参数间相关程度
(2)行列式,表征参数联合搞死分布置信椭球的体积,数值越大代表整体联合不确定性越高
(3)最大特征值(范数),捕捉参数空间波动最剧烈的单一方向,用来识别不稳定主成分
(4)Frobenious范数,整合全部方差与两两参数协方差,完整度量协方差矩阵整体波动能量
源与流
现在,我们知道了饿预测方差过高很大程度上来源于参数不确定性,那么我们就可以从这里入手。实际上,我们有两种思路:
(1)一种是缩小参数估计的范围,从而间接降低参数不确定性;
(2)一种是对参数不确定性完整建模,从而直接控制参数不确定性,这种思想源自于统计学的贝叶斯理论,是一种标准贝叶斯方法
首先,我们来看下第一种,缩小参数估计范围的思路。这种思想的两个典型例子就是Lasso回归和Ridge回归。
Ridge回归: Lasso回归:
接下来,我们再开看第二种思路,对参数不确定性完整建模--标准贝叶斯方法。我们先给出贝叶斯公式: 其中是关联的先验概率密度函数。我们对于以上狮子不再仅仅是要使分子最大,还要将作为一个整体来使用。这里,秘密大部分在于分母,它基本上是归一化常数:
正如我们看到的,在中隐藏的信息远远超过了知识为了计算的需要。上式的计算难点在于,一般来说,积分的估计没有解析计算方法。在这种情况下,人们需要借助近似技术来获得所需的信息。为了这个目的,可以使用很多种方法,更具体地说,我们将考虑以下这些方法:
(1)拉普拉斯近似法
(2)变分近似法
(3)蒙特卡洛积分求值技术