NO.27.tip: 共轭先验

背景

我们考虑一类具有特殊形式先验模型的贝叶斯推理,称为共轭先验,这简化了后验的计算。形式上,如果后验与先验在同一参数化族中,即 ,那么我们称先验 是似然函数 的共轭先验。换句话说, 在贝叶斯更新下是封闭的。如果 族对应于指数族,那么计算可以以闭合形式执行。在更复杂的设置中,我们不能执行闭合形式推理,但通常可以在更大的计算管道中利用这些结果作为可处理的子程序。

源与流

单变量高斯分布模型

我们将推导单变量高斯分布的后验 。为了简单起见,我们分三个步骤来讨论:仅推理 ,仅推理 ,然后同时推理这两个参数。

给定 的后验

如果 是已知常数,则 的似然概率为:

可以证明,共轭先验是另一个高斯分布 。应用高斯分布的贝叶斯规则,我们发现相应的后验由下式给出:

其中, 是经验均值。

如果我们使用精度参数,那么这个结果更容易理解,而精度参数只是方差的逆。具体来说,设 为观测精度, 为先验精度。然后我们可以将后验重新改写为如下的形式:

这些公式非常直观:后验精度 是先验精度 加上 个单位的测量精度 。此外,后验均值 是经验均值 和先验均值 的凸组合。这表明后验均值是经验均值和先验均值之间的折中。如果相对于信号强度,先验的值较小(即相对于 较小),我们给予经验均值更多的权重。如果相对于信号强度,先验的值较大(即相对于 较大),我们给予先验更多的权重。还要注意的是,后验均值是用 来表示的,因此有 个精度为 的测量值,相当于有一个值为 、精度为 的测量值。

为了进一步理解这些方程,在观察到单个数据点 (因此 )后,考虑后验。于是,后验均值可以记作以下的等价形式:

式(8) 是先验均值和数据的凸组合;式(9) 是向数据 调整的先验均值;式(10) 是向先验均值调整的数据,被称为收缩估计(shrinkage estimate)。如果我们定义权重 ,这更容易理解。于是,就有:

请注意,对于高斯分布,后验均值和后验众数是相同的。因此,我们可以使用上述公式来执行最大后验估计。

给定 的后验

如果 是已知常数,则 的似然为:

其中,我们不能再忽视前面的 项。标准共轭先验是逆伽马分布,其定义为:

将似然和先验相乘,我们可以看到,后验也是逆伽马分布:

使用 分布的一个小麻烦是先验的强度被编码在 中。因此,在贝叶斯统计学文献中,通常使用逆伽马分布的一种替代参数化形式,称为(缩放的)逆卡方分布(inverse chi-squared distribution):

其中,(称为自由度(degrees of freedom, dof)参数)控制先验的强度, 对先验均值进行编码。有了这个先验,后验变为:

我们看到,后验自由度 是先验自由度 加上 ,后验平方和 是先验平方和 加上数据平方和。

的后验:共轭先验

现在假设我们希望对均值和方差进行推理。相应的共轭先验是正态逆伽马(normal inverse gamma)分布:

然而,通常使用正态逆卡方(Normal Inverse Chi-squared, NIX)分布对正态逆伽马分布重新参数化,其定义如下:

可以证明,其后验为:

相应的解释如下。对于 ,后验均值 是先验均值 和最大似然估计 的凸组合;后验的强度 是先验的强度 加上数据点 的数量。对于 ,我们使用平方和:后验平方和 是先验平方和 加上数据平方和 ,加上由于先验均值 和最大似然估计 之间的差异而产生的项;后验的强度 是先验的强度 加上数据点数量

的后验边缘为:

后验均值为

的后验边缘具有学生分布,因为学生分布是高斯分布的(缩放)混合分布:

后验均值为

多元高斯分布模型

我们将推导多元高斯分布的后验 。为了简单起见,我们分三个步骤来讨论:仅推理 ,仅推理 ,然后同时推理这两个参数。

给定 的后验

似然具有以下形式:

为了简单起见,我们将使用共轭先验,在这种情况下,共轭先验是高斯分布先验。特别是,如果 ,则我们可以导出 的高斯分布的后验:

给定 的后验

我们现在讨论如何计算

似然

似然为:

可以证明:

其中:

是经验散布矩阵, 是中心矩阵(centering matrix):

因此,我们可以将似然改写为下式:

接下来,我们将使用这种形式的似然概率。

先验

很明显,先验概率的公式如下所示:

其中, 是逆威沙特分布。遗憾的是,在式(39) 的似然中, 以非因子化的方式出现在一起(见第一个指数项),因此式(40) 中的因子化先验与似然不共轭。

上述先验有时被称为条件共轭(conditionally conjugate),因为条件概率 都是单独共轭。为了创建完全共轭先验,我们需要使用 相互依赖的先验。我们将使用形式为 的联合分布。

查看似然公式(39),我们看到自然共轭先验具有正态逆威沙特(Normal-Inverse-Wishart, NIW)分布的形式,其定义如下:

其中,归一化常数定义为:

正态逆威沙特分布的参数可以解释如下: 的先验均值,而 是我们对该先验均值 的信任程度; 的先验均值(二者成一定比例),而 是我们对该先验均值 的信任程度。

后验

为了推导后验,让我们首先将散布矩阵重写为以下的形式:

其中, 是平方和(sum of squares)矩阵。

现在,我们将似然与先验相乘,结果为:

其中:

我们可以使用一种称为完成平方(completing the square)的技巧来简化 矩阵。将此应用于上述公式,我们得到:

因此,我们可以将后验重写为以下的形式:

其中:

这个结果实际上是非常直观的:后验均值 是先验均值和最大似然估计的凸组合;后验散布矩阵 是先验散布矩阵 加上经验散布矩阵 加上由于均值的不确定性而产生的额外项(从而产生了自己的虚拟散布矩阵);后验置信因子 都随着我们所依赖数据的增加而增大。

后验边缘

我们计算了联合后验:

我们现在讨论如何计算后验边缘

很容易看出, 的后验边缘为:

对于均值,我们可以证明:

其中,。直观上,这一结果是因为 是高斯分布的无限混合模型,其中每个混合分量都有一个从逆威沙特分布中得出的值 ;通过将这些值混合在一起,我们得到了一个学生 t 分布,该分布比单个高斯分布具有更重的尾部。

后验众数

的最大后验估计为:

为了找到该众数,我们首先注意到 只出现在条件分布 中,并且该正态分布的众数等于其平均值,即 。还要注意,这适用于任何 。因此,我们可以将 代入式(64) 中,并推导出 的众数。请注意:

其中, 是与 无关的常数。然后,我们取关于 的导数:

通过将导数设为 0 并求解 ,我们发现, 是使式(65) 最大化的矩阵。

通过检查发现 为正定矩阵,我们得出 为协方差矩阵 的最大后验估计。

总之, 的最大后验估计为:

后验预测

我们现在讨论如何通过对参数进行积分来预测未来的数据。如果 ,其中 ,则可以证明,对于单个观测向量,后验预测分布如下:

其中,

指数族模型

我们已经看到,如果先验与似然共轭,那么精确的贝叶斯分析会大大简化。由于后验函数必须具有与先验函数相同的形式,因此参数数量也相同,也即似然函数必须具有固定大小的充分统计量,这样我们就可以记作 。这表明,唯一存在共轭先验的分布族是指数族,接下来,我们将展示如何对通用指数族模型进行共轭分析。

似然

回想一下,指数族的似然为:

其中,

先验

对照似然的形式,我们可以定义先验:

其中, 是先验的强度, 是先验的均值, 是归一化因子。可以从表示先验信念的虚拟样本(virtual sample)中推导出参数

后验

后验由下式给出:

其中:

我们发现,这与之前的先验形式相同,但我们更新了充分统计量和样本容量。

后验均值由先验均值和经验均值(即最大似然估计)的凸组合给出:

其中,

边缘似然

从式(78) 中我们可以看出,边缘似然由下式给出:

后验预测密度

现在,在给定过去数据 的情况下,我们将推导未来可观测值 的预测密度: