NO.28.tip: 无信息先验

背景

当我们几乎没有或根本没有特定领域的知识时,最好使用非信息性(uninformative)、无信息性(noninformative)或客观性(objective)先验,"让数据自己说话"。遗憾的是,没有唯一的方法来定义这样的先验,它们都编码了某种知识。因此,最好使用术语扩散先验(diffuse prior)、最少信息性先验(minimally informative prior)或默认先验(default prior)。

源与流

是具有先验 的随机变量,并且设 的一些可逆变换。我们希望选择一个对函数 保持不变(invariant)的先验,这样后验就不依赖于我们如何对模型进行参数化。

例如,考虑比率参数为 的伯努利分布。假设 Alice 使用二项式似然和数据 ,并计算 。现在假设 Bob 使用相同的似然和数据,但根据比率参数 对模型进行参数化。Bob 使用变量变化公式将 Alice 的先验转换为 ,然后计算 。如果随后转换回 参数化,那么 Bob 应该得到与 Alice 相同的结果。

只要使用 Jeffreys 先验(以 Harold Jeffreys 命名),我们就可以实现这一目标。在一维数据中,Jeffreys 的先验为 ,其中 是 Fisher 信息。在多维数据中,Jeffreys 的先验的形式为 ,其中 是 Fisher 信息矩阵(式 (5) 节)。

为了理解为什么 Jeffreys 先验对参数化是不变的,请考虑一维数据的情况。假设 。利用变量的变化,我们可以导出 的相应先验,如下所示:

因此,无论我们使用 参数化还是 参数化,先验都是相同的。

接下来,我们将列举一些 Jeffreys 先验的例子。

单变量高斯均值和方差的 Jeffreys 先验

考虑两个参数都未知的一维高斯分布 ,因此 。根据式 (5),Fisher 信息矩阵为:

因此,。然而,高斯分布的标准 Jeffreys 无信息性先验被定义为独立的无信息先验的乘积,即

事实证明,我们可以使用共轭正态逆卡方先验来模拟这个先验:

这使我们可以很容易地重用高斯共轭分析的结果。

不变性先验

位置-尺度分布族(location-scale family)是由位置 和尺度 进行参数化的概率分布族。如果 是该概率分布族中的随机变量,那么 也是相同概率分布族中的随机变量。

在推断位置参数 时,直观上,我们希望使用平移不变性先验(translation-invariant prior)是合理的,因为平移不变性先验满足这样的性质,即分配给任何区间 的概率质量与分配给任何其他相同宽度平移区间(例如 )的概率质量相同。也就是说,

这可以使用下式来实现:

因为:

这与具有未知均值 和固定方差的高斯分布 Jeffreys 先验相同。这是因为 ,根据式 (5),因此

尺度不变性先验

在推断尺度参数 时,我们可能希望使用尺度不变性先验(scale-invariant prior)。尺度不变性先验的性质满足分配给任何区间 的概率质量与分配给任何其他区间 的概率相同,其中 $c>0$。也就是说,

这可以使用下式来实现:

于是:

这与具有固定均值 和未知尺度 的高斯分布 Jeffreys 先验相同。这是因为 ,根据式 (5),因此

学习不变性先验

只要已知希望模型满足的某种不变性,那么我们就可以使用这种不变性来编码相应的先验。在某些情况下,可以通过解析方法来完成。当无法采用解析方法来求解时,可以通过求解变分优化问题来学习不变性先验。

参照先验

定义无信息性先验的一种方法是,当在数据集上进行平均时,将其定义为与所有可能的后验相距最远的分布。这是参照先验(reference prior)的基本思想。更准确地说,我们称 是一个参照先验,如果该先验最大化了后验和先验之间的预期 KL 散度:

其中,。这与最大化互信息 相同。

我们可以消除数据集上的积分,请注意:

其中,我们使用了 这一事实。

可以证明,在一维数据中,相应的先验等价于 Jeffreys 先验。在更高的数据维度中,我们可以使用链式法则一次计算一个参数的参照先验。然而,其计算可能会比较复杂。