NO.28.tip: 无信息先验
背景
当我们几乎没有或根本没有特定领域的知识时,最好使用非信息性(uninformative)、无信息性(noninformative)或客观性(objective)先验,"让数据自己说话"。遗憾的是,没有唯一的方法来定义这样的先验,它们都编码了某种知识。因此,最好使用术语扩散先验(diffuse prior)、最少信息性先验(minimally informative prior)或默认先验(default prior)。
源与流
设 是具有先验 的随机变量,并且设 是 的一些可逆变换。我们希望选择一个对函数 保持不变(invariant)的先验,这样后验就不依赖于我们如何对模型进行参数化。
例如,考虑比率参数为 的伯努利分布。假设 Alice 使用二项式似然和数据 ,并计算 。现在假设 Bob 使用相同的似然和数据,但根据比率参数 对模型进行参数化。Bob 使用变量变化公式将 Alice 的先验转换为 ,然后计算 。如果随后转换回 参数化,那么 Bob 应该得到与 Alice 相同的结果。
只要使用 Jeffreys 先验(以 Harold Jeffreys 命名),我们就可以实现这一目标。在一维数据中,Jeffreys 的先验为 ,其中 是 Fisher 信息。在多维数据中,Jeffreys 的先验的形式为 ,其中 是 Fisher 信息矩阵(式 (5) 节)。
为了理解为什么 Jeffreys 先验对参数化是不变的,请考虑一维数据的情况。假设 。利用变量的变化,我们可以导出 的相应先验,如下所示:
因此,无论我们使用 参数化还是 参数化,先验都是相同的。
接下来,我们将列举一些 Jeffreys 先验的例子。
单变量高斯均值和方差的 Jeffreys 先验
考虑两个参数都未知的一维高斯分布 ,因此 。根据式 (5),Fisher 信息矩阵为:
因此,。然而,高斯分布的标准 Jeffreys 无信息性先验被定义为独立的无信息先验的乘积,即
事实证明,我们可以使用共轭正态逆卡方先验来模拟这个先验:
这使我们可以很容易地重用高斯共轭分析的结果。
不变性先验
位置-尺度分布族(location-scale family)是由位置 和尺度 进行参数化的概率分布族。如果 是该概率分布族中的随机变量,那么 也是相同概率分布族中的随机变量。
在推断位置参数 时,直观上,我们希望使用平移不变性先验(translation-invariant prior)是合理的,因为平移不变性先验满足这样的性质,即分配给任何区间 的概率质量与分配给任何其他相同宽度平移区间(例如 )的概率质量相同。也就是说,
这可以使用下式来实现:
因为:
这与具有未知均值 和固定方差的高斯分布 Jeffreys 先验相同。这是因为 ,根据式 (5),因此 。
尺度不变性先验
在推断尺度参数 时,我们可能希望使用尺度不变性先验(scale-invariant prior)。尺度不变性先验的性质满足分配给任何区间 的概率质量与分配给任何其他区间 的概率相同,其中 $c>0$。也就是说,
这可以使用下式来实现:
于是:
这与具有固定均值 和未知尺度 的高斯分布 Jeffreys 先验相同。这是因为 ,根据式 (5),因此 。
学习不变性先验
只要已知希望模型满足的某种不变性,那么我们就可以使用这种不变性来编码相应的先验。在某些情况下,可以通过解析方法来完成。当无法采用解析方法来求解时,可以通过求解变分优化问题来学习不变性先验。
参照先验
定义无信息性先验的一种方法是,当在数据集上进行平均时,将其定义为与所有可能的后验相距最远的分布。这是参照先验(reference prior)的基本思想。更准确地说,我们称 是一个参照先验,如果该先验最大化了后验和先验之间的预期 KL 散度:
其中,。这与最大化互信息 相同。
我们可以消除数据集上的积分,请注意:
其中,我们使用了 这一事实。
可以证明,在一维数据中,相应的先验等价于 Jeffreys 先验。在更高的数据维度中,我们可以使用链式法则一次计算一个参数的参照先验。然而,其计算可能会比较复杂。