NO.5.tip: 变分推理
背景
数学上,变分法就是求使积分泛函取极值的未知函数,相当于函数版的求导找最值。统计上,考虑一个具有未知(潜在)变量 、已知变量 和固定参数 的模型。(如果参数未知,可以将这些参数添加到 中,稍后我们将展开讨论。)我们假设先验为 ,似然为 ,因此未归一化联合概率为 ,后验为:
由于我们在函数(即分布 )上最小化,所以这被称为变分方法。在实践中,我们选择一个参数族 ,在此处我们使用 ,称为变分参数,来指定我们使用的是族中的哪一个成员。对于给定的 ,我们可以使用以下公式来计算最佳变分参数:
一般而言,最后一项 难以计算。幸运的是,该项独立于 ,因此我们可以忽略该项。结果,我们留下了第一个项,可以记作:
最小化这个目标将最小化 KL 散度,使我们的近似接近真正的后验。
源与流
因为KL散度非负,则
第一项的负值被称为证据下界函数:
"证据下界"这个名字的产生是因为:
其中, 被称为"证据"。因此,最大化相对于 的证据下界将最小化原始 KL 散度,因为 相对于 是一个常数。(请注意:我们使用符号 来表示证据下界,而不是 ,因为我们希望最大化 ,但最小化 。)
我们可以将证据下界重写如下:
我们可以将其解释为:
证据下界 = 期望对数联合概率 + 熵
第二项鼓励后验具有最大熵,而第一项鼓励后验成为联合最大后验估计配置。
我们也可以将证据下界重写为:
我们可以将其解释为:
证据下界 = 期望对数似然 - 从后验到先验的 KL 散度
KL 散度项的作用就像一个正则化因子,用于防止后验与先验偏离过多。
存在有两种主要的方法来选择变分后验 的形式。在第一种方法中,我们选择一种方便的函数形式,例如多元高斯分布,然后使用基于梯度的方法优化证据下界。这被称为固定形式变分推理。另一种方法是进行均值场假设,即后验因子分解:
其中, 是第 组变量的后验。我们不需要为每个 指定函数形式。相反,通过以坐标上升的方式,一次一个地最大化相对于每组变分参数的证据下界,来推导出最优分布形式。因此,这被称为自由形式变分推理。
下界最大化(即标准变分推理)存在的一个问题是,我们正在最小化 ,这会导致迫零性行为,这意味着 往往过于紧凑(过于自信),以避免 但 的情况,这将导致无限的 KL 惩罚。
尽管迫零性对于一些多模态后验(例如,混合模型)来说可能是理想的行为,但对于许多单模态后验来说(例如,贝叶斯逻辑回归或者具有对数凹似然的高斯过程)就不那么合理了。避免这个问题的一种方法是最小化 ,这是避零性,这往往会导致广泛的后验分布,从而避免过度自信。在本节中,我们讨论期望传播。期望传播可以被视为 的局部近似。