NO.32.tip: Probit回归

背景

我们将讨论 probit 回归,该回归类似于二元逻辑回归,只是 probit 回归使用 而不是 作为均值函数,其中 是标准正态分布的累积分布函数,。因此,对应的链接函数为 ;高斯分布的累积分布函数的逆函数被称为 probit 函数

高斯分布的累积分布函数 与逻辑函数非常相似。因此,probit 回归和"正则"逻辑回归表现得非常相似。然而,probit 回归有一些优点。特别是,probit 回归作为一个潜在变量模型,有一个简单的解释,即源于经济学研究的选择理论。这也简化了贝叶斯参数推理的任务。

源与流

潜在变量解释

我们可以将 解释为这样一个因子:对于给定的输入 ,该因子与我们对输入积极响应(即生成 )的可能性成一定的比例。然而,通常还有其他未观察到的因子会影响个人的反应。让我们使用高斯噪声 对这些隐藏因子进行建模。假设对积极结果的组合偏好由潜在变量 表示。只有当这个潜在因子是正值而不是负值时,才会选择积极标签。即,

当我们将 边缘化时,我们得到了 probit 模型:

因此,我们可以将 probit 回归视为应用于噪声输入的阈值函数。

我们可以使用同样的方式来解释逻辑回归。然而,在这种情况下,噪声项 来自逻辑分布(logistic distribution),其定义如下:

其中,均值为 ,方差为 。该分布的累积分布函数由下式给出:

很显然,如果我们使用 的逻辑噪声,我们就可以得到逻辑回归。然而,处理高斯噪声在计算上更加容易,接下来将展开讨论。

最大似然估计

使用随机梯度下降的最大似然估计

我们可以使用标准梯度方法寻找到 probit 回归的最大似然估计。设 ,则单个样例 的对数似然的梯度由下式给出:

其中, 是标准正态分布的概率密度函数, 是概率密度函数的累积分布函数。类似地,单个样例的海森矩阵由下式给出:

这可以传递给任何基于梯度的优化器。

使用期望最大化的最大似然估计

我们可以使用 probit 回归的潜在变量解释,推导出一个期望最大化算法来拟合模型。

假设在 上有一个先验分布 ,完全数据对数似然具有以下形式:

期望步骤中的后验分布是一个截断的高斯概率分布(truncated Gaussian):

在式 (7) 中,我们发现, 仅线性地依赖于 ,所以我们只需要计算 ,也就是说仅需要计算后验均值。可以证明,其计算公式为:

其中,

在最大化步骤中,我们使用岭回归来估计 ,其中 是我们试图预测的输出。具体来说,我们有:

期望最大化算法很简单,但可能比直接梯度法慢得多,如图 15-12 所示。这是因为期望步骤中的后验熵相当高,因为我们只观察到 是正值还是负值,但没有给出关于其大小的似然信息。使用更强的正则化因子可以帮助加快收敛速度,因为这种方法限制了看似合理的 值的范围。此外,还可以使用各种加速技巧,例如数据增强方法。

贝叶斯推理

可以使用 probit 回归的潜在变量公式,来推导用于近似后验 的简单吉布斯采样算法。

其关键思想是使用辅助潜在变量,在给定这个潜在变量的条件下,使得整个模型成为共轭线性高斯模型。潜在变量的完全条件由下式给出:

因此,后验是截断的高斯分布。我们可以从截断高斯 中分两步进行采样:第一次采样 ,然后设置

参数的完全条件由下式给出:

也可以使用变分贝叶斯,其速度往往要快得多。

有序probit回归

probit 回归潜在变量解释的一个优点是,可以很容易扩展到响应变量以某种方式排序的情况,例如输出低、中和高。这被称为有序回归(ordinal regression)。其基本思想如下:如果有 个输出值,我们引入 个阈值 并设置

其中,。出于可识别性的原因,我们设置 。例如,如果 ,这将简化为标准的二元 probit 模型,其中当 $z_n < 0$ 时,;当 时,。如果 ,我们将实数线上的数据划分为 3 个区间:。我们可以通过改变参数 来确保每个区间中概率质量下降的相对量正确,从而匹配每个类别标签的经验频率。

由于我们需要对 进行优化,并且后者必须服从排序约束,因此寻找到该模型的最大似然估计比二元 probit 回归要困难一些。例如,关于基于期望最大化的方法。也可以推导出该模型的简单吉布斯采样算法。

多项式probit模型

现在考虑响应变量可以采用 个无序分类值的情况,即 。多项式 probit 模型定义如下:

为了了解更多有关该模型及其与多项式逻辑回归之间联系的信息。

如果使用 而不是设置 ,那么我们可以得到一个称为多元 probit(multivariate probit;又称为多变量 probit)的模型,这是对 相关的二元结果进行建模的一种方法。