NO.8.tip: 核密度估计

背景

  参数话的密度估计方法的一个关键局限是,所选择的密度模型可能是不适合数据分布的,这可能导致预测性能不佳。而非参数化的密度估计方法对分布的形式几乎不作任何假设。

  直方图是非参数的一个良好灵感来源。标准直方图简单将 划分为互不相交的宽度为 的分箱,然后计算落在不同分箱中的观测值 的数量 。为了将此计数值转换为归一化的概率密度,我们可以将其简单地除以观测值总数 和分箱宽度 的乘积,以获得落入每个分箱的概率值:

可以看出,。这种方法就给出了密度 的一种模型,在每个分箱的宽度上,密度是恒定的。通常情况下,我们选择具有相同宽度的分箱,

  直方图方法也给密度估计带来了两条重要的经验。首先,要在特定位置估计概率密度,就应该考虑落在该位置某个局部邻域内的数据点。其次,为了获得良好的结果,平滑参数的值既不应该太大也不应该太小。

  假设观测值是从某个 维空间(这里将其视为欧氏空间)中的某个未知概率密度 中产生的,我们希望估计 的值。根据先前关于局部性的讨论,考虑包含 的一个小区域 。与该区域相关联的概率质量为

  假设我们已经收集了一个包含 个从 中产生的观测值的数据集。因为每个数据点在 内的概率为 ,所以 内的点的总数 将服从二项分布:

  可以看出,落入该区域的点的平均占比为 。类似地,可以看出,此均值对应的方差为 。对于较大的 ,该分布在均值处将变得十分尖锐,因此

  然而,如果我们同时假设区域 足够小,以至于概率密度 在该区域内大致保持恒定,则有

  其中 是区域 的体积。结合式 (4) 和式 (5),可以得到密度估计的形式为

  请注意,式 (6) 的有效性依靠两个相互矛盾的假设:区域 足够小,以至于密度在该区域内近似恒定;但区域 又足够大(与该区域内密度的值相关),使得落入该区域的点的数量 足以使二项分布变得十分尖锐。

  我们可以通过两种不同的方式利用式 (6)。一种是固定 并根据数据确定 的值,这将引出后面讨论的 近邻技术;另一种是固定 并根据数据确定 的值,从而引出核密度估计技术。可以证明,当 时,只要 随着 以合适的速率缩小,而 随着 以合适的速率增长, 近邻密度估计和核密度估计都会收敛到真实概率密度。

源与流

  下面详细讨论核密度估计技术。首先,对于希望确定概率密度的点 ,将区域 取为以点 为中心的超小立方体。为了计算落入该区域的点的数量 ,定义如下函数:

  它表示以原点为中心的单位立方体。函数 是一个核函数,在这里,它又称为 Parzen 窗。根据式 (7),如果数据点 位于以点 为中心、边长为 的立方体内,那么量 将为 1,否则为 0。因此,位于该立方体内的数据点的总数为

  将式 (8) 代入式 (6),可得点 处估计的密度为

  这里使用了 维空间中超小立方体的体积公式 。利用函数 的对称性,我们可以不再将其视为以点 为中心的单个立方体,而是视为以 个数据点 为中心的 个立方体的总和,进而重新解释这个方程。

  就目前情况来看,核密度估计 [式 (9)] 将遇到与直方图方法相同的一个问题,即存在人为的不连续性,此处体现在立方体的边界上。如果我们选择更平滑的核函数,则可以获得更平滑的密度模型。我们通常选择使用高斯函数,导出的核密度模型为

  其中 代表所使用的高斯分量的标准差。因此,我们得到密度模型的方式是,首先在每个数据点上放置一个高斯分布,并将整个数据集的贡献相加,然后除以 来正确地归一化密度。正如预期的那样,我们可以看到参数 充当了平滑参数的角色,并且 较小时对噪声敏感,与 较大时过度平滑之间存在权衡。同样,类似于直方图密度估计中的分箱选择或曲线拟合中所使用多项式的阶数选择, 的优化是模型复杂性的问题。

  我们可以选择任何其他核函数 ,只要满足以下两个条件即可。

  这两个条件确保了得到的概率分布在任何地方都是非负的,并且积分为 1。由式 (9) 给出的这类密度模型称为核密度估计器Parzen 估计器。它们有一个很大的优点,就是在"训练"阶段不涉及计算,因为只需要将训练集存储起来即可。然而,这同时也是这类密度模型的一个巨大缺点,因为评估密度的计算成本会随着数据集的增大而线性增长。