NO.9.tip: K近邻密度估计
背景
使用核方法进行密度估计的一个难点在于,对所有核来说控制核宽度的参数 是固定的。在数据密度较高的区域,较大的 值可能导致过度平滑,并且可能淡化从数据中本应提取出的结构。然而,减小 值可能会导致在其他数据密度较低的区域产生噪声估计。因此, 的最佳选择可能取决于数据空间中的位置。这个问题可以通过使用最近邻方法进行密度估计来解决。
源与流
因此,下面我们重新回到局部密度估计的一般结果:
我们不使用固定 值并从数据中确定 值的方式,而是考虑固定 值并使用数据找到适当的 值。为此,对于希望估计密度 的点 ,考虑以点 为中心的小球,并允许小球的半径增长,直至恰好包含 个数据点。然后,密度 的估计由式(1)给出,其中 设置为小球的体积。这种技术称为 近邻。
相同数据集下,我们可以选择不同参数 时的 近邻密度估计。我们可以看到 值决定了模型的平滑程度,而且同样存在一个既不太大也不太小的最佳 值。注意 近邻产生的模型并不是一个真正的密度模型,因为其在整个空间上的积分是发散的。