NO.3.tip: 最大似然估计

背景

  最大似然估计是统计中的一个重要理论框架,作为一门优化技术,他用最朴素的表达--凸优化--描绘了机器学习的万里长卷

源与流

  首先,我们了解一下什么是似然函数。考虑上的一族概率分布,每个概率分布对应一个向量,概率密度为。固定可以看成的函数,成为似然函数。事实上,考虑似然函数的对数更为方便,我们称为对数-似然函数,用表示,即 通常对参数都有一些曰肃,可以作为x的先验知识,或者是似然函数的定义域。

  现在考虑如下问题,根据观测到的服从分布的一个样本,估计参数的值。最大似然估计就是一种广为采用的方法,其中参数的估计为 即选择使得似然(或者对数似然)函数在的观测值处最大的那个参数值作为的估计只。如果我们有关于的先验信息,比如说,我们可以显示添加约束,或者隐式添加约束,当时,定义

  求取参数向量的最大似然估计问题可以表述如下: 其中给出了参数向量的先验信息或者其他约束。在这个优化问题中,向量(在概率密度中是参数)是优化变量,向量(观测到样本)是问题参数。

  对于的每个观测值,如果对数-似然函数都是凹的,且集合可以表述为线性等式约束以及凸不等式约束的组合,那么最大似然估计问题是凸优化问题。事实上,很多这一类问题都满足这个条件。对这些问题,可以通过凸优化确定最大似然估计。

  现在,我们已经清楚了最大似然估计的优化表达,如何应用到具体算法场景中呢?不要着急,我们需要加入一个叫(独立同分布)的假设,才能让足底啊似然估计真正落地。

  考虑线性测量模型 其中,是待估计参数向量,是测量量或观测量,是测量误差或者噪声。假设独立同分布,在上具有概率密度,此时似然函数为 因此对数-似然函数为 最大似然估计是下面优化问题的任意一个最优点: 其中优化变量为。如果概率密度是对数-凹的,此优化问题是凸优化问题。

  在有了假设后,我们还不能去优化似然函数,因为其中的概率分布还没有明确的解析表达。接下来,我们通过为噪声指定具体分布的方式来确定似然函数的明确解析表达,进而凸优化问题可解。常见的分布有以下两种:

  Gauss噪声:当是Gauss噪声,均值为,方差为时,概率密度函数为,则对数-似然函数为: 其中矩阵的行向量为。因此的最大似然估计为,也即范数逼近问题的解。

  Laplace噪声:当服从Laplace分布时,即具有概率密度,其中的最大似然估计为,也即范数逼近问题的解。

  在这里,我们也可以从最大似然估计的角度理解范数逼近在大误差情况下的鲁棒性。可以将范数逼近问题看成是概率密度函数是Laplace函数的最大似然估计;范数逼近问题可以看成是噪声服从Gauss分布的最大似然估计。Laplace密度函数比Gauss密度函数具有更大的截尾,即对于Laplace密度函数,取值很大的概率远远大于Gauss密度函数的情况。因此,相应的最大似然估计方法将会接收更多大残差。