指数分布在统计结构中占用重要地位,他得成员具有许多共同的重要性质,对这些性质的一般性讨论可以带来不少启发。
给定参数 η,关于 x 的指数族分布可以定义为以下形式的分布的集合:
p(x∣η)=h(x)g(η)exp{ηTu(x)}(1)
其中 x 可以是标量或矢量,它可以是离散的或连续的。η 则称为分布的自然参数,u(x) 是 x 的某个函数。函数 g(η) 可以解释为用来确保分布被归一化的系数,因此满足
g(η)∫h(x)exp{ηTu(x)}dx=1(2)
其中 x 若为离散变量,则积分改为求和。
首先考虑伯努利分布:
p(x∣μ)=Bern(x∣μ)=μx(1−μ)1−x(3)
将式 (3) 的右侧表示为对数的指数,可得
p(x∣μ)=exp{xlnμ+(1−x)ln(1−μ)}=(1−μ)exp{ln(1−μμ)x}(4)
与式 (1) 比较后,我们可以确定
η=ln(1−μμ)(5)
对 μ 进行求解可得 μ=σ(η),其中
σ(η)=1+exp(−η)1(6)
它又称为sigmoid 函数。因此,我们可以使用以下标准表达式来描述伯努利分布:
p(x∣η)=σ(−η)exp(ηx)(7)
这里使用了等式 1−σ(η)=σ(−η),其易由式 (6) 证得。与式 (1) 比较可得
u(x)=x(8)
h(x)=1(9)
g(η)=σ(−η)(10)
接下来考虑多项分布,对于单个观测 x,其形式为
p(x∣μ)=k=1∏Mμkxk=exp{k=1∑Mxklnμk}(11)
其中 x=(x1,⋯,xM)T。式 (11) 同样可以写成标准表达式:
p(x∣η)=exp(ηTx)(12)
其中 ηk=lnμk,并且我们定义 η=(η1,⋯,ηM)T。与式 (1) 比较可得
u(x)=x(13)
h(x)=1(14)
g(η)=1(15)
注意,参数 ηk 不是独立的,因为参数 μk 受到下式的约束:
k=1∑Mμk=1(16)
因此,对于给定的任意 M−1 个参数 μk,剩余参数的值被固定。在某些情况下,通过仅用 M−1 个参数表达分布,可以方便地去除这一约束。这可以通过使用关系式 (16) 将 μM 用剩余的 {μk}(其中 k=1,⋯,M−1)表示,从而留下 M−1 个参数来实现。请注意,这些剩余参数仍然受到下式的约束:
0⩽μk⩽1,k=1∑M−1μk⩽1(17)
利用约束式 (16),多项分布变为
exp{k=1∑Mxklnμk}=exp{k=1∑M−1xklnμk+(1−k=1∑M−1xk)ln(1−k=1∑M−1μk)}=exp{k=1∑M−1xkln(1−∑j=1M−1μjμk)+ln(1−k=1∑M−1μk)}(18)
现在我们确定了
ln(1−∑jμjμk)=ηk(19)
可以通过首先对式 (19) 两边的 k 求和,然后重新排列和反向代入来求解 k:
μk=1+∑jexp(ηj)exp(ηk)(20)
它又称为softmax 函数或归一化指数。因此在这种表示中,多项分布将采用以下形式:
p(x∣η)=(1+k=1∑M−1exp(ηk))−1exp(ηTx)(21)
这是带有参数向量 η=(η1,⋯,ηM−1)T 的指数族分布的标准形式。与式 (1) 比较可得
u(x)=x(22)
h(x)=1(23)
g(η)=(1+k=1∑M−1exp(ηk))−1(24)
最后考虑高斯分布。对于一元高斯分布,我们有
p(x∣μ,σ2)=(2πσ2)1/21exp{−2σ21(x−μ)2}(25)
=(2πσ2)1/21exp{−2σ21x2+σ2μx−2σ21μ2}(26)
经过一些简单的重排,就可以得到标准指数族分布的形式:
η=(μ/σ2−1/2σ2)(27)
u(x)=(xx2)(28)
h(x)=(2π)−1/2(29)
g(η)=(−2η2)1/2exp(4η2η12)(30)
指数族分布在参数估计时具有很实际的性质,即它天然给出最小充分统计量(这来源于费曼分解定理),做参数估计时,只需要保存充分统计量,不需要存全部原始数据,大数据场景极致节省内存。