极大似然估计——统计推断的参数估计方法
极大似然估计
极大似然估计(Maximum Likelihood Estimation, MLE)又称最大似然估计,是一种利用给定样本观测值来评估模型参数的方法,其基本原理为:利用已知的样本结果信息,反推最具有可能(最大概率)导致这些样本结果出现的模型参数值。
分两种情况介绍极大似然估计的方法和步骤。
- 离散型总体
设离散型总体XXX的分布律为
P(X=x)=p(x;θ), P\left(X=x\right) = p\left(x; \theta\right), P(X=x)=p(x;θ),
其中θ∈Θ\theta \in \varThetaθ∈Θ为未知参数,Θ\varThetaΘ为θ\thetaθ的所有可能取值范围(称为参数空间),则对于给定的样本观测值x1,x2,⋯ ,xnx_1, x_2, \cdots, x_nx1,x2,⋯,xn,样本的联合分布律为
P(X1=x1,X2=x2,⋯ ,Xn=xn)=∏i=1np(xi;θ). P\left(X_1 = x_1, X_2 = x_2, \cdots, X_n = x_n\right) = \prod_{i=1}^{n} p\left(x_i; \theta\right). P(X1=x1,X2=x2,⋯,Xn=xn)=i=1∏np(xi;θ).
称L(θ)L\left(\theta\right)L(θ)为似然函数,它是未知参数θ\thetaθ的函数。
- 连续型总体
设连续型总体XXX的概率密度函数为f(x;θ)f\left(x; \theta\right)f(x;θ),其中θ∈Θ\theta \in \varThetaθ∈Θ为未知参数,Θ\varThetaΘ为θ\thetaθ的所有可能取值范围(称为参数空间),则对于给定的样本观测值x1,x2,⋯ ,xnx_1, x_2, \cdots, x_nx1,x2,⋯,xn,样本的联合概率密度为∏i=1nf(xi;θ)\prod_{i=1}^{n} f\left(x_i; \theta\right)∏i=1nf(xi;θ),从而随机变量XiX_iXi落在点xix_ixi的邻域(其半径为Δxi\Delta x_iΔxi)内的概率可近似为
∏i=1nf(xi;θ)Δxi. \prod_{i=1}^{n} f\left(x_i; \theta\right) \Delta x_i. i=1∏nf(xi;θ)Δxi.
当xi(i=1,2,⋯ ,n)x_i \left(i=1,2,\cdots,n\right)xi(i=1,2,⋯,n)取定时,它是θ\thetaθ的函数,记为L(θ)L\left(\theta\right)L(θ),称
L(θ)=∏i=1nf(xi;θ)Δxi,θ∈Θ L\left(\theta\right) = \prod_{i=1}^{n} f\left(x_i; \theta\right) \Delta x_i, \theta \in \varTheta L(θ)=i=1∏nf(xi;θ)Δxi,θ∈Θ
为似然函数。由于Δxi(i=1,2,⋯ ,n)\Delta x_i \left(i=1,2,\cdots,n\right)Δxi(i=1,2,⋯,n)与θ\thetaθ无关,故似然函数常取为
L(θ)=∏i=1nf(xi;θ),θ∈Θ. L\left(\theta\right) = \prod_{i=1}^{n} f\left(x_i; \theta\right), \theta \in \varTheta. L(θ)=i=1∏nf(xi;θ),θ∈Θ.
极大似然估计法是,根据抽样得到的样本观测值x1,x2,⋯ ,xnx_1, x_2, \cdots, x_nx1,x2,⋯,xn来选取参数θ\thetaθ的值,使样本观测值出现的可能性最大,即使似然函数L(θ)L\left(\theta\right)L(θ)达到最大值,从而求得参数θ\thetaθ的极大似然估计θ^\hat{\theta}θ^。
定义 设总体的概率函数为 p(x;θ)p\left(x; \theta\right)p(x;θ),θ∈Θ\theta \in \varThetaθ∈Θ,其中 θ\thetaθ是一个未知参数或几个未知参数组成的参数向量,Θ\varThetaΘ是参数空间,x1,x2,⋯ ,xnx_1, x_2, \cdots, x_nx1,x2,⋯,xn是来自该总体的样本,将样本的联合概率函数看成 θ\thetaθ的函数,用 L(θ;x1,x2,⋯ ,xn)L\left(\theta; x_1, x_2, \cdots, x_n\right)L(θ;x1,x2,⋯,xn)表示,简记为 L(θ)L\left(\theta\right)L(θ),
L(θ)=L(θ;x1,x2,⋯ ,xn)=p(x1;θ)p(x2;θ)⋯p(xn;θ), L\left(\theta\right) = L\left(\theta; x_1,x_2, \cdots, x_n\right) = p\left(x_1; \theta\right)p\left(x_2; \theta\right)\cdots p\left(x_n; \theta\right), L(θ)=L(θ;x1,x2,⋯,xn)=p(x1;θ)p(x2;θ)⋯p(xn;θ),
L(θ)L\left(\theta\right)L(θ)称为样本的似然函数。若某统计量 θ^=θ^(x1,⋯ ,xn)\hat{\theta} = \hat{\theta}\left(x_1, \cdots, x_n\right)θ^=θ^(x1,⋯,xn)满足
L(θ^)=maxθ∈ΘL(θ), L\left(\hat{\theta}\right) = \max_{\theta \in \varTheta} L\left(\theta\right), L(θ^)=θ∈ΘmaxL(θ),
则称 θ^\hat{\theta}θ^是 θ\thetaθ的极大似然估计,简记为 MLE(maximum likelihood estimate)。
由于 lnx\ln xlnx是 xxx的单调增函数,因此,使对数似然函数 lnL(θ)\ln L\left(\theta\right)lnL(θ)达到最大与使 L(θ)L\left(\theta\right)L(θ)达到最大是等价的。人们通常更习惯于由 lnL(θ)\ln L\left(\theta\right)lnL(θ)出发寻找 θ\thetaθ的极大似然估计。当 L(θ)L\left(\theta\right)L(θ)是可微函数时,求导是求极大似然估计最常用的方法,此时对对数似然函数求导更加简单些。
当L(θ)L\left(\theta\right)L(θ)是可微函数时,要使L(θ)L\left(\theta\right)L(θ)取到最大值,θ\thetaθ必须满足方程
dL(θ)dθ=0, \dfrac{{\rm d}L\left(\theta\right)}{{\rm d}\theta} = 0, dθdL(θ)=0,
此方程称为似然方程。
而由于L(θ)L\left(\theta\right)L(θ)是nnn个函数的乘积,在求导时比较复杂,而lnL(θ)\ln L\left(\theta\right)lnL(θ)是L(θ)L\left(\theta\right)L(θ)的单调递增函数,lnL(θ)\ln L\left(\theta\right)lnL(θ)与L(θ)L\left(\theta\right)L(θ)在同一点处取得最大值,因此求解上述似然方程可以转化为求解方程
dlnL(θ)dθ=0, \dfrac{{\rm d}\ln L\left(\theta\right)}{{\rm d}\theta} = 0, dθdlnL(θ)=0,
这个方程称为对数似然方程。
当总体XXX的分布中有多个未知参数θ1,θ2,⋯ ,θm\theta_1, \theta_2, \cdots, \theta_mθ1,θ2,⋯,θm时,似然函数就是这些参数的多元函数L(θ1,θ2,⋯ ,θm)L\left(\theta_1, \theta_2, \cdots, \theta_m\right)L(θ1,θ2,⋯,θm),则相应地有对数似然方程组。
{∂lnL(θ1,θ2,⋯ ,θm)∂θ1=0,∂lnL(θ1,θ2,⋯ ,θm)∂θ2=0,⋮∂lnL(θ1,θ2,⋯ ,θm)∂θm=0, \begin{cases} \dfrac{\partial \ln L\left(\theta_1, \theta_2, \cdots, \theta_m\right)}{\partial \theta_1} = 0, \\ \dfrac{\partial \ln L\left(\theta_1, \theta_2, \cdots, \theta_m\right)}{\partial \theta_2} = 0, \\ \vdots \\ \dfrac{\partial \ln L\left(\theta_1, \theta_2, \cdots, \theta_m\right)}{\partial \theta_m} = 0, \end{cases} ⎩
⎨
⎧∂θ1∂lnL(θ1,θ2,⋯,θm)=0,∂θ2∂lnL(θ1,θ2,⋯,θm)=0,⋮∂θm∂lnL(θ1,θ2,⋯,θm)=0,
由此方程组解得θ1,θ2,⋯ ,θm\theta_1, \theta_2, \cdots, \theta_mθ1,θ2,⋯,θm的极大似然估计值θ^1,θ^2,⋯ ,θ^m\hat{\theta}_1, \hat{\theta}_2, \cdots, \hat{\theta}_mθ^1,θ^2,⋯,θ^m.
综上,可得求极大似然估计的一般步骤:
(1) 写出似然函数L(θ)=L(x1,x2,⋯ ,xn,θ)L\left(\theta\right) = L\left(x_1, x_2, \cdots, x_n, \theta\right)L(θ)=L(x1,x2,⋯,xn,θ);
(2) 令dL(θ)dθ=0\dfrac{{\rm d}L\left(\theta\right)}{{\rm d}\theta} = 0dθdL(θ)=0或dlnL(θ)dθ=0\dfrac{{\rm d}\ln L\left(\theta\right)}{{\rm d}\theta} = 0dθdlnL(θ)=0,求出驻点;
(3) 判断并求出最大值点,用样本值代入是参数的极大似然估计值。
注:
(1) 当似然函数关于未知参数不可微时,只能按最大似然原理计算最大值点;
(2) 上述的一般步骤对含有多个未知参数的情形同样适用,只需将求导数变为求偏导数;
(3) 称dlnL(θ)dθ=0\dfrac{{\rm d}\ln L\left(\theta\right)}{{\rm d}\theta} = 0dθdlnL(θ)=0为对数似然方程,称∂lnL(θ1,θ2,⋯ ,θn)∂θi=0\dfrac{\partial \ln L\left(\theta_1, \theta_2, \cdots, \theta_n\right)}{\partial \theta_i} = 0∂θi∂lnL(θ1,θ2,⋯,θn)=0,i=1,2,⋯ ,ni=1,2,\cdots,ni=1,2,⋯,n为对数似然方程组。
极大似然估计的不变性原理 设θ^\hat{\theta}θ^是θ\thetaθ的极大似然估计,u=u(θ)u = u\left(\theta\right)u=u(θ)是θ\thetaθ的函数,且具有单值的反函数θ=θ(u)\theta = \theta\left(u\right)θ=θ(u),则u(θ^)u\left(\hat{\theta}\right)u(θ^)是u(θ)u\left(\theta\right)u(θ)的极大似然估计。
注 从极大似然估计的定义可以看出,若 L(θ)L\left(\theta\right)L(θ)与联合概率函数相差一个与 θ\thetaθ无关的比例因子,不会影响极大似然估计,因此,可以在 L(θ)L\left(\theta\right)L(θ)中剔去与 θ\thetaθ无关的因子。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)