QUICK REVIEW
[论文解读] Parameter Estimation from Censored Samples using the Expectation-Maximization Algorithm
Chanseok Park, Seong Beom Lee|arXiv (Cornell University)|Mar 17, 2012
Statistical Distribution Estimation and Applications参考文献 14被引用 3
一句话总结
本文提出使用期望最大化(EM)和蒙特卡洛期望最大化(MCEM)算法,从右删失数据中进行最大似然估计,特别适用于正态分布、拉普拉斯分布和瑞利分布。该方法通过迭代填补删失值并更新参数,有效处理因删失导致的缺失数据,无论初始值如何,均能获得准确且稳定的估计,且收敛于最大似然估计(MLE)。
ABSTRACT
This paper deals with parameter estimation when the data are randomly right censored. The maximum likelihood estimates from censored samples are obtained by using the expectation-maximization (EM) and Monte Carlo EM (MCEM) algorithms. We introduce the concept of the EM and MCEM algorithms and develop parameter estimation methods for a variety of distributions such as normal, Laplace and Rayleigh distributions. These proposed methods are illustrated with three examples.
研究动机与目标
- 解决在标准数值优化因对初始值敏感而失效时,删失寿命数据中参数估计的挑战。
- 克服现有方法(如最佳线性无偏估计(BLUE)和近似MLE)的局限性,这些方法仅适用于特定类型的删失,且无法收敛至真实的MLE。
- 开发一个通用框架,利用EM和MCEM算法,适用于多种分布的I型(包括随机)和II型删失。
- 展示所提算法在不同初始值和分布假设下的稳健性与收敛性。
- 为直接似然最大化提供一种计算上可行且准确的替代方案,尤其适用于复杂或高维模型。
提出的方法
- 使用(w_i, δ_i)表示法构建右删失样本的观测数据似然,其中w_i = min(x_i, R_i),δ_i表示失效是否发生在删失之前。
- 应用EM算法,将删失观测视为缺失数据,通过迭代计算完整数据对数似然的期望并最大化,以更新参数估计。
- 对于E步涉及难以解析计算的积分的分布(如正态分布、拉普拉斯分布),采用MCEM变体,通过蒙特卡洛抽样近似期望步骤。
- 通过基于模拟的E步(使用逆变换抽样)实现截断正态和拉普拉斯分布的删失值生成,从而在当前参数估计下实现删失值的模拟。
- 采用迭代更新:对正态分布,通过条件期望更新均值和方差;对拉普拉斯分布,通过经验矩更新位置和尺度参数;对瑞利分布,通过重要性抽样实现MCEM的尺度参数更新。
- 通过监控对数似然和参数稳定性来确保收敛,EM算法通常在10–15次迭代内收敛,MCEM算法在5–10次迭代内收敛。
实验结果
研究问题
- RQ1当直接优化因初始值不佳或似然函数平坦而失败时,EM和MCEM算法能否为删失数据提供一致且准确的最大似然估计?
- RQ2在I型和II型删失样本中,EM/MCEM算法与BLUE或近似MLE等现有方法相比,在收敛性和准确性方面表现如何?
- RQ3MCEM算法在不同分布(正态、拉普拉斯、瑞利)下对初始参数值选择的鲁棒性如何?
- RQ4MCEM算法能否通过蒙特卡洛近似处理E步中存在难以解析计算积分的复杂似然函数?
- RQ5EM和MCEM算法在不同参数分布的删失数据中的收敛行为和计算效率如何?
主要发现
- EM和MCEM算法在正态、拉普拉斯和瑞利分布的删失数据中均能实现高精度的参数估计,且无论初始值如何,均能收敛至MLE。
- 在正态分布删失样本(N=10, r=7)中,通过EM/MCEM得到的MLE为μ̂ = 1.742,σ̂ = 0.079,纠正了Gupta(1952)先前报告的MLE错误。
- 在拉普拉斯分布示例中(N=20, r=18),MCEM得到的估计为μ̂ = 49.766,σ̂ = 4.688,比BLUE(μ̂ = 49.561,σ̂ = 4.813)更接近真实MLE。
- 在瑞利分布中(N=20, r=15),MCEM在不同初始值下均收敛至β̂ = 6.132–6.133,与MLE值6.134非常接近。
- MCEM算法表现出快速收敛(5–15次迭代)且对初始值不敏感,结果稳定至小数点后三位。
- 基于模拟的E步(使用逆变换抽样)能够准确近似删失数据的填补,验证了MCEM方法在指数族以外分布中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。