Skip to main content
QUICK REVIEW

[论文解读] Empirical Bayes estimation of normal means, accounting for uncertainty in estimated standard errors

Mengyin Lu, Matthew Stephens|arXiv (Cornell University)|Jan 30, 2019
Statistical Methods and Inference参考文献 14被引用 7
一句话总结

本文提出了一种两阶段经验贝叶斯方法,用于在标准误估计存在不确定性时估计正态分布均值,解决了朴素t分布方法中的关键缺陷。通过首先对标准误应用经验贝叶斯收缩,然后求解经验贝叶斯t均值问题,该方法实现了可靠的点估计和区间估计,在低样本量情形下显著优于朴素或临时性替代方法,提升准确性和覆盖率。

ABSTRACT

We consider Empirical Bayes (EB) estimation in the normal means problem, when the standard deviations of the observations are not known precisely, but estimated with error -- which is almost always the case in practical applications. In classical statistics accounting for estimated standard errors usually involves replacing a normal distribution with a $t$ distribution. This suggests approaching this problem by replacing the normal assumption with a $t$ assumption, leading to an "EB $t$-means problem". Here we show that an approach along these lines can indeed work, but only with some care. Indeed, a naive application of this idea is flawed, and can perform poorly. We suggest how this flaw can be remedied by a two-stage procedure, which first performs EB shrinkage estimation of the standard errors and then solves an EB $t$-means problem. We give numerical results illustrating the effectiveness of this remedy.

研究动机与目标

  • 解决在标准误被估计而非已知时,朴素地将t分布应用于经验贝叶斯正态均值估计所存在的缺陷。
  • 开发一种系统性方法,正确地在经验贝叶斯框架中考虑估计标准误的不确定性。
  • 改进在标准误被估计的高维正态均值问题中,估计的准确性和可信区间覆盖率。
  • 证明两阶段方法——先对标准误进行收缩,再进行EB t均值分析——相比朴素或临时性方法能提供更可靠的推断。

提出的方法

  • 使用类似Smyth(2004)的分层模型,对估计的标准误应用经验贝叶斯收缩,以获得调整后的标准误和自由度。
  • 利用所得的调整后标准误和自由度,定义观测效应的t分布抽样模型:$\hat{\beta}_j \mid \beta_j, \hat{s}_j \sim t_{\nu_j}(\beta_j, \hat{s}_j)$。
  • 在经验贝叶斯t均值模型(EBTM)下进行经验贝叶斯推断,估计混合分布$g_\beta$,并计算后验分布$p(\beta_j \mid \hat{\beta}_j, \hat{s}_j, \hat{g}_\beta)$。
  • 利用后验分布计算点估计(例如后验均值)和$\beta_j$的可信区间,确保不确定性量化得当。
  • 通过模拟研究,将两阶段方法与朴素EB t均值方法及临时性方法(如p值转标准误)进行比较。
  • 使用相对均方根误差(RRMSE)和95%可信区间的经验覆盖率(按信号强度和样本量划分)评估性能。

实验结果

研究问题

  • RQ1在标准误被估计而非已知时,朴素地将正态似然替换为t分布,在经验贝叶斯正态均值估计中是否能产生有效的推断?
  • RQ2两阶段经验贝叶斯程序——先收缩标准误,再求解EB t均值问题——是否能显著提升估计准确性和覆盖率,优于朴素或临时性方法?
  • RQ3所提出方法的性能如何随样本量和效应分布形状(如尖峰型、双峰型、平顶型)而变化?
  • RQ4当标准误存在不确定性时,该方法在显著发现上是否能保持良好的可信区间覆盖率,尤其是对重要发现?
  • RQ5在标准误被估计的高维设置中,该方法能否在提升估计准确性的同时,可靠地控制错误发现率?

主要发现

  • 两阶段方法——先对标准误进行经验贝叶斯收缩,再进行EB t均值推断——在高零假设(低信号)情形下,RMSE相比未收缩估计最高可提升90%。
  • 朴素地应用EB t均值模型会导致推断失效,因为$(\hat{\beta}_j - \beta_j)/\hat{s}_j \mid \hat{s}_j$不遵循t分布,从而破坏模型有效性。
  • 当$N \geq 4$时,95%下可信界限的覆盖率通常令人满意;但当$N=2$时,覆盖率显著下降(例如在大正态情形中降至23%),表明尾部被过度收缩。
  • 临时性方法(VL+pval2se+ash)在FDR控制方面表现尚可,但估计准确性低于系统性的两阶段EBTM方法。
  • 对于两阶段方法,后选择覆盖率保持良好,表明其在聚焦于显著发现时仍具鲁棒性。
  • 该方法在低信号情形下保持保守行为,尽管为防止收缩不足,尾部的过度收缩在所难免。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。