Skip to main content
QUICK REVIEW

[论文解读] Nonparametric Empirical Bayes Estimation on Heterogeneous Data

Banerjee, Trambak, Luella Fu|arXiv (Cornell University)|Feb 28, 2020
Statistical Methods in Clinical Trials参考文献 61被引用 15
一句话总结

本文提出了非参数经验贝叶斯结构蒂威德(NEST)估计器,以解决在异质数据下大规模估计中的选择偏差问题,其中干扰参数(如方差)在各研究中变化。通过将蒂威德公式扩展为使用核化斯丁差异来非参数地建模未知先验,NEST 在加权平方误差损失下实现了渐近最优性,并在模拟和真实应用场景(如棒球击球率与共同基金夏普比率)中优于现有方法。

ABSTRACT

The simultaneous estimation of many parameters based on data collected from corresponding studies is a key research problem that has received renewed attention in the high-dimensional setting. Many practical situations involve heterogeneous data where heterogeneity is captured by a nuisance parameter. Effectively pooling information across samples while correctly accounting for heterogeneity presents a significant challenge in large-scale estimation problems. We address this issue by introducing the ``Nonparametric Empirical Bayes Structural Tweedie" (NEST) estimator, which efficiently estimates the unknown effect sizes and properly adjusts for heterogeneity via a generalized version of Tweedie's formula. For the normal means problem, NEST simultaneously handles the two main selection biases introduced by heterogeneity: one, the selection bias in the mean, which cannot be effectively corrected without also correcting for, two, selection bias in the variance. We develop theory to show that NEST is asymptotically as good as the optimal Bayes rule that uniquely minimizes a weighted squared error loss. In our simulation studies NEST outperforms competing methods, with much efficiency gains in many settings. The proposed method is demonstrated on estimating the batting averages of baseball players and Sharpe ratios of mutual fund returns. Extensions to other members of the two-parameter exponential family are discussed.

研究动机与目标

  • 解决在研究单元间干扰参数(如方差)异质时,大规模估计中的选择偏差问题。
  • 开发一种非参数经验贝叶斯估计器,能够处理变化的异质性,而无需假设已知或相同的干扰参数。
  • 在异方差条件下,相对于最小化加权平方误差损失的贝叶斯规则,实现渐近最优性。
  • 在模拟和涉及异质数据的真实世界应用中,优于现有的收缩与经验贝叶斯方法。
  • 通过灵活且数据驱动的方法,将蒂威德公式扩展至具有未知干扰参数的两参数指数族。

提出的方法

  • 提出 NEST 估计器作为蒂威德公式的广义扩展,通过引入核化斯丁差异来估计效应大小与干扰参数的联合先验分布。
  • 采用凸优化框架,通过惩罚似然方法估计非参数先验,其中平滑参数 λ 控制拟合与平滑之间的权衡。
  • 使用基于核的得分函数估计器,近似对数边际密度的导数,从而高效计算结构化蒂威德调整。
  • 将该方法应用于正态均值问题和威布尔尺度混合分布,推导出在已知与未知干扰参数下 NEST 估计器的显式形式。
  • 针对干扰参数未知的情形,实施一种迭代估计策略,通过经验贝叶斯原理交替进行主要参数与干扰参数的收缩。
  • 通过模拟和真实数据(包括棒球击球率与共同基金夏普比率)验证该方法,证明其在异方差条件下的稳健性能。

实验结果

研究问题

  • RQ1非参数经验贝叶斯方法能否在存在各向异方差的大规模估计问题中有效校正选择偏差?
  • RQ2在异方差条件下,NEST 估计器与现有收缩与经验贝叶斯方法相比,在偏差校正与均方误差方面表现如何?
  • RQ3NEST 估计器在加权平方误差损失下,相对于理论贝叶斯规则,在多大程度上实现了渐近最优性?
  • RQ4能否通过非参数先验,将广义蒂威德公式扩展至具有未知干扰参数的两参数指数族?
  • RQ5与其它非参数最大似然估计器(NPMLE)相比,NEST 在高维设置下的计算可扩展性如何?

主要发现

  • NEST 实现了渐近最优性,收敛于在真实未知先验分布下最小化加权平方误差损失的贝叶斯规则。
  • 在模拟中,NEST 一致优于竞争方法,包括线性收缩与阈值估计器,在异方差条件下表现出显著的效率提升。
  • 该方法能同时有效校正均值与方差的选择偏差,而这些偏差在传统估计器中常被混淆。
  • NEST 在真实数据上表现出强劲的实证性能:其对棒球运动员击球率与共同基金夏普比率的估计精度优于基准方法。
  • 尽管计算复杂度较高(由于 Hessian 矩阵评估导致 O(n³)),NEST 在中等规模问题中仍具竞争力,未来工作将聚焦于通过一阶方法加速优化。
  • 将方法扩展至威布尔尺度混合分布及其他两参数指数族是可行的,当充分统计量可用时,可获得闭式估计器。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。