Skip to main content
QUICK REVIEW

[論文レビュー] Large-scale interval and point estimates from an empirical Bayes extension of confidence posteriors

David R. Bickel|arXiv (Cornell University)|Dec 29, 2010
Gene expression and cancer classification参考文献 30被引用数 10
ひとこと要約

本稿は、信頼区間分布と局所発見誤り率(LFDR)推定値を統合することで、高次元の生物学的データにおける縮約型区間推定と点推定を実現する、信頼区間後度の半パラメトリックな経験ベイズ拡張を提案する。LFDRに基づく縮約と頻度主義的カバレッジ性を組み合わせることで、名目水準を上回る頻度で真のパラメータをカバーする、より短く正確な信頼区間が得られ、ゲノム研究やバイオインフォマティクスにおける特徴の優先順位付けが向上する。

ABSTRACT

The proposed approach extends the confidence posterior distribution to the semi-parametric empirical Bayes setting. Whereas the Bayesian posterior is defined in terms of a prior distribution conditional on the observed data, the confidence posterior is defined such that the probability that the parameter value lies in any fixed subset of parameter space, given the observed data, is equal to the coverage rate of the corresponding confidence interval. A confidence posterior that has correct frequentist coverage at each fixed parameter value is combined with the estimated local false discovery rate to yield a parameter distribution from which interval and point estimates are derived within the framework of minimizing expected loss. The point estimates exhibit suitable shrinkage toward the null hypothesis value, making them practical for automatically ranking features in order of priority. The corresponding confidence intervals are also shrunken and tend to be much shorter than their fixed-parameter counterparts, as illustrated with gene expression data. Further, simulations confirm a theoretical argument that the shrunken confidence intervals cover the parameter at a higher-than-nominal frequency.

研究の動機と目的

  • 高次元推定における一貫性のある区間推定の欠如、特に発見誤り率(FDR)および局所FDR(LFDR)推定の問題に対処すること。
  • LFDR推定の背後にある階層モデルに整合する縮約型点推定および区間推定を提供する方法を開発すること。ただし、強いパラメトリック仮定を必要としないこと。
  • LFDR情報を組み込んだ信頼区間後度から導かれる後度中央値を用いて、ゲノム分野における特徴の優先順位付けを改善すること。
  • 信頼区間後度フレームワークを活用することで、短い信頼区間であっても頻度主義的カバレッジ性が保持または向上することを保証すること。
  • 高次元設定において不確実性と縮約を反映しない従来の信頼区間および点推定の代替手段を提供すること。

提案手法

  • 信頼区間後度は、ネストされた信頼区間のカバレッジ確率によって定義されるが、これを経験ベイズ枠組みに拡張し、推定されたLFDRを重みとして用いる。
  • 各パラメータ $ \theta_i $ に対して、マージナル信頼区間後度 $ \hat{P}^{(i)} $ を構築し、信頼区間分布と推定されたLFDR $ \hat{\ell}_i $ を統合する。
  • $ \hat{P}^{(i)} $ の後度中央値を、パラメータ変換に対して不変な縮約型点推定として用いる。これは統計的有意性に適応する。
  • 信頼区間は後度中央値を中心に構築され、帰無仮説方向に縮約され、固定パラメータの区間と比較して幅が小さくなる。
  • 理論的導出とシミュレーションにより、縮約型区間のカバレッジ率が名目水準を上回ることが確認された。
  • 完全に指定された事前分布に依存しないように、半パラメトリックな経験ベイズ設定においてLFDR推定値を事前情報の代理として用いる。

実験結果

リサーチクエスチョン

  • RQ1信頼区間後度を経験ベイズ設定に拡張することで、高次元生物学的データにおける一貫性のある、縮約型の区間推定と点推定を実現できるか?
  • RQ2区間幅が短くなったにもかかわらず、得られた信頼区間が名目カバレッジ率を維持または上回るか?
  • RQ3拡張された信頼区間後度の後度中央値が、特徴の優先順位付けのための信頼性が高く、パラメータ変換に対して不変な基準として適しているか?
  • RQ4推定精度と区間幅の観点から、本手法は従来の信頼区間および点推定と比較して、どの程度優れているか?
  • RQ5相関性と高次元性が存在する状況下でも、LFDR推定値を統合することで、区間推定の信頼性がどの程度向上するか?

主な発見

  • シミュレーションにより、提案された信頼区間後度から得られる縮約型信頼区間が、名目水準95%を上回る頻度で真のパラメータ値をカバーすることが確認された。
  • 信頼区間後度の後度中央値は、頑健でパラメータ変換に対して不変な点推定であり、真のパラメータ値を的確に捉えるか、それに近い値を達成する。
  • マージナル信頼区間後度 $ \hat{P}^{(i)} $ を用いた信頼区間は、固定パラメータの区間と比較して顕著に短く、カバレッジ性は維持または向上している。
  • 本手法は、パラメータ分布に関する強いパラメトリック仮定を必要とせず、LFDR推定値を頻度主義フレームワークに統合するのに成功した。
  • 遺伝子発現データにおいて、本手法は縮約推定値を中心に据えた、より短く情報量の多い信頼区間を生成し、特徴の優先順位付けを向上させた。
  • 本手法は、LFDRを後度確率として解釈する落とし穴を回避しており、LFDR推定値が保守的であることを認識し、絶対的確実性として扱わないことを重視している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。