Skip to main content
QUICK REVIEW

[論文レビュー] Selection Bias Correction and Eect Size Estimation under Dependence

Kean Ming Tan, Noah Simon|arXiv (Cornell University)|May 16, 2014
Statistical Methods and Inference参考文献 24被引用数 3
ひとこと要約

この論文は、大規模な仮説検定において一般的な仮定である検定統計量の独立性を仮定せずに、効果量推定における選択バイアスを是正する頻度主義推定量を提案する。シミュレーションおよび実際の遺伝子発現データにおいて、従来の手法よりも精度が向上し、特に依存性が強い状況でも有効である。これは、選択に起因するバイアスを補正するための条件付き期待値フレームワークを活用することで達成される。

ABSTRACT

We consider large-scale studies in which it is of interest to test a very large number of hypotheses, and then to estimate the eect sizes corresponding to the rejected hypotheses. For instance, this setting arises in the analysis of gene expression or DNA sequencing data. However, naive estimates of the eect sizes suer from selection bias, i.e., some of the largest naive estimates are large due to chance alone. Many authors have proposed methods to reduce the eects of selection bias under the assumption that the naive estimates of the eect sizes are independent. Unfortunately, when the eect size estimates are dependent, these existing techniques can have very poor performance, and in practice there will often be dependence. We propose an estimator that adjusts for selection bias under a recently-proposed frequentist framework, without the independence assumption. We study some properties of the proposed estimator, and illustrate that it outperforms past proposals in a simulation study and on two gene expression data sets.

研究の動機と目的

  • ゲノム研究やハイドロウプットデータ解析において一般的な、多数の仮説を同時に検定する状況における効果量推定における選択バイアスの問題に対処すること。
  • 実世界のデータではしばしば破綻するが、従来のバイアス補正手法が仮定している効果量推定値間の独立性を前提としない限界を克服すること。
  • 検定統計量の間の依存性を考慮するが、強い分布的仮定を必要としない頻度主義フレームワークを用いた効果量推定のための枠組みを構築すること。
  • 特に選択バイアスが単純推定値を著しく上昇させる状況において、棄却された仮説の効果量推定値の精度を向上させること。

提案手法

  • 選択イベントを条件とする頻度主義フレームワークに基づく選択バイアス補正手法を提案し、より大きな効果量推定値が選択されやすいという事実を補正する。
  • 検定統計量の同時分布を考慮することで、依存性下での真の効果量を推定するための条件付き期待値アプローチを用いる。
  • 多変量正規分布近似を用いて効果量推定値間の依存構造をモデル化し、推定値が相関している場合でも補正が可能であることを実現する。
  • 一般な依存構造下で、観測された検定統計量と選択結果を条件とした真の効果量の期待値を求めるべく推定量を導出する。
  • ベイズ的事前分布や再サンプリングに依存しないため、大規模な生物学的データ解析で一般的な頻度主義的文脈に適用可能である。
  • 2つの遺伝子発現データセットを用いたシミュレーション研究および実データ応用を通じて、推定量の性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1検定統計量が独立ではなく依存している場合、選択バイアスは効果量推定にどのように影響を与えるか?
  • RQ2効果量推定値間の独立性を仮定しない状況でも、頻度主義的推定量が選択バイアスを是正できるか?
  • RQ3現実的な依存構造下で、提案手法は既存のバイアス補正技術と比較してどのように性能を発揮するか?
  • RQ4相関のある検定統計量を有する実世界の遺伝子発現データにおいて、提案された推定量は良好な精度と被覆率を維持できるか?

主な発見

  • 提案手法は、依存性下での効果量推定における選択バイアスを顕著に低減し、シミュレーション研究において独立性を仮定する従来手法を上回る性能を示した。
  • テスト数が多く、検定統計量が相関している状況においても、真の効果量の被覆率が正確に保たれた。
  • 2つの実際の遺伝子発現データセットにおいて、提案手法は単純推定値および既存の補正済み推定値と比較して、より信頼性が高く、過大評価が少ない効果量推定値を生成した。
  • 提案手法は、ハイドロウプット生物学的データでよく観察される多様な依存構造に対して、頑健な性能を発揮した。
  • 特に検定統計量間に強い相関がある状況において、従来手法に比べて平均二乗誤差とバイアスの低減が顕著に改善された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。