Skip to main content
QUICK REVIEW

[論文レビュー] False Discovery Proportion control for aggregated Knockoffs

Alexandre Blain, Bertrand Thirion|arXiv (Cornell University)|Oct 16, 2023
Gene expression and cancer classificationBiochemistry, Genetics and Molecular Biology参考文献 27被引用数 3
ひとこと要約

本稿では、複数回のノックオフ抽出におけるπ統計量を調和平均による集約と共同誤差率(JER)キャリブレーションを用いて、脳イメージングおよびゲノムデータにおいて、既存手法よりも顕著なパワー向上を達成しつつ、厳密なFDP制御を実現する新規なノックオフベース手法KOPIを提案する。KOPIは、帰無分布に関する仮定を必要とせず、再現性を確保する。

ABSTRACT

Controlled variable selection is an important analytical step in various scientific fields, such as brain imaging or genomics. In these high-dimensional data settings, considering too many variables leads to poor models and high costs, hence the need for statistical guarantees on false positives. Knockoffs are a popular statistical tool for conditional variable selection in high dimension. However, they control for the expected proportion of false discoveries (FDR) and not their actual proportion (FDP). We present a new method, KOPI, that controls the proportion of false discoveries for Knockoff-based inference. The proposed method also relies on a new type of aggregation to address the undesirable randomness associated with classical Knockoff inference. We demonstrate FDP control and substantial power gains over existing Knockoff-based methods in various simulation settings and achieve good sensitivity/specificity tradeoffs on brain imaging and genomic data.

研究の動機と目的

  • 標準的なノックオフ手法が期待FDRのみを制御するのに対し、False Discovery Proportion(FDP)の制御が欠如している問題に対処する。
  • 各実行におけるノックオフのランダム生成が引き起こす不安定性および再現不能性を軽減する。
  • FDP制御を維持しつつ、既存の集約ベースのノックオフ手法よりも統計的パワーを向上させる。
  • 帰無仮説下でのノックオフ統計量がi.i.d.であると仮定しない任意の集約スキームに対してもロバストな手法を開発する。
  • 神経画像やゲノミクスなどの高次元設定において、信頼性があり再現可能で強力な条件付き変数選択を可能にする。

提案手法

  • 複数回のノックオフ抽出から得られるπ統計量を調和平均による集約を用いる新しい集約スキームを提案し、安定性とパワーを向上させる。
  • FDPの明示的上限を導出するために共同誤差率(JER)フレームワークを導入し、厳密なFDP制御を可能にする。
  • 二分探索によるキャリブレーションを用いて再帰的閾値を精緻化し、FDP制御を確保するとともにパワーを最大化する。
  • 帰無仮説下におけるノックオフ統計量の対称性を活用して、JERの有効なデータ駆動型上限を構築する。
  • e-BH手順フレームワークをπ統計量から得られる集約e値に適用し、堅牢にFDR制御を実現する。
  • [17]で提示されたπ統計量を変数重要度の順序付け基準として用い、複数回のノックオフ実現における集約を実施する。

実験結果

リサーチクエスチョン

  • RQ1FDR制御を代理指標として用いずに、ノックオフベース推論におけるFDP制御を達成できるか?
  • RQ2複数回のノックオフ抽出の集約が、高次元変数選択における再現性と統計的パワーの両方を向上させられるか?
  • RQ3π統計量の調和平均集約は、分位数ベースまたは平均化ベースの集約スキームよりも高いパワーをもたらすか?
  • RQ4帰無仮説下でのノックオフ統計量がi.i.d.であると仮定しない状況でも、FDP制御を達成できるか?
  • RQ5実際のfMRIおよびゲノムデータセットにおいて、本手法は既存の集約ベースのノックオフ手法と比較して、パワーとFDP制御の両面で優れているか?

主な発見

  • KOPIは、すべてのシミュレーション設定および実データ応用(脳イメージングおよびゲノム含む)において、名目水準でのFDP制御を達成した。
  • セミシミュレーテッドfMRIデータにおいて、KOPIはFDP制御を維持しつつ、すべての手法の中で最高の統計的パワー(中央値パワー > 0.8)を達成し、他のすべてのノックオフベース手法を上回った。
  • 79サンプル、90遺伝子のゲノムデータセットでは、KOPIは50回の実行においてたった8つの異なる遺伝子を選択したが、そのうち3つの遺伝子は100%の選択頻度を示し、高い安定性と特異性を示した。
  • バニラノックオフでは、50回の実行で24個の異なる遺伝子が選択され、どの遺伝子も70%を超える選択頻度に達しなかったため、再現性が著しく低いことが示された。
  • 他のすべての集約ベース手法は、ゲノムデータセットにおいてすべての実行でパワーを失っていたが、KOPIは一貫して有効であった。
  • KOPIの計算時間は、古典的なノックオフ集約手法と同等であり、通常のfMRIデータセットでは数分で実行可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。