Skip to main content
QUICK REVIEW

[論文レビュー] Derandomizing Knockoffs

Zhimei Ren, Yuting Wei|arXiv (Cornell University)|Dec 4, 2020
Genetic Associations and Epidemiology参考文献 61被引用数 6
ひとこと要約

本稿では、複数回の実行結果を統合することで、安定的かつ一貫性のある変数選択を実現しつつ、厳密な誤差制御を維持する、Model-Xノックオフスの非ランダム化フレームワークを提案する。ノックオフスと安定性選択の原則を組み合わせることで、家族ごとの誤差率(PFER)およびk家族単位誤差率(k-FWER)の制御を達成し、特に二段階型全ゲノム関連解析(GWAS)において、高次元の変数選択におけるパワーと第一種誤差制御を顕著に向上させる。

ABSTRACT

Model-X knockoffs is a general procedure that can leverage any feature importance measure to produce a variable selection algorithm, which discovers true effects while rigorously controlling the number or fraction of false positives. Model-X knockoffs is a randomized procedure which relies on the one-time construction of synthetic (random) variables. This paper introduces a derandomization method by aggregating the selection results across multiple runs of the knockoffs algorithm. The derandomization step is designed to be flexible and can be adapted to any variable selection base procedure to yield stable decisions without compromising statistical power. When applied to the base procedure of Janson et al. (2016), we prove that derandomized knockoffs controls both the per family error rate (PFER) and the k family-wise error rate (k-FWER). Further, we carry out extensive numerical studies demonstrating tight type-I error control and markedly enhanced power when compared with alternative variable selection algorithms. Finally, we apply our approach to multi-stage genome-wide association studies of prostate cancer and report locations on the genome that are significantly associated with the disease. When cross-referenced with other studies, we find that the reported associations have been replicated.

研究の動機と目的

  • ランダム化ノックオフスによる不確実性に起因する、実行回ごとの変数選択結果の不一致を解消すること。
  • 統計的パワーおよび誤差率の保証を損なわず、安定性を向上させる一般化された非ランダム化フレームワークを開発すること。
  • 厳密な誤差制御と再現性が不可欠な確認的研究、特に二段階型GWASにおいて、信頼できる変数選択を可能にすること。
  • 集約された発見セットに対する第一種誤差制御を提供する手法を提示し、従来の選択頻度ベースの報告方法の限界を克服すること。
  • 実世界のゲノムデータにおいて、生物学的に再現可能な結果が得られることを実証すること。

提案手法

  • 独立した乱数シードを用いて、複数回 Model-X ノックオフスアルゴリズムを実行し、複数の選択セットを生成する。
  • 安定性選択の原則に基づいた基準を用いて選択結果を統合し、複数回の実行で一貫して特定された変数を選択する。
  • 選択頻度にしきい値を適用して最終的な発見セットを形成し、安定性を確保するとともに、誤検出を低減する。
  • Jansonら(2016)の理論的結果を活用し、集約手順が PFER および k-FWER の両方を制御することを証明する。
  • 二段階型 GWAS ワークフローを設計:第一段階では、非ランダム化ノックオフスを用いて候補スナイパーポリモーフィズム(SNP)を同定し、第二段階では、フォローアップ研究で結果を確認する。
  • SNP クラスタリングに 2% 解像度を用い、近接するバリアントをグループ化し、各クラスタのリード SNP を報告することで、先行研究との比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1厳密な誤差制御を維持しつつ、選択の安定性を向上させる非ランダム化ノックオフス手順を構築可能か?
  • RQ2複数回のノックオフス実行を統合することで、標準ノックオフスに比べて統計的パワーが向上するか?
  • RQ3ベース手順が PFER 制御を満たす場合、非ランダム化ノックオフス手順が PFER および k-FWER の両方を制御できるか?
  • RQ4非ランダム化ノックオフスによる発見は、独立した GWAS スタディにおいて再現可能かつ生物学的に妥当であるか?
  • RQ5本手法は、強い誤差率保証を伴う確認的解析を可能にする二段階型 GWAS ワークフローに適応可能か?

主な発見

  • 非ランダム化ノックオフスは、ベース手順が PFER を制御する場合でさえ、家族ごとの誤差率(PFER)およびk家族単位誤差率(k-FWER)のきびしい制御を達成する。
  • 数値実験において、ヴァナ・ノックオフスや他の変数選択アルゴリズムに比べ、顕著に高い統計的パワーを示す。
  • 2% 解像度および FWER 水準 0.1 で同定されたすべての SNP は、文献に事前に報告済みであるか、独立した GWAS スタディで確認済みである。
  • FWER 制御を 3-FWER に緩和して 0.1 に設定した場合、追加で7つの SNP が同定され、これらすべてが先行文献またはメタアナリシスで裏付けられていた。
  • 各クラスタのリード SNP(例:rs12621278、rs1016343、rs7501939)は、外部スタディでも生物学的に再現されており、本手法の信頼性を裏付けている。
  • 本手法により、誤差制御のもとで候補 SNP を同定し、フォローアップスタディで確認する科学的に妥当な二段階型 GWAS ワークフローの実現が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。