[論文レビュー] Inference After Selecting Plausibly Valid Instruments with Application to Mendelian Randomization
本稿では、選択バイアスを補正するための選択的推論(selective inference)を用いて、Mendelian randomization(MR)におけるデータ駆動型器具変数選択を考慮する条件付き推論フレームワークを提案する。特に、sisVIVE手順による選択された器具変数を条件として用いることで、名目的カバレッジを達成する有効な帰無分布および信頼区間を導出する。これは、選択を無視する従来の手法とは異なり、反保守的推論を避けるものである。
Mendelian randomization (MR) is a popular method in genetic epidemiology to estimate the effect of an exposure on an outcome by using genetic instruments. These instruments are often selected from a combination of prior knowledge from genome wide association studies (GWAS) and data-driven instrument selection procedures or tests. Unfortunately, when testing for the exposure effect, the instrument selection process done a priori is not accounted for. This paper studies and highlights the bias resulting from not accounting for the instrument selection process by focusing on a recent data-driven instrument selection procedure, sisVIVE, as an example. We introduce a conditional inference approach that conditions on the instrument selection done a priori and leverage recent advances in selective inference to derive conditional null distributions of popular test statistics for the exposure effect in MR. The null distributions can be characterized with individual-level or summary-level data in MR. We show that our conditional confidence intervals derived from conditional null distributions attain the desired nominal level while typical confidence intervals computed in MR do not. We conclude by reanalyzing the effect of BMI on diastolic blood pressure using summary-level data from the UKBiobank that accounts for instrument selection.
研究の動機と目的
- Mendelian randomization(MR)解析において、器具変数選択プロセスを無視することで生じるバイアスを是正すること。
- データ駆動型の器具変数選択(例:sisVIVEなど)を考慮する条件付き推論アプローチを開発すること。
- 選択された器具変数を条件とした、曝射効果の有効な帰無分布および信頼区間を導出すること。
- 標準的なMR推論が選択バイアスのため名目的カバレッジを維持できないのに対し、提案手法がそれを達成することを示すこと。
- UK Biobankの実世界の要約統計データを用いて、BMIが拡張血圧に与える因果効果を再分析すること。
提案手法
- 選択的推論を用いて、特定の器具変数セットがデータ駆動型手順(例:sisVIVE)により選択されたという出来事(event)を条件として扱う。
- 選択された器具変数セットの下で、検定統計量(例:Anderson-Rubin、二段階最小二乗法)の条件付き帰無分布を導出する。
- 個別レベルおよび要約レベルのMRデータの両方への適用を可能とし、大規模な遺伝学的研究における実用的応用を可能にする。
- 最近の選択後推論の進展を活用し、器具変数がその強さや多因子性(pleiotropy)のテストに基づいて選ばれたという事実を補正する。
- 選択イベントを条件とした信頼区間を構築し、正しい頻度的カバレッジを保証する。
- 器具変数の有効性に関する曖昧さを扱うために、ランダム化手順を用いることで、ユニオンベースの手法に比べてより高い頑健性とパワーを向上させる。
実験結果
リサーチクエスチョン
- RQ1MRにおけるデータ駆動型器具変数選択を無視すると、どのようにして無効な推論が生じるか?
- RQ2器具変数の強さや多因子性テストに基づいて選択された場合に、選択的推論をMRにおける選択バイアス補正に適応可能か?
- RQ3条件付き帰無分布から導出された信頼区間は、有限標本において名目的カバレッジ水準を維持するか?
- RQ4提案手法は、Kang et al. (2015) らの既存手法と比較して、区間幅およびカバレッジの点でどのように異なるか?
- RQ5器具変数選択は、MR研究における第一種過誤率および検出力にどのような影響を与えるか?
主な発見
- 器具変数選択を無視する標準的なMR信頼区間は、名目的95%カバレッジ水準に達しないことが判明し、反保守的推論を引き起こす。
- 提案された条件付き推論フレームワークは、選択された器具変数を条件としているため、望ましい名目的カバレッジを達成する信頼区間を生成する。
- UK Biobankの再分析において、BMIが拡張血圧に与える影響の条件付き信頼区間は、標準的な区間よりも狭く、より正確であった。
- U=2の場合、TSLSを用いた選択的信頼区間は(0.034, 0.058)であったのに対し、Kang et al. (2015) のユニオンベース手法は(0.031, 0.059)を出力し、同等の精度ながらわずかに高い精度を示した。
- ユニオンベース手法に比べ、実際の選択結果に焦点を当てることで、本手法は検出力を向上させるとともに、区間幅を短縮する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。