Skip to main content
QUICK REVIEW

[論文レビュー] Floodgate: inference for model-free variable importance

Lu Zhang, Lucas Janson|arXiv (Cornell University)|Jul 2, 2020
Statistical Methods and Inference参考文献 74被引用数 13
ひとこと要約

Floodgate は、共変量 X と結果 Y の間の条件付き依存度を測る指標である最小二乗誤差(mMSE)ギャップの漸近的に有効な信頼区間を構築する、モデルフリーな推論手法である。この手法は、任意のユーザー指定の回帰関数(例:機械学習から得られるもの)を活用し、その推定誤差に応じて精度を自動調整することで、パラメトリックな仮定を必要とせず、解釈可能で頑健な推論を可能にする。

ABSTRACT

Many modern applications seek to understand the relationship between an outcome variable $Y$ and a covariate $X$ in the presence of a (possibly high-dimensional) confounding variable $Z$. Although much attention has been paid to testing \emph{whether} $Y$ depends on $X$ given $Z$, in this paper we seek to go beyond testing by inferring the \emph{strength} of that dependence. We first define our estimand, the minimum mean squared error (mMSE) gap, which quantifies the conditional relationship between $Y$ and $X$ in a way that is deterministic, model-free, interpretable, and sensitive to nonlinearities and interactions. We then propose a new inferential approach called \emph{floodgate} that can leverage any working regression function chosen by the user (allowing, e.g., it to be fitted by a state-of-the-art machine learning algorithm or be derived from qualitative domain knowledge) to construct asymptotic confidence bounds, and we apply it to the mMSE gap. \acc{We additionally show that floodgate's accuracy (distance from confidence bound to estimand) is adaptive to the error of the working regression function.} We then show we can apply the same floodgate principle to a different measure of variable importance when $Y$ is binary. Finally, we demonstrate floodgate's performance in a series of simulations and apply it to data from the UK Biobank to infer the strengths of dependence of platelet count on various groups of genetic mutations.

研究の動機と目的

  • 共変量 Z を条件とする Y と X 間の依存度の強さを測る、モデルフリーで解釈可能かつ感受性の高い変数重要性の指標を開発すること。
  • 条件付き平均 E[Y|X,Z] にパラメトリックまたは滑らかさの仮定を必要としない、この指標の漸近的に有効な信頼区間を提供すること。
  • ユーザーが選択した作業回帰関数の平均二乗誤差に応じて、信頼区間の精度が適応的に向上することを保証すること。
  • 二値の結果 Y や、X|Z の分布が部分的にしか特定されていない設定(例:パラメトリックモデルで記述可能な分布)への拡張を図ること。
  • シミュレーションと UK Biobank の血小板数の遺伝性に関する応用を通じて、本手法の妥当性と性能を実証すること。

提案手法

  • mMSE ギャップを、Z を与えたもとで X を含めることによる予測誤差の低減を測る、モデルフリーで解釈可能な変数重要性の指標として定義する。
  • 帰無仮説下で X|Z の分布を保持する条件付きパーミュテーションスキームを用いて、mMSE ギャップの漸近的下限信頼区間を構築する。
  • E[Y|X,Z] を推定するために、ユーザーが指定した作業回帰関数 μ(X,Z) を使用し、機械学習や分野特化型モデルを統合可能にする。
  • 観測値と帰無仮説下で再現された予測誤差の差に基づく検定統計量を用い、帰無仮説下での条件付きサンプリングにより標準化することで信頼区間を導出する。
  • E[Y|X,Z] に滑らかさ、スパarsity、パラメトリックな形の仮定を一切必要としない最小限の仮定のもとで有効性を保証し、二重ロバストな設定へも拡張可能である。
  • データ分割戦略を適用することで、作業モデルが誤った指定であっても、信頼区間のマージナルな有効性を維持し、頑健性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1Z を条件とする Y と X 間の非線形的および相互作用的効果を捉える、モデルフリーで解釈可能かつ感受性の高い変数重要性の指標を定義できるか?
  • RQ2E[Y|X,Z] のパラメトリックまたは滑らかさの形を仮定しない条件下で、このような指標の漸近的に有効な信頼区間を構築する方法は何か?
  • RQ3信頼区間の精度は、ユーザーが提供する回帰関数の品質にどの程度適応的に向上するか?
  • RQ4本フレームワークは、二値の結果 Y や、X|Z がパラメトリックモデルでのみ特定可能な設定へ拡張可能か?
  • RQ5有限標本および実世界の応用(例:高次元の共変量を伴う遺伝的関連解析)において、本手法はどの程度の性能を示すか?

主な発見

  • Floodgate は、E[Y|X,Z] が任意で非滑らかであっても、mMSE ギャップの漸近的に有効な信頼区間を生成する。
  • 信頼区間の幅は、ユーザーが選択した作業回帰関数の平均二乗誤差に応じて適応的に変化し、モデルがより正確な場合にはより狭い区間が得られる。
  • データ分割と帰無仮説下での条件付きパーミュテーションを用いることで、作業モデルが誤った指定であっても有効性が保たれる。
  • UK Biobank 応用において、Floodgate はSNP群の集団ごとに血小板数の有意な遺伝性を同定し、下限信頼区間が従来検出されなかった遺伝的効果を明らかにした。
  • 本手法は、相互作用構造に関する事前知識を必要とせず、従来のパラメトリック手法よりも複雑な非線形な遺伝的効果をよりよく捉える。
  • 二値の Y や、X|Z の分布が部分的にしか特定されない設定(例:多変量正規分布、離散マルコフ連鎖)への拡張により、本フレームワークの柔軟性と広範な適用可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。