Skip to main content
QUICK REVIEW

[論文レビュー] Causality-based tests to detect the influence of confounders on mobile health diagnostic applications: a comparison with restricted permutations

Elias Chaibub Neto, Meghasyam Tummalacherla|arXiv (Cornell University)|Nov 12, 2019
Advanced Causal Inference Techniques参考文献 15被引用数 8
ひとこと要約

本稿では、移動ヘルス診断モデルにおける交絡要因の影響を特定する因果関係に基づく手法を提案し、制限付き順列法のより正確な代替手段を提供する。制限付き順列法は、直接効果が存在しない場合を除き、交絡要因効果の推定に偏りを生じることを示し、mHealthデータを通じて、因果関係に基づく検定法が調整後の残存交絡を検出する際、順列法を上回ることを示している。

ABSTRACT

Machine learning practice is often impacted by confounders. Confounding can be particularly severe in remote digital health studies where the participants self-select to enter the study. While many different confounding adjustment approaches have been proposed in the literature, most of these methods rely on modeling assumptions, and it is unclear how robust they are to violations of these assumptions. This realization has recently motivated the development of restricted permutation methods to quantify the influence of observed confounders on the predictive performance of a machine learning models and evaluate if confounding adjustment methods are working as expected. In this paper we show, nonetheless, that restricted permutations can generate biased estimates of the contribution of the confounders to the predictive performance of a learner, and we propose an alternative approach to tackle this problem. By viewing a classification task from a causality perspective, we are able to leverage conditional independence tests between predictions and test set labels and confounders in order to detect confounding on the predictive performance of a classifier. We illustrate the application of our causality-based approach to data collected from mHealth study in Parkinson's disease.

研究の動機と目的

  • 遠隔研究における自己選択に起因する人種的・文化的要因によるバイアスが生じる状況を想定し、移動ヘルス診断アプリケーションにおける交絡要因の問題に対処すること。
  • 直接効果が存在する場合に、交絡要因の影響を評価するための制限付き順列法の限界、特にその推定に偏りが生じる傾向を特定すること。
  • モデリングの仮定に依存せずに交絡要因の寄与を正確に定量化できる因果関係に基づくアプローチを開発・検証すること。
  • 一般的な交絡要因補正手法(例:マッチング、IPW、残差化)が、パーキンソン病のmHealthデータにおける年齢関連信号をどれだけ効果的に除去できるかを評価すること。

提案手法

  • 因果ダイアグラム(例:図1)を用いて、特徴量(X)、疾患状態(Y)、交絡要因(A)、および直接効果(θXY)の関係をモデル化し、関連の形式的分解を可能にする。
  • Wrightのパス解析を適用して、共分散と因果効果の理論的関係を導出し、Eπ∗[Cov(X,Y∗)] = Cov(X,A)Cov(Y,A)/Var(A) であることを示す。
  • 相関および距離相関検定を用いて、特徴量、疾患状態、交絡要因の間の条件付き独立性(CI)を評価する因果関係に基づく検定法を提案する。
  • 偏相関および距離相関検定を用いて、調整済みモデルが依然として交絡信号(例:A ⊥⊥ Y | X)を保持しているかどうかを評価する。
  • 1,000回の順列を用いたp値を計算し、多重比較補正としてボンフェローニ補正を適用して条件付き独立性を検定する。
  • mPowerパーキンソン病データを用いて手法を検証し、調整なし、マッチング、近似IPW、特徴量の残差化を比較する。

実験結果

リサーチクエスチョン

  • RQ1特徴量と疾患状態の間に直接効果が存在する場合、制限付き順列法は交絡要因が予測性能に与える寄与を正確に推定できるか?
  • RQ2直接効果が存在する状況において、因果関係に基づくアプローチは制限付き順列法よりも信頼性が高く、バイアスのない代替手段となるか?
  • RQ3一般的な交絡要因補正手法(マッチング、IPW、残差化)は、mHealth診断モデルにおける年齢関連信号をどれだけ効果的に除去できるか?
  • RQ4条件付き独立性検定は、AUCスコアが向上しているように見える場合でも、調整後の残存交絡を検出できるか?
  • RQ5なぜ特徴量の残差化は、AUCスコアを向上させることがあるが、同時に年齢との関連性を高めることがあるのか?このアーティファクトはどのように検出できるか?

主な発見

  • 制限付き順列法は、Eπ∗[Cov(X,Y∗)] = θXAθAY + θXYθAY² であるのに対し、真の交絡要因のみの寄与 θXAθYA を正しく推定できないため、偏りを生じる。
  • 因果関係に基づくアプローチは、交絡要因効果を正しく特定し、制限付き順列法が失敗する場面でも残存交絡を検出できる。
  • マッチングは、A ⊥⊥ Y | X を除くすべてのH0が棄却されたことから、年齢と疾患状態の関連を効果的に除去した。
  • 近似IPWはバランスを改善したが、年齢信号を完全に除去できず、距離相関検定で非ゼロの関連(全スプリットでp = 0.001)が検出された。
  • 特徴量の残差化はアーティファクトを生じた:元々最も重要度が低かった4つの特徴量が残差化後に最も重要度が高くなり、年齢との距離相関も顕著に上昇した(例:特徴量23は残差化後に高い相関を示した)。
  • 残差化手法はAUCスコアを向上させたが、同時に特徴量と年齢の関連性を拡大したため、高AUCが残存交絡を隠すことがあることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。