Skip to main content
QUICK REVIEW

[論文レビュー] Naïve regression requires weaker assumptions than factor models to adjust for multiple cause confounding

Justin Grimmer, Dean Knox|arXiv (Cornell University)|Jul 24, 2020
Advanced Causal Inference Techniques参考文献 19被引用数 8
ひとこと要約

この論文は、複数原因設定における観察されない交絡要因を補正するための因子モデルに基づくdeconfounderという手法よりも、より弱い仮定の下で漸近的に不偏となる、単純な重回帰(直接的に結果を複数の処置で回帰する)の有効性を示している。著者らは、各交絡要因が無限個の処置に影響を与える場合、単純な重回帰は一貫性を示すが、deconfounderの変種は追加の検証不能な仮定を必要とし、実際の応用ではしばしば単純な重回帰を上回らないことが判明しており、スタン・リーがマーベルの収益に155億ドルの因果的寄与をしたという非現実的な推定値を生じることもある。

ABSTRACT

The empirical practice of using factor models to adjust for shared, unobserved confounders, $\mathbf{Z}$, in observational settings with multiple treatments, $\mathbf{A}$, is widespread in fields including genetics, networks, medicine, and politics. Wang and Blei (2019, WB) formalizes these procedures and develops the "deconfounder," a causal inference method using factor models of $\mathbf{A}$ to estimate "substitute confounders," $\hat{\mathbf{Z}}$, then estimating treatment effects by regressing the outcome, $\mathbf{Y}$, on part of $\mathbf{A}$ while adjusting for $\hat{\mathbf{Z}}$. WB claim the deconfounder is unbiased when there are no single-cause confounders and $\hat{\mathbf{Z}}$ is "pinpointed." We clarify pinpointing requires each confounder to affect infinitely many treatments. We prove under these assumptions, a naïve semiparametric regression of $\mathbf{Y}$ on $\mathbf{A}$ is asymptotically unbiased. Deconfounder variants nesting this regression are therefore also asymptotically unbiased, but variants using $\hat{\mathbf{Z}}$ and subsets of causes require further untestable assumptions. We replicate every deconfounder analysis with available data and find it fails to consistently outperform naïve regression. In practice, the deconfounder produces implausible estimates in WB's case study to movie earnings: estimates suggest comic author Stan Lee's cameo appearances causally contributed \$15.5 billion, most of Marvel movie revenue. We conclude neither approach is a viable substitute for careful research design in real-world applications.

研究の動機と目的

  • 複数原因設定における観察されない交絡要因を補正する際の、単純な重回帰とdeconfounder手法の理論的・実証的性能を評価すること。
  • deconfounderが不偏であるための条件を明確にすること、特に各交絡要因が無限個の処置に影響を与える(強い無限交絡)という要件を強調すること。
  • 実データおよびシミュレーションを用いて、有限標本におけるdeconfounderが単純な重回帰を一貫して上回るかどうかを検証すること。
  • 特に複雑な交絡構造を有する状況において、両手法の現実世界の観察的研究における実用的妥当性を評価すること。
  • 因子モデルが複数原因の交絡要因補正に必要または優れているという仮定に疑問を呈すること。

提案手法

  • 著者らは、交絡要因Zが無限個の処置に影響を与える(強い無限交絡)場合、結果Yを処置Aで単純に重回帰した場合に漸近的に不偏であることを示す理論的枠組みを構築した。
  • 線形線形および非線形モデル下での単純推定量のバイアスを導出し、強い無限交絡仮定の下ではバイアスが消滅することを示した。
  • deconfounder手法は2段階の手続きとして分析された:まず因子モデルを用いて処置Aから代替交絡要因Ẑを推定し、次にYをẐおよびAの部分集合で回帰する。
  • 線形および非線形設定下で、単純な重回帰と、正則化、ホワイトノイズ、事後平均、サブセットdeconfounder推定量を含む複数のdeconfounderバリエーションを比較した。
  • 有限標本における性能は、シミュレーションおよびマーベル映画収益に関するdeconfounderの俳優事例研究の再現を通じて評価された。
  • 事後予測モデルチェックを用いてモデル適合度を評価したが、著者らはこれがdeconfounderが機能しているかどうかを信頼性を持って特定できないことを示した。

実験結果

リサーチクエスチョン

  • RQ1複数原因の交絡が存在する状況で、単純な重回帰がいつ漸近的に不偏となるか。
  • RQ2deconfounder手法は、不偏性を達成するために単純な重回帰よりも強い仮定を必要とするか。
  • RQ3さまざまなシミュレーションおよび現実世界の設定において、有限標本においてdeconfounderが一貫して単純な重回帰を上回るか。
  • RQ4deconfounderがスタン・リーが155億ドルのマーベル収益に因果的に寄与したと推定するという非現実的な推定値を生じる理由は何か。これはその信頼性に何を示唆するか。
  • RQ5因子モデルは複数原因の交絡要因補正に必要であるか。それとも、より弱い仮定の下で単純な重回帰で十分な場合があるか。

主な発見

  • 各観察されない交絡要因が無限個の処置に影響を与える場合(強い無限交絡)、単純な重回帰は漸近的に不偏である。これはdeconfounderが不偏であるために必要な仮定よりも弱い条件である。
  • deconfounderは、強い無限交絡に加え、処置のサブセットや推定された代替交絡要因を用いる場合、追加の検証不能な仮定を必要とする。
  • deconfounder自身のマーベル俳優事例研究において、非現実的な推定値が生じた:スタン・リーのカメオ出演がボックスオフィス収益に155億ドルの因果的寄与をしたと推定された。
  • 利用可能なデータを用いたdeconfounder分析の再現により、有限標本において単純な重回帰は常にdeconfounderを上回るか、同等の性能を示した。
  • 非線形設定下でも、単純な重回帰はパラメトリック情報の有効活用が可能であるが、deconfounderのバリエーションは処置効果に関する強い、検証不能な仮定を必要とする。
  • 両手法とも、未検証の仮定に依存し、誤った結果を生じる可能性があるため、慎重な研究設計がなければ現実世界の因果推論には現在は適さない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。