Skip to main content
QUICK REVIEW

[論文レビュー] Latent Causal Invariant Model

Xinwei Sun, Tao Wu|arXiv (Cornell University)|Nov 4, 2020
Domain Adaptation and Few-Shot Learning参考文献 70被引用数 10
ひとこと要約

本稿では、変分ベイジアン推論を用いて因果的要因(S)と誤った共変要因(Z)を分離する、因果的表現学習フレームワークであるLatent Causal Invariant Models(LaCIM)を提案する。ドメイン間で条件付き分布P(Y|do(S))およびP(X|do(S),do(Z))の不変性を強制することにより、LaCIMは分布外一般化において優れた性能を発揮し、解釈性を高めた上で、従来手法を上回る結果を得た。

ABSTRACT

Current supervised learning can learn spurious correlation during the data-fitting process, imposing issues regarding interpretability, out-of-distribution (OOD) generalization, and robustness. To avoid spurious correlation, we propose a Latent Causal Invariance Model (LaCIM) which pursues causal prediction. Specifically, we introduce latent variables that are separated into (a) output-causative factors and (b) others that are spuriously correlated to the output via confounders, to model the underlying causal factors. We further assume the generating mechanisms from latent space to observed data to be causally invariant. We give the identifiable claim of such invariance, particularly the disentanglement of output-causative factors from others, as a theoretical guarantee for precise inference and avoiding spurious correlation. We propose a Variational-Bayesian-based method for estimation and to optimize over the latent space for prediction. The utility of our approach is verified by improved interpretability, prediction power on various OOD scenarios (including healthcare) and robustness on security.

研究の動機と目的

  • 分布外(OOD)一般化性能の低下を引き起こす誤った相関の問題に対処すること。
  • 観測された入力Xが非観測の因果的要因Sと誤った共変要因Zから生成され、S–Z間の相関が変化することでドメインシフトが生じる因果モデルを形式化すること。
  • 十分なドメイン多様性のもとで因果的不変性の理論的同定可能性を確立し、SとZの分離推論を可能にすること。
  • 分布外予測のための不変表現を学習するための変分ベイジアン手法を開発すること。
  • 視覚、医療、合成ベンチマークの各分野において、改善されたOOD一般化性能と分離された、解釈可能な特徴を実証すること。

提案手法

  • データ生成プロセスをX ← f_x(S, Z, ε_x)およびY ← f_y(S, ε_y)としてモデル化し、f_xとf_yがドメインをまたいで不変であると仮定する。
  • SとZのドメイン依存的な誤った相関を捉えるためにドメイン変数Dを導入し、ドメインシフトを形式化する。
  • P(Y|do(S))およびP(X|do(S),do(Z))がドメイン間で安定していること、すなわち分布シフトに対して頑健であることを因果的不変性として定義する。
  • 不変性制約の下で同時尤度の下界を最大化することで、潜在変数SとZを推論する変分ベイジアンフレームワークを提案する。
  • 推論段階では、OOD一般化のためのdo(S)介入を想定した分離された潜在空間S上で最適化を行う。
  • 識別可能性と不変性を強制するために、ドメイン固有の推論ネットワークと分離された潜在事前分布を備えた変更版VAEを用いる。

実験結果

リサーチクエスチョン

  • RQ1SとZの間の誤った相関がドメインごとに変化する潜在変数モデルにおいて、因果的不変性を形式的に定義・同定できるか?
  • RQ2観測データからのみ、因果的要因Sと誤った共変要因Zの分離がどの条件下で同定可能か?
  • RQ3OOD一般化のための不変表現を学習する変分推論手法を設計できるか?
  • RQ4因果的不変性を強制することで、標準的なディープラーニングおよび不変性に基づくベースラインと比較して、分布外テストセットにおける予測性能が向上するか?
  • RQ5学習された潜在変数Sは、分離可能で意味的に意味のある表現として解釈可能か?

主な発見

  • 十分なドメイン多様性のもとで、因果的不変性の理論的同定可能性が確立され、Sは置換および点変換を除いてZから分離可能であることが証明された。
  • LaCIMはCMNIST、NICO、ADNIのデータセットにおいて、DANNやドメイン一般化手法を含むベースラインを上回る、最先端のOOD一般化性能を達成した。
  • モデルは分離可能で解釈可能な意味的特徴(例:物体の輪郭とテクスチャが背景や文脈から分離)を学習しており、定性的な分析によって裏付けられた。
  • 交絡および選択バイアスが存在する状況下でも、LaCIMはOODドメインにおいて高い予測精度を維持し、分布シフトに対して頑健であることが示された。
  • 変分推論フレームワークは不変表現を効果的に学習しており、アブレーションスタディにより、OOD性能の向上に不変性目的の必要性が確認された。
  • 実験的結果から、潜在空間におけるdo(S)介入の最適化がOOD精度を顕著に向上させることを示し、因果的不変性原理の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。