Skip to main content
QUICK REVIEW

[論文レビュー] Empirical or Invariant Risk Minimization? A Sample Complexity Perspective

Kartik Ahuja, Jun Wang|arXiv (Cornell University)|Oct 30, 2020
Statistical Methods and Inference参考文献 29被引用数 15
ひとこと要約

この論文は、標本複雑性の観点から、Empirical Risk Minimization (ERM) と Invariant Risk Minimization (IRM) を比較し、交絡要因または逆因果的シフトの下で、IRM が分布外一般化において ERM を上回ることを示している。IRM は理想の予測子からの誤差が O(√ε) 以内に収まり、標本複雑性は O(1/ε²) に比例し、モデルの複雑性に関して多項式的に増加する。一方、ERM はこのような設定では漸近的にバイアスを持つが、共変量シフトの下では両手法が同程度に性能を発揮する。

ABSTRACT

Recently, invariant risk minimization (IRM) was proposed as a promising solution to address out-of-distribution (OOD) generalization. However, it is unclear when IRM should be preferred over the widely-employed empirical risk minimization (ERM) framework. In this work, we analyze both these frameworks from the perspective of sample complexity, thus taking a firm step towards answering this important question. We find that depending on the type of data generation mechanism, the two approaches might have very different finite sample and asymptotic behavior. For example, in the covariate shift setting we see that the two approaches not only arrive at the same asymptotic solution, but also have similar finite sample behavior with no clear winner. For other distribution shifts such as those involving confounders or anti-causal variables, however, the two approaches arrive at different asymptotic solutions where IRM is guaranteed to be close to the desired OOD solutions in the finite sample regime, while ERM is biased even asymptotically. We further investigate how different factors -- the number of environments, complexity of the model, and IRM penalty weight -- impact the sample complexity of IRM in relation to its distance from the OOD solutions

研究の動機と目的

  • 分布外一般化において IRM を ERM より優先すべき状況を解明すること。
  • 異なる分布シフトの種類の下で ERM と IRM の有限標本および漸近的挙動を分析すること。
  • 多項式生成モデルにおける IRM の真の不変予測子に対する標本複雑性を定量化すること。
  • 無限データのもとでも ERM が漸近的にバイアスを持つ場合の条件を同定すること。
  • 共変量シフト、交絡要因、逆因果変数を含む複数の分布シフトメカニズムにおける ERM と IRM の性能を比較すること。

提案手法

  • 分布シフトを不変性条件により形式化:P(Y|Φ*(X)) が環境間で一定である。
  • 線形および多項式生成メカニズムを有する構造方程式モデルの下で ERM と IRM を分析する。
  • IRM の標本複雑性の境界を導出し、IRM の制約における緩和パrameter ε に対して O(1/ε²) のスケーリングを示す。
  • 勾配解析を用いて、行列 ρ̄ がフルランクである場合に ERM が漸近的にバイアスを持つことを証明する。
  • IRM では最小最大化最適化を用いて環境間での不変性を強制し、最悪ケースのリスクを最小化する。
  • 最適化および高次元統計の理論的ツールを用いて、理想の不変予測子からの逸脱を境界づける。

実験結果

リサーチクエスチョン

  • RQ1どのような分布シフトの種類の下で、IRM が標本複雑性および有限標本性能において ERM を上回るのか?
  • RQ2交絡要因または逆因果的変数がデータ生成過程に存在する場合、ERM は漸近的に不偏であるか?
  • RQ3IRM の標本複雑性は、制約における緩和パrameter ε およびモデルクラスの複雑性に対してどのようにスケーリングされるか?
  • RQ4どのような条件下で ERM は無限データのもとでもバイアスを持つのか、そして IRM はどのようにしてこのバイアスを回避するのか?
  • RQ5環境数、モデルの複雑性、IRM のペナルティ重みが、IRM が不変予測子への収束にどのように寄与するのか?

主な発見

  • 共変量シフト(Φ* = identity)の下では、ERM と IRM は同じ漸近的解を達成し、有限標本挙動も類似しており、明確な優劣はない。
  • 交絡要因または逆因果的シフトの設定(Φ* ≠ identity)では、ERM は漸近的にバイアスを持ち、無限データでも真の不変予測子に収束しない。
  • IRM は理想の不変予測子からの誤差が O(√ε) 以内に収まり、多項式モデルでは標本複雑性が O(1/ε²) に比例する。
  • IRM の標本複雑性はモデルクラスの複雑性に関して多項式的に増加するが、ERM のバイアスは共変量シフトでない設定ではデータサイズにかかわらず持続する。
  • ERM のバイアスは、行列 ρ̄ = [𝔼[εᵉXᵉ]] のランクが 1 以上である場合に生じるが、これは非退化分布のもとで一般に成立する。
  • IRM の最小最大化最適化により、弱い正則性条件のもとで不変予測子への収束が保証されるが、ERM はこのような不変性を保証しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。