Skip to main content
QUICK REVIEW

[論文レビュー] Out-of-Distribution Generalization Analysis via Influence Function

Haotian Ye, Chuanlong Xie|arXiv (Cornell University)|Jan 21, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 10
ひとこと要約

本稿では、観測済みのドメインにおけるテスト精度に依存するのを避けるために、分布外(OOD)一般化性能を評価するための指標として、影響関数の分散を提案する。この指標は、真のOOD分布が未知または観測されていない状況においても、従来の手法(例:IRMペナルティ)よりも真のOOD精度と相関が強く、より優れた性能を示すことが実証されている。

ABSTRACT

The mismatch between training and target data is one major challenge for current machine learning systems. When training data is collected from multiple domains and the target domains include all training domains and other new domains, we are facing an Out-of-Distribution (OOD) generalization problem that aims to find a model with the best OOD accuracy. One of the definitions of OOD accuracy is worst-domain accuracy. In general, the set of target domains is unknown, and the worst over target domains may be unseen when the number of observed domains is limited. In this paper, we show that the worst accuracy over the observed domains may dramatically fail to identify the OOD accuracy. To this end, we introduce Influence Function, a classical tool from robust statistics, into the OOD generalization problem and suggest the variance of influence function to monitor the stability of a model on training domains. We show that the accuracy on test domains and the proposed index together can help us discern whether OOD algorithms are needed and whether a model achieves good OOD generalization.

研究の動機と目的

  • 観測済みドメインにおけるテスト精度をOOD一般化の代理指標として使用するという、重大な限界を是正すること。これは、真のOOD分布が観測されていない場合に誤解を招く可能性がある。
  • 全ターゲットドメインのセットが不明な状況においても、OOD一般化が必要かどうかを特定できる、モデルに依存しない指標を開発すること。
  • ハイパーパramータチューニングに依存せず、安定的で解釈可能かつ比較可能な、異なるアルゴリズム間でのモデルの耐性を測る指標を提供すること。
  • IRMペナルティが選択指標としての役割を果たす際の欠陥を克服すること。これは、ペナルティ項に過剰適合することで、実際のOOD性能と相関がなく、偏りが生じる可能性があるため。

提案手法

  • ロバスト統計における影響関数を採用し、複数のドメインにまたがる訓練データポイントに対するモデル予測の感度を測定する。
  • 訓練ドメイン全体における影響関数の分散を計算し、分布シフト下でのモデルの一貫性を評価する安定性指標として、$\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$ と表記する。
  • シャッフルベースラインを用いて分散指標を正規化し、絶対的スケールの解釈を必要とせず、異なるモデルやアルゴリズム間での相対的比較を可能にする。
  • 二段階評価を提案する:第一に、影響関数の分散を用いてOOD一般化が必要かどうかを判断し、第二に、同じOODカテゴリ内でのモデル順位付けにテスト精度を用いる。
  • Colored MNIST、VLCS、PACS といった実世界のベンチマークにこの指標を適用し、ERM、IRM、Mixup、gDRO と比較する。
  • 低影響関数分散が、テスト精度がそれを予測できない状況でも、高OOD精度と強く相関していることを実証する。

実験結果

リサーチクエスチョン

  • RQ1観測済みドメインにおけるテスト精度は、モデルの真のOOD一般化性能を信頼できる指標として機能するか?
  • RQ2全ターゲットドメインが不明な状況において、OOD一般化が必要かどうかを検出できるモデルに依存しない指標は存在するか?
  • RQ3影響関数の分散は、IRMペナルティと比較して、OOD耐性の予測子として優れているか?
  • RQ4影響関数の分散は、未観測ドメインにうまく一般化するモデルと、訓練ドメインに過剰適合するモデルを区別するのに役立つか?
  • RQ5ハイパーパramータが最適にチューニングされていない状況においても、提案された指標は多様なアルゴリズムやデータセットで有効に機能するか?

主な発見

  • 観測ドメインにおけるテスト精度は、OOD精度の代理指標として不十分である。Colored MNISTでは、ERMがテストドメインでIRMを上回るが、IRMははるかに優れたOOD精度を達成している。
  • 影響関数分散指標 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$ は、複数のデータセットとアルゴリズムにわたり、OOD性能と一貫して相関しており、低い値がより良いOOD一般化を示す。
  • VLCSでは、gDROの平均影響関数分散が最も高く(5.17)、安定性に欠けることを示している。一方、ERMとMixupは低い値(2.05と2.70)を示し、OOD性能の優位性と整合的である。
  • IRMペナルティは、選択指標として不適切である。OOD性能が悪い場合でもペナルティ値が低くなる(例:Cドメインでペナルティ2.59e-4、OOD精度38.64%)し、ERMと同等のOOD精度を持つMixupに対しても高いペナルティ値を示すことがある。
  • 提案された指標は、ペナルティのスケールに依存せず、ハイパーパramータチューニングに依存しないため、信頼できるモデル選択が可能である。これは、異なるアルゴリズムにわたり、安定的かつ頑健であることを示している。
  • $\mathcal{E}_{all} \setminus \mathcal{E}_{tr} = \{S\}$ の場合、gDROのシャッフル版 $\mathcal{V}_{{\bm{\gamma}}|{\bm{\theta}}}$ は標準版よりも顕著に小さいことが判明し、これは不変特徴をあまり学習していないことを示している。一方、ERMとMixupでは差がほとんどなく、より高い安定性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。