Skip to main content
QUICK REVIEW

[論文レビュー] Agree to Disagree: Diversity through Disagreement for Better Transferability

Matteo Pagliardini, Martin Jaggi|arXiv (Cornell University)|Feb 9, 2022
Machine Learning and Data Classification被引用数 7
ひとこと要約

本稿では、分布内データでは深層ニューラルネットワークが一致するよう促し、分布外(OOD)データでは不一致するよう促すことで、モデルの転移性と不確実性推定を向上させる訓練アルゴリズムD-BATを提案する。一般化された差異(generalized discrepancy)を用いて不一致を通じて多様性を強制することで、D-BATは単純さバイアスを軽減し、誤った特徴量に依存するのを減らし、複数のベンチマークにおけるOOD検出および一般化性能を向上させる。

ABSTRACT

Gradient-based learning algorithms have an implicit simplicity bias which in effect can limit the diversity of predictors being sampled by the learning procedure. This behavior can hinder the transferability of trained models by (i) favoring the learning of simpler but spurious features -- present in the training data but absent from the test data -- and (ii) by only leveraging a small subset of predictive features. Such an effect is especially magnified when the test distribution does not exactly match the train distribution -- referred to as the Out of Distribution (OOD) generalization problem. However, given only the training data, it is not always possible to apriori assess if a given feature is spurious or transferable. Instead, we advocate for learning an ensemble of models which capture a diverse set of predictive features. Towards this, we propose a new algorithm D-BAT (Diversity-By-disAgreement Training), which enforces agreement among the models on the training data, but disagreement on the OOD data. We show how D-BAT naturally emerges from the notion of generalized discrepancy, as well as demonstrate in multiple experiments how the proposed method can mitigate shortcut-learning, enhance uncertainty and OOD detection, as well as improve transferability.

研究の動機と目的

  • 分布シフト下での一般化に際して勾配ベース学習の限界、特に単純さバイアスが誤った特徴量を好むことによる問題を是正すること。
  • 分布シフトに強い多様で転移可能な表現を学習することで、深層モデルの転移性を向上させること。
  • 分布外(OOD)サンプルの不確実性推定を向上させることで、OODデータにおけるアンサンブルの不一致を増加させること。
  • 誤った特徴量と非誤った特徴量が同等に予測力を持つ場合、既存手法がバイアス除去に失敗する問題を克服すること。
  • 相互情報量のようなグローバル統計に依存しない、理論的裏付けがあり実用的な多様性誘導手法を提供すること。

提案手法

  • D-BATは、分布内(ID)データでは予測の不一致を最小化し、分布外(OOD)データでは不一致を最大化するようにアンサンブルモデルを訓練する。
  • この手法は、異なるデータ分布におけるモデルの予測の差を測る一般化差異(generalized discrepancy)に基づいて導出される。
  • 標準的な交差エントロピー損失に加え、OODデータに対して差異に基づく損失を組み合わせることで、OODサンプルでの予測の分散を促進する。
  • 差異損失は各データポイントごとに計算され、バッチ最適化が可能で、全バッチ統計の必要性を回避する。
  • 訓練中にOODデータへのアクセスを必要とせず、代わりに敵対的摂動やプロキシOODデータを用いて分布シフトをシミュレートする。
  • アンサンブルモデルは個々のモデルの予測を組み合わせ、高い不一致は特にOOD入力における高い不確実性を示す。

実験結果

リサーチクエスチョン

  • RQ1分布内データでは一致させながら分布外データでは不一致を強制することで、分布シフト下でのモデル一般化性能が向上するか?
  • RQ2誤った特徴量と非誤った特徴量が同等に予測力を持つ状況でも、D-BATは誤った特徴量への依存を効果的に低減するか?
  • RQ3D-BATは、相互情報量に基づく多様性測定と比較して、意味のあるモデルの不一致をどれほどうまく捉えられるか?
  • RQ4訓練中に明示的なOODデータがなくても、D-BATはOOD入力の不確実性推定を向上させられるか?
  • RQ5差異に基づく訓練目的は、既存のドメイン適応やバイアス除去手法と比較して、より優れた転移性をもたらすか?

主な発見

  • D-BATは、単純で誤った特徴量に依存するのを防ぐことで、短絡的学習(shortcut learning)を顕著に低減する。これは、誤った特徴量が複雑な特徴量と同等に予測力を持つ場合でも同様に有効である。
  • LMS-5およびColored-MNISTデータセットでは、D-BATはOOD一般化ベンチマークで95%以上のテスト精度を達成し、ERMや他のデバイアス化ベースラインを上回る。
  • 標準的な訓練法や相互情報量ベースのアプローチと比較して、OOD検出のAUCが最大15ポイント向上する。
  • D-BATの不一致スコアは、直感的な多様性の概念と整合するが、相互情報量は逆予測を行うモデルを低多様性と誤って特定する。
  • 実験により、D-BATの差異に基づく損失は、相互情報量よりも多様でOODに強い予測子を特定するのに効果的であることが確認された。
  • D-BATが生成するアンサンブルモデルは、OODサンプルに対して高い不確実性を示し、明示的なOODデータがなくても不一致スコアが不確実性を効果的に示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。