Skip to main content
QUICK REVIEW

[論文レビュー] On Calibration and Out-of-domain Generalization

Yoav Wald, Amir Feder|arXiv (Cornell University)|Feb 20, 2021
Domain Adaptation and Few-Shot Learning参考文献 41被引用数 10
ひとこと要約

本稿では、機械学習における分布外(OOD)一般化の実用的で理論的裏付けのある代替指標として、マルチドメインキャリブレーションを提案する。複数のドメインで同時にキャリブレーションが達成されることにより擬似相関が存在しないことが示唆され、その結果、マルチドメインECEに基づくモデル選択、レジラント等方回帰、エンドツーエンドのキャリブレーション学習といった手法が導入され、WILDSおよびColored MNISTベンチマークにおけるOOD性能が向上した。

ABSTRACT

Out-of-domain (OOD) generalization is a significant challenge for machine learning models. Many techniques have been proposed to overcome this challenge, often focused on learning models with certain invariance properties. In this work, we draw a link between OOD performance and model calibration, arguing that calibration across multiple domains can be viewed as a special case of an invariant representation leading to better OOD generalization. Specifically, we show that under certain conditions, models which achieve \emph{multi-domain calibration} are provably free of spurious correlations. This leads us to propose multi-domain calibration as a measurable and trainable surrogate for the OOD performance of a classifier. We therefore introduce methods that are easy to apply and allow practitioners to improve multi-domain calibration by training or modifying an existing model, leading to better performance on unseen domains. Using four datasets from the recently proposed WILDS OOD benchmark, as well as the Colored MNIST dataset, we demonstrate that training or tuning models so they are calibrated across multiple domains leads to significantly improved performance on unseen test domains. We believe this intriguing connection between calibration and OOD generalization is promising from both a practical and theoretical point of view.

研究の動機と目的

  • 学習ドメイン内では強力な性能を示すが、未学習の分布では失敗する機械学習における分布外(OOD)一般化の課題に対処すること。
  • 高次元データにスケーリングが困難で、しばしば擬似相関を除去できない、従来の不変表現学習手法における深刻なギャップを特定すること。
  • 複数ドメインにおけるモデルキャリブレーションと擬似相関の不在の間の理論的関連を確立し、キャリブレーションを不変性の代理指標として位置づけること。
  • 実用的でトレーニング可能かつ測定可能な手法を整備し、マルチドメインキャリブレーションを向上させ、現実世界の状況におけるより良いOOD一般化を実現すること。
  • 実験的に、マルチドメインキャリブレーションを最適化することで、WILDSやColored MNISTを含む多様なベンチマークでOOD精度が顕著に向上することを示すこと。

提案手法

  • 複数の環境におけるキャリブレーションの尺度として、全学習ドメインにおけるECEの平均値として定義されるマルチドメイン期待キャリブレーション誤差(ECE)スコアを提案する。
  • ドメイン内精度を所望のしきい値に制約しつつマルチドメインECEを最小化するモデル選択手法を導入し、精度とロバスト性のトレードオフを可能にする。
  • 再トレーニングなしにドメイン間でのキャリブレーションを改善するために、レジラント等方回帰を後処理ステップとして適用する。
  • Kumarら(2018)の手法を用いて、マルチドメインキャリブレーションを直接最適化するエンドツーエンドの訓練目的を定式化し、深層ネットワークがキャリブレート可能で不変な表現を学習できるようにする。
  • 因果モデリングを用いて、因果的要因、反因果的非擬似要因、反因果的擬似要因を区別し、理論的分析を構造的因果モデルに根拠づける。
  • 理論的分析により、一般位置条件の下でガウス線形モデルにおいて、複数ドメインでの同時キャリブレーションが擬似相関の不在を示すことが証明され、本手法の形式的裏付けが得られた。

実験結果

リサーチクエスチョン

  • RQ1マルチドメインキャリブレーションは、分布外一般化の測定可能でトレーニング可能な代替指標として機能できるか?
  • RQ2どのような条件下でマルチドメインキャリブレーションがモデルにおける擬似相関の不在を示すか?
  • RQ3マルチドメインキャリブレーションは、不変リスク最小化(IRM)のような既存の不変性ベース手法と比較して、OOD性能でどのように差をつけるか?
  • RQ4等方回帰のような後処理技術が、キャリブレーションの向上を通じてどれほどOOD一般化を改善できるか?
  • RQ5マルチドメインキャリブレーションを最適化することで、多様なベンチマークデータセットで一貫したOOD精度の向上が得られるか?

主な発見

  • 一般位置条件の下でガウス線形モデルにおいて、十分な数のドメインで同時にキャリブレーションが達成されれば、擬似相関が必然的に排除される。
  • マルチドメインECEを最小化するモデル選択は、0.25,0.9分布のテスト環境で64.98%のOOD精度を達成し、ドメイン内精度のみに基づくモデル選択を上回った。
  • 提案手法は、IRMv1のペナルティがOOD精度に基づいてモデルを正しくランク付けできない失敗事例においても、IRMv1を著しく上回るOOD性能を達成した。
  • レジラント等方回帰による後処理は、再トレーニングなしにドメイン間でのキャリブレーションを向上させ、OOD一般化を強化した。
  • WILDSベンチマークにおいて、深層ネットワークにマルチドメインキャリブレーション目的を組み込むことで、特にCivilCommentsおよびCAMELYON17データセットでOOD精度が顕著に向上した。
  • 訓練環境における平均ECEは、特にIRMが失敗するような困難な分布シフトにおいて、IRMv1ペナルティよりもOOD性能とより信頼性の高い相関を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。