[論文レビュー] Calibrated ensembles can mitigate accuracy tradeoffs under distribution shift
本稿では、標準的でロバストなモデルをインディストリビューション(ID)データ上でキャリブレーションした後、それらをアンサンブル化するIDキャリブレーションアンサンブルという手法を提案する。この手法により、11の自然な分布シフトデータセットにおいて、IDおよびアウトオブディストリビューション(OOD)精度の両方で最先端の性能を達成した。本手法は、OODデータを一切使用しないにもかかわらず、90.3%のID精度と74.5%のOOD精度を達成し、個々のモデルや先行の自己学習手法を上回る性能を発揮した。
We often see undesirable tradeoffs in robust machine learning where out-of-distribution (OOD) accuracy is at odds with in-distribution (ID) accuracy: a robust classifier obtained via specialized techniques such as removing spurious features often has better OOD but worse ID accuracy compared to a standard classifier trained via ERM. In this paper, we find that ID-calibrated ensembles -- where we simply ensemble the standard and robust models after calibrating on only ID data -- outperforms prior state-of-the-art (based on self-training) on both ID and OOD accuracy. On eleven natural distribution shift datasets, ID-calibrated ensembles obtain the best of both worlds: strong ID accuracy and OOD accuracy. We analyze this method in stylized settings, and identify two important conditions for ensembles to perform well both ID and OOD: (1) we need to calibrate the standard and robust models (on ID data, because OOD data is unavailable), (2) OOD has no anticorrelated spurious features.
研究の動機と目的
- ロバストな機械学習における一般的な精度のトレードオフ、すなわちロバストモデルがOOD性能を向上させるためにID精度を犠牲にすることを是正すること。
- OODデータを必要としない一般化可能でデータ効率の良い手法を開発し、IDおよびOOD精度の両方を向上させること。
- 自然な分布シフトにおいて、キャリブレーション済みの標準的およびロバストモデルをアンサンブル化することで、ID-OOD精度のトレードオフを緩和できるかどうかを調査すること。
- 分布シフト下でIDキャリブレーションアンサンブルが成功または失敗する条件、特に分布シフトに伴う誤った特徴相関の有無について特定すること。
提案手法
- 温度スケーリングを用いて、インディストリビューション(ID)バリデーションデータ上で標準的およびロバストモデルを別々にキャリブレーションし、信頼性の高い予測を実現する。
- キャリブレーション済みの標準的およびロバストモデルの予測を単純に平均することでアンサンブル化する。これは、キャリブレーション後におけるID性能の理論的最適性を満たす。
- キャリブレーションにOODデータを一切使用せず、実際の状況では通常入手不可能なOODデータに依存しない。
- IDおよびOODテストセットの両方でアンサンブルを評価し、分布シフトに伴う性能を測定する。
- 独立した信号を持つ簡素化された設定で理論的条件を導出し、本手法の成功条件を理論的に分析する。
- IDデータ上でチューニングされた重み付きアンサンブルや自己学習ベースラインと比較する。
実験結果
リサーチクエスチョン
- RQ1OODデータを一切使用せずに、キャリブレーション済みの標準的およびロバストモデルをアンサンブル化することで、IDおよびOOD精度を向上させることができるか?
- RQ2どのような分布シフト条件下で、IDキャリブレーションアンサンブルが個々のモデルや先行の最先端手法を上回るか?
- RQ3なぜIDキャリブレーションアンサンブルは自然な分布シフトでは良好に機能するが、逆相関する誤った特徴を有する敵対的・合成されたシフトでは失敗するのか?
- RQ4IDデータにおけるモデルキャリブレーションが、IDおよびOOD性能の向上を可能にする役割は何か?
主な発見
- 11の自然な分布シフトデータセットにおいて、IDキャリブレーションアンサンブルは90.3%のインディストリビューション精度と74.5%のアウトオブディストリビューション精度を達成し、標準モデル(88.7% ID、65.2% OOD)およびロバストモデル(86.8% ID、72.3% OOD)を上回った。
- 追加のラベルなしデータを一切使用しないにもかかわらず、自己学習に基づく先行の最先端手法を上回った。
- 自然な分布シフトにおいて、誤った特徴がOODで逆相関していない場合、ID-OOD精度のトレードオフが完全に解消された。
- 誤った特徴がOODシフトで逆相関する場合、アンサンブルは標準モデルとロバストモデルの間のOOD精度(72.3%~74.5%)にとどまり、理論的期待に一致する失敗を示した。
- IDデータにおけるキャリブレーションは、IDデータの期待キャリブレーション誤差(ECE)を顕著に低減したが、OODのキャリブレーションは依然として悪いため、IDキャリブレーションのみではOODキャリブレーションには不十分であることが示唆された。
- チューニングされた重み付きアンサンブルよりも、キャリブレーション済みモデルの単純なアンサンブルが優れた性能を発揮した。これは、最適な組み合わせがハイパーパramータチューニングではなく、キャリブレーションによって達成される可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。