Skip to main content
QUICK REVIEW

[論文レビュー] Combining Ensembles and Data Augmentation can Harm your Calibration

Yeming Wen, Ghassen Jerfel|arXiv (Cornell University)|Oct 19, 2020
Adversarial Robustness in Machine Learning参考文献 51被引用数 9
ひとこと要約

本論文は、アンサンブルとデータ拡張(特にMixup)を組み合わせることで、ソフトラベルによる下位の自信と重みのマージナライゼーションが重複することで、モデルのキャリブレーションが劣化するという深刻な病理を特定する。これを是正するため、著者らはCAMixupを提案する——これはクラスおよび例レベルで適応的にMixup係数を調整する手法であり、キャリブレーションを回復させつつ精度を向上させる。CIFAR-10、CIFAR-100、ImageNetにおいて、最先端の不確実性キャリブレーションを達成した。

ABSTRACT

Ensemble methods which average over multiple neural network predictions are a simple approach to improve a model's calibration and robustness. Similarly, data augmentation techniques, which encode prior information in the form of invariant feature transformations, are effective for improving calibration and robustness. In this paper, we show a surprising pathology: combining ensembles and data augmentation can harm model calibration. This leads to a trade-off in practice, whereby improved accuracy by combining the two techniques comes at the expense of calibration. On the other hand, selecting only one of the techniques ensures good uncertainty estimates at the expense of accuracy. We investigate this pathology and identify a compounding under-confidence among methods which marginalize over sets of weights and data augmentation techniques which soften labels. Finally, we propose a simple correction, achieving the best of both worlds with significant accuracy and calibration gains over using only ensembles or data augmentation individually. Applying the correction produces new state-of-the art in uncertainty calibration across CIFAR-10, CIFAR-100, and ImageNet.

研究の動機と目的

  • アンサンブルとMixupのようなデータ拡張を個別に適用すればキャリブレーションが向上する一方で、両者を組み合わせるとモデルのキャリブレーションが劣化する理由を調査すること。
  • 特に、Mixupによるソフトラベルに起因する下位の自信と、アンサンブルによる重みのマージナライゼーションが重複することで生じるキャリブレーション劣化の根本的要因を同定すること。
  • 両者の利点を享受しつつキャリブレーションを損なわない是正手法を開発すること。
  • 複数のベンチマークで最先端の不確実性キャリブレーションを達成するとともに、競争力のある精度を維持すること。

提案手法

  • 検証セットの信頼性(正答率から自信度を差し引いた値)に基づき、クラスごとに適応的にMixup係数を割り当てるCAMixupを提案し、下位の自信を是正する。
  • クラスレベルの信頼性にしきい値処理を適用し、各クラスに対してMixupを適用すべきかどうかを判断する。これにより、全例に均一にMixupを適用するのを回避する。
  • 忘れやすさのカウント(高くなるほど予測が信頼性が低いことを示す)を用いて、例レベルの拡張を実装するCAMixupの拡張版を開発。忘れやすさカウントが高い例にのみMixupを適用することで、キャリブレーションを向上させる。
  • 特にインダゥストリィ(分布内)およびアウトオブディストリビューション(分布外)データのキャリブレーションをさらに精緻化するために、温度スケーリングをCAMixupと併用する。
  • 標準的なディープラーニングパイプラインにCAMixupを統合し、訓練中に検証時のモデル挙動に応じて動的にMixup係数を調整する。
  • MC-dropout、BatchEnsemble、Deep Ensemblesの複数のアンサンブル手法と、CIFAR-10、CIFAR-100、ImageNetの複数のデータセットを用いて評価し、堅牢性と一般化性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1アンサンブルとMixupを組み合わせると、個別に適用すればキャリブレーションが向上するにもかかわらず、なぜキャリブレーションが悪化するのか?
  • RQ2重みのマージナライゼーション(アンサンブル)とラベルスムージング(Mixup)を組み合わせた際、なぜ下位の自信が重複して悪化するのか?
  • RQ3動的かつ適応的なMixup係数戦略が、この相互作用によって引き起こされるキャリブレーション劣化を是正できるか?
  • RQ4提案されたCAMixup手法は、アンサンブルやデータ拡張を個別に使用する場合よりも優れたキャリブレーションと精度を達成できるか?
  • RQ5この手法は、ResNet-50などの異なるアーキテクチャやImageNetのような大規模データセットにも一般化可能か?

主な発見

  • MC-dropout、BatchEnsemble、Deep Ensemblesの3つのアンサンブル手法すべてにおいて、アンサンブルとMixupを組み合わせるとキャリブレーションが著しく劣化し、CIFAR-10およびCIFAR-100ではECEが顕著に上昇した。
  • 根本的要因は、下位の自信が重複する現象である。Mixupによるソフトラベルが負の自信バイアスをもたらし、これがアンサンブルによる重みのマージナライゼーションと組み合わさることで悪化する。
  • CAMixupはCIFAR-10(0.4% ECE)およびCIFAR-100(2.3% ECE)で最先端のキャリブレーションを達成し、個別手法や単純な組み合わせを上回った。
  • ImageNetでは、CAMixupが1.5% ECEを達成し、ResNet-50を用いて77.4%のトップ-1精度を維持しながら、新たな最先端水準を記録した。
  • 忘れやすさカウントに基づくCAMixupは、CIFAR-10において、BatchEnsembleおよびMC-dropoutの大多数の指標でクラスベースのCAMixupを上回るキャリブレーションを達成したが、CIFAR-100では一貫性に欠けた結果となった。
  • 温度スケーリングをCAMixupと組み合わせることで、インダゥストリィデータのキャリブレーションがさらに向上したが、アウトオブディストリビューションデータのキャリブレーションには顕著な改善が見られなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。