Skip to main content
QUICK REVIEW

[論文レビュー] Diverse Ensembles Improve Calibration

Asa Cooper Stickland, Iain Murray|arXiv (Cornell University)|Jul 8, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用数 13
ひとこと要約

本稿では、各アンサンブルメンバーに特化した多様なデータ拡張(敵対的摂動、AugMix、確率的深さ)を適用することで、深層ニューラルネットワークアンサンブルにおけるモデルのキャリブレーションを向上させる、単純ながら効果的な手法を提案する。さらに、わずかな確率で元の入力を混ぜることで、i.i.d. および分布外データの両方でキャリブレーションと精度が向上し、CIFAR-10 および CIFAR-100 ベンチマークにおいて強力なベースラインを上回る性能を達成する。

ABSTRACT

Modern deep neural networks can produce badly calibrated predictions, especially when train and test distributions are mismatched. Training an ensemble of models and averaging their predictions can help alleviate these issues. We propose a simple technique to improve calibration, using a different data augmentation for each ensemble member. We additionally use the idea of `mixing' un-augmented and augmented inputs to improve calibration when test and training distributions are the same. These simple techniques improve calibration and accuracy over strong baselines on the CIFAR10 and CIFAR100 benchmarks, and out-of-domain data from their corrupted versions.

研究の動機と目的

  • 分布シフト下での誤った予測の問題に対処すること。
  • 計算コストを増加させることなく、アンサンブルモデルのキャリブレーションと一般化性能を向上させること。
  • 各アンサンブルメンバーに異なるデータ拡張を適用することで、モデルのキャリブレーションが向上するかを検証すること。
  • 未拡張および拡張済みの入力を混合することによるキャリブレーション性能への影響を評価すること。

提案手法

  • 各アンサンブルメンバーに異なるデータ拡張(敵対的摂動、AugMix、確率的深さ)を適用して多様性を高める。
  • バッチアンサンブルを用いて大部分のモデルパラメータを共有し、トレーニングおよび保存コストを低減する。
  • ランダムな混合戦略を導入:確率pで未拡張の入力を使用し、それ以外は拡張済みの入力を使用する。
  • 敵対的摂動の場合は、ランダムスケーリングとドロップアウト風マスキングを施した変更版の高速勾配符号法を用いて入力を生成する。
  • AugMixについては、元の手法を簡素化し、ベータ分布の代わりにベルヌーイ試行を用いて元の画像と拡張済み画像の間で選択する。
  • 各アンサンブルメンバーを効率的にパラメータ化するため、学習可能な適応ベクトルr_iおよびs_iを共有重み行列Wと組み合わせて使用する。

実験結果

リサーチクエスチョン

  • RQ1各アンサンブルメンバーに異なるデータ拡張を適用することで、i.i.d. および分布外データの両方でモデルのキャリブレーションが向上するか?
  • RQ2未拡張および拡張済みの入力を混合することで、i.i.d. テストセットにおけるキャリブレーションと精度にどのような影響を与えるか?
  • RQ3トレーニング分布とテスト分布が異なる状況で、各メンバーに異なる拡張を適用することで、誤ったキャリブレーションが軽減されるか?
  • RQ4拡張戦略の選択(例:敵対的拡張対比 AugMix)が、損傷を加えたデータにおける性能に与える影響は?
  • RQ5性能向上の要因は、アンサンブルの多様性に起因するのか、それとも特定の形式のデータ拡張に起因するのか?

主な発見

  • 各アンサンブルメンバーに異なる拡張の強度を適用したことで、CIFAR-10-CではECEが1.4ポイント、CIFAR-100-Cでは1.2ポイント低下し、非多様なアンサンブルと比較して改善した。
  • 未拡張の入力を混ぜ込む(p=0.875)ことで、i.i.d. データにおけるキャリブレーションが向上し、常に拡張する場合と比較してCIFAR-10ではECEが0.3ポイント低下した。
  • 敵対的摂動とAugMixの組み合わせが最良の性能を示し、CIFAR-10-Cでは10.9%の誤差を達成した。これはHendrycksら(2020)の34.9%の誤差を上回った。
  • 多様な拡張を適用したアンサンブルは、分布外データにおいて非多様な対応よりも一貫して優れたキャリブレーションを示したが、精度は同程度であった。
  • 未拡張の入力を使用しない(p=1.0)と、i.i.d. データにおける性能が劣化した。これは、i.i.d. 例にさらされることでキャリブレーションが達成されることの重要性を示している。
  • 本手法はCIFAR-10およびCIFAR-100の両方で強力なベースラインを上回り、すべてのベンチマークでキャリブレーションおよび精度の最先端の結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。