Skip to main content
QUICK REVIEW

[論文レビュー] Certifiably Adversarially Robust Detection of Out-of-Distribution Data

Julian Bitterwolf, Alexander Meinke|arXiv (Cornell University)|Jul 16, 2020
Adversarial Robustness in Machine Learning被引用数 16
ひとこと要約

本稿では、任意の分布外(OOD)点のl∞-球(半径ε)内において、分類器の信頼度を保証的に低く抑える方法GOOD(Guaranteed Out-of-distribution Detection)を提案する。訓練中に区間境界伝播(IBP)を用いて、このような球内での最大信頼度の上界を最小化することで、OODに対する敵対的摂動に対して証明可能なロバスト性を達成し、分布内タスクにおける精度の著しい低下を伴わない。

ABSTRACT

Deep neural networks are known to be overconfident when applied to out-of-distribution (OOD) inputs which clearly do not belong to any class. This is a problem in safety-critical applications since a reliable assessment of the uncertainty of a classifier is a key property, allowing the system to trigger human intervention or to transfer into a safe state. In this paper, we aim for certifiable worst case guarantees for OOD detection by enforcing not only low confidence at the OOD point but also in an $l_\infty$-ball around it. For this purpose, we use interval bound propagation (IBP) to upper bound the maximal confidence in the $l_\infty$-ball and minimize this upper bound during training time. We show that non-trivial bounds on the confidence for OOD data generalizing beyond the OOD dataset seen at training time are possible. Moreover, in contrast to certified adversarial robustness which typically comes with significant loss in prediction performance, certified guarantees for worst case OOD detection are possible without much loss in accuracy.

研究の動機と目的

  • 深層ニューラルネットワーク分類器が、敵対的摂動下でも分布外(OOD)データに対して低信頼度を維持することを、証明可能な最悪ケース保証で提供すること。
  • 分布内での敵対的例にとどまらず、安全性に深刻な影響を及える可能性があるにもかかわらず、しばしば無視されがちな分布外入力に対しても、証明可能なロバスト性を拡張すること。
  • トレーニング時に見られなかった分布外データセット(例:MNISTの数字で学習した際のEMNISTの文字)に対しても、OOD検出の保証を一般化する訓練手法を開発すること。
  • 従来の証明可能な敵対的ロバスト性手法とは異なり、分布内分類タスクにおける性能の著しい低下を伴わず、証明可能なOODロバスト性を達成すること。

提案手法

  • 任意の与えられたOOD点の周囲のl∞-球(半径ε)における分類器の信頼度の上界を、区間境界伝播(IBP)を用いて計算する。
  • 新しい目的関数を用いて、IBPから得られる上界を訓練中に最小化することで、OOD入力のε-球内にあるいかなる点に対しても、モデルが高信頼度を割り当てられないように保証する。
  • 最悪ケースOOD信頼度バウンドを明示的に最適化するGOOD(Guaranteed Out-of-distribution Detection)訓練方式を導入する。
  • トレーニング中に多様なOODデータに対して、証明可能なバウンド最小化を適用することで、トレーニング中に見られなかった関連するが未確認のOODデータセットへの一般化を可能にする。
  • IBPバウンディングの微分可能な緩和を用いることで、標準的なバックプロパゲーションを用いたエンドツーエンド訓練を可能にする。
  • 複数のデータセットおよびε値において、AAUCとGAUC指標を用いて証明可能な保証を検証し、トレーニング時のOOD分布を超えた一般化を示している。

実験結果

リサーチクエスチョン

  • RQ1l∞ノルムにおける敵対的摂動下でも、深層ニューラルネットワークが分布外入力に対して低信頼度を維持することを、証明可能な保証で提供できるか?
  • RQ2IBP訓練によるOODロバスト性の証明は、敵対的ロバスト性と同様に、分布内分類タスクにおいて顕著な精度コストを伴うのか?
  • RQ3トレーニング時に存在しなかった分布外データセット(例:MNISTの数字で学習した際のEMNISTの文字)に対しても、証明可能なOOD検出保証を一般化できるか?
  • RQ4AAUCやGAUC指標において、GOODの性能はOutlier Exposure(OE)、ACET、CCUといった最先端のOOD検出手法と比較して、より高い証明可能なロバスト性とより大きな摂動半径への一般化を達成できるか?
  • RQ5既存の手法が失敗する、分布内マニフォールドに近い分布外点の周囲のl∞-球に対して、意味のある最悪ケース信頼度バウンディングを達成できるか?

主な発見

  • GOODは、OOD検出における証明可能な最悪ケース信頼度バウンディングを達成した:CIFAR-100のチンパンジー画像の周囲のl∞-球(ε=0.01)において、すべてのクラスに対して信頼度が22.7%未満であることを保証する。
  • GOODは、証明可能なOODロバスト性を提供しながらも、分布内精度をほぼSOTA水準に維持する(例:ε=0.03のCIFAR-10では99.1%)。これは、敵対的ロバスト性手法が著しい精度低下を伴うのとは対照的である。
  • MNIST → EMNIST lettersのOOD検出タスクにおいて、GOODはε=0.08でGAUC 84.5%を達成し、ACET(52.1%)やOE(63.6%)を上回り、未確認のOODデータへの一般化も可能である。
  • GOODは大きなε値に対しても良好に一般化する:MNISTで学習した場合、CIFAR-10でε=0.1のGAUCは77.3%を達成し、ACET(52.1%)やOE(63.6%)を著しく上回る。
  • GOODは、評価されたすべてのデータセットおよびε値において、最先端のAAUCおよびGAUCを達成し、トレーニング時に使用された脅威モデルを超えた、証明可能なOODロバスト性の一般化が優れていることを示している。
  • GOODの証明可能なバウンディングは非自明で意味のあるものである:例えば、モデルがそのような画像で学習されていなくても、チンパンジー画像の周囲のl∞-球に対して信頼度が22.7%未満であることを保証している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。