Skip to main content
QUICK REVIEW

[論文レビュー] On Attacking Out-Domain Uncertainty Estimation in Deep Neural Networks

Huimin Zeng, Zhenrui Yue|arXiv (Cornell University)|Oct 3, 2022
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本論文は、分布外(OOD)の不確実性推定における深層ニューラルネットワークの脆弱性を暴く白箱攻撃を提案する。この攻撃は、人間の知覚に影響を及げないほどの微小な摂動を生成し、最先端の不確実性推定モデルがOOD入力に対して高い信頼度を割り当てるように仕向け、その結果、OODデータに対して90%を超える信頼度スコアを示すようになる。Deep Ensemble、DUQ、DUE、SNGPといった手法は、OOD検出性能が優れているものの、攻撃に対して極めて脆弱であることが示された。

ABSTRACT

In many applications with real-world consequences, it is crucial to develop reliable uncertainty estimation for the predictions made by the AI decision systems. Targeting at the goal of estimating uncertainty, various deep neural network (DNN) based uncertainty estimation algorithms have been proposed. However, the robustness of the uncertainty returned by these algorithms has not been systematically explored. In this work, to raise the awareness of the research community on robust uncertainty estimation, we show that state-of-the-art uncertainty estimation algorithms could fail catastrophically under our proposed adversarial attack despite their impressive performance on uncertainty estimation. In particular, we aim at attacking the out-domain uncertainty estimation: under our attack, the uncertainty model would be fooled to make high-confident predictions for the out-domain data, which they originally would have rejected. Extensive experimental results on various benchmark image datasets show that the uncertainty estimated by state-of-the-art methods could be easily corrupted by our attack.

研究の動機と目的

  • 深層ニューラルネットワークにおける最先端の不確実性推定手法が、分布外(OOD)入力に焦点を当てた敵対的攻撃に対して、いかに深刻な脆弱性を有するかを明らかにすること。
  • 非常に高い精度を示す不確実性推定モデルであっても、微小で人間の知覚に影響を及げない摂動によって、OODデータに対して過信された予測を下すように操作可能であることを実証すること。
  • 自動運転や医療診断などの安全に重要なAIアプリケーションにおいて、不確 Promise とされる。
  • 不確実性推定モデルの敵対的摂動に対する耐性を体系的に評価できる白箱攻撃フレームワークのプロトタイプを提供すること。
  • 今後の研究が、このような攻撃に対する耐性を持つ不確実性推定アルゴリズムおよび防御機構の開発を促進すること。

提案手法

  • 深層ニューラルネットワークの不確実性推定ヘッドを標的とした白箱攻撃を提案し、特にOOD入力に対して高い信頼度を割り当てるようにモデルをだますことを目的としている。
  • 勾配に基づく最適化手法を用いて、OOD入力をモデルの予測空間における高信頼度領域へとシフトさせる敵対的摂動を生成する。
  • OODサンプルの予測信頼度を最大化し、同時にインディスクリプション(ID)サンプルの信頼度を最小化する損失関数を採用することで、攻撃の効果性と的確性を保証する。
  • Deep Ensemble、DUQ(RBFベース)、DUE(ガウス過程ベース)、SNGP(スペクトル正規化ガウス過程)といった複数の最先端の不確実性推定手法に攻撃を適用する。
  • CIFAR-10、SVHN、NotMNISTなどの複数のベンチマークデータセットを用い、摂動の大きさ(ε)を変化させることで、スケーラビリティと耐性を評価する。
  • 攻撃前後における信頼度分布の可視化を行い、OODサンプルのモデル信頼度が著しく上昇していることを示している。

実験結果

リサーチクエスチョン

  • RQ1最先端の不確実性推定手法は、分布外(OOD)入力に対してどれほど敵対的摂動によってだませられるのか。
  • RQ2摂動の大きさ(ε)が、異なる不確実性推定モデルにおける攻撃の成功率と信頼度上昇に与える影響は何か。
  • RQ3提案された攻撃は、多様なアーキテクチャや不確実性推定手法において一貫して信頼性を低下させるのか。
  • RQ4敵対的摂動が、分布外検出における重要な不確実性指標(エントロピー、リジェクトレートなど)に与える影響は何か。
  • RQ5敵対的訓練を施したモデル(例:敵対的訓練を施したDeep Ensemble)は、標準モデルと比較して、提案攻撃に対してどれほど耐性を示すのか。

主な発見

  • 提案された敵対的攻撃は、最先端の不確実性推定モデルが分布外(OOD)入力に対して予測信頼度を著しく上昇させることに成功し、複数の事例で信頼度スコアが90%を超えた。
  • NotMNISTにおけるDUQモデルでは、エントロピーがクリーン状態(1.02)からεが0.016から0.063に増加するにつれて0.80および0.72に低下し、不確実性が著しく減少した。
  • SVHNでは、敵対的訓練を施したDeep Ensembleがεが大きくなるにつれてエントロピーとリジェクトレートが上昇し、一貫性のない挙動を示したが、依然として高信頼度の誤った予測を出力した。
  • 信頼度分布の可視化により、元々OOD画像に対して約50%の信頼度しか持たなかったDUEのようなモデルが、攻撃後には90%を超える信頼度に達することが明らかになった。
  • 攻撃はDeep Ensemble、DUQ、DUE、SNGPといった多様な不確実性推定手法に効果を示し、広範な脆弱性を示した。
  • 結果として、深刻なセキュリティギャップが判明した:強力なOOD検出性能を示すモデルですら、分布外入力に対して過信された、ひいては危険な予測を下すように操作可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。