Skip to main content
QUICK REVIEW

[論文レビュー] Comment on "Adv-BNN: Improved Adversarial Defense through Robust Bayesian Neural Network"

R. Zimmermann|arXiv (Cornell University)|Jul 1, 2019
Adversarial Robustness in Machine Learning参考文献 4被引用数 15
ひとこと要約

この論文は、$l_\infty$ adversarial 攻撃に対するBayesian neural network(Adv-BNN)の頑健性に関する主張を、攻撃手法が不十分であったために生じた誤った優位性に起因することを示す。著者らは、確率的重みサンプル間の勾配推定を安定化させる平均化されたPGD(A-PGD)攻撃を提案し、Adv-BNNがより強力な攻撃で評価された場合、標準的な adversarially trained ネットワークと同等の頑健性しか示さないことが判明した。A-PGDによって生成された例で微調整を行うことで、Adv-BNNの頑健性が回復し、元の評価が勾配不安定性に起因するバイアスに起因していたことが示された。

ABSTRACT

A recent paper by Liu et al. combines the topics of adversarial training and Bayesian Neural Networks (BNN) and suggests that adversarially trained BNNs are more robust against adversarial attacks than their non-Bayesian counterparts. Here, I analyze the proposed defense and suggest that one needs to adjust the adversarial attack to incorporate the stochastic nature of a Bayesian network to perform an accurate evaluation of its robustness. Using this new type of attack I show that there appears to be no strong evidence for higher robustness of the adversarially trained BNNs.

研究の動機と目的

  • Adv-BNN、すなわちBayesian neural network防御の、より正確な adversarial attack 条件下での頑健性を評価すること。
  • 元のAdv-BNN論文で用いられた攻撃手法の欠陥を同定すること、特にBayesian networkの確率的性質を考慮していない点に注目すること。
  • Adv-BNNが報告した頑健性の向上が、不適切な攻撃に起因する誤差であり、本質的な頑健性の向上ではないことを示すこと。
  • 重み分布の確率的性質を適切に扱う、より強力な攻撃手法である平均化PGD(A-PGD)を提案・検証すること。
  • A-PGDによって生成された adversarial 例でAdv-BNNを再訓練することで、より頑健なモデルが得られることを示すことにより、防御評価における攻撃の正確性の重要性を確認すること。

提案手法

  • 複数の確率的重みサンプル $\bm{\epsilon}$ を用いた期待勾配推定により、勾配上昇を安定化させる平均化PGD(A-PGD)攻撃を提案。
  • 標準的なPGD更新則を、$\bm{\epsilon}$ に関する期待値に置き換えることで、Bayesian networkにおける収束性と攻撃の信頼性を向上。
  • 元のAdv-BNN論文と同一のネットワークアーキテクチャと訓練設定を採用。推論時に期待出力を近似するためにアンサンブルサイズ40を用いる。
  • $l_\infty$-有界の摂動を用い、半径 $\gamma = 0.035$ および $\gamma = 0.07$ を設定。150ステップで攻撃を実行し、収束を確認。
  • 公開済みのモデルとコードを用いて、元のAdv-BNNおよび adversarially trained 標準CNNをSTL-10データセット上で再実装。
  • A-PGD攻撃によって生成された adversarial 例を用いて、Adv-BNNを再訓練し、より高い頑健性が達成可能かどうかを評価。

実験結果

リサーチクエスチョン

  • RQ1より正確で勾配安定化された攻撃手法を用いた場合、Adv-BNNの $l_\infty$ 攻撃に対する報告された頑健性は維持されるか?
  • RQ2Adv-BNNが標準的な adversarially trained ネットワークを上回る性能を示すのは、本質的な頑健性のおかげか、それとも攻撃が重みの確率的性質を処理できないことによる誤差か?
  • RQ3提案されたA-PGD攻撃を用いた adversarial training により、Bayesian neural network をより頑健にできるか?
  • RQ4攻撃手法の選択が、Bayesian neural network の頑健性の評価にどのように影響するか?
  • RQ5確率的ネットワークにおける勾配不安定性が、adversarial 頑健性評価の信頼性に与える影響は何か?

主な発見

  • ナーブなPGD攻撃で評価した場合、元のAdv-BNN防御は標準的な adversarially trained ネットワークよりも顕著に頑健に見える。$\gamma = 0.035$ 時に37.6%の精度を達成した。
  • 提案されたA-PGD攻撃で評価した場合、Adv-BNNの精度は $\gamma = 0.035$ 時に30.3%に低下し、元の攻撃における勾配不安定性に起因して頑健性が過大評価されていたことが示された。
  • A-PGD評価下では、標準的な adversarially trained CNN がAdv-BNNを上回り、$\gamma = 0.035$ 時に38.2%の精度を達成した。これにより、Adv-BNNに一貫した頑健性優位性はないことが判明した。
  • A-PGDによって生成された adversarial 例でAdv-BNNを再訓練することで、頑健性が向上し、$\gamma = 0.035$ 時に31.2%の精度を達成した。これは元のAdv-BNNを上回り、標準CNNと同等の性能を示した。
  • A-PGD攻撃はナーブなPGD攻撃よりも、Bayesian networkの真の頑健性を明らかにするのに効果的であり、勾配平均化が正確な評価に不可欠であることを証明した。
  • 本研究は、Bayesian neural network の頑健性が攻撃手法の正確性に極めて敏感であり、ナーブな攻撃ではモデル性能に関する誤った結論を導く可能性があると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。