[論文レビュー] Breaking Transferability of Adversarial Samples with Randomness
本論文は、深層ニューラルネットワーク(DNN)における敵対的攻撃の転送性を破る2つのランダム化ベースの防御手法を提案する。推論時に100のモデルからなるプールからDNNをランダムに選択するか、モデル重みに小さなガウスノイズを追加することで、再訓練を必要とせずに、耐性を著しく向上させ、最大74.2%の耐性向上を達成した。これは、攻撃の予算が変化する状況でも、アンサンブル敵対的訓練を上回る性能を発揮した。
We investigate the role of transferability of adversarial attacks in the observed vulnerabilities of Deep Neural Networks (DNNs). We demonstrate that introducing randomness to the DNN models is sufficient to defeat adversarial attacks, given that the adversary does not have an unlimited attack budget. Instead of making one specific DNN model robust to perfect knowledge attacks (a.k.a, white box attacks), creating randomness within an army of DNNs completely eliminates the possibility of perfect knowledge acquisition, resulting in a significantly more robust DNN ensemble against the strongest form of attacks. We also show that when the adversary has an unlimited budget of data perturbation, all defensive techniques would eventually break down as the budget increases. Therefore, it is important to understand the game saddle point where the adversary would not further pursue this endeavor. Furthermore, we explore the relationship between attack severity and decision boundary robustness in the version space. We empirically demonstrate that by simply adding a small Gaussian random noise to the learned weights, a DNN model can increase its resilience to adversarial attacks by as much as 74.2%. More importantly, we show that by randomly activating/revealing a model from a pool of pre-trained DNNs at each query request, we can put a tremendous strain on the adversary's attack strategies. We compare our randomization techniques to the Ensemble Adversarial Training technique and show that our randomization techniques are superior under different attack budget constraints.
研究の動機と目的
- 敵対的転送性がDNNにおいて本質的で避けがたいものであるという仮定に挑戦すること。
- DNNのバージョン空間における意思決定境界の耐性と攻撃の深刻さの関係を調査すること。
- 再訓練を必要とせず、敵対的転送性を遮断する実用的で計算効率の良い防御を構築すること。
- 特にブラックボックス設定下で、攻撃の予算が変化する状況におけるランダム化技術の有効性を評価すること。
- 提案手法をアンサンブル敵対的訓練と比較し、制限された摂動予算下での優れた耐性を示すこと。
提案手法
- 各推論クエリにおいて、あらかじめ訓練済みの100のモデルからなるプールからDNNをランダムに選択し、攻撃者に対して使用されたモデルを隠蔽する。
- 単一のDNNの学習済み重みに小さなガウスランダムノイズを導入し、敵対的摂動に対する耐性を向上させる。
- 予測アンサンブル($E_p$)と攻撃アンサンブル($E_a$)が異なる動的アンサンブル戦略を用い、転送性を攪乱する。
- CIFAR-10、MNIST、Traffic Signデータセットにおいて、$L_2$-ノルムを用いたターゲットありおよびターゲットなしの敵対的攻撃を通じて耐性を評価する。
- 攻撃の信頼度($Conf$)が変化する状況下で、静的アンサンブル、ランダムアンサンブル、標準アンサンブル敵対的訓練と性能を比較する。
- クリーンデータ上の精度と攻撃下での耐性のバランスを最適化するため、ノイズの標準偏差($x$)を最適化する。
実験結果
リサーチクエスチョン
- RQ1モデル選択のランダム化またはモデル重みのランダム化は、異なるDNN間での敵対的サンプルの転送性を効果的に破壊できるか?
- RQ2敵対的摂動の深刻さ(攻撃の予算)は、DNNにおける転送性の成功にどのように影響するか?
- RQ3推論時に使用するDNNをランダムに選択することは、固定または静的アンサンブルと比較して耐性を著しく向上させるか?
- RQ4アンサンブル学習や敵対的データでの再訓練を必要とせず、重みのランダム化のみで強力な防御が可能か?
- RQ5攻撃の信頼度が異なる状況下で、ランダム化ベースの防御の性能はアンサンブル敵対的訓練と比べてどうか?
主な発見
- DNNの重みに小さなガウスノイズを追加することで、低予算攻撃下のクリーンデータに対する耐性が最大74.2%向上した。
- 各クエリで100のモデルからランダムにDNNを選択することで、特に$Conf=0$のとき、転送性に基づく攻撃の成功率が低下した。
- 動的アンサンブル戦略($E_p \neq E_a$)は静的アンサンブル($E_p = E_a$)を著しく上回り、高い摂動予算下でも精度が維持された。
- 重みのランダム化($x > 0$)により、高信頼度攻撃($Conf \geq 5$)下でも耐性が向上し、標準アンサンブルでは弱い構成のため失敗した状況でも有効だった。
- MNISTデータセットがランダム化に対して最も耐性が高く、次にCIFAR-10、Traffic Signデータセットが最も影響を受けにくかった。これは、低い微分エントロピーに起因する。
- 攻撃の摂動予算が無制限の場合、いかなる防御手法でも完全に耐えられず、転送性は攻撃の深刻さによって制限されることを確認した。これは、転送性がモデル設計そのものに起因するのではなく、攻撃の深刻さに依存することを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。