[論文レビュー] Stochastic Security: Adversarial Defense Using Long-Run Dynamics of Energy-Based Models
本稿では、収束性を持つエネルギーに基づくモデル(EBM)を用いた長時間のマルコフ連鎖モンテカルロ(MCMC)サンプリングとラングジュアンダイナミクスを用いて、自然に訓練された分類器の事後訓練防御を提案する。この手法は反復的に入力を精錬することで adversarial 入力を浄化し、CIFAR-10、SVHN、CIFAR-100 で最先端のロバスト精度を達成する。再訓練を必要とせず、標準的な adversarial training よりも一部の状況で優れる。
The vulnerability of deep networks to adversarial attacks is a central problem for deep learning from the perspective of both cognition and security. The current most successful defense method is to train a classifier using adversarial images created during learning. Another defense approach involves transformation or purification of the original input to remove adversarial signals before the image is classified. We focus on defending naturally-trained classifiers using Markov Chain Monte Carlo (MCMC) sampling with an Energy-Based Model (EBM) for adversarial purification. In contrast to adversarial training, our approach is intended to secure pre-existing and highly vulnerable classifiers. The memoryless behavior of long-run MCMC sampling will eventually remove adversarial signals, while metastable behavior preserves consistent appearance of MCMC samples after many steps to allow accurate long-run prediction. Balancing these factors can lead to effective purification and robust classification. We evaluate adversarial defense with an EBM using the strongest known attacks against purification. Our contributions are 1) an improved method for training EBM's with realistic long-run MCMC samples, 2) an Expectation-Over-Transformation (EOT) defense that resolves theoretical ambiguities for stochastic defenses and from which the EOT attack naturally follows, and 3) state-of-the-art adversarial defense for naturally-trained classifiers and competitive defense compared to adversarially-trained classifiers on Cifar-10, SVHN, and Cifar-100. Code and pre-trained models are available at https://github.com/point0bar1/ebm-defense.
研究の動機と目的
- 再訓練を伴わず、強力な白箱攻撃に対して自然に訓練された深層ニューラルネットワークを防御するという未解決の問題に取り組む。
- adversarial training とは異なる方法であり、分類器の訓練プロセスを変更しない事後訓練防御を開発する。
- CIFAR-10 などの複雑なデータセットにおいて、安定的で長時間の MCMC サンプリングを EBM で実現し、敵対的信号を除去しながら意味的コンテンツを保持する。
- 期待値-変換(EOT)を用いた包括的な評価フレームワークを導入し、確率的防御およびその攻撃を公平に評価する。
提案手法
- 本手法は、ラベルなしの自然画像上で訓練された畳み込みニューラルネットワークベースのエネルギーに基づくモデル(EBM)を用い、入力画像に対してラングジュアンダイナミクスによるサンプリングを実行する。
- ラングジュアンサンプリングは、EBM からの勾配と注入されたガウスノイズを用いて、ピクセルを反復的に更新し、低エネルギー(自然に見える)な構成へと進化させる。
- 浄化されたサンプルは、長時間の MCMC チェインによって生成され、代謝的安定性の性質を活用して分類の一貫性を維持しながら敵対的摂動を除去する。
- 最終的な予測は、複数の独立した MCMC チェインからのログティの平均を取ることで得られ、サンプリング分布上の真の期待値を近似する。
- 長時間のサンプリングを安定化させるための改善された収束学習手順を導入し、複雑なデータセット上での有効な浄化を可能にする。
- 確率的防御を堅牢に評価するための期待値-変換(EOT)防御を提案し、EOT 攻撃は同じフレームワークから自然に導出される。
実験結果
リサーチクエスチョン
- RQ1収束性を持つ EBM を用いた長時間の MCMC サンプリングは、敵対的入力を効果的に浄化し、自然に訓練された分類器のロバスト性を回復させることができるか?
- RQ2EBM サンプリングを用いた事後訓練防御は、自然に訓練されたモデルにおいて、標準的な adversarial training よりもロバスト性を上回ることができるか?
- RQ3確率的防御の評価を公平に行うには、サンプリングのランダムなばらつきによる過大評価を避けるにはどのような評価手法が必要か?
- RQ4CIFAR-10 などの複雑な画像データセット上で、安定的で長時間の EBM サンプリングを実現するために、EBM 訓練にどのような変更が必要か?
- RQ5EBM を用いた浄化は、EOT や BPDA 変換付き PGD といった、最も強力な既知の白箱攻撃に対しても有効に機能するか?
主な発見
- 提案された EBM 防御は、$\ell_\infty$ パラメータ $\varepsilon = 8/255$ の条件下で SVHN において 67.55% のロバスト精度を達成し、標準的な adversarial training(50.39%)を上回った。
- CIFAR-100 においても、同じ攻撃条件下で 26.10% のロバスト精度を達成し、標準的な adversarial training(25.47%)を上回った。
- 本手法は、CIFAR-10、SVHN、CIFAR-100 において、自然に訓練された分類器として、強力な適応的攻撃に対しても最先端のロバスト精度を示した。
- 改善された EBM 訓練手順により、従来は不安定で防御に不適切であった複雑なデータセット上での現実的で長時間の MCMC サンプリングが可能になった。
- EOT 防御および攻撃フレームワークにより、確率的防御の公平な評価が可能となり、従来の評価における曖昧さが解消された。
- 本防御は、EOT 変換付き PGD や BPDA 変換付き PGD といった、最も強力な既知の攻撃に対しても有効であり、従来の前処理防御が失敗する状況でもロバスト性を保った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。