[論文レビュー] Making Substitute Models More Bayesian Can Enhance Transferability of Adversarial Examples
この論文は、ブラックボックス攻撃における adversarial examples の転送性を向上させるために、代替モデルに対するベイジアン微調整手法を提案する。モデル重みを確率分布としてモデル化し、事後分布の平均を最適化することで、より転送性の高い摂動を生成する。ImageNet では攻撃成功率が19%絶対的上昇を達成し、最先端手法を大きく上回り、既存の技術と組み合わせることで顕著な性能向上を示す。
The transferability of adversarial examples across deep neural networks (DNNs) is the crux of many black-box attacks. Many prior efforts have been devoted to improving the transferability via increasing the diversity in inputs of some substitute models. In this paper, by contrast, we opt for the diversity in substitute models and advocate to attack a Bayesian model for achieving desirable transferability. Deriving from the Bayesian formulation, we develop a principled strategy for possible finetuning, which can be combined with many off-the-shelf Gaussian posterior approximations over DNN parameters. Extensive experiments have been conducted to verify the effectiveness of our method, on common benchmark datasets, and the results demonstrate that our method outperforms recent state-of-the-arts by large margins (roughly 19% absolute increase in average attack success rate on ImageNet), and, by combining with these recent methods, further performance gain can be obtained. Our code: https://github.com/qizhangli/MoreBayesian-attack.
研究の動機と目的
- 代替モデルの多様性を高めることで、ブラックボックス攻撃における adversarial examples の転送性を向上させること。
- 先行研究が主に入力の多様性とバックプロパゲーションに注目しているのに対し、代替モデルの訓練/微調整への注目が不足しているという問題に取り組むこと。
- 効果的なアンサンブル型攻撃生成を可能にする、原理的で整合性のあるベイジアンフレームワークを代替モデルの訓練に開発すること。
- モデルパラメータのベイジアンモデリングが、耐性モデルやビジョントランスフォーマーのアーキテクチャを含む多様な被害者モデルにおいて、adversarial 転送性を向上させることを示すこと。
提案手法
- 代替モデルの重みとバイアスを、ガウス事後分布を持つ確率変数としてモデル化し、不確実性を考慮した訓練を可能にする。
- 攻撃を、代替モデルの事後分布にわたる期待 adversarial 損失を最大化する問題として定式化し、効果的にアンサンブルモデルを攻撃する。
- 深層ニューラルネットワークのための汎用的なガウス事後分布近似と互換性を持つ、ベイジアン推論に基づく一貫性のある微調整戦略を開発する。
- 計算効率を標準訓練と同等に保ちながら、事後分布上の確率的最適化を介して実装する。
- 既存の転送ベース攻撃技術と互換性があり、それらと組み合わせることでさらなる性能向上が可能である。
- 変分推論を用いてベイジアン代替モデルを訓練し、重みの事後分布を等方的またはフル共分散ガウス分布で近似する。
実験結果
リサーチクエスチョン
- RQ1ベイジアンパラメータの不確実性による代替モデルの多様性向上が、adversarial examples の転送性を高めることができるか?
- RQ2標準的な決定的訓練と比較して、代替モデルのベイジアン微調整が、より頑健で転送性の高い adversarial examples をもたらすか?
- RQ3ビジョントランスフォーマーや耐性モデルを含む多様な被害者モデルにおいて、提案手法は最先端の転送ベース攻撃と比較して、成功率の面で優れているか?
- RQ4既存の攻撃技術と組み合わせることで、ベイジアン代替モデルが効果的に転送性を向上させることができるか?
主な発見
- 提案手法は、ILA++ と組み合わせた場合、ImageNet における平均攻撃成功率が最先端手法と比較して19%絶対的上昇を達成し、94.65%の成功率を記録した。
- ViT-B や DeiT-B といったビジョントランスフォーマーでは、それぞれ21.66%および43.53%の成功率を達成し、I-FGSM(4.70%および5.92%)および ILA++(9.48%および21.34%)を著しく上回った。
- 平滑化された ResNet-50(認証可能耐性モデル)を攻撃した場合、ℓ∞=16/255 の条件下で29.25%の成功率を達成した。これは、I-FGSM の9.74%およびLGVの17.64%を上回る。
- ResNet、VGG、DenseNet、MobileNet、PNASNet など多様なアーキテクチャにおいても、既存手法と組み合わせた場合、平均成功率が92%を超える強力な性能を維持した。
- 代替モデルが標準的な ResNet-50 であっても、ベイジアン微調整そのものが顕著な転送性向上をもたらすことが示され、単体でも有効であることがわかった。
- ILA++ と組み合わせた場合、平均成功率が94.65%に達し、PNASNet においても最悪ケースで84.44%の成功率を示した。これは、さまざまなモデルに対して一貫した頑健性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。