[論文レビュー] Rethinking Model Ensemble in Transfer-based Adversarial Attacks
本稿では、アンサンブルのサロゲートモデルにおける損失関数の平坦性と局所最適解への近接性に注目することで、転送ベースの adversarial 攻撃を強化する新規手法 Common Weakness Attack (CWA) を提案する。Sharpness Aware Minimization と Cosine Similarity Encourager を統合することで、より転送性の高い adversarial 例を生成し、敵対的訓練を施したモデルにおいて、logits アンサンブルを用いた MI よりも 30% 高い成功率を達成する。
It is widely recognized that deep learning models lack robustness to adversarial examples. An intriguing property of adversarial examples is that they can transfer across different models, which enables black-box attacks without any knowledge of the victim model. An effective strategy to improve the transferability is attacking an ensemble of models. However, previous works simply average the outputs of different models, lacking an in-depth analysis on how and why model ensemble methods can strongly improve the transferability. In this paper, we rethink the ensemble in adversarial attacks and define the common weakness of model ensemble with two properties: 1) the flatness of loss landscape; and 2) the closeness to the local optimum of each model. We empirically and theoretically show that both properties are strongly correlated with the transferability and propose a Common Weakness Attack (CWA) to generate more transferable adversarial examples by promoting these two properties. Experimental results on both image classification and object detection tasks validate the effectiveness of our approach to improving the adversarial transferability, especially when attacking adversarially trained models. We also successfully apply our method to attack a black-box large vision-language model -- Google's Bard, showing the practical effectiveness. Code is available at \url{https://github.com/huanranchen/AdversarialAttacks}.
研究の動機と目的
- 単なるモデル出力の平均化を超えて、モデルアンサンブルがブラックボックス攻撃における転送性を向上させる理由を解明すること。
- アンサンブル攻撃がより効果的である背後にある要因である、平坦な損失関数の形状と局所最適解への近接性といった幾何的性質を同定すること。
- 複数のモデルに共通する弱みを明示的に最適化する、原理的かつ整合性のある手法を開発すること。
- クエリアクセスに依存せず、高い計算コストを要しない条件下でも、特に敵対的訓練を施したモデルに対して、転送性を向上させること。
提案手法
- アンサンブルの目的関数を二次近似で定式化し、転送性がヘッセ行列のフロベニウスノルム(平坦性)と各モデルの局所最適解との二乗 L2 距離に依存することを明らかにする。
- 損失と鋭さの両方を最小化する組み合わせ目的関数を用いることで、平坦な損失関数の形状を促進する Sharpness Aware Minimization (SAM) を導入する。
- 複数のモデル間での勾配を一致させるために、Cosine Similarity Encourager (CSE) を適用し、共通の局所最適解付近への収束を促進する。
- MI や TI や Adam といった既存の最適化手法とは直交するため、さらなる性能向上が得られるようにシームレスに統合可能である。
- 画像分類およびオブジェクト検出の両分野で検証を行い、検出器向けのユニバーサル adversarial パッチ生成も含む。
- CWA は計算的にも効率的であり、最小限の反復回数(T=5)でもベースラインを上回る性能を示しており、反復回数に依存するものではなく、本質的な有効性を示している。
実験結果
リサーチクエスチョン
- RQ1単なるモデル出力の平均化を超えて、なぜモデルアンサンブルがブラックボックス攻撃における転送性を向上させるのか?
- RQ2損失関数の幾何的性質、特に平坦性と局所最適解への近接性は、adversarial 転送性とどのように関係しているのか?
- RQ3複数のモデルに共通する「共通の弱み」を明示的に最適化することで、より転送性の高い adversarial 例を生成できるか?
- RQ4ヘッセ行列のノルムと局所最適解からの距離は、アンサンブル攻撃における転送性をどの程度予測できるか?
- RQ5提案手法は、既存の攻撃アルゴリズムと効果的に組み合わせて性能をさらに向上させられるか?
主な発見
- MI-CWA は、24 個の敵対的訓練済みモデルにおいて、logits アンサンブルを用いた MI よりも 30% 高い攻撃成功確率を達成し、優れた転送性を示した。
- CWA が生成する adversarial 例の周囲の損失関数の形状は、MI よりも平坦であることが、複数の防御モデルの可視化で確認された。
- CWA は、サロゲートモデルとブラックボックスモデル間の勾配のコサイン類似度を顕著に向上させ、共通の弱みへの整合性が高まっていることを示している。
- T=5 の反復回数でさえも、他の手法を上回る性能を示しており、計算コストの高さに起因するものではなく、本質的な有効性が裏付けられた。
- オブジェクト検出の分野では、Adam-CWA が、8 種類の最新の検出器で mAP 9.85 を達成するユニバーサル adversarial パッチを生成し、先行研究を上回った。
- アブレーションスタディにより、平坦性と局所最適解への近接性の両方が重要であり、いずれかを除去すると性能が著しく低下することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。