[論文レビュー] Training Meta-Surrogate Model for Transferable Adversarial Attack
本稿では、ブラックボックス攻撃におけるより高い転送性を持つ adversarial examples を生成するため、Meta-Surrogate Model (MSM) を訓練する新しいフレームワークである Meta-Transfer Attack (MTA) を提案する。二重最適化問題として定式化し、微分可能でカスタム化された PGD 攻撃者を用いることで、MTA は転送成功率を顕著に向上させ、敵対的に訓練されたモデルに対して SGM-DI-PGD よりも最大 96.1% 高い成功率を達成する。
We consider adversarial attacks to a black-box model when no queries are allowed. In this setting, many methods directly attack surrogate models and transfer the obtained adversarial examples to fool the target model. Plenty of previous works investigated what kind of attacks to the surrogate model can generate more transferable adversarial examples, but their performances are still limited due to the mismatches between surrogate models and the target model. In this paper, we tackle this problem from a novel angle -- instead of using the original surrogate models, can we obtain a Meta-Surrogate Model (MSM) such that attacks to this model can be easier transferred to other models? We show that this goal can be mathematically formulated as a well-posed (bi-level-like) optimization problem and design a differentiable attacker to make training feasible. Given one or a set of surrogate models, our method can thus obtain an MSM such that adversarial examples generated on MSM enjoy eximious transferability. Comprehensive experiments on Cifar-10 and ImageNet demonstrate that by attacking the MSM, we can obtain stronger transferable adversarial examples to fool black-box models including adversarially trained ones, with much higher success rates than existing methods. The proposed method reveals significant security challenges of deep models and is promising to be served as a state-of-the-art benchmark for evaluating the robustness of deep models in the black-box setting.
研究の動機と目的
- クエリが許可されないブラックボックス設定における adversarial 攻撃の転送性の限界を解消すること。
- 学習された Meta-Surrogate Model (MSM) が、標準的なサロゲートモデルよりも転送性の高い adversarial examples を生成できるかどうかを調査すること。
- 未学習のターゲットモデルに対して最大の転送性を達成するように最適化する、微分可能でエンドツーエンドのトレーニングパイプラインを開発すること。
- より強い、クエリフリーのブラックボックス攻撃ベンチマークを提供することで、深層モデルのロバストネス評価を向上させること。
提案手法
- MSM のトレーニングを、MSM に対する攻撃をアンロールし、ターゲットモデルへの転送性を最適化する二重最適化問題として定式化する。
- 離散的な sign 操作と ReLU 操作を、arctan とシグモイド関数による微分可能な近似に置き換えることで、攻撃プロセス全体にバックプロパゲーションを可能にするカスタム化された PGD 攻撃者を導入する。
- 二重損失目的関数を採用:一つは MSM における攻撃成功を最大化し、もう一つは得られた adversarial examples のターゲットモデルへの転送性を最大化する。
- MSM のトレーニングには、例えば ResNet-50 や Inception-V1 といったソースモデルを監視として用い、MSM に対する攻撃が他のモデルへも一般化するようにする。
- 二段階のトレーニングプロセスを採用:内側のループではカスタム化された PGD を用いて MSM に対して adversarial 攻撃を実行し、外側のループでは MSM パラメータを更新して転送性を最大化する。
- 訓練された MSM を用いて adversarial examples を生成し、それらを多様なブラックボックスターゲットモデル(敵対的に訓練されたモデルを含む)で評価する。
実験結果
リサーチクエスチョン
- RQ1学習された Meta-Surrogate Model (MSM) は、ブラックボックス攻撃における転送性の高い adversarial examples を生成するために、標準的なサロゲートモデルを上回ることができるか?
- RQ2MSM のトレーニングを、攻撃プロセスにバックプロパゲーションを可能にする微分可能で適切に定式化された最適化問題としてどのように定式化できるか?
- RQ3攻撃プロセスにおけるどの要素が、効果的なバックプロパゲーションと高い転送性を実現するために不可欠か?
- RQ4MTA は、最先端の手法と比較して、自然に訓練されたモデルおよび敵対的に訓練されたモデルの両方において、どの程度転送成功率を向上させるか?
主な発見
- ImageNet における敵対的に訓練された Inception-V1 モデルを攻撃する際、MTA-PGD は SGM-DI-PGD よりも 96.1% 高い転送攻撃成功率を達成した。
- 敵対的に訓練された ResNet-50 モデルでは 25.8%、DenseNet-22BC モデルでは 45.5% の成功率向上が、SGM-DI-PGD と比較して確認された。
- アブレーションスタディにより、カスタム化された PGD における arctan 項目が不可欠であることが確認された。この項目を除去すると、すべてのターゲットモデルで性能が 17% 以上低下した。
- 内側ループにおける攻撃イテレーション数 $T_t$ には最適値(CIFAR-10 では 7)が存在し、それ以上に増やすとアンロールの複雑さが増し、性能が低下する。
- MTA-PGD と IR-PGD を組み合わせた MTA-IR-PGD はさらに性能向上を示し、既存の転送性向上技術が MSM フレームワークと効果的に統合可能であることを示している。
- バックボーンアーキテクチャの選択(例:ResNet-13 と DenseNet-22BC)が MSM の性能に影響を与えることが示され、モデルアーキテクチャ設計がさらなる転送性向上に寄与可能であると考えられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。