[論文レビュー] Boosting Black-Box Attack with Partially Transferred Conditional Adversarial Distribution
本稿では、白ボックスのサーヴィレートモデルから部分的に条件付き adversarial 分布 (CAD) を転送することで、クエリ効率と攻撃成功率を向上させる、新しいブラックボックス敵対的攻撃手法 $π$-ATTACK を提案する。ターゲットモデルのクエリを用いて転送されないCADパラメータを学習することで、アーキテクチャ的・データセット的差異に起因するサーヴィレートバイアスに対して頑健であり、ベンチマークデータセットおよび実世界のAPIにおいて最先端の性能を達成する。
This work studies black-box adversarial attacks against deep neural networks (DNNs), where the attacker can only access the query feedback returned by the attacked DNN model, while other information such as model parameters or the training datasets are unknown. One promising approach to improve attack performance is utilizing the adversarial transferability between some white-box surrogate models and the target model (i.e., the attacked model). However, due to the possible differences on model architectures and training datasets between surrogate and target models, dubbed "surrogate biases", the contribution of adversarial transferability to improving the attack performance may be weakened. To tackle this issue, we innovatively propose a black-box attack method by developing a novel mechanism of adversarial transferability, which is robust to the surrogate biases. The general idea is transferring partial parameters of the conditional adversarial distribution (CAD) of surrogate models, while learning the untransferred parameters based on queries to the target model, to keep the flexibility to adjust the CAD of the target model on any new benign sample. Extensive experiments on benchmark datasets and attacking against real-world API demonstrate the superior attack performance of the proposed method.
研究の動機と目的
- 異なるモデルアーキテクチャや学習データセットに起因するサーヴィレートバイアスによって生じる敵対的転送性の低下を是正すること。
- クローズドセットおよびオープンセットのブラックボックス攻撃シナリオにおいて、攻撃成功率とクエリ効率を向上させること。
- 新たな正常サンプルに適応する柔軟性を維持しながら、有益なサーヴィレートモデルの知識を活用する転送メカニズムを開発すること。
- 効率的な学習を可能にする条件付き生成フロー (c-Glow) を用いて、複雑な条件付き敵対的分布 (CAD) を正確にモデル化すること。
- 訓練データが不明でモデルの差異が顕著な実世界のAPIにおいて、本手法の有効性を検証すること。
提案手法
- 部分的転送メカニズムの提案:サーヴィレートモデルからCADパラメータの一部のみを転送し、残りはターゲットモデルのクエリフィードバックから学習する。
- CADを条件付き生成フロー (c-Glow) を用いてモデル化し、単純な分布(例:正規分布)を可逆ニューラルネットワークを介して複雑なCADに変換する。
- 高価な敵対的サンプルの代わりにランダムにサンプリングされた摂動を用いることで、c-Glowの効率的な学習アルゴリズムを開発し、学習コストを削減する。
- ターゲットモデルのクエリフィードバックを活用して、転送されないCADパラメータを微調整し、各新しい正常入力に動的に適応可能にする。
- 訓練データが既知のクローズドセットと未知のオープンセットの両方のシナリオに適用可能であり、実世界のAPI攻撃を含む。
- CADのラベル非依存性を活用して、サーヴィレートモデルとターゲットモデル間のクラスラベル不一致への感受性を低減する。
実験結果
リサーチクエスチョン
- RQ1条件付き敵対的分布 (CAD) の部分的転送は、ブラックボックス攻撃におけるサーヴィレートバイアスの悪影響を軽減できるか?
- RQ2ターゲットモデルの訓練データが未知であるオープンセットシナリオにおいて、本手法はどのように性能を発揮するか?
- RQ3条件付き生成フロー (c-Glow) は、高い忠実度と効率性を兼ね備えたCADを効果的にモデル化できるか?
- RQ4敵対的サンプルの代わりにランダムにサンプリングされた摂動を用いることで、CAD学習が効果的かつスケーラブルに可能になるか?
- RQ5実世界のシステムにおいて、攻撃成功率とクエリ効率の観点から、最先端のブラックボックス攻撃手法と比較して本手法はどのように差をつけるか?
主な発見
- クローズドセットのシナリオにおいて、$π$-ATTACKはCIFAR-10およびImageNetの両方で42件中35件の最良結果、42件中6件の2番目の最良結果を達成した。
- オープンセットのシナリオにおいて、$π$-ATTACKは27件中22件の最良結果、27件中3件の2番目の最良結果を達成し、サーヴィレートバイアスによる攻撃成功率低下はたった0.53%にとどまった。
- 実世界のImagga Tagging API(オープンセット、実世界)において、$π$-ATTACKは85%の攻撃成功率を達成し、中央値クエリ数は21.0で、すべてのベースラインを上回った。
- API攻撃において、中央値クエリ数を21.0にまで削減したが、これはSimBAの96.0およびTREMBAの51.0と比較して、優れたクエリ効率を示している。
- サーヴィレートバイアスに起因する攻撃成功率の低下はたった0.53%にとどまり、他のクエリ・アンド・トランスファー手法と比較して、アーキテクチャ的・データセット的差異に対して顕著に頑健であることが証明された。
- ランダム摂動を用いたc-GlowベースのCADモデリングにより、正確かつ効率的なCAD近似が可能となり、本手法の有効性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。