[論文レビュー] On the Design of Black-box Adversarial Examples by Leveraging Gradient-free Optimization and Operator Splitting Method
本稿では、ADMMとゼロ次(ZO)最適化およびベイズ最適化(BO)を組み合わせた一般化されたブラックボックス敵対的攻撃フレームワークを提案する。このフレームワークにより、多様な歪み指標と脅威モデルにおいて、効率的で耐障害性の高い攻撃が可能になる。MNIST、CIFAR-10、ImageNetにおいて、攻撃成功確率を維持しつつ、最大99.2%のクエリ削減を達成し、最先端のクエリ効率性を実現した。
Robust machine learning is currently one of the most prominent topics which could potentially help shaping a future of advanced AI platforms that not only perform well in average cases but also in worst cases or adverse situations. Despite the long-term vision, however, existing studies on black-box adversarial attacks are still restricted to very specific settings of threat models (e.g., single distortion metric and restrictive assumption on target model's feedback to queries) and/or suffer from prohibitively high query complexity. To push for further advances in this field, we introduce a general framework based on an operator splitting method, the alternating direction method of multipliers (ADMM) to devise efficient, robust black-box attacks that work with various distortion metrics and feedback settings without incurring high query complexity. Due to the black-box nature of the threat model, the proposed ADMM solution framework is integrated with zeroth-order (ZO) optimization and Bayesian optimization (BO), and thus is applicable to the gradient-free regime. This results in two new black-box adversarial attack generation methods, ZO-ADMM and BO-ADMM. Our empirical evaluations on image classification datasets show that our proposed approaches have much lower function query complexities compared to state-of-the-art attack methods, but achieve very competitive attack success rates.
研究の動機と目的
- 既存のブラックボックス敵対的攻撃における高いクエリ複雑度を低減すること、特にクエリ制限付きまたは実世界の設定において有効にすること。
- 従来の手法が特定の歪み指標(例:ℓ₂ や ℓ∞)や脅威モデル(例:スコアベースのみ)に限定されているという限界を克服すること。
- さまざまな ℓp-ノルム歪み指標と、スコアベースおよび意思決定ベースの両方の脅威モデルをサポートする統一的で柔軟なフレームワークの開発。
- 攻撃成功確率を損なわずにクエリ効率を向上させ、実世界の機械学習システムへの実用的導入を可能にすること。
- モデル勾配が利用できない勾配フリーな設定においても、耐障害性の高い敵対的攻撃生成を可能にすること。
提案手法
- 制約付き最適化のための1次オペレータスプリッティング手法である交替方向乗数法(ADMM)に基づく一般化された敵対的攻撃フレームワークを提案する。
- ゼロ次(ZO)最適化をADMMと統合し、勾配フリーな攻撃生成を可能にし、効率的な関数クエリ利用のためのランダム勾配推定(RGE)を用いる。
- スコアベース攻撃に適した ZO-ADMM と、意思決定ベース攻撃に適した BO-ADMM を開発し、ベイズ最適化を活用してクエリ効率を向上させる。
- 任意の ℓp-ノルムボール制約(例:ℓ₀、ℓ₁、ℓ₂)およびその線形結合をサポートするようにフレームワークを一般化し、柔軟な歪み制御を実現する。
- ブラックボックスモデルからのソフトラベル(スコアベース)およびハードラベル(意思決定ベース)フィードバックを処理できるように、ADMM定式化を適応させる。
- 反復的更新による低コストな部分問題に分解できる拡張ラグランジュ形式を用い、敵対的攻撃問題を解く。
実験結果
リサーチクエスチョン
- RQ1勾配フリーな制約下において、ADMMに基づく最適化がブラックボックス敵対的攻撃生成に効果的に適応可能か?
- RQ2提案された ZO-ADMM フレームワークは、最先端の ZOO や境界ベース攻撃と比較して、クエリ効率性および攻撃成功確率で優れているか?
- RQ3最適化プロセスの再設計なしに、さまざまな ℓp-ノルム歪み指標にどの程度一般化可能か?
- RQ4意思決定ベースのブラックボックス攻撃設定において、ベイズ最適化(BO)の統合がさらにクエリ複雑度を低減できるか?
- RQ5スコアベースおよび意思決定ベースのフィードバックを含む多様な脅威モデルにおいて、このフレームワークはどの程度耐障害性を示すか?
主な発見
- ImageNet において、ZO-ADMM 攻撃は、ZOO 攻撃と比較して、初期成功に必要なクエリ数を非標的攻撃で94.3%、標的攻撃で99.2%削減した。
- MNIST および CIFAR-10 において、ZO-ADMM は1,000クエリ未満で成功した攻撃を達成し、ベースライン手法を著しく上回った。
- ℓ₂ 歪みに対して、ZO-ADMM は MNIST で平均 ℓ₂ 歪み1.93で100%の攻撃成功確率を達成し、ZOO よりも効率性と歪み制御の両面で優れた性能を示した。
- フレームワークは ℓ₀ および ℓ₁ ノルムにも成功裏に一般化され、それぞれ平均 ℓ₀ 歪み18.5、ℓ₁ 歪み10.5で100%の攻撃成功確率を達成した。
- 意思決定ベースの設定では、ラベルのみ攻撃や ZOO 攻撃と比較して、はるかに少ないクエリ数で高い攻撃成功確率を達成し、一部の状況では ZOO 攻撃をも上回った。
- 収束解析により、データセットの複雑さに応じて数百から数万クエリの後、ZO-ADMM が低歪みレベルに安定することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。