Skip to main content
QUICK REVIEW

[論文レビュー] Switching Transferable Gradient Directions for Query-Efficient Black-Box Adversarial Attacks

Chen Ma, Shuyu Cheng|arXiv (Cornell University)|Sep 15, 2020
Adversarial Robustness in Machine Learning参考文献 38被引用数 4
ひとこと要約

SWITCHは、代替モデルからの転送可能勾配を活用し、改善が止まった際に勾配とその逆方向を動的に切り替えることで、クエリ効率の高いブラックボックス敵対的攻撃を提案する。最小限のクエリで最先端の成功率を達成しており、特にターゲット攻撃や防御保護付きの設定において、きびしいクエリ予算下でも優れた性能を示している。

ABSTRACT

We propose a simple and highly query-efficient black-box adversarial attack named SWITCH, which has a state-of-the-art performance in the score-based setting. SWITCH features a highly efficient and effective utilization of the gradient of a surrogate model $\hat{\mathbf{g}}$ w.r.t. the input image, i.e., the transferable gradient. In each iteration, SWITCH first tries to update the current sample along the direction of $\hat{\mathbf{g}}$, but considers switching to its opposite direction $-\hat{\mathbf{g}}$ if our algorithm detects that it does not increase the value of the attack objective function. We justify the choice of switching to the opposite direction by a local approximate linearity assumption. In SWITCH, only one or two queries are needed per iteration, but it is still effective due to the rich information provided by the transferable gradient, thereby resulting in unprecedented query efficiency. To improve the robustness of SWITCH, we further propose SWITCH$_ ext{RGF}$ in which the update follows the direction of a random gradient-free (RGF) estimate when neither $\hat{\mathbf{g}}$ nor its opposite direction can increase the objective, while maintaining the advantage of SWITCH in terms of query efficiency. Experimental results conducted on CIFAR-10, CIFAR-100 and TinyImageNet show that compared with other methods, SWITCH achieves a satisfactory attack success rate using much fewer queries, and SWITCH$_ ext{RGF}$ achieves the state-of-the-art attack success rate with fewer queries overall. Our approach can serve as a strong baseline for future black-box attacks because of its simplicity. The PyTorch source code is released on https://github.com/machanic/SWITCH.

研究の動機と目的

  • 勾配推定に依存するスコアベースのブラックボックス攻撃における高いクエリ複雑性を解決すること。
  • ターゲットモデルの勾配を必要とせず、代替モデルからの転送可能勾配を活用することで、クエリ効率を向上させること。
  • 代替勾配が敵対的領域から離れる状況を検出し、その逆方向に動的に切り替えること。
  • 勾配ベースの更新とランダム勾配フリー(RGF)バックアップを組み合わせることで、防御モデルに対する耐性を高めること。
  • 将来的なブラックボックス攻撃研究のための、単純ながらも効果的なベースラインを確立すること。

提案手法

  • 各イテレーションで、SWITCHはまず、ℓp正規化された代替勾配 $ar{oldsymbol{g}}$ の方向に敵対的例を更新する。
  • もし $ar{oldsymbol{g}}$ の方向に1ステップ進んでも攻撃目的(損失)が増加しない場合、SWITCHは誤った更新を避けるために逆方向 $-ar{oldsymbol{g}}$ に切り替える。
  • このスイッチの決定は、深層ニューラルネットワークの局所的近似線形性仮定に基づいている。
  • この手法は1イテレーションあたり1〜2クエリのみを用いる——$oldsymbol{x}_{ ext{adv}} + \theta \bar{oldsymbol{g}}$ での損失評価の1回、および任意で $oldsymbol{x}_{ ext{adv}} - \theta \bar{oldsymbol{g}}$ での評価の1回。
  • SWITCH${}_{ ext{RGF}}$ は、$ar{oldsymbol{g}}$ と $-ar{oldsymbol{g}}$ の両方が損失の向上に失敗した場合に、ランダム勾配フリー(RGF)推定を用いることでこの手法を拡張する。
  • このアプローチは、クエリ効率を維持しながら、特にターゲット攻撃や防御モデルなどの困難な設定での耐性を高めている。

実験結果

リサーチクエスチョン

  • RQ1代替勾配とその逆方向との間で動的スイッチングを行うことで、ブラックボックス攻撃におけるクエリ効率が向上するか?
  • RQ2局所的近似線形性仮定は、敵対的攻撃における方向スイッチングを誘導するためにどの程度有効か?
  • RQ3勾配ベースとランダム勾配フリーの更新を組み合わせたハイブリッド戦略は、クエリ効率を損なわずにさらに成功率を向上させられるか?
  • RQ4SWITCHは極めて限られたクエリ予算下で、特にターゲット攻撃および防御保護付きのシナリオにおいてどの程度の性能を示すか?
  • RQ5単純な勾配ベースの手法が、複雑なランダムサーチベースの攻撃を上回るクエリ効率と成功率を達成できるか?

主な発見

  • CIFAR-10でWRN-40を用いて、365クエリのわずかな予算で非ターゲット攻撃の成功率が92.5%に達し、同クエリ予算下で先行手法を上回った。
  • CIFAR-10におけるターゲット $oldsymbol{ ext{ℓ}}_2$ 攻撃では、1,000クエリ未満の制限下で最高の成功率(74.7%)を達成し、初期収束が速いことが示された。
  • SWITCH${}_{ ext{RGF}}$ は、RGFと比較してクエリ消費量を最大50%削減しながら、より高い成功率を達成しており、特に防御保護付きの設定で顕著な効果を示した。
  • 防御モデル(ComDefend、Feature Distillation、JPEG)に対して、ComDefendでは最高の成功率を記録し、Feature DistillationではSOTAと同等の結果を得た。
  • Square Attackなどのランダムサーチベースの攻撃よりも、SWITCHは収束が速く、クエリ予算が極めて限られた状況(例:1,000未満)で特に効果的である。
  • 単純さにもかかわらず、CIFAR-10、CIFAR-100、TinyImageNetを含む複数のベンチマークで、SWITCHはクエリ効率と成功率の両面で新たなSOTAを樹立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。