Skip to main content
QUICK REVIEW

[論文レビュー] Evading Adversarial Example Detection Defenses with Orthogonal Projected Gradient Descent

Oliver Bryniarski, Nabeel Hingun|arXiv (Cornell University)|Jun 28, 2021
Adversarial Robustness in Machine Learning被引用数 15
ひとこと要約

本稿では、分類器または検出器の損失のどちらかにのみ勾配降下法を適用することで、無駄な摂動を回避し、敵対的例生成を向上させる、新しい攻撃手法である直交射影勾配降下法(OPGD)を提案する。この手法は、4つの最先端の検出防御を効果的に回避し、分類器の精度を0%に低下させつつ、検出のAUCを0.5未満に維持する。これはランダムな推測よりも劣る性能である。

ABSTRACT

Evading adversarial example detection defenses requires finding adversarial examples that must simultaneously (a) be misclassified by the model and (b) be detected as non-adversarial. We find that existing attacks that attempt to satisfy multiple simultaneous constraints often over-optimize against one constraint at the cost of satisfying another. We introduce Orthogonal Projected Gradient Descent, an improved attack technique to generate adversarial examples that avoids this problem by orthogonalizing the gradients when running standard gradient-based attacks. We use our technique to evade four state-of-the-art detection defenses, reducing their accuracy to 0% while maintaining a 0% detection rate.

研究の動機と目的

  • 分類器と検出防御の両方を同時にだます敵対的例を生成するという課題に対処すること。
  • 従来の攻撃が、誤分類の最適化に過剰に注力することで、検出回避というもう一方の制約を満たせないという限界を克服すること。
  • 未満たされた制約に基づいて勾配を効果的に選択的に最適化する、より単純で効果的な攻撃戦略を開発すること。
  • 4つのこれまでに破られなかった検出防御に対してこの手法を評価し、その強靭性と一般化能力を示すこと。
  • 将来的な研究や評価を支援するため、実用的でオープンソースの実装を提供すること。

提案手法

  • 標準の射影勾配降下法を修正し、勾配更新を直交化し、各ステップで分類器損失または検出器損失のどちらかにのみ適用する。
  • ハイパーパrameter λ を用いた結合損失関数の最小化ではなく、未満たされた制約に基づいて f(x) と g(x) を交互に最適化する。
  • 各イテレーションで、f と g の両方の勾配を計算し、未満たされた制約を最も直接的に減少させる勾配を適用する。
  • このアプローチにより、摂動が常に最も重要な制約を改善するために使用され、すでに満たされた目的に対して無駄な最適化が回避される。
  • SPAM のような微分可能な検出器の場合、勾配を逆伝播可能にするために、検出器の特徴抽出の微分可能な近似を用いる。
  • 標準のPGDに最小限のコード変更を加えることで実装されており、既存の敵対的攻撃パイプラインへの統合が容易である。

実験結果

リサーチクエスチョン

  • RQ1敵対的例生成において、複数の同時制約を効率的に満たす勾配ベースの攻撃を設計できるか?
  • RQ2選択的かつ直交的な勾配降下法は、結合損失最適化よりも検出防御を攻撃する際に優れているか?
  • RQ3OPGD は、4つのこれまでに破られなかった検出防御を回避できるか? また、検出率は低く保たれるか?
  • RQ4OPGD は標準の脅威モデルおよび異なる摂動ノルム(例:ℓ∞、ℓ2)の下でどのように性能を発揮するか?
  • RQ5勾配の直交性は、摂動の効率性と制約の満たし方に対してどのような影響を与えるか?

主な発見

  • OPGD は、評価された4つの検出防御すべてにおいて、保護された分類器の精度を0%にまで低下させた。
  • すべての防御において、検出のAUCが0.5未満を維持した。これは、ランダムな推測よりも劣る性能であることを示している。
  • SPAM 検出器では、5%の偽陽性率で98.8%の攻撃成功率を達成し、元の防御の最良攻撃(3%)を著しく上回った。
  • ハニーポット防御、密度層解析、感受性不一致検出器では、100%の攻撃成功率を達成した。
  • 攻撃は効率的に実行され、CIFAR-10 では数分、ImageNet では数時間で、1枚のGPUで実行可能だった。
  • SPAM 検出器の微分可能な近似により、効果的な勾配ベースの最適化が可能になり、従来微分不能とされていた防御に対しても攻撃が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。