Skip to main content
QUICK REVIEW

[論文レビュー] RayS: A Ray Searching Method for Hard-label Adversarial Attack

Jinghui Chen, Quanquan Gu|arXiv (Cornell University)|Jun 23, 2020
Adversarial Robustness in Machine Learning参考文献 41被引用数 7
ひとこと要約

RaySは、連続的な意思決定境界の探索を離散的問題に再定式化することで、ゼロ次勾配推定を不要にする画期的なハードラベル敵対的攻撃手法である。無効な探索を素早く除外するチェックステップを導入することで、特に$L_{\infty}$ノルムの脅威モデル下で、先行するハードラベル攻撃よりも著しく高い攻撃成功確率と低いクエリ複雑度を達成し、標準的なホワイトボックスおよびブラックボックス攻撃を回避する「誤って強力な」モデルを露呈する。

ABSTRACT

Deep neural networks are vulnerable to adversarial attacks. Among different attack settings, the most challenging yet the most practical one is the hard-label setting where the attacker only has access to the hard-label output (prediction label) of the target model. Previous attempts are neither effective enough in terms of attack success rate nor efficient enough in terms of query complexity under the widely used $L_\infty$ norm threat model. In this paper, we present the Ray Searching attack (RayS), which greatly improves the hard-label attack effectiveness as well as efficiency. Unlike previous works, we reformulate the continuous problem of finding the closest decision boundary into a discrete problem that does not require any zeroth-order gradient estimation. In the meantime, all unnecessary searches are eliminated via a fast check step. This significantly reduces the number of queries needed for our hard-label attack. Moreover, interestingly, we found that the proposed RayS attack can also be used as a sanity check for possible "falsely robust" models. On several recently proposed defenses that claim to achieve the state-of-the-art robust accuracy, our attack method demonstrates that the current white-box/black-box attacks could still give a false sense of security and the robust accuracy drop between the most popular PGD attack and RayS attack could be as large as $28\%$. We believe that our proposed RayS attack could help identify falsely robust models that beat most white-box/black-box attacks.

研究の動機と目的

  • 広く用いられる$L_{\\text{\textbackslash{}infty}}$ノルムの脅威モデル下で、効果的かつ効率的なハードラベル敵対的攻撃の課題に取り組む。
  • ゼロ次勾配推定や劣った探索戦略に依存するため、効果的または効率的でない既存のハードラベル攻撃の限界を克服する。
  • 標準的なホワイトボックスおよびブラックボックス攻撃を回避するが、より洗練されたハードラベル攻撃(例: RayS)に対しては脆弱である「偽の強度」を示すモデルを検出できる手法を開発する。
  • 素早いチェック機構により不要な探索を排除することで、クエリ効率を向上させる。
  • 現在の防御が高精度なロバスト性を主張している場合でも、RaySのようなより洗練されたハードラベル攻撃に対しては依然として脆弱であることを実証する。

提案手法

  • 実験的観察に基づき、$L_{\infty}$ノルム設定下で、意思決定境界に最も近い点を求める連続的問題を離散的探索問題に再定式化する。
  • 意思決定境界の半径を主な探索基準として用い、誤分類への近接度を直接測定する。
  • 候補となる摂動が意思決定境界上にあるかどうかを素早く検証するための高速チェックステップを導入し、効果のない探索経路を除外する。
  • 元の入力から離散的方向に沿ってレーザーに基づく探索を実施し、摂動空間を効率的に探索する。
  • ハードラベルフィードバック(分類予測)にのみ依存することで、ゼロ次勾配推定を回避する。
  • 探索の離散的性質を活かし、クエリ複雑度を低減しながらも高い攻撃成功確率を維持する。

実験結果

リサーチクエスチョン

  • RQ1ゼロ次勾配推定に依存せず、$L_{\infty}$ノルムの脅威モデル下で、非常に効果的かつ効率的なハードラベル攻撃を設計できるか?
  • RQ2提案手法RaySは、SignOPT、HSJA、およびRaySといった既存のハードラベル攻撃と比較して、クエリ効率および攻撃成功確率においてどのように異なるか?
  • RQ3RaySは、標準的なホワイトボックスおよびブラックボックス攻撃ではロバストに見えるが、より洗練されたハードラベル攻撃に対しては脆弱であるモデルをどの程度露呈できるか?
  • RQ4従来の損失関数(例: CrossEntropy や CW 損失)は、意思決定境界付近の途中の敵対的例の真の潜在的価値を正確に反映できないのはなぜか?
  • RQ5ハードラベル攻撃設定において、代替損失関数(例: CrossEntropy や CW 損失)よりも意思決定境界半径がより信頼性の高い探索基準であると示せるか?

主な発見

  • Adversarial Interpolation Training を施した WideResNet モデル(CIFAR-10、$\epsilon=0.031$)において、RayS は 44.5% の最先端の攻撃成功確率を達成し、ADB は 0.030 であった。これは SignOPT(87.1% のロバスト精度)や HSJA(70.0% のロバスト精度)を著しく上回った。
  • Adversarial Training で防御されたモデルのロバスト精度は、RayS 攻撃時、標準的な PGD 攻撃と比較して最大28%低下し、顕著な「偽の強度」が明らかになった。
  • 同じ CIFAR-10 データセットにおいて、RayS は別のロバストモデル(Adversarial Interpolation Training)のロバスト精度を 46.9% にまで低下させた。一方、HSJA では 70.5%、SignOPT では 84.2% であったため、RayS の優れた有効性が示された。
  • 高速チェックステップにより不要な探索を排除することで、RayS は従来のハードラベル攻撃よりもクエリ複雑度を低減し、より効率的であることが分かった。
  • RayS は、PGD や他のホワイトボックス/ブラックボックス攻撃では高いロバスト精度を維持するが、RayS 攻撃では失敗する「偽の強度」を持つモデルを効果的に検出でき、現在の防御における誤った安心感を示している。
  • CrossEntropy や CW 損失といった代替損失関数とは異なり、意思決定境界半径は、顕著に異なる敵対的潜在力を持つ例であっても同じ損失値を示す可能性があるため、探索を誤導するリスクが低い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。