[論文レビュー] Randomization matters. How to defend against strong adversarial attacks
本稿では、敵対的訓練された分類器のアンサンブルブースティングに基づく確率的防御手法を提案し、理論的および実験的に、ランダム化が強力な適応的攻撃に対して著しく耐性を向上させることを示している。ゲーム理論的耐性保証を介して、単一の決定的モデルを上回る性能を示す分類器の混合により、適応的PGD攻撃下でのCIFAR-10における精度が0.55に達し、敵対的訓練より13%高い。
Is there a classifier that ensures optimal robustness against all adversarial attacks? This paper answers this question by adopting a game-theoretic point of view. We show that adversarial attacks and defenses form an infinite zero-sum game where classical results (e.g. Sion theorem) do not apply. We demonstrate the non-existence of a Nash equilibrium in our game when the classifier and the Adversary are both deterministic, hence giving a negative answer to the above question in the deterministic regime. Nonetheless, the question remains open in the randomized regime. We tackle this problem by showing that, undermild conditions on the dataset distribution, any deterministic classifier can be outperformed by a randomized one. This gives arguments for using randomization, and leads us to a new algorithm for building randomized classifiers that are robust to strong adversarial attacks. Empirical results validate our theoretical analysis, and show that our defense method considerably outperforms Adversarial Training against state-of-the-art attacks.
研究の動機と目的
- 決定的分類器がすべての敵対的攻撃に対して最適な耐性を達成できるかどうかを調査すること。
- 決定的アプローチの制限を克服できるかどうかを、確率的防御戦略が強力な適応的攻撃に対して有効であるかを検討すること。
- 強力な適応的攻撃に対して耐性を持つ、実用的で理論的根拠を持つ確率的分類器を構築するための手法を開発すること。
- CIFAR-10およびCIFAR-100における最先端の攻撃に対して、その手法を実験的に検証すること。
提案手法
- 攻撃者と防御者(分類器)の間の無限次元ゼロサムゲームとして、敵対的攻撃・防御問題を形式化する。
- 決定的設定においてナッシュ均衡が存在しないことを証明し、これにより決定的分類器が普遍的に最適であることは不可能であると示す。
- 現在の混合分類器に対する敵対的例を生成し、それを用いて新たなモデルを繰り返し訓練することで、確率的分類器を構築するブースティング手法を導入する。
- 適応的攻撃に対する混合分類器の耐性を最大化するために、期待されるロジットと期待される損失の最適化を訓練中に用いる。
- 複数回のランダムリスタートと勾配ベース最適化を用いた適応的攻撃(例:Adaptive-ℓ∞-PGD)を用いて耐性を評価する。
- 最終的な混合分類器の耐性を向上させるために、自然な精度ではなく攻撃下での性能(bestAUA)に基づいて初期分類器を選択する。
実験結果
リサーチクエスチョン
- RQ1すべての敵対的攻撃に対して最適な耐性を保証する決定的分類器は存在するか?
- RQ2強力な適応的攻撃に対して、確率的防御戦略は決定的戦略を上回ることができるか?
- RQ3ブースティングにより構築された分類器の混合は、個々のモデルよりもより良好な最悪ケースの耐性保証を提供するか?
- RQ4ゲーム理論的枠組みは、敵対的防御におけるランダム化の使用を正当化できるか?
主な発見
- 本稿では、関連する無限次元ゼロサムゲームにおいてナッシュ均衡が存在しないことから、決定的分類器がすべての敵対的攻撃に対して最適な耐性を達成できないことを証明している。
- 任意の決定的防御は、確率的混合分類器によって上回られることを示しており、ランダム化の理論的優位性を裏付けている。
- 提案されたブーストされた確率的分類器は、適応的ℓ∞-PGD攻撃下でCIFAR-10で0.55の精度を達成し、敵対的訓練(0.42)より0.13高い。
- CIFAR-100では、ℓ∞-PGD攻撃下で0.53の精度、ℓ2-C&W攻撃下で0.52の精度を達成し、両方の状況で敵対的訓練を上回った。
- 初期分類器を自然な精度ではなく攻撃下での性能(bestAUA)に基づいて選択することで、自然精度に基づく選択に比べて3%高い精度が得られた。
- 整合性のチェックにより、勾配マスキングの存在が確認されず、ℓ∞-PGD攻撃(ε=0.250)下で精度が0.000に低下したため、耐性評価の妥当性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。