Skip to main content
QUICK REVIEW

[論文レビュー] MORA: Improving Ensemble Robustness Evaluation with Model-Reweighing Attack

Yunrui Yu, Xitong Gao|arXiv (Cornell University)|Nov 15, 2022
Adversarial Robustness in Machine Learning被引用数 5
ひとこと要約

本稿では、敵対的例生成中の各サブモデルの「攻撃のしやすさ」に基づき、重要性を動的に調整することでアンサンブルのロバストネス評価を向上させる、MORAと呼ばれるモデル再重み付け攻撃を提案する。MORAは最先端の攻撃と比較して著しく高速な収束と高い成功確率を達成し、CIFAR-10ではℓ∞ノイズが0.02、CIFAR-100では0.01の条件下で、最近のアンサンブル防御のロバストネスが著しく過大評価されていることを暴露した—多くの防御が実質0%のロバストネスを示していた。

ABSTRACT

Adversarial attacks can deceive neural networks by adding tiny perturbations to their input data. Ensemble defenses, which are trained to minimize attack transferability among sub-models, offer a promising research direction to improve robustness against such attacks while maintaining a high accuracy on natural inputs. We discover, however, that recent state-of-the-art (SOTA) adversarial attack strategies cannot reliably evaluate ensemble defenses, sizeably overestimating their robustness. This paper identifies the two factors that contribute to this behavior. First, these defenses form ensembles that are notably difficult for existing gradient-based method to attack, due to gradient obfuscation. Second, ensemble defenses diversify sub-model gradients, presenting a challenge to defeat all sub-models simultaneously, simply summing their contributions may counteract the overall attack objective; yet, we observe that ensemble may still be fooled despite most sub-models being correct. We therefore introduce MORA, a model-reweighing attack to steer adversarial example synthesis by reweighing the importance of sub-model gradients. MORA finds that recent ensemble defenses all exhibit varying degrees of overestimated robustness. Comparing it against recent SOTA white-box attacks, it can converge orders of magnitude faster while achieving higher attack success rates across all ensemble models examined with three different ensemble modes (i.e., ensembling by either softmax, voting or logits). In particular, most ensemble defenses exhibit near or exactly 0% robustness against MORA with $\ell^\infty$ perturbation within 0.02 on CIFAR-10, and 0.01 on CIFAR-100. We make MORA open source with reproducible results and pre-trained models; and provide a leaderboard of ensemble defenses under various attack strategies.

研究の動機と目的

  • 既存の最先端の敵対的攻撃におけるアンサンブル防御のロバストネスの過大評価を特定・是正すること。
  • 特にソフトマックスや投票戦略における勾配の遮断と勾配の多様化が、ロバストネス評価に与える影響を解明すること。
  • 異なるアンサンブル形成戦略に対して、真のロバストネスを正確に評価できるより効果的で信頼性の高い攻撃手法を開発すること。
  • アンサンブルに含まれるサブモデル数を増やすことが、実際にロバストネスを向上させるのか、あるいは低下させるのかを実証的に示すこと。
  • 標準化とアンサンブル防御の評価の前進を図るため、再現可能でオープンソースのベンチマークとランク付きリーダーボードを提供すること。

提案手法

  • MORAは、各サブモデルの勾配に基づく「攻撃のしやすさ」に応じて、攻撃におけるその貢献度を動的に調整するダイナミックな再重み付け機構を導入する。
  • アンサンブル出力と各個別サブモデル出力の差の勾配を計算することで、相対的な脆弱性を評価する。
  • 収束性と成功確率の向上を図るため、適応的ステップサイズスケジューリング、モーメンタム、損失正規化技術を用いる。
  • ソフトマックス、投票、ロジットの3つの戦略を対象とし、特にℓ∞ノイズに対して評価する。
  • 反復的に適用され、各ステップで攻撃しやすいサブモデルを優先する再重み付けが行われる。
  • MORAは白箱設定下でPGD、C&W、APGD、AutoAttackと比較され、性能とロバストネス評価の正確性を検証する。

実験結果

リサーチクエスチョン

  • RQ1なぜ既存の最先端攻撃は、アンサンブル防御のロバストネスを信頼性高く評価できないのか?
  • RQ2ソフトマックスのようなアンサンブル形成戦略における勾配の遮断は、どの程度ロバストネスの過大評価を引き起こすのか?
  • RQ3サブモデル間での勾配の多様化は、勾配を単純に合算する従来の攻撃戦略をどのように損なうのか?
  • RQ4多数のサブモデルを撃破することが、アンサンブル全体を撃破するために必須であるという仮定に根本的な欠陥があるのか?
  • RQ5敵対的訓練下で、アンサンブル内のサブモデル数を増やすことは、ロバストネスを向上させるのか、それとも損なうのか?

主な発見

  • MORAは、最近のアンサンブル防御が著しくロバストネスが過大評価されていることを暴露した—CIFAR-10ではℓ∞ノイズが0.02、CIFAR-100では0.01の条件下で、多くの防御が実質的または正確に0%のロバストネスを示した。
  • AA や PGD といったベースライン手法と比較して、収束が最大60倍速く、500イテレーション以内に高い成功確率を達成した。
  • ロジットベースのアンサンブル形成戦略が、ソフトマックスおよび投票戦略をすべてのテスト防御で上回り、最もロバストな戦略であった。
  • 大きなアンサンブル(例:8個のサブモデル)は、ロバストネスを低下させる可能性があり、より多くのモデルが常に防御を強化するという仮定に反する。
  • サブモデルの少数を撃破するだけで、全体のアンサンブルを誤導することが可能であり、多数のサブモデルが正しく予測したままでも成立する。
  • 多様なサブモデルからの勾配を合算すると、攻撃効果が相殺される可能性があることが明らかになった—これにより、包括的なアンサンブル損失最小化は効果を失う。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。