[論文レビュー] Towards Evaluating the Robustness of Neural Networks Learned by Transduction
本稿では、ニューラルネットワークにおける伝達学習ベースの防御の評価を目的とした、新たな適応的攻撃フレームワーク「グリーディーモデルスペース攻撃(GMSA)」を提案する。強力な二段階最適化目的関数を定式化し、モデル空間への転送性を活用することで、DENT や RMC、URejectron といった、従来の AutoAttack に対しても耐性を示していた防御を破壊した。同時に、伝達的 adversarial training が顕著に堅牢性を向上させることを示し、防御設計の新たな道筋を示唆している。
There has been emerging interest in using transductive learning for adversarial robustness (Goldwasser et al., NeurIPS 2020; Wu et al., ICML 2020; Wang et al., ArXiv 2021). Compared to traditional defenses, these defense mechanisms "dynamically learn" the model based on test-time input; and theoretically, attacking these defenses reduces to solving a bilevel optimization problem, which poses difficulty in crafting adaptive attacks. In this paper, we examine these defense mechanisms from a principled threat analysis perspective. We formulate and analyze threat models for transductive-learning based defenses, and point out important subtleties. We propose the principle of attacking model space for solving bilevel attack objectives, and present Greedy Model Space Attack (GMSA), an attack framework that can serve as a new baseline for evaluating transductive-learning based defenses. Through systematic evaluation, we show that GMSA, even with weak instantiations, can break previous transductive-learning based defenses, which were resilient to previous attacks, such as AutoAttack. On the positive side, we report a somewhat surprising empirical result of "transductive adversarial training": Adversarially retraining the model using fresh randomness at the test time gives a significant increase in robustness against attacks we consider.
研究の動機と目的
- 敵対的堅牢性における伝達学習ベースの防御に対する原理的で整合性のある脅威モデルの欠如を解消すること。
- テスト時に動的に学習を行う防御に対して、適応的攻撃を設計する際の理論的および実装上の課題を分析すること。
- 既存の伝達的防御を効果的に破壊できる新たな攻撃ベースライン「グリーディーモデルスペース攻撃(GMSA)」を提案すること。
- 現実的で適応的な攻撃シナリオ下での伝達的防御の堅牢性を評価し、現在のアプローチの限界を明らかにすること。
- 伝達的 adversarial training という新たな防御戦略を検討・検証し、その強力な実証的利得を示すこと。
提案手法
- テスト時の攻撃者と防御者の相互作用を捉える、1ラウンドおよび複数ラウンドの厳密な脅威モデルを定式化し、伝達的防御のための脅威状況を形式化する。
- モデルの近傍における攻撃成功率を最大化する、頑健な二段階攻撃目的関数を提案し、微分可能性の要件を緩和する。
- 複数のモデルの族に対して効果的な adversarial 例を探索するグリーディー最適化フレームワーク「グリーディーモデルスペース攻撃(GMSA)」を導入する。
- モデル間での adversarial 例の転送性を活用して、二段階攻撃目的関数を近似し、実用的な展開を可能にする。
- アンサンブル攻撃と再訓練時の新規ランダム性を用いて、現実的なテスト時適応シナリオを模擬する。
- 標準ベンチマーク(CIFAR-10、MNIST、GTSRB)を用いて防御を検証し、GMSA と AutoAttack の両条件下での堅牢精度を比較する。
実験結果
リサーチクエスチョン
- RQ1敵対的堅牢性における伝達学習ベースの防御のための脅威状況を形式的にどのようにモデル化できるか?
- RQ2テスト時に学習を行う防御に対して適応的攻撃を設計するにあたり、主な理論的および実装上の課題は何か?
- RQ3新たな攻撃フレームワークが、AutoAttack などの既存ベースラインを上回って伝達的防御を破壊できるか?
- RQ4標準 adversarial training と比較して、伝達的 adversarial training は顕著に堅牢性を向上させるか?
- RQ5URejectron などの既存の伝達的防御は、多様な攻撃タイプに対してどのような失敗モードを示すか?
主な発見
- GMSA は DENT、RMC、URejectron の防御を成功裏に破壊し、それらの堅牢精度を、単独の adversarial training と同等の水準まで低下させた。
- CIFAR-10 において、DENT の堅牢精度は AutoAttack 条件下の 57.77% から GMSA 条件下で 54.12% に低下し、adversarial training に比べて 3% 未満の改善にとどまった。
- 伝達的 adversarial training (TADV) により、MNIST では 86.61% から 94.27%、CIFAR-10 では 45.29% から 54.12% に堅牢性が向上した。
- URejectron は CW 攻撃および画像劣化攻撃に対して失敗し、人間が感知できない adversarial 例が回避可能であり、健全な摂動が誤って拒否される事例も確認された。
- GMSA が生成した adversarial 例は、TADV の下で再訓練された新しいモデルへの転送性が著しく低いことが示され、防御がこのような攻撃に対して堅牢であることが裏付けられた。
- 本研究により、伝達学習が inherently 堅牢性を向上させるわけではないこと、および現在の防御が適応的で二段階に配慮した攻撃に対して脆弱であることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。