Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Training with Rectified Rejection

Tianyu Pang, Huishuai Zhang|arXiv (Cornell University)|Sep 29, 2021
Adversarial Robustness in Machine Learning参考文献 111被引用数 8
ひとこと要約

本稿では、真の信頼度(T-Con)—正しく分類されたクラスに対するモデルの予測確率—を信頼度補正を通じて学習することで、敵対的ロバストネスを向上させるモジュールであるリクタフィードリジェクション(RR)を提案する。R-Con(補正された信頼度)とリジェクタを組み合わせることで、適応的攻撃下において敵対的に誤分類された入力を正しく分類されたものと効果的に区別でき、計算コストをほとんど増加させずに高いロバスト正答率を達成する。

ABSTRACT

Adversarial training (AT) is one of the most effective strategies for promoting model robustness, whereas even the state-of-the-art adversarially trained models struggle to exceed 60% robust test accuracy on CIFAR-10 without additional data, which is far from practical. A natural way to break this accuracy bottleneck is to introduce a rejection option, where confidence is a commonly used certainty proxy. However, the vanilla confidence can overestimate the model certainty if the input is wrongly classified. To this end, we propose to use true confidence (T-Con) (i.e., predicted probability of the true class) as a certainty oracle, and learn to predict T-Con by rectifying confidence. We prove that under mild conditions, a rectified confidence (R-Con) rejector and a confidence rejector can be coupled to distinguish any wrongly classified input from correctly classified ones, even under adaptive attacks. We also quantify that training R-Con to be aligned with T-Con could be an easier task than learning robust classifiers. In our experiments, we evaluate our rectified rejection (RR) module on CIFAR-10, CIFAR-10-C, and CIFAR-100 under several attacks, and demonstrate that the RR module is well compatible with different AT frameworks on improving robustness, with little extra computation.

研究の動機と目的

  • 追加データなしでCIFAR-10で通常60%を上回らない敵対的訓練モデルにおける継続的な正答率ボトルネックを解消すること。
  • 誤分類された入力においてもモデルの確信度を過剰に推定してしまう、シンプルな信頼度の限界を克服すること。
  • リジェクション意思決定のより信頼性の高い確信度オラクルとしての真の信頼度(T-Con)を予測する手法を提案すること。
  • 補正された信頼度(R-Con)を用いて、適応的攻撃下でも誤って分類された入力と正しく分類された入力を区別できるリジェクタを設計すること。

提案手法

  • 真のクラスの予測確率として定義される、理想的な確信度プロキシとしての真の信頼度(T-Con)を導入する。
  • T-Conのより正確な推定を学習するための信頼度補正を提案し、これを補正された信頼度(R-Con)と呼ぶ。
  • R-Conを用いて、適応的攻撃下でも誤って分類される可能性の高い入力を特定・リジェクトするリジェクタを設計する。
  • やや緩い条件下で、結合されたR-Conリジェクタと信頼度リジェクタが、誤って分類された入力と正しく分類された入力を区別できることを証明する。
  • T-Conに一致するようにR-Conモジュールを学習させることで、完全にロバストな分類器を学習するのよりも学習目標が単純であることが示される。
  • 計算コストをほとんど増加させずに、既存の敵対的訓練フレームワークにRRモジュールを統合する。

実験結果

リサーチクエスチョン

  • RQ1補正された信頼度予測子は、敵対的訓練モデルにおけるリジェクション意思決定の信頼性を向上させることができるか?
  • RQ2適応的攻撃下でも、R-Conを用いて敵対的に誤分類された入力を正しく分類されたものと区別することは可能か?
  • RQ3補正を通じてT-Conを予測する学習は、標準的な敵対的訓練のみに比べて、より優れたロバストネスをもたらすか?
  • RQ4R-Conの学習は、ロバスト分類器を学習するのと比べてどれほど難易度が高いか?
  • RQ5RRモジュールは、計算コストを著しく増加させることなく、さまざまなATフレームワークと効果的に組み合わせられるか?

主な発見

  • RRモジュールは、CIFAR-10、CIFAR-10-C、CIFAR-100において、複数の敵対的攻撃に対してロバストテスト正答率を顕著に向上させる。
  • 信頼性の高いR-Conプロキシのおかげで、適応的攻撃下においても敵対的摂動を加えられた入力を効果的にリジェクトできる。
  • T-Conに一致するようにR-Conモジュールを学習させることは、完全にロバストな分類器を学習させるのよりも実験的に容易であることが示された。
  • RRモジュールは多様な敵対的訓練フレームワークと互換性があり、追加計算コストが最小限に抑えられる。
  • やや緩い仮定の下で、結合されたR-Conと信頼度リジェクタシステムは、誤って分類された入力を正しく分類されたものと区別できる。
  • 実験結果により、追加データや主要なアーキテクチャ変更なしに、RRがロバストネスを向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。