Skip to main content
QUICK REVIEW

[論文レビュー] Controlling Over-generalization and its Effect on Adversarial Examples Generation and Detection

Mahdieh Abbasi, Arezoo Rajabi|arXiv (Cornell University)|Aug 21, 2018
Adversarial Robustness in Machine Learning参考文献 27被引用数 8
ひとこと要約

この論文は、過剰一般化を制御するための追加クラス「dustbin」を備えた拡張された畳み込みニューラルネットワーク(CNN)を提案し、分布外のサンプルおよび対策例に対してより高い耐性を発揮する。代表的な自然な分布外データと補間された分布内サンプルを用いて訓練することで、悪意ある入力をより高いレジレクションレートで検出しつつ、分布内精度を維持し、対策例と分布外サンプルを正当なクラスから明確に分離する。

ABSTRACT

Convolutional Neural Networks (CNNs) significantly improve the state-of-the-art for many applications, especially in computer vision. However, CNNs still suffer from a tendency to confidently classify out-distribution samples from unknown classes into pre-defined known classes. Further, they are also vulnerable to adversarial examples. We are relating these two issues through the tendency of CNNs to over-generalize for areas of the input space not covered well by the training set. We show that a CNN augmented with an extra output class can act as a simple yet effective end-to-end model for controlling over-generalization. As an appropriate training set for the extra class, we introduce two resources that are computationally efficient to obtain: a representative natural out-distribution set and interpolated in-distribution samples. To help select a representative natural out-distribution set among available ones, we propose a simple measurement to assess an out-distribution set's fitness. We also demonstrate that training such an augmented CNN with representative out-distribution natural datasets and some interpolated samples allows it to better handle a wide range of unseen out-distribution samples and black-box adversarial examples without training it on any adversaries. Finally, we show that generation of white-box adversarial attacks using our proposed augmented CNN can become harder, as the attack algorithms have to get around the rejection regions when generating actual adversaries.

研究の動機と目的

  • CNNが敵対的例に対して脆弱であることと、分布外サンプルが高信頼度で誤分類されることの共通の根本原因である過剰一般化を是正すること。
  • 敵対的例と分布外入力を同時に検出できる統合的でエンドツーエンドのソリューションを開発すること。
  • 計算的に効率的で代表的な自然な分布外データセットを同定し、dustbinクラスの訓練データとして効果的に活用すること。
  • 敵対的例を訓練データに含めず、自然な分布外データと補間されたサンプルを用いて過剰一般化を低減できることを実証すること。
  • dustbinクラスのレジレクション領域を導入することで、白箱攻撃の成功を困難にする、すなわち白箱攻撃生成の難易度を高めること。

提案手法

  • 分布外および敵対的サンプルを明示的にモデル化するため、標準的なCNNに追加の「dustbin」クラスを追加する。
  • dustbinクラスを形成するために、代表的な自然な分布外データセットと補間された分布内サンプルを用いて拡張CNNを訓練する。
  • dustbinクラスの訓練に最も適した自然な分布外セットを特定・評価するためのフィットネス指標を導入する。
  • 得られたモデルを用いて、分布外サンプルおよび敵対的例を正当なクラスに誤分類する代わりにdustbinクラスに分類することで検出する。
  • モデルが学習した特徴空間を活用し、攻撃者がdustbinレジレクション領域を回避する必要があるため、白箱攻撃生成を困難にする。
  • 複数の分布内および分布外ベンチマークで、しきい値ベースの手法(OpenMax、Calibrated CNN)および標準CNNと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1分布外および敵対的サンプルに専用のdustbinクラスを導入することで、CNNにおける過剰一般化を効果的に制御できるか?
  • RQ2dustbinクラスの訓練に適した代表的な自然な分布外データセットを、計算効率よく効果的に選択する方法は何か?
  • RQ3自然な分布外データと補間されたサンプルを用いて訓練された拡張CNNは、分布外サンプルおよび敵対的例の検出を向上させられるか?
  • RQ4ベースラインモデルと比較して、拡張CNNは敵対的例および分布外入力の誤分類をどの程度低減できるか?
  • RQ5dustbinレジレクション領域を生成することで、白箱攻撃の生成を拡張CNNがより困難にすることができるか?

主な発見

  • 代表的な自然な分布外データセットと補間されたサンプルで訓練された拡張CNNは、NotMNIST(既知)で99.98%のレジレクションレート、Omniglot(未知)で100%のレジレクションレートを達成し、OpenMaxおよびCalibrated CNNを上回った。
  • CIFAR-10では、拡張モデルが未確認の分布外セットに対して0.00%の誤差と100%のレジレクションを達成し、しきい値ベースのベースラインを著しく上回った。
  • CIFAR-100では、TinyImageNet(既知)に対して1.52%の誤差と98.35%のレジレクションを達成したが、Calibrated CNNはクラス数の多さのため収束しなかった。
  • モデルは分布内精度を高い水準で維持した(例:CIFAR-10で97.05%)一方で、分布外サンプルの誤分類を低減した。
  • 拡張CNNでは、白箱攻撃に必要な摂動の大きさが増加し、攻撃の有効性が低下した。攻撃者はdustbinレジレクション領域を回避する必要があるためである。
  • 分布外データセットのフィットネス指標により、訓練データの効果的選定が可能となり、モデルの耐性および一般化性能が直接的に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。