Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Detection and Correction by Matching Prediction Distributions

Giovanni Vacanti, Arnaud Van Looveren|arXiv (Cornell University)|Feb 21, 2020
Adversarial Robustness in Machine Learning参考文献 22被引用数 13
ひとこと要約

本稿では、元の入力と再構築された入力の分類器予測分布を一致させるためにKullback-Leibler(KL)ダイバージェンス損失を用いて訓練されたオートエナボーダーを用いた、教師なしの敵対的検出および是正手法を提案する。この手法は、MNISTおよびFashion-MNISTにおける強力なグレイボックス攻撃(例:Carlini-Wagner、SLIDE)をほぼ完全に検出でき、CIFAR-10においてもホワイトボックス条件下でも高い有効性を示し、CIFAR-10-Cにおけるデータの損傷を検出可能である。

ABSTRACT

We present a novel adversarial detection and correction method for machine learning classifiers.The detector consists of an autoencoder trained with a custom loss function based on the Kullback-Leibler divergence between the classifier predictions on the original and reconstructed instances.The method is unsupervised, easy to train and does not require any knowledge about the underlying attack. The detector almost completely neutralises powerful attacks like Carlini-Wagner or SLIDE on MNIST and Fashion-MNIST, and remains very effective on CIFAR-10 when the attack is granted full access to the classification model but not the defence. We show that our method is still able to detect the adversarial examples in the case of a white-box attack where the attacker has full knowledge of both the model and the defence and investigate the robustness of the attack. The method is very flexible and can also be used to detect common data corruptions and perturbations which negatively impact the model performance. We illustrate this capability on the CIFAR-10-C dataset.

研究の動機と目的

  • 攻撃の種別やモデル防御の知識が不要な、堅牢で教師なしの敵対的検出および是正手法の開発。
  • 入力再構築誤差ではなく、分類器の出力確率分布に注目することで、敵対的例の検出を向上させること。
  • MNIST、Fashion-MNIST、CIFAR-10といった多様なデータセットにおける強力なグレイボックスおよびホワイトボックス攻撃に対する本手法の有効性の評価。
  • 敵対的攻撃を超えて、実運用環境における有害なデータ損傷および分布シフトの検出に本手法の有用性を拡張すること。
  • 任意の微分可能な分類器に適用可能な柔軟で汎用的な防御メカニズムの提供。

提案手法

  • 本手法は、元の入力と再構築された入力における分類器の予測確率の間のKullback-Leibler(KL)ダイバージェンスに基づくカスタム損失関数を用いて訓練されたオートエナボーダーを採用する。
  • オートエナボーダーは、元の分類器の出力分布を保持する対称的かつアーチファクトのない再構築を学習し、敵対的摂動を効果的に除去する。
  • 敵対的スコアは、元の入力と再構築された入力における分類器の予測のKLダイバージェンスとして計算され、検出信号として機能する。
  • 防御は教師なしで訓練され、ラベル付きの敵対的例や攻撃戦略の知識を一切必要としない。
  • CIFAR-10-Cベンチマークにおける損傷付き入力の敵対的スコアを測定することで、データドリフトの検出に本手法を拡張する。
  • 本アプローチはモジュール式であり、多様なアーキテクチャを有する複数のオートエナボーダーをアンサンブル学習することで、より高い耐性を実現可能である。

実験結果

リサーチクエスチョン

  • RQ1元の入力と再構築された入力の予測分布を一致させることで、強力なグレイボックス敵対的攻撃を効果的に検出できるか?
  • RQ2攻撃者がモデルおよび防御の両方の詳細を完全に把握しているホワイトボックス状況下でも、本手法の検出効果は高いか?
  • RQ3予測分布間のKLダイバージェンスから導出される敵対的スコアは、一般的なデータ損傷および分布シフトの検出に一般化可能か?
  • RQ4アンサンブル学習によるモデルの統合は、転送可能な攻撃に対する検出システムの耐性をどの程度向上させるか?
  • RQ5本手法は、アーキテクチャやハイパーパramータの調整なしに、異なるデータモダリティおよび分類器アーキテクチャに普遍的に適用可能か?

主な発見

  • 本手法は、MNISTおよびFashion-MNISTにおけるCarlini-WagnerおよびSLIDE攻撃をほぼ完全に無効化し、ほとんどの場合で検出AUC値が0.95を超える。
  • CIFAR-10では、ホワイトボックス攻撃下でも高い検出性能を維持し、C&WではAUC値0.7673、SLIDEでは0.7268、FGSMではε値に応じて最大0.85を達成する。
  • 敵対的スコアはCIFAR-10-Cにおけるデータ損傷を効果的に検出でき、損傷により誤分類される有害なインスタンスのスコアは、影響を受けないインスタンスのスコアより2.91倍から5.87倍高い。
  • Kolmogorov-Smirnov検定により、損傷ありと損傷なしのインスタンス間の敵対的スコアの差が統計的に有意であることが確認され、p値 = 0.0である。
  • ホワイトボックス攻撃が多様なオートエナボーダーのアーキテクチャ間で転送されにくいことから、攻撃転送に対する本手法の内在的耐性が示された。
  • 攻撃者が防御メカニズムの詳細を完全に把握している状況でも本手法は有効であるため、ホワイトボックス脅威に対して強い耐性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。