Skip to main content
QUICK REVIEW

[論文レビュー] Defending Against Adversarial Attacks by Suppressing the Largest Eigenvalue of Fisher Information Matrix

Chaomin Shen, Yaxin Peng|arXiv (Cornell University)|Sep 13, 2019
Adversarial Robustness in Machine Learning参考文献 21被引用数 10
ひとこと要約

この論文では、損失関数に正則化項を追加することでフィッシャー情報行列(FIM)の最大固有値を抑えることで、敵対的攻撃に対する新たな防御手法を提案している。FIMの最大固有値を制限することにより、小さな入力摂動に対するモデルの感度が低下し、再訓練を1回のファインチューニングステップにとどめ、複数のネットワークとデータセットで高いクリーン精度を維持したまま、顕著な耐性向上が達成される。

ABSTRACT

We propose a scheme for defending against adversarial attacks by suppressing the largest eigenvalue of the Fisher information matrix (FIM). Our starting point is one explanation on the rationale of adversarial examples. Based on the idea of the difference between a benign sample and its adversarial example is measured by the Euclidean norm, while the difference between their classification probability densities at the last (softmax) layer of the network could be measured by the Kullback-Leibler (KL) divergence, the explanation shows that the output difference is a quadratic form of the input difference. If the eigenvalue of this quadratic form (a.k.a. FIM) is large, the output difference becomes large even when the input difference is small, which explains the adversarial phenomenon. This makes the adversarial defense possible by controlling the eigenvalues of the FIM. Our solution is adding one term representing the trace of the FIM to the loss function of the original network, as the largest eigenvalue is bounded by the trace. Our defensive scheme is verified by experiments using a variety of common attacking methods on typical deep neural networks, e.g. LeNet, VGG and ResNet, with datasets MNIST, CIFAR-10, and German Traffic Sign Recognition Benchmark (GTSRB). Our new network, after adopting the novel loss function and retraining, has an effective and robust defensive capability, as it decreases the fooling ratio of the generated adversarial examples, and remains the classification accuracy of the original network.

研究の動機と目的

  • 意思決定境界の高い湾曲性が原因で生じる深層ニューラルネットワークの敵対的例に対する脆弱性を是正すること。
  • フィッシャー情報行列(FIM)の最大固有値を制御することで、敵対的攻撃に対する耐性が向上するかを調査すること。
  • 1回の再訓練ステップで実現可能な、単純で説明可能かつ効果的な防御機構を開発すること。
  • FIMの最大固有値を抑えることで、多様な攻撃タイプとアーキテクチャにおいて敵対的例の欺瞞率が低下することを示すこと。
  • ラベルスムージングなどの既存の防御とは異なり、情報幾何学に明確な数学的根拠を持つ、理論的裏付けのある代替防御を提供すること。

提案手法

  • 元のネットワークの損失関数に、フィッシャー情報行列(FIM)のトレースに基づく正則化項を導入し、最大固有値を制限する。
  • FIMの最大固有値がトレースによって上界で抑えられることを数学的に利用し、間接的な制御を可能にする。
  • KLダイバージェンスに基づいて導出された、FIMのトレースに比例する項を標準的な交差エントロピー損失に追加する。
  • 修正された損失関数を用いてネットワークを1回再訓練することで、アーキテクチャの変更なしに敵対的耐性を統合する。
  • 正常例と敵対的例の出力差がFIMを含む二次形式として表現され、その最大固有値が入力摂動に対する感度を決定することを活用する。
  • 防御の妥当性を検証するため、FIMの主要固有ベクトルを用いて敵対的例を生成するOne Step Spectral Attack(OSSA)をベンチマーク攻撃として採用する。

実験結果

リサーチクエスチョン

  • RQ1FIMの最大固有値を抑えることで、小さな入力摂動に対するモデルの感度が低下し、敵対的攻撃に対する耐性が向上するか?
  • RQ2ラベルスムージングなどの既存手法と比較して、本防御は耐性と説明可能性の面でどのように差をつけるか?
  • RQ3複数の攻撃タイプとデータセットにおいて、クリーン精度を維持しながら欺瞞率を顕著に低下させるか?
  • RQ4攻撃者がソースモデルからターゲットモデルに敵対的例を転送するブラックボックス攻撃にも一般化可能か?
  • RQ5繰り返し適用型およびワンステップ型を含む、ホワイトボックスおよびブラックボックス攻撃に対しても有効か?

主な発見

  • 提案された防御は、MNIST、CIFAR-10、GTSRBのすべてのテスト攻撃手法(FGSM、BIM、DeepFool、CW、JSMA)において、敵対的例の欺瞞率を低下させた。
  • LeNetを用いたMNISTでは、元のモデルにおける敵対的例までの平均$l_{\backslash infty}$距離が0.107から0.170に増加し、より強い耐性を示した。
  • One Step Spectral Attack(OSSA)では、$\varepsilon=1.0$の条件下で防御モデルでは敵対的例が生成できず、強い耐性を示した。
  • クロスモデルブラックボックステストでは、防御モデルは元のモデルから生成された敵対的例に対して97.47%の精度を示したのに対し、元のネットワークでは0%であった。
  • 距離指標すべてにおいて、防御モデルが元のモデルを上回り、距離比が1:1.3から1:1.8の範囲にあり、耐性の向上が明確に示された。
  • クリーン精度を高く維持(例:FGSMを用いたMNISTでは97.47%)しながら、耐性を顕著に向上させたため、精度と防御のトレードオフがないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。