Skip to main content
QUICK REVIEW

[論文レビュー] Effects of Loss Functions And Target Representations on Adversarial Robustness

Sean Saito, Sujoy Roy|arXiv (Cornell University)|Dec 1, 2018
Adversarial Robustness in Machine Learning参考文献 41被引用数 6
ひとこと要約

この論文は、標準的な交差エントロピーとワンホットエンコーディングの代わりに、平均二乗誤差(MSE)損失とコードワードベースのターゲット表現を用いたニューラルネットワークの訓練を提案している。変更されたモデルは、非標的攻撃に対して最大98.7%のロバストな正確度を達成し、標的攻撃の成功率を最大99.8%まで低下させ、顕著に小さいリプシッツ定数を示しており、変更に適合した攻撃に対しても強靭性が向上していることを示している。

ABSTRACT

Understanding and evaluating the robustness of neural networks under adversarial settings is a subject of growing interest. Attacks proposed in the literature usually work with models trained to minimize cross-entropy loss and output softmax probabilities. In this work, we present interesting experimental results that suggest the importance of considering other loss functions and target representations, specifically, (1) training on mean-squared error and (2) representing targets as codewords generated from a random codebook. We evaluate the robustness of neural networks that implement these proposed modifications using existing attacks, showing an increase in accuracy against untargeted attacks of up to 98.7\% and a decrease of targeted attack success rates of up to 99.8\%. Our model demonstrates more robustness compared to its conventional counterpart even against attacks that are tailored to our modifications. Furthermore, we find that the parameters of our modified model have significantly smaller Lipschitz bounds, an important measure correlated with a model's sensitivity to adversarial perturbations.

研究の動機と目的

  • 非標準的な訓練目的およびターゲット表現が敵対的ロバストネスを向上させるかどうかを調査すること。
  • ホワイトボックスおよびトランスファー攻撃を含む多様な攻撃シナリオにおけるロバストネスを評価すること。
  • リプシッツ定数を用いたモデルパラメータとロバストネスの関係を分析すること。
  • 提案された変更に適合した標的攻撃を設計し、その耐性をテストすること。

提案手法

  • tanh活性化出力とランダムなコードブックからのコードワード間の平均二乗誤差(MSE)損失を用いてモデルを訓練し、標準的な交差エントロピーとワンホットターゲットに置き換える。
  • クラスラベルを表すためにランダムなコードブックからのサンプリングによりコードワードを生成し、ワンホットエンコーディングを回避する。
  • 未標的および標的設定の両方でロバストネスを評価するために、標準的な敵対的攻撃(FGSM、BIM、MIM、L-BFGS、CWL2)を適用する。
  • 新しい損失関数およびターゲット表現に対応した修正されたCWL2攻撃を設計し、モデルの耐性をテストする。
  • 畳み込み層の重みの上界リプシッツ定数を計算し、パラメータの感度とロバストネスの関連性を分析する。
  • さまざまな脅威モデル下でのデータセット(CIFAR-10、MNIST、Fashion-MNIST)におけるモデル性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1交差エントロピー損失を平均二乗誤差に置き換えることで、画像分類モデルの敵対的ロバストネスが向上するか?
  • RQ2ワンホットベクトルの代わりにランダムなコードワードを使用することで、敵対的攻撃に対するロバストネスはどの程度向上するか?
  • RQ3アーキテクチャおよび訓練目的に適合した攻撃に対して、変更されたモデルはどのように性能を示すか?
  • RQ4リプシッツ定数によるスペクトル解析は、観察されたロバストネスの向上を説明できるか?
  • RQ5MSE損失とコードワードターゲットの組み合わせは、トランスファーベースのブラックボックス攻撃に対してもロバストネスを維持できるか?

主な発見

  • 変更されたモデルは、非標的攻撃に対して最大98.7%の正確度を達成し、標準的な交差エントロピーベースラインを著しく上回った。
  • 変更されたモデルでは、標的攻撃の成功率が標準モデルと比較して最大99.8%まで低下した。
  • 新しい損失関数およびターゲット形式に適合した修正されたCWL2攻撃に対しても、モデルはベースラインと比較して28.5%低い攻撃成功率を維持した。
  • R:TANH:MSEモデルでは、100%の攻撃成功率を達成するのに、ε = 0.35(ベースラインではε = 0.03)とはるかに大きな摂動が必要であり、より高いロバストネスを示している。
  • MSEで訓練されたモデルの畳み込み層重みの上界リプシッツ定数は、交差エントロピーで訓練されたモデルと比較して最大3倍も小さく、摂動に対する感度が低減しているという仮説を支持している。
  • 可視化結果から、変更されたモデルにおける敵対的例は、より人間の目には認識されにくく、MIM攻撃(ε = 0.1)でさえも誤分類に至らせるためにより大きな摂動を必要としていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。