[論文レビュー] Towards Robust Deep Neural Networks
本稿では、$l_∞$-有界入力摂動に対する感度を最小化することにより、深層ニューラルネットワークのロバスト性を向上させる、新たな損失関数を提案する。感度の指標として、過剰近似された出力到達可能集合の体積に基づくものである。実験の結果、明示的な adversarial training を用いなくても、最先端のロバスト性とより優れた一般化性能、低い感度を達成している。
We investigate the topics of sensitivity and robustness in feedforward and convolutional neural networks. Combining energy landscape techniques developed in computational chemistry with tools drawn from formal methods, we produce empirical evidence indicating that networks corresponding to lower-lying minima in the optimization landscape of the learning objective tend to be more robust. The robustness estimate used is the inverse of a proposed sensitivity measure, which we define as the volume of an over-approximation of the reachable set of network outputs under all additive $l_{\infty}$-bounded perturbations on the input data. We present a novel loss function which includes a sensitivity term in addition to the traditional task-oriented and regularization terms. In our experiments on standard machine learning and computer vision datasets, we show that the proposed loss function leads to networks which reliably optimize the robustness measure as well as other related metrics of adversarial robustness without significant degradation in the classification error. Experimental results indicate that the proposed method outperforms state-of-the-art sensitivity-based learning approaches with regards to robustness to adversarial attacks. We also show that although the introduced framework does not explicitly enforce an adversarial loss, it achieves competitive overall performance relative to methods that do.
研究の動機と目的
- 最適化のランドスケープにおける極小解のエネルギーとニューラルネットワークのロバスト性との関係を調査すること。
- $l_\infty$-有界入力摂動下での過剰近似された出力到達可能集合の体積に基づく感度指標を開発すること。
- 明示的な adversarial 損失に依存せずに、高感度をペナルティ化することでロバスト性を最適化する学習フレームワークを設計すること。
- 訓練済みモデルにおける分類精度、感度、adversarial ロバスト性のトレードオフを評価すること。
提案手法
- 訓練サンプル全体における $l_\infty$-有界入力摂動下での過剰近似された出力到達可能集合の体積の総和として感度測定値を定義する。
- Reluplex および線形プログラミングの緩和法を用いて、各入力サンプルの到達可能出力集合を推定する。
- 標準的な交差エントロピー損失と正則化項に加え、感度ペナルティ項を組み合わせた新たな損失関数を提案する。
- エネルギーランドスケープ解析を用いて、低エネルギーの極小解が感度低減とロバスト性向上に寄与することを検証する。
- 計算化学および形式手法分野の正式な検証技術を応用して、感度の境界を推定する。
- 提案された損失関数を用いてネットワークを訓練し、MNIST および CIFAR-10 データセット上でロバスト性を評価する。
実験結果
リサーチクエスチョン
- RQ1最適化ランドスケープにおける極小解のエネルギーと、対応するニューラルネットワークの感度との間に相関関係があるか?
- RQ2有界な入力摂動下での出力到達可能集合の体積を低減することは、adversarial ロバスト性の向上に寄与するか?
- RQ3感度に基づく訓練は、adversarial training と比較してロバスト性および一般化性能において優れているか?
- RQ4明示的な adversarial 損失を用いなくても、感度を最小化することで adversarial ロバスト性が向上するか?
- RQ5提案フレームワークにおける感度、分類精度、adversarial ロバスト性のトレードオフはいかなるものか?
主な発見
- MNIST テストデータにおいて、本手法は感度指標として $8.65 \times 10^3$ を達成し、ベースライン($1.27 \times 10^{12}$)および K&W($2.12 \times 10^5$)と比べて顕著に低い値を示した。
- MNIST テストデータにおいて、本手法は交差エントロピー損失を $\mathbf{0.125}$ に抑え、分類性能において K&W($0.262$)およびベースライン($0.082$)を上回った。
- adversarial エラーを直接最小化していなくても、adversarial エラーを $24.5\%$ まで低減し、ベースライン($91.23\%$)を大きく上回り、K&W($14.54\%$)に近づいた。
- 感度低減と adversarial ロバスト性の向上の間に強い相関関係が確認され、感度の低減が adversarial 損失の低減に寄与することが示された。
- エネルギーランドスケープ解析により、低エネルギーの極小解は感度が低いネットワークに対応しており、最適化ランドスケープの性質がロバスト性に影響を与えるという仮説が裏付けられた。
- 本手法は、感度、adversarial ロバスト性、分類精度の間で良好なトレードオフを達成し、一般化性能において K&W を上回りながらも、競争力あるロバスト性を維持した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。