Skip to main content
QUICK REVIEW

[論文レビュー] Improved Adversarial Robustness by Reducing Open Space Risk via Tent Activations

Andras Rozsa, Terrance E. Boult|arXiv (Cornell University)|Aug 7, 2019
Adversarial Robustness in Machine Learning参考文献 32被引用数 13
ひとこと要約

本稿では、計算コストが低く、有界で開放的空間リスクを抑える活性化関数「tent活性化関数」を導入し、訓練コストを増加させることなく敵対的ロバストネスを向上させることを目的としている。ReLUのような単調な活性化関数に置き換えることで、分布外の入力に対する応答を制限し、敵対的摂動に対する脆弱性を低減する。MNISTでは平均91.8%のロバスト正答率、CIFAR-10では73.5%を達成し、それぞれPGD敵対的訓練を15ポイント以上、30ポイント以上上回った。

ABSTRACT

Adversarial examples contain small perturbations that can remain imperceptible to human observers but alter the behavior of even the best performing deep learning models and yield incorrect outputs. Since their discovery, adversarial examples have drawn significant attention in machine learning: researchers try to reveal the reasons for their existence and improve the robustness of machine learning models to adversarial perturbations. The state-of-the-art defense is the computationally expensive and very time consuming adversarial training via projected gradient descent (PGD). We hypothesize that adversarial attacks exploit the open space risk of classic monotonic activation functions. This paper introduces the tent activation function with bounded open space risk and shows that tents make deep learning models more robust to adversarial attacks. We demonstrate on the MNIST dataset that a classifier with tents yields an average accuracy of 91.8% against six white-box adversarial attacks, which is more than 15 percentage points above the state of the art. On the CIFAR-10 dataset, our approach improves the average accuracy against the six white-box adversarial attacks to 73.5% from 41.8% achieved by adversarial training via PGD.

研究の動機と目的

  • 敵対的例に対する深層ニューラルネットワークの脆弱性を解消するため、活性化関数における開放的空間リスクを根本的要因として特定すること。
  • 学習データの外側での応答成長を制限する、新しい活性化関数の設計により、深層学習モデルにおける開放的空間リスクを低減すること。
  • 敵対的訓練に比べて計算コストを増加させることなく、敵対的ロバストネスを向上させること。
  • 有界な開放的空間リスクが、標準ベンチマークで顕著に高いロバスト正答率をもたらすことを実証すること。
  • PGDに基づく敵対的訓練の代替手段として、理論的裏付けがあり、効率的かつ高いクリーン正答率を維持できる手法を提供すること。

提案手法

  • 出力が有界な非単調的かつ区分線形な関数である、tent活性化関数を提案。この関数は、学習データから離れた入力に対する応答を制限する。
  • 特定の入力閾値を超えると出力をゼロとするように設計し、ReLUなどの関数で見られる無限大への応答を防ぐ。
  • 敵対的訓練で必要な前向き・後向き伝搬の追加ステップを回避するため、標準的な最適化(重み減衰付きSGD)を用いて深層ネットワークを訓練する。
  • MNISTおよびCIFAR-10のWide ResNetアーキテクチャ(WRN-28-1およびWRN-28-10)のすべての隠れ層にtent活性化関数を適用する。
  • 訓練の安定化とロバストネスの向上を図るため、tentパラメータ(δ)に重み減衰を適用する。
  • 白ボックスおよびブラックボックスの敵対的攻撃(例:PGD、DeepFool、Carlini & Wagner)を用いて、複数の脅威モデルにおけるロバストネスを評価する。

実験結果

リサーチクエスチョン

  • RQ1活性化関数における開放的空間リスクの低減が、敵対的ロバストネスの向上に寄与するか?
  • RQ2tent活性化関数のような有界な開放的空間リスクを持つ活性化関数は、標準的なReLUベースのネットワークよりも敵対的攻撃に対して優れた性能を示すか?
  • RQ3tent活性化関数は、計算コストを増加させることなく、PGDベースの敵対的訓練を上回るロバスト正答率を達成できるか?
  • RQ4クリーンデータおよびブラックボックス攻撃の下で、tent活性化付きネットワークの性能は敵対的訓練モデルと比べてどうか?
  • RQ5なぜPGDによる敵対的訓練は、DeepFoolのような特定の攻撃に対してロバストネスを向上させないのか?そしてtent活性化関数はこの問題を解決できるか?

主な発見

  • MNISTでは、tent活性化付きWRN-28ネットワークが6つの白ボックス攻撃で平均91.8%のロバスト正答率を達成し、PGD敵対的訓練(76.8%)を15ポイントも上回った。
  • CIFAR-10では、tent活性化付きWRN-28-10が73.5%の平均ロバスト正答率を達成したのに対し、PGD敵対的訓練では41.8%にとどまり、31.7ポイントの改善を達成した。
  • tent活性化付きモデルは、クリーンテスト正答率を高く維持しており、特に低容量ネットワークにおいて顕著だった。一方、PGD敵対的訓練はクリーンデータの性能を著しく低下させた。
  • DeepFool攻撃に対しては、PGD敵対的訓練は標準訓練よりもロバストネスを低下させたが、tent活性化付きモデルはロバストであり、ベースラインを上回った。
  • ブラックボックス環境でも、tent活性化付きモデルはPGD訓練モデルと同等またはそれ以上のロバストネスを示し、特に低容量アーキテクチャにおいて顕著だった。
  • tent活性化関数は計算的に効率的であり、敵対的訓練とは異なり、訓練に追加のオーバーヘッドを生じさせない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。