Skip to main content
QUICK REVIEW

[論文レビュー] Blind Pre-Processing: A Robust Defense Method Against Adversarial Examples

Adnan Siraj Rakin, Zhezhi He|arXiv (Cornell University)|Feb 5, 2018
Adversarial Robustness in Machine Learning参考文献 22被引用数 9
ひとこと要約

本論文は、分類器に到達する入力の前に、tanh、バッチ正則化、符号化技術を特徴とする非可逆で非線形な変換を施すことで、深層ニューラルネットワークの adversarial 攻撃に対する耐性を向上させる、盲目的な前処理(Blind Pre-Processing, BP)という新しい防御手法を提案する。この手法は、 adversarial training を用いない状態で MNIST において 98.65% の最先端の精度を達成し、CIFAR-10 および SVHN においても強力な攻撃に対して高い性能を維持する。

ABSTRACT

Deep learning algorithms and networks are vulnerable to perturbed inputs which is known as the adversarial attack. Many defense methodologies have been investigated to defend against such adversarial attack. In this work, we propose a novel methodology to defend the existing powerful attack model. We for the first time introduce a new attacking scheme for the attacker and set a practical constraint for white box attack. Under this proposed attacking scheme, we present the best defense ever reported against some of the recent strong attacks. It consists of a set of nonlinear function to process the input data which will make it more robust over the adversarial attack. However, we make this processing layer completely hidden from the attacker. Blind pre-processing improves the white box attack accuracy of MNIST from 94.3\% to 98.7\%. Even with increasing defense when others defenses completely fail, blind pre-processing remains one of the strongest ever reported. Another strength of our defense is that it eliminates the need for adversarial training as it can significantly increase the MNIST accuracy without adversarial training as well. Additionally, blind pre-processing can also increase the inference accuracy in the face of a powerful attack on CIFAR-10 and SVHN data set as well without much sacrificing clean data accuracy.

研究の動機と目的

  • adversarial training に依存せずに、強力なホワイトボックス攻撃に対しても耐性を高める防御手法の開発を目的とする。
  • 攻撃の強度が増すと失敗する、あるいは異なるデータセットに一般化できない既存の防御の限界を克服することを目的とする。
  • 攻撃者に前処理層が見えないよう設計することで、実世界の応用(例:自動運転車)に適した実用的で導入可能な防御を提供することを目的とする。
  • 離散データにおける LS-PGA や PGD といった強力な攻撃に対しても、綺麗なデータの精度を向上させつつ高い耐性を維持することを目的とする。
  • 入力分布を耐性に最適化することで、pre-processing が一部の状況下で adversarial training を上回ることを示すこと。

提案手法

  • 分類器に到達する前に、tanh、バッチ正則化、one-hot/thermometer 符号化を組み合わせた非可逆的で隠された前処理パイプラインを適用する。
  • 攻撃者に完全に未知の前処理層を設計し、勾配に基づく攻撃を防ぐためにハードウェア埋め込み型の防御層を模倣する。
  • モデルの重み、勾配、学習手順へのアクセスは想定するが、盲目的な前処理層へのアクセスは想定しない、修正されたホワイトボックス攻撃モデルを用いる。
  • CIFAR-10 の周波数プロットで明確に現れるピクセル強度分布の再分配によりエッジ遷移を増加させ、微小な摂動の効果を低下させる。
  • 攻撃を受けたデータの精度比(α)という指標(綺麗なデータ精度と耐性のバランスを取る)を最大化するために、前処理コンポーネントの組み合わせ(例:tanh+BN、フィルタ+BN)を最適化する。
  • 実世界の展開状況を反映するためのホワイトボックス攻撃に対する実用的制約を導入し、誤った楽観的評価を受ける obfuscated gradient 防御を是正する。

実験結果

リサーチクエスチョン

  • RQ1adversarial training を用いない状態で、特に MNIST において高い耐性を達成できる防御は設計可能か?
  • RQ2盲的な前処理は入力ピクセル強度の分布にどのような影響を与え、それが adversarial 耐性に寄与するか?
  • RQ3離散データにおける LS-PGA や投影勾配降下法(PGD)といった強力な攻撃に対しても、防御は有効に機能するか?
  • RQ4MNIST ではうまく機能するバッチ正則化が CIFAR-10 で失敗するのはなぜか? これは前処理コンポーネントの選択にどのような影響を与えるか?
  • RQ5攻撃を受けたデータの精度比(α)は、異なるデータセットおよび前処理の組み合わせにおいて、全体の防御性能とどの程度相関するか?

主な発見

  • Blind pre-processing は、adversarial training を用いない状態で MNIST において 98.65% のテスト精度を達成し、訓練プロセスに adversarial データを一切使用しない状態でこのような性能が達成された初の事例である。
  • tanh とバッチ正則化の組み合わせが最も高い攻撃を受けたデータの精度比(α = 49.8)を示し、強力な耐性を示しているが、大きなデータセットでは綺麗なデータ精度がわずかに低下する。
  • CIFAR-10 および SVHN では高い耐性を維持しているが、それぞれ 86% および 95% の精度に回復させるために adversarial training が必要であることが示され、綺麗なデータ精度と耐性の間のトレードオフが顕在化している。
  • LS-PGA や離散データにおける修正版 PGD 攻撃において、最近の防御を上回る優れた耐性を示しており、優れた耐性の有効性を裏付けている。
  • ピクセル分布の分析から、tanh 加工により標準偏差が増加し、特にエッジ遷移が強化されることが明らかになった。これにより、微小な adversarial 摂動の影響が低減される。
  • 攻撃者が隠された前処理層を逆算できないように設計されているため、obfuscated gradient 攻撃に対しても防御は有効である。勾配に基づく攻撃は無効化される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。