Skip to main content
QUICK REVIEW

[論文レビュー] A Method for Computing Class-wise Universal Adversarial Perturbations

Tejus Gupta, Abhishek Sinha|arXiv (Cornell University)|Dec 1, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用数 5
ひとこと要約

本論文は、深層ニューラルネットワークの意思決定境界の線形構造を活用することで、反復的最適化やハイパーパrameterを一切必要としない、データフリーで閉形式の方法を提案し、クラス別ユニバーサル adversarial パーティクルを生成する。この手法はネットワーク重みの線形関数としてパラメータを計算し、反復的最適化を一切行わず、ハイパーパrameterを必要とせず、ImageNet モデルで 34–51% の欺瞞率を達成し、アーキテクチャ間で強い転送性を示す。

ABSTRACT

We present an algorithm for computing class-specific universal adversarial perturbations for deep neural networks. Such perturbations can induce misclassification in a large fraction of images of a specific class. Unlike previous methods that use iterative optimization for computing a universal perturbation, the proposed method employs a perturbation that is a linear function of weights of the neural network and hence can be computed much faster. The method does not require any training data and has no hyper-parameters. The attack obtains 34% to 51% fooling rate on state-of-the-art deep neural networks on ImageNet and transfers across models. We also study the characteristics of the decision boundaries learned by standard and adversarially trained models to understand the universal adversarial perturbations.

研究の動機と目的

  • 反復的最適化を必要とせず、トレーニングデータに依存しない、クラス固有のユニバーサル adversarial パーティクルを高速に生成する手法の開発。
  • 深層ニューラルネットワークの意思決定境界の線形性を調査し、これを効率的な攻撃生成に活用すること。
  • 提案手法のパラメータが異なるモデルやデータセット間でどれほど転送可能で、どれほど頑健であるかを評価すること。
  • 特定の ImageNet クラスがなぜユニバーサル パーティクルに対して本質的により脆弱であるかを理解すること。

提案手法

  • 提案手法は、トレーニング済みニューラルネットワークの最終全結合層の重みに対する線形関数としてユニバーサル パーティクルを計算し、閉形式かつ反復的でない計算を可能にする。
  • ターゲットクラスに対応する重み行列の符号を用いてパラメータを生成することで、計算コストを最小限に抑える。
  • トレーニングデータやハイパーパrameterへのアクセスを一切不要としており、ブラックボックス環境でも高い効率性と実装可能性を有する。
  • 深層ネットワークの意思決定境界が、特にクラス固有の重みベクトルの方向において近似的に線形であるという仮定に基づいてパラメータを導出する。
  • 複数のデータセットおよびモデルで、ターゲットクラスのクリアな画像に対する欺瞞率を評価することで、パラメータの有効性を検証する。
  • コサイン類似度と特異値分解を用いて、例固有の adversarial パーティクルとユニバーサル パラメータの整合性を分析する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークの意思決定境界の線形性を活用することで、反復的最適化やトレーニングデータを一切必要とせずにユニバーサル adversarial パーティクルを生成できるか?
  • RQ2提案手法の線形重みベースのアプローチは、従来の反復的最適化に基づく手法と比較して、欺瞞率と転送性においてどのように異なるか?
  • RQ3標準的および adversarially 訓練されたモデルにおける意思決定境界はどの程度線形的であるか? また、これはユニバーサル パラメータの有効性にどのように影響するか?
  • RQ4特定の ImageNet クラスがユニバーサル パラメータに対して著しく高いまたは低い欺瞞率を示すのはなぜか? これは異なるアーキテクチャ間で一貫性があるか?
  • RQ5例固有の adversarial パラメータの方向が、提案されたユニバーサル パラメータとどれほど一致するか? これは共通の脆弱性方向を示唆するか?

主な発見

  • 提案手法は、トレーニングデータやハイパーパrameterを一切必要とせず、最先端の ImageNet モデルで 34% から 51% の欺瞞率を達成した。
  • 攻撃は強いモデル間転送性を示し、VGG-16 と ResNet-18 の間で全 ImageNet クラスにおいて平均 10.96% の欺瞞率差に留まった。
  • 例固有の adversarial パラメータの方向と、提案されたユニバーサル パラメータの間には高いコサイン類似度が観察され、共通の脆弱性方向を示している。
  • 標準モデルの 81 組のペアワイズ意思決定境界のうち 38 組が決定係数(R²)≥ 0.9 を示し、意思決定境界が主に線形であるという仮説を支持した。
  • adversarially 訓練されたモデルでは、すべてのペアワイズ境界で R² 値がほぼゼロであった。これは、adversarial 訓練によって線形性が崩れる可能性を示唆している。
  • 一部の ImageNet クラスは本質的により脆弱である。77 クラスが 20% 未満の欺瞞率を示し、37 クラスが 80% を超える。この傾向は異なるアーキテクチャ間でも一貫していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。