Skip to main content
QUICK REVIEW

[論文レビュー] Practical No-box Adversarial Attacks against DNNs

Qizhang Li, Yiwen Guo|arXiv (Cornell University)|Dec 4, 2020
Adversarial Robustness in Machine Learning被引用数 7
ひとこと要約

本稿は、攻撃者が被害モデルのアーキテクチャ、パラメータ、学習データ、クエリインターフェースにアクセスできない状況下で、実用的なノーボックス敵対的攻撃を提案する。代わりに、同じドメインのラベルなし例10~20個のみを用いてプロトタイプ自己符号化器を訓練し、高い転送性を持つ敵対的例を生成する。この攻撃により、商業用有名人認識システムの精度が15.40%まで低下し、事前学習済みモデルを用いた攻撃と同等の性能を達成した。

ABSTRACT

The study of adversarial vulnerabilities of deep neural networks (DNNs) has progressed rapidly. Existing attacks require either internal access (to the architecture, parameters, or training set of the victim model) or external access (to query the model). However, both the access may be infeasible or expensive in many scenarios. We investigate no-box adversarial examples, where the attacker can neither access the model information or the training set nor query the model. Instead, the attacker can only gather a small number of examples from the same problem domain as that of the victim model. Such a stronger threat model greatly expands the applicability of adversarial attacks. We propose three mechanisms for training with a very small dataset (on the order of tens of examples) and find that prototypical reconstruction is the most effective. Our experiments show that adversarial examples crafted on prototypical auto-encoding models transfer well to a variety of image classification and face verification models. On a commercial celebrity recognition system held by clarifai.com, our approach significantly diminishes the average prediction accuracy of the system to only 15.40%, which is on par with the attack that transfers adversarial examples from a pre-trained Arcface model.

研究の動機と目的

  • クエリ、モデルアクセス、学習データが一切ないというより強い脅威モデル下での敵対的攻撃のギャップを埋める。
  • 極めて限られたデータ(例:10~20枚の画像)から、モデルやデータにアクセスせずに効果的な敵対的例を生成できるかを調査する。
  • このようなデータ不足・ノーボックス条件における代替モデルの学習メカニズムを開発・評価する。
  • これらの最小データから作成されたモデルを用いて生成された敵対的例の転送性を、実世界のDNN(商業システムを含む)に適用して示す。

提案手法

  • 攻撃者がアーキテクチャ、パラメータ、学習データにアクセスできない状況で、被害モデルと同じドメインの10~20枚の画像のみを用いてプロトタイプ自己符号化器を訓練する。
  • 3つのメカニズムを検討:回転画像からのビュー予測、ジグソーパuzzle再構成、プロトタイプ画像生成。その中で、プロトタイプ画像生成が最も効果的であった。
  • 訓練済みの自己符号化器を用いて、代替モデル上で勾配ベースの攻撃(例:PGD)により敵対的例を生成する。
  • 多様な被害モデル(ImageNet分類器、顔認識システムなど)にこれらの敵対的例を適用し、転送性を評価する。
  • 特徴の識別能と攻撃の転送性を向上させるために、プロトタイプデコーダーの数(1~20)を最適化する。
  • 敵対的訓練を施したモデルでもテストすることで耐性を検証し、標準的な敵対的訓練がノーボックス攻撃に対して完全に防御できないことが判明した。

実験結果

リサーチクエスチョン

  • RQ1攻撃者が被害モデルのアーキテクチャ、パラメータ、学習データ、クエリインターフェースに一切アクセスできない状況でも、効果的な敵対的例を生成できるか?
  • RQ210~20枚程度の最小限のデータから生成された敵対的例は、画像分類や顔認識分野の多様で未知のDNNにどれほど転送可能か?
  • RQ3ビュー予測、ジグソーパuzzle再構成、プロトタイプ画像生成の3つの提案手法のうち、どの手法がデータ不足下で最も転送性の高い敵対的例を生成するか?
  • RQ4自己符号化器アーキテクチャにおけるプロトタイプデコーダーの数は、攻撃性能と転送性に顕著な影響を与えるか?
  • RQ5標準的な敵対的訓練防御は、最小限のデータから生成されたノーボックス敵対的攻撃に対して依然として有効か?

主な発見

  • 提案されたノーボックス攻撃により、商業用有名人認識システム(Clarifai.com)の予測精度が100.00%から15.40%まで低下し、実世界での高い有効性を示した。
  • わずか10枚の顔画像からでも、Clarifaiシステムに対して15.40%の攻撃成功率を達成し、事前学習済みArcFaceモデルを用いた攻撃と同等の性能を示した。
  • プロトタイプ再構成手法がビュー予測やジグソーパuzzle再構成を上回り、多様な被害モデルに最も優れた転送性を示した。
  • より多くの学習データが使われるほど攻撃性能が向上したが、2枚の画像でも依然として有効であり、極端なデータ不足下でも実現可能であることが示された。
  • 敵対的訓練を施したResNetモデルに対しても攻撃が有効であり、ノーボックス攻撃下で39.24%の精度にまで低下した。これはベースライン(54.12%)を上回っており、標準的な防御が不十分であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。