Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Reprogramming of Neural Networks

Gamaleldin F. Elsayed, Ian Goodfellow|arXiv (Cornell University)|Jun 28, 2018
Adversarial Robustness in Machine Learning参考文献 33被引用数 21
ひとこと要約

この論文は、入力に1つの固定された敵対的摂動を適用することで、事前学習済みの深層ニューラルネットワークを新たなタスク—例えばMNISTやCIFAR-10の画像分類—に再プログラミングする、新しい攻撃である敵対的再プログラミングを紹介する。この手法はモデルの内在的な柔軟性を活用し、タスク固有のファインチューニングや入力ごとの計算を必要とせずに、成功裏にタスクの再利用を実現する。

ABSTRACT

Deep neural networks are susceptible to \emph{adversarial} attacks. In computer vision, well-crafted perturbations to images can cause neural networks to make mistakes such as confusing a cat with a computer. Previous adversarial attacks have been designed to degrade performance of models or cause machine learning models to produce specific outputs chosen ahead of time by the attacker. We introduce attacks that instead {\em reprogram} the target model to perform a task chosen by the attacker---without the attacker needing to specify or compute the desired output for each test-time input. This attack finds a single adversarial perturbation, that can be added to all test-time inputs to a machine learning model in order to cause the model to perform a task chosen by the adversary---even if the model was not trained to do this task. These perturbations can thus be considered a program for the new task. We demonstrate adversarial reprogramming on six ImageNet classification models, repurposing these models to perform a counting task, as well as classification tasks: classification of MNIST and CIFAR-10 examples presented as inputs to the ImageNet model.

研究の動機と目的

  • 事前学習済みのニューラルネットワークが再訓練や入力ごとの変更なしに、まったく新しいタスクに再利用可能かどうかを調査すること。
  • 多様な入力ドメインにわたり、1つの固定された敵対的摂動を用いてモデルの挙動を再プログラミングする可能性を検討すること。
  • 特に実世界の展開環境において、深層ニューラルネットワークがこのような再プログラミング攻撃に対してどれほど脆弱であるかを評価すること。
  • 敵対的プログラムを明らかに悪意のない入力に隠すことで検出を回避する可能性を評価すること。
  • 展開済みの機械学習システムにおける敵対的再プログラミングのモデルセキュリティ、倫理的利用、計算リソースの悪用に関する影響を検討すること。

提案手法

  • 敵対的プログラムを、新しいタスクドメイン(例:MNIST)の入力を、事前学習済みモデル(例:ImageNet分類器)の入力空間に写像する学習可能な変換 $ h_f(\tilde{x}; \theta) $ として定義する。
  • 摂動を制御するための学習可能なパラメータ $ \theta $ を用い、$ \theta $ を最適化することで、モデル出力を所望のターゲット関数 $ g(\tilde{x}) $ に一致させる。
  • 再プログラミングされたモデルの新しいタスクにおける分類誤差を最小化する微分可能目的関数を用いて敵対的プログラムを訓練するが、摂動の大きさは $ \alpha $ を用いて制約する。
  • 入力画像をシャッフルすることで敵対的信号をぼかし、検出を困難にし、より高いステルス性を実現する。
  • 元のモデルの出力をターゲットタスクの出力空間に変換するためのハードコード済みラベルマッピング $ h_g $ を使用する。
  • 標準的なバックプロパゲーションを用いて敵対的プログラムを最適化し、$ \theta $ を入力変換を定義する学習可能なパラメータとして扱う。

実験結果

リサーチクエスチョン

  • RQ11つの固定された入力摂動のみを用いて、事前学習済みニューラルネットワークを新たなタスクに再プログラミングできるか?
  • RQ2視覚的類似性のないドメイン間(例:ImageNet分類器上でMNISTを処理)において、敵対的再プログラミングがどの程度成功するか?
  • RQ3敵対的プログラムは、明らかに正常な入力に隠すことができるか?
  • RQ4モデルアーキテクチャーや学習プロセスは、敵対的再プログラミングへの感受性にどのように影響するか?
  • RQ5展開済みの機械学習システムにおける敵対的再プログラミングの広範なセキュリティ的・倫理的影響は何か?

主な発見

  • 敵対的再プログラミングは、6つのImageNet分類モデルを用いて、カウンティングタスク、MNIST分類、CIFAR-10分類を1つの固定摂動で成功裏に再プログラミングした。
  • 新しいタスクの入力データ(例:MNIST)がImageNetデータと視覚的に類似していない場合でも攻撃が成立し、モデルの高い柔軟性を示している。
  • 学習済みモデルではランダム初期化されたネットワークよりも再プログラミングが効果的であり、学習済み表現が感受性を高めることを示している。
  • 敵対的プログラムは、見かけ上無害なImageNet画像に埋め込むことができ、攻撃がステルス性を持ち、検出が困難であることを示している。
  • 入力変換のみに依存し、入力ごとの計算やモデルのファインチューニングを一切必要としないため、再プログラミングが実現している。
  • データ分布が重複しない状況でも動作することから、敵対的再プログラミングは単なるトランスファー学習の結果ではないことが示唆されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。