Skip to main content
QUICK REVIEW

[論文レビュー] Data from Model: Extracting Data from Non-robust and Robust Models

Philipp Benz, Chaoning Zhang|arXiv (Cornell University)|Jul 13, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用数 8
ひとこと要約

本稿では、代替データセットと仮想ログチを用いた勾配最適化により、トレーニング済みモデルからデータを抽出する「モデルからのデータ(DfM)」という手法を紹介する。抽出されたデータで再トレーニングしたモデルは高い正確性を維持しており、特にロバストなモデルではその傾向が顕著である。これは、データとモデルの間の共通の特徴マッピングが、根本的な接続であることを確認するものである。

ABSTRACT

The essence of deep learning is to exploit data to train a deep neural network (DNN) model. This work explores the reverse process of generating data from a model, attempting to reveal the relationship between the data and the model. We repeat the process of Data to Model (DtM) and Data from Model (DfM) in sequence and explore the loss of feature mapping information by measuring the accuracy drop on the original validation dataset. We perform this experiment for both a non-robust and robust origin model. Our results show that the accuracy drop is limited even after multiple sequences of DtM and DfM, especially for robust models. The success of this cycling transformation can be attributed to the shared feature mapping existing in data and model. Using the same data, we observe that different DtM processes result in models having different features, especially for different network architecture families, even though they achieve comparable performance.

研究の動機と目的

  • 深層学習の逆プロセス、すなわちトレーニング済みモデルからデータを抽出することを調査すること。
  • 元のトレーニングデータにアクセスできない状況下でも、モデルが学習した特徴マッピングを回復・再利用できるかどうかを検討すること。
  • 異なるモデルアーキテクチャおよびトレーニング方式(非ロバスト対比ロバスト)における特徴マッピングの安定性と相互運用性を比較すること。
  • データ→モデルおよびモデル→データのサイクル処理が、複数反復にわたりモデル性能を保持するかどうかを評価すること。
  • 同じデータセットから得た異なるモデルランが、一意の特徴表現を学習するのか、それとも共有の特徴表現を学習するのかを理解すること。

提案手法

  • 代替画像と仮想ログチをターゲットとして、$l_2$-損失を用いた射影勾配降下法(PGD)を用いて、モデルのログチから合成データを生成する。
  • 元のDNNのターゲットログチ行動をモデル化するため、正規分布$\mathcal{N}(\mu, \sigma)$からサンプリングされた仮想ログチを用いる。
  • DfMによって生成されたデータを用いて、標準的なバックプロパゲーションによりモデルを再トレーニングし、出力ログチと保存済みの真値ログチとの$l_2$-距離を最小化する。
  • 情報保持度を評価するために、データ→モデル(DtM)とDfMプロセスを繰り返し連結する反復的チェーン処理を実施する。
  • 抽出データでトレーニングされたモデル間でのクロストレーニングおよびクロス評価を実施し、特徴の相互運用性と転送可能性を評価する。
  • 標準的および敵対的トレーニングを施したモデルを用い、MNISTおよびCIFAR-10で性能を評価し、アーキテクチャおよびトレーニングタイプごとの正確性を比較する。

実験結果

リサーチクエスチョン

  • RQ1元のトレーニングデータにアクセスできない状況下でも、トレーニング済みの深層ニューラルネットワークからデータを効果的に抽出できるか?
  • RQ2抽出データでトレーニングしたモデルの性能は、元のデータセットでトレーニングしたモデルと比べてどの程度か?
  • RQ3異なるモデルアーキテクチャは、同じデータから同じか異なる特徴マッピングを学習するか?
  • RQ4モデルのロバスト性(標準的対敵対的トレーニング)が、抽出された特徴マッピングの品質および相互運用性に与える影響は?
  • RQ5データ→モデルおよびモデル→データの変換を複数回繰り返した場合、どの程度まで特徴マッピングが保持されるか?

主な発見

  • DfMを用いて抽出されたデータでトレーニングしたモデルは、元のデータセットでトレーニングしたモデルと同等の正確性を達成しており、性能低下は最小限である。特にロバストモデルでは顕著である。
  • 非ロバストモデルでは、1回のDfM-DtMサイクルによる正確性低下は中程度(例:CIFAR-10では約3–5%低下)であるが、ロバストモデルではほぼ同一の性能(例:ResNet50では90.2% 対 90.5%)を示す。
  • クロス評価では、同じアーキテクチャだが異なるランから抽出されたデータでトレーニングしたモデル同士の正確性は約40–60%にとどまり、学習済みの特徴マッピングが異なることを示している。
  • 同じアーキテクチャファミリー(例:VGGまたはResNet)同士では、異なるファミリー同士と比較して特徴マッピングの相互運用性が高く、ResNetモデル同士でクロス評価すると約60%の正確性を達成する。
  • ロバストモデルは非ロバストモデルと比較して、より一貫性があり、特徴マッピングが転送可能であることが判明しており、例としてロバストに抽出されたデータで再トレーニングした場合、ResNet50では90.3–91.6%の高いクロスアーキテクチャ正確性を示した。
  • DtMおよびDfMプロセスのサイクル処理により、複数反復にわたりモデル性能が保持され、正確性の低下は限定的であるため、学習済みの特徴マッピングの安定性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。