Skip to main content
QUICK REVIEW

[論文レビュー] Model Weight Theft With Just Noise Inputs: The Curious Case of the Petulant Attacker

Nicholas Roberts, Vinay Uday Prabhu|arXiv (Cornell University)|Dec 19, 2019
Adversarial Robustness in Machine Learning参考文献 9被引用数 8
ひとこと要約

この論文は、i.i.d. ベルヌーイ雑音入力とソフトマックス層の出力へのアクセスのみを用いて、畳み込みニューラルネットワークの重みを盗作可能であることを示している。MNISTでは96%、KMNISTでは82%のテスト精度を達成した。主な貢献は、データセットの複雑さ、特に空間相関性とモデル抽出可能性の相関関係を示し、抽出後の性能比に基づく新しいデータセット複雑度指標を提案したことである。

ABSTRACT

This paper explores the scenarios under which an attacker can claim that 'Noise and access to the softmax layer of the model is all you need' to steal the weights of a convolutional neural network whose architecture is already known. We were able to achieve 96% test accuracy using the stolen MNIST model and 82% accuracy using the stolen KMNIST model learned using only i.i.d. Bernoulli noise inputs. We posit that this theft-susceptibility of the weights is indicative of the complexity of the dataset and propose a new metric that captures the same. The goal of this dissemination is to not just showcase how far knowing the architecture can take you in terms of model stealing, but to also draw attention to this rather idiosyncratic weight learnability aspects of CNNs spurred by i.i.d. noise input. We also disseminate some initial results obtained with using the Ising probability distribution in lieu of the i.i.d. Bernoulli distribution.

研究の動機と目的

  • 実際の訓練データにアクセスできない状況下でも、ランダムな雑音入力とソフトマックス層へのアクセスのみを用いてモデル重みを盗作可能かどうかを調査すること。
  • 入力雑音分布とモデル抽出可能性の関係、特に空間相関性の影響を調査すること。
  • 雑音入力によるモデル抽出の難易度に基づく、新しいデータセット複雑度指標を提案すること。
  • 特にイジングモデルを含む、異なる雑音分布が重み盗作の成功に与える影響を評価すること。
  • 非情報的入力でさえも、CNNの重み盗作の脆弱性に注意を喚起し、アーキテクチャ的要因とデータ分布依存性を強調すること。

提案手法

  • パラメータ p=0.5 のベルヌーイ分布を用いて、手続き的に600,000枚のバイナリランダム画像を生成し、入力刺激として用いる。
  • 各ランダム画像を被害者モデルのソフトマックス層に入力し、クラス確率分布をラベルとして収集する。
  • ランダム入力と対応するソフトマックス出力を教師信号として用い、新規モデルを再び訓練する。
  • 空間的に相関のある雑音入力を生成するためにイジングモデルを用い、i.i.d. 雑音分布と性能を比較する。
  • オリジナルのテストセットにおける抽出後検証精度を、抽出前の精度で正規化することで、モデル抽出可能性を測定する。
  • イジングモデルの逆温度βを変化させ、抽出性能および一般化性能への影響を調査する。

実験結果

リサーチクエスチョン

  • RQ1i.i.d. ベルヌーイ雑音を入力とし、ソフトマックス層へのアクセスのみを用いて、深層ニューラルネットワークの重みを効果的に盗作可能か?
  • RQ2空間相関性を持つ入力雑音分布(特にイジングモデル)の選択が、モデル抽出成功に与える影響は何か?
  • RQ3抽出後の精度 / 抽出前の精度という比によって測定されるデータセットの固有の複雑さは、その学習可能性および構造的性質をどの程度反映しているか?
  • RQ4なぜイジングモデルはi.i.d. 雑音分布(ベルヌーイ、ガウス、ギブスなど)を上回る性能を示すのか?これは空間相関性がモデル重み学習に果たす役割をどのように示唆するか?
  • RQ5イジングモデルの温度パラメータβは、盗作モデルの一般化性能および精度にどのように影響するか?

主な発見

  • i.i.d. ベルヌーイ雑音入力のみを用いた場合、MNIST用の盗作モデルは95.93%の検証精度を達成し、オリジナルモデル性能の96.87%に相当した。
  • KMNISTでは、盗作モデルが81.18%の精度を達成し、オリジナルモデルの94.79%の85.64%に相当した。
  • イジングモデル(β=0.3)は、MNISTで98.02%の最高抽出精度を記録し、i.i.d. 雑音分布を顕著に上回った。
  • イジングモデルの成功は、空間相関性をモデル化できる能力に起因し、ベルヌーイ、ガウス、ギブスなどのi.i.d. 雑音分布にはそのような相関性が欠如しているためである。
  • 性能比(抽出後精度 / 抽出前精度)は、データセット複雑度の有効な代理指標であると判明し、MNISTは最も容易に抽出可能で、notMNISTは最も困難(比 0.1181)であった。
  • βを変化させた際の損失および精度曲線には、オカムの剃刀の丘(Occam’s hill effect)が観察され、MNIST、KMNIST、Fashion MNISTではβ=0.3で最適性能を示したが、notMNISTではβ=0.8が最適であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。