Skip to main content
QUICK REVIEW

[論文レビュー] Are You Stealing My Model? Sample Correlation for Fingerprinting Deep Neural Networks

Jiyang Guan, Jian Liang|arXiv (Cornell University)|Oct 21, 2022
Adversarial Robustness in Machine Learning被引用数 10
ひとこと要約

本稿では、サンプル間相関を用いて盗難された深層ニューラルネットワークを検出する、新しいモデルフォグリプリント手法SACを提案する。正しく分類されない通常のサンプル、またはCutMix増強サンプルを用いて、元モデルと疑惑モデル間の相関差を計算することで、敵対的訓練や転移学習を含む多様な攻撃に対して、代替モデルの訓練や敵対的例の生成を必要とせずに、SOTAのAUC性能(最大1.0)を達成する。

ABSTRACT

An off-the-shelf model as a commercial service could be stolen by model stealing attacks, posing great threats to the rights of the model owner. Model fingerprinting aims to verify whether a suspect model is stolen from the victim model, which gains more and more attention nowadays. Previous methods always leverage the transferable adversarial examples as the model fingerprint, which is sensitive to adversarial defense or transfer learning scenarios. To address this issue, we consider the pairwise relationship between samples instead and propose a novel yet simple model stealing detection method based on SAmple Correlation (SAC). Specifically, we present SAC-w that selects wrongly classified normal samples as model inputs and calculates the mean correlation among their model outputs. To reduce the training time, we further develop SAC-m that selects CutMix Augmented samples as model inputs, without the need for training the surrogate models or generating adversarial examples. Extensive results validate that SAC successfully defends against various model stealing attacks, even including adversarial training or transfer learning, and detects the stolen models with the best performance in terms of AUC across different datasets and model architectures. The codes are available at https://github.com/guanjiyang/SAC.

研究の動機と目的

  • 敵対的例に依存する既存のモデルフォグリプリント手法の限界を解消し、敵対的訓練や転移学習の下でも機能しない問題を解決すること。
  • モデルの訓練プロセスに干渉せず、性能を低下させない、堅牢なモデル所有権確認技術を開発すること。
  • 代替モデルの訓練や敵対的例の生成を排除することで、フォグリプリントの時間的・計算的コストを低減すること。
  • さまざまなアーキテクチャやデータセット、特に転移学習や敵対的微調整といった困難な状況を含む、モデル盗難攻撃の効果的検出を可能にすること。

提案手法

  • 元モデルと疑惑モデルの間のサンプル間出力相関に基づき、新しいフォグリプリント指標としてサンプル相関(SAC)を提案する。
  • SAC-wを導入し、元モデルで誤分類された通常のサンプルを入力として用いることで、敵対的例に依存しない相関差を計算する。
  • SAC-mを開発し、CutMix増強サンプルを入力として用いることで、代替モデルの訓練や敵対的例の生成を完全に回避する。
  • スチュアトの類似度を相関関数として用い、盗難済みモデルと非盗難モデルとの間のギャップを最大化する。
  • 選択されたサンプルのモデル出力間の平均相関を計算し、これをフォグリプリントとして採用。この相関差を検出信号として用いる。
  • モデルの訓練プロセスを変更せずに手法を適用することで、元の精度を保持し、後からでも導入可能にする。

実験結果

リサーチクエスチョン

  • RQ1モデル出力間のサンプル相関は、盗難された深層ニューラルネットワークを検出するための堅牢で転送可能なフォグリプリントとして機能できるか?
  • RQ2従来の敵対的例ベース手法が失敗する敵対的訓練や転移学習の下で、SAC-wはどのように性能を示すか?
  • RQ3計算コストを低減しつつ、CutMix増強サンプルが敵対的例の代替としてフォグリプリントに有効に機能するか?
  • RQ4入力サンプルの選択(例:誤分類されたサンプル vs. 通常のサンプル)が、検出性能およびサンプル効率に与える影響は何か?
  • RQ5相関関数の選択(例:コサイン類似度 vs. ガウス型RBF)が、検出の堅牢性およびAUC性能に与える影響は何か?

主な発見

  • SACは、ほとんどのモデルアーキテクチャおよびデータセットで、敵対的訓練や転移学習の下でも、AUCが1.0という完璧な性能を達成する。
  • SAC-mは、フォグリプリント時間をわずか4.45秒にまで短縮し、CAE手法と比較して5,738倍も高速化され、顕著な効率的向上が確認された。
  • 誤分類サンプルを僅か50個で使用するだけで、SAC-wはAUC > 0.99を達成し、少数サンプル設定でも優れた性能を示す。
  • 防御者データが限られる状況においても、SAC-mはSAC-wおよび他のベースラインを上回り、精度と効率の両面で優位性を示す。
  • コサイン類似度を相関関数として用いることで、盗難済みモデルと非盗難モデルとの間で最大のギャップが得られ、最も効果的な選択であることが判明した。
  • モデルのプルーニング、微調整、モデル抽出攻撃の下でも、AUC値がすべての評価攻撃で一貫して0.99以上を維持し、高い堅牢性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。