Skip to main content
QUICK REVIEW

[論文レビュー] Fingerprinting Multi-exit Deep Neural Network Models via Inference Time

Tian Dong, Han Qiu|arXiv (Cornell University)|Oct 7, 2021
Adversarial Robustness in Machine Learning参考文献 26被引用数 4
ひとこと要約

本稿では、予測出力を用いるのではなく推論時間を利用して知的財産権所有権を検証する、マルチエグジット深層ニューラルネットワークモデル向けの新規フォージャーピント技法を提案する。特定の内部エグジットで一意で測定可能な推論時間コストを引き起こすように設計されたフォージャーピントサンプルを用いることで、敵対的訓練、モデルプルーニング、構造的変更に対して高い一意性と耐性を示し、複数のアーキテクチャとデータセットにおいて、従来の予測ベースのフォージャーピント技法を上回る性能を発揮する。

ABSTRACT

Transforming large deep neural network (DNN) models into the multi-exit architectures can overcome the overthinking issue and distribute a large DNN model on resource-constrained scenarios (e.g. IoT frontend devices and backend servers) for inference and transmission efficiency. Nevertheless, intellectual property (IP) protection for the multi-exit models in the wild is still an unsolved challenge. Previous efforts to verify DNN model ownership mainly rely on querying the model with specific samples and checking the responses, e.g., DNN watermarking and fingerprinting. However, they are vulnerable to adversarial settings such as adversarial training and are not suitable for the IP verification for multi-exit DNN models. In this paper, we propose a novel approach to fingerprint multi-exit models via inference time rather than inference predictions. Specifically, we design an effective method to generate a set of fingerprint samples to craft the inference process with a unique and robust inference time cost as the evidence for model ownership. We conduct extensive experiments to prove the uniqueness and robustness of our method on three structures (ResNet-56, VGG-16, and MobileNet) and three datasets (CIFAR-10, CIFAR-100, and Tiny-ImageNet) under comprehensive adversarial settings.

研究の動機と目的

  • マルチエグジット深層ニューラルネットワークモデルの実世界での展開における、有効な知的財産権保護の欠如に対処すること。
  • 予測出力に依存する従来のフォージャーピントおよびウォーターマーキング手法の限界を克服すること。これらの手法は敵対的訓練や構造的操作に対して脆弱である。
  • 独立して訓練されたモデルと区別できる一意のフォージャーピント技術を設計すること。同時に、モデルの微調整、プルーニング、敵対的再訓練に対して耐性を持つこと。
  • モデル重みの変更やバックドアの埋め込みを伴わず、市販のモデルと互換性を持つ信頼性の高い所有権検証を可能にすること。

提案手法

  • 本手法は、ターゲットとなるマルチエグジットモデル内の指定された内部分類器で早期エグジットを引き起こすように、特別に設計されたフォージャーピントサンプルの集合を生成する。これにより、一意の推論時間シグネチャが得られる。
  • この手法は、推論時間コストがモデルの内部構造およびレイヤー固有の計算に強く依存することを利用しており、区別可能な時間的フォージャーピントを生成する。
  • フォージャーピント生成プロセスは予測ラベルに依存しないため、再訓練、プルーニング、構造的変更によって生じるモデル精度の変化に対しても耐性を持つ。
  • 不審なモデルのフォージャーピントサンプルに対する推論時間の比較に、しきい値ベースの検証メカニズムを用いる。さまざまな敵対的設定において高い真正陽性率を達成する。
  • 一意性と耐性を定量化するために、EEC AUCスコアとIP検証率を用いて、さまざまな攻撃シナリオ下での評価を実施する。
  • フォージャーピントサンプルは最小限の摂動(L2スコア < 0.05)で生成され、視覚的非検出性を保ちつつ、強力な時間的フォージャーピントの相違性を維持する。

実験結果

リサーチクエスチョン

  • RQ1予測出力に依存せずに、推論時間をマルチエグジットDNNモデル向けの信頼性があり一意のフォージャーピント信号として使用できるか?
  • RQ2提案手法の推論時間フォージャーピント手法は、敵対的訓練、モデル微調整、IC再訓練や削除などの構造的変更に対してどれほど耐性を示すか?
  • RQ3同じアーキテクチャとデータセットで独立して訓練されたモデルに対して所有権を検証する際、この手法がどれほど一意性を維持できるか?
  • RQ4異なるDNNアーキテクチャ(ResNet-56, VGG-16, MobileNet)およびデータセット(CIFAR-10, CIFAR-100, Tiny-ImageNet)において、この手法はどのように性能を発揮するか?
  • RQ5しきい値 $T_f$ を変化させた場合、誤検出と検証精度のトレードオフにどのような影響を与えるか?

主な発見

  • 提案手法は、標準的な敵対的摂動(RAD=5)下で100の独立モデルおよび100のシャドウモデルに対して平均0.99のIP検証率を達成し、高い一意性を示した。
  • RAD=15の強い敵対的訓練下でも、ResNet-56およびVGG-16では0.98の検証率を維持した。一方、ベースライン手法は予測ラベルのずれにより大多数のケースで失敗した。
  • モデル微調整に対しても本手法は耐性を示し、1つのターゲットモデルあたり80の微調整済みモデルにおいて、EEC AUCスコアが最小限の低下(平均AUC > 0.98)を示した。
  • フォージャーピントサンプルと元の画像間のL2スコアは常に0.05未満であり、視覚的非検出性を確認するとともに、強力な時間的フォージャーピントの相違性を維持した。
  • 特に敵対的訓練および構造的変更の下で、最先端の予測ベースのフォージャーピント技法を上回る一意性と耐性を示した。
  • しきい値チューニングの結果、$T_f = 0.005$が最適なバランスを達成し、RAD=5下で独立モデルでは0.99、シャドウモデルでは0.98の検証率を達成した。一方、より高いしきい値では精度が低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。