Skip to main content
QUICK REVIEW

[論文レビュー] Defending against Model Stealing via Verifying Embedded External Features

Yiming Li, Linghui Zhu|arXiv (Cornell University)|Dec 6, 2021
Adversarial Robustness in Machine Learning被引用数 6
ひとこと要約

本論文は、少数の訓練サンプルに対してスタイル変換を適用することで、被害者モデルに外部特徴を埋め込むことで、モデル盗難に対する新たな防御を提案する。その後、その特徴が含まれているかどうかを検出するメタ・クラスファイアを用いて所有権を検証する。この手法は、モデルの精度を維持したまま、多様な盗難攻撃(多段階攻撃を含む)を効果的に検出でき、CIFAR-10およびImageNetにおけるすべてのテスト攻撃でp値 < 10⁻⁵を達成した。

ABSTRACT

Obtaining a well-trained model involves expensive data collection and training procedures, therefore the model is a valuable intellectual property. Recent studies revealed that adversaries can `steal' deployed models even when they have no training samples and can not get access to the model parameters or structures. Currently, there were some defense methods to alleviate this threat, mostly by increasing the cost of model stealing. In this paper, we explore the defense from another angle by verifying whether a suspicious model contains the knowledge of defender-specified \\emph{external features}. Specifically, we embed the external features by tempering a few training samples with style transfer. We then train a meta-classifier to determine whether a model is stolen from the victim. This approach is inspired by the understanding that the stolen models should contain the knowledge of features learned by the victim model. We examine our method on both CIFAR-10 and ImageNet datasets. Experimental results demonstrate that our method is effective in detecting different types of model stealing simultaneously, even if the stolen model is obtained via a multi-stage stealing process. The codes for reproducing main results are available at Github (https://github.com/zlh-thu/StealingVerification).

研究の動機と目的

  • 重みや訓練データにアクセスできない状況で、敵対的攻撃者が展開済みのモデルをクローンする脅威が増加しているのを対処すること。
  • 既存の検証ベースの防御には、データセット固有の特徴に依存するため、モデル間の特徴類似性によって誤検出が生じるという限界があるため、それを克服すること。
  • 被害者モデルに一意の外部特徴を埋め込むことで、信頼性の高い所有権検証を可能にする防御メカニズムを開発すること。
  • 多段階の盗難攻撃に対しても効果を保ち、悪意のない入力に対するモデルの性能を低下させないことを保証すること。

提案手法

  • 少数の訓練画像にスタイル変換を適用することで、被害者モデルに外部特徴を埋め込み、元のラベルを保持する。
  • 被害者モデルの予測結果に基づいてメタ・クラスファイアを訓練し、不審なモデルが埋め込まれたスタイル特徴を学習しているかどうかを検出する。
  • スタイライズドテスト画像に対する反応に基づいて、正当なモデルと盗難モデルを区別するため、メタ・クラスファイアを用いる。
  • 特徴の転送性と検出感度を最大化するために、明確な模様やテクスチャを持つスタイライズド画像を選択する。
  • クエリオンative、ラベルクエリ、ゼロショット盗難を含む、さまざまな攻撃タイプに対してCIFAR-10およびImageNetデータセットで手法を検証する。
  • 検出性能を評価するために統計的仮説検定(p値)を用い、p値が低いほど盗難の証拠が強いことを示す。

実験結果

リサーチクエスチョン

  • RQ1外部特徴を埋め込んだ検証に基づく防御は、多様な攻撃タイプにわたり、モデル盗難を信頼性高く検出できるか?
  • RQ2複数段階の攻撃(例えば、順次的かつ異なる攻撃手法を経て生成される)によるモデル盗難を、提案手法はどの程度効果的に検出できるか?
  • RQ3少数の訓練サンプルにスタイル変換を適用して特徴を埋め込むことで、標準入力に対するモデルの精度が低下することなく検出が可能になるか?
  • RQ4特に誤検出率の観点から、既存の検証ベースの防御(データセット固有の特徴に依存)と比較して、本手法はどのように優れているか?
  • RQ5盗難モデルがスラッグモデルから微調整または蒸留された場合でも、メタ・クラスファイアは正当なモデルと盗難モデルを効果的に区別できるか?

主な発見

  • CIFAR-10におけるすべてのテスト攻撃で、p値 < 10⁻⁵を達成し、検出に関する強い統計的証拠を示した。
  • ImageNetでは、すべての攻撃タイプでp値が10⁻⁴未満を維持し、大規模データセットにおいても高い検出性能を示した。
  • 多段階攻撃による盗難モデルに対しても、すべてのテスト状況でp値 ≤ 0.01を維持し、有効性を保った。
  • メタ・クラスファイアの導入により、ベースライン手法と比較して検出性能が著しく向上し、すべての攻撃設定でp値が桁落ちするほど低減された。
  • DNNがテクスチャやスタイル特徴に対してより感受性を示すことを踏まえ、パッチベースのバックドア手法(例:BadNets)よりも、スタイル変換による特徴埋め込みが効果的であった。
  • 埋め込まれた特徴は少数の訓練画像にのみ適用されており、ラベルは変更されていないため、元のモデルの精度は良性サンプルにおいても維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。