[論文レビュー] MOVE: Effective and Harmless Ownership Verification via Embedded External Features
本稿では、少数の訓練サンプルに対してスタイル変換を用いて外部特徴を埋め込むことで、効果的で無害な盗難モデルの検出を可能にする、新たなモデル所有権検証手法MOVEを提案する。この手法は、モデルの機能を損なわず、バックドアのリスクを回避しながら、白ボックスおよびブラックボックスの両設定において、既存のウォーターマーキングおよび防御手法を上回る高い正確性で多様なモデル盗難攻撃を同定する。
Currently, deep neural networks (DNNs) are widely adopted in different applications. Despite its commercial values, training a well-performing DNN is resource-consuming. Accordingly, the well-trained model is valuable intellectual property for its owner. However, recent studies revealed the threats of model stealing, where the adversaries can obtain a function-similar copy of the victim model, even when they can only query the model. In this paper, we propose an effective and harmless model ownership verification (MOVE) to defend against different types of model stealing simultaneously, without introducing new security risks. In general, we conduct the ownership verification by verifying whether a suspicious model contains the knowledge of defender-specified external features. Specifically, we embed the external features by modifying a few training samples with style transfer. We then train a meta-classifier to determine whether a model is stolen from the victim. This approach is inspired by the understanding that the stolen models should contain the knowledge of features learned by the victim model. In particular, evision{we develop our MOVE method under both white-box and black-box settings and analyze its theoretical foundation to provide comprehensive model protection.} Extensive experiments on benchmark datasets verify the effectiveness of our method and its resistance to potential adaptive attacks. The codes for reproducing the main experiments of our method are available at https://github.com/THUYimingLi/MOVE.
研究の動機と目的
- 敵対的攻撃者がクエリや直接アクセスによって事前に訓練済みの深層ニューラルネットワーク(DNN)を複製するという、急速に拡大するモデル盗難の脅威に対処すること。
- 既存の検証ベースの防御手法の限界、すなわちモデル性能を低下させるか、隠れたバックドアを導入するという問題を克服すること。
- 効果的かつ無害な防御を実現すること。具体的には、多様な盗難手法を検出可能であり、モデルの正確性を維持し、セキュリティリスクを回避すること。
- 埋め込んだ特徴がサンプル固有であり、悪意のないものであるため、バックドア攻撃やメンバーシップ推定とは本質的に異なるウォーターマーキング機構を確保すること。
- ホワイトボックスおよびブラックボックスの両方の脅威モデルにおいて包括的な保護を提供すること。
提案手法
- スタイル変換を用いて、少数の訓練サンプルに外部特徴を埋め込み、元のラベルを保持することで、機能の劣化を回避する。
- 被害モデルの予測結果に基づいてメタ分類器を訓練し、疑惑のあるモデルが埋め込んだ特徴の知識を保持しているかどうかを検出する。
- 仮説検定を用いて所有権検証を実施し、変換されたサンプルに対する疑惑モデルの挙動を元のモデルの期待される挙動と比較する。
- 清澄なデータで訓練された無害なモデルを用いてメタ分類器をキャリブレーションし、訓練データの記憶を学習するのではなく、特徴の知識を検出する能力を保証する。
- 白ボックスおよびブラックボックスの両設定で手法を適用することで、広範な適用可能性と、適応的攻撃に対する頑健性を確保する。
- スタイル変換に基づく特徴の特徴的な性質を活用し、既存のバックドアおよびメンバーシップ推定攻撃による検出を回避する。

実験結果
リサーチクエスチョン
- RQ1モデル所有権検証システムは、直接的コピー、蒸留、ゼロショット、微調整、クエリベースの攻撃を含む、多様なタイプのモデル盗難攻撃を検出可能か?
- RQ2少数のラベル付きサンプルに対してスタイル変換を用いて特徴を埋め込むことで、モデルの正確性が保持され、悪意のあるバックドアが導入されないか?
- RQ3本手法は、既存のウォーターマーキングおよび防御機構と比較して、検出正確性および適応的攻撃に対する耐性において優れているか?
- RQ4埋め込んだ特徴が元の訓練分布に含まれない場合でも、特徴を学習したモデルとそうでないモデルを区別できるか?
- RQ5メンバーシップ推定およびバックドア分析ツールが従来のウォーターマーキング方式を標的とする場合、本手法はそれらの検出に対して頑健か?
主な発見
- MOVEは、CIFAR-10およびImageNetの両データセットにおいて、直接的コピーおよび蒸留攻撃に対してほぼ完璧な検出性能(Δμ > 0.90)を達成し、p値 < 10−5 を達成した。
- ゼロショット、微調整、クエリベースの盗難攻撃のようなより複雑な攻撃に対しても、ブラックボックス設定下においても高い検出性能(Δμ > 0.5)を維持した。
- 訓練データではなくテストデータから生成された変換画像を用いることで、類似した検出性能が得られた。これは、本手法が訓練サンプルの記憶を検出しているのではなく、特徴の知識を検出していることを確認する。
- スタイル変換によって埋め込まれたトリガーは視覚的に意味を持たず、バックドアベースの防御におけるものとは構造的に異なるため、標準的なバックドア検出手法では検出不可能である。
- メンバーシップ推定およびバックドア検出技術に対して抵抗性を示した。特徴はサンプル固有であり、特定のクラスやラベルに束縛されていないためである。
- 健全なサンプルにおける性能劣化が最小限に抑えられ、本手法の無害性および実世界への実用性を確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。