Skip to main content
QUICK REVIEW

[論文レビュー] Robust Watermarking of Neural Network with Exponential Weighting

Ryota Namba, Jun Sakuma|arXiv (Cornell University)|Jan 18, 2019
Adversarial Robustness in Machine Learning参考文献 20被引用数 14
ひとこと要約

本稿では、モデル改変(例:プルーニング)およびクエリ改変(例:敵対的摂動)に対して耐性のある水増しを実現するため、指数的重み付けを用いた頑健なニューラルネットワーク水増し手法を提案する。訓練中にラベル変更済みのキーサンプルと指数的重み付けを組み合わせることで、あらゆるデータセットおよび攻撃タイプにおいて完全な検証(AUC = 1.0)を達成し、極めて強い改ざんに対しても性能を維持しつつ、モデルの精度を損なわない。

ABSTRACT

Deep learning has been achieving top performance in many tasks. Since training of a deep learning model requires a great deal of cost, we need to treat neural network models as valuable intellectual properties. One concern in such a situation is that some malicious user might redistribute the model or provide a prediction service using the model without permission. One promising solution is digital watermarking, to embed a mechanism into the model so that the owner of the model can verify the ownership of the model externally. In this study, we present a novel attack method against watermark, query modification, and demonstrate that all of the existing watermark methods are vulnerable to either of query modification or existing attack method (model modification). To overcome this vulnerability, we present a novel watermarking method, exponential weighting. We experimentally show that our watermarking method achieves high verification performance of watermark even under a malicious attempt of unauthorized service providers, such as model modification and query modification, without sacrificing the predictive performance of the neural network model.

研究の動機と目的

  • ブラックボックス所有権検証における、既存の水増し手法がモデル改変およびクエリ改変攻撃に対して脆弱であるという問題に対処すること。
  • 不正なサービスプロバイダーがモデルやクエリを改ざんしても、高い検証精度を維持する水増し方式を開発すること。
  • 現実的な敵対的条件下でも、モデル性能の低下を伴わずに、水増し検証が信頼性高く効果的に行えるようにすること。
  • 構造的変更(例:プルーニング)および入力レベルの操作(例:敵対的例)の両方に耐性を持つ手法を提案すること。
  • 多様なデータセットおよび攻撃シナリオにおいて、完全な水増し検証(AUC = 1.0)を達成し、既存手法を上回ること。

提案手法

  • 敵対的例の真のラベルを変更することで、モデルが誤分類する「水増しキーデータ」を生成する。
  • 指数的重み付けを用いて水増しを埋め込む。各キーサンプルが損失関数に与える寄与度は、訓練順序における位置に応じて指数関数的に重み付けされる。
  • 指数的重み付けにより、初期のキーサンプルが最終的なモデルパラメータに強く影響を与えるようにすることで、モデルのファインチューニングやプルーニングに対しても水増し信号が保持される。
  • 水増しは、キーサンプルをモデルにクエリし、予測信頼度分布が指数的重み付けパターンに基づいて導かれたしきい値と照合されることで検証される。
  • 本手法はブラックボックス設定で動作し、モデルパラメータへのアクセスを必要とせず、予測サービスとのインタラクションのみを要する。
  • 本手法は、クエリレベル攻撃(例:オートエンコーダーを用いたクエリ改変)およびモデルレベル攻撃(例:プルーニング、ファインチューニング)の両方に耐性を持つように設計されている。

実験結果

リサーチクエスチョン

  • RQ1水増し手法は、モデル改変およびクエリ改変攻撃の両方の下でも高い検証精度を維持できるか?
  • RQ2均一または線形重み付けと比較して、指数的重み付けは水増しの耐性をどのように向上させるか?
  • RQ3ラベル変更済みの敵対的例生成は、モデル精度を損なわせつつも、水増し検出可能性を向上させるか?
  • RQ4提案手法は、すべての攻撃タイプおよび複数のデータセットにおいて、完全な検証(AUC = 1.0)を達成できるか?
  • RQ5キーサンプルの数が、水増し方式の耐性および検証性能に与える影響は何か?

主な発見

  • 提案手法は、CIFAR10、CIFAR100、GTSRB、MNISTのすべてのデータセットにおいて、モデル改変(プルーニング)およびクエリ改変(オートエンコーダー)攻撃下でもAUC = 1.0を達成した。
  • 既存の水増し手法(Zhang et al., 2018)、(Merrer et al., 2017)、(Rouhani et al., 2018)は、少なくとも1つの攻撃タイプ下でAUC = 1.0に達しないことが判明し、一部では顕著な性能低下を示した。
  • キーサンプルを5個に減らしても、GTSRBにおけるプルーニング攻撃下でAUCが0.85以上を維持し、すべてのベースライン手法を上回った。
  • モデルの予測精度は変化せず、あらゆる条件下でテスト精度の低下は報告されていない。
  • キーサンプル数を5個にまで減らしても、検証性能が安定しており、信号の耐性が強いことが示された。
  • 指数的重み付け機構により、ファインチューニングやプルーニングの過程でも水増し信号が効果的に保持され、構造的改ざんに対して極めて強い耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。