Skip to main content
QUICK REVIEW

[論文レビュー] RIGA: Covert and Robust White-Box Watermarking of Deep Neural Networks

Tianhao Wang, Florian Kerschbaum|arXiv (Cornell University)|Oct 31, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用数 14
ひとこと要約

RIGAは、敵対的訓練を用いて重みに水 Stam を埋め込むことで、正確性の損失がなく、かつ不審性が低く、耐性が高い、画期的なホワイトボックス水 Stam 植え込み方式を提案する。GANに類似したフレームワークを用いてモデル重みに水 Stam を隠し、深層ニューラルネットワークを抽出器として用いることで、検出や削除攻撃(微調整、プルーニング、モデル蒸留を含む)に対して強く耐性を持つ。

ABSTRACT

Watermarking of deep neural networks (DNN) can enable their tracing once released by a data owner. In this paper, we generalize white-box watermarking algorithms for DNNs, where the data owner needs white-box access to the model to extract the watermark. White-box watermarking algorithms have the advantage that they do not impact the accuracy of the watermarked model. We propose Robust whIte-box GAn watermarking (RIGA), a novel white-box watermarking algorithm that uses adversarial training. Our extensive experiments demonstrate that the proposed watermarking algorithm not only does not impact accuracy, but also significantly improves the covertness and robustness over the current state-of-art.

研究の動機と目的

  • 正確性の損失が許されない安全至上主義の応用分野において、正確で追跡可能な深層学習モデルの実現を満たす必要性に対応する。
  • 検出可能または削除攻撃に対して脆弱である既存のホワイトボックス水 Stam 植え込み方式の限界を克服する。
  • 非水 Stam モデルの重み分布と一致するなど、不審性が低く、一般的なモデル変換攻撃に対して耐性を持つ水 Stam 植え込み手法を開発する。
  • 従来のホワイトボックス水 Stam 植え込み手法における線形抽出器を深層ニューラルネットワークに置き換えることで、埋め込み容量と耐性を向上させる。

提案手法

  • 水 Stam 植え込みモデルを生成器とし、水 Stam 検出器を判別器とする、GANに類似した敵対的訓練フレームワークを導入し、モデル重みに水 Stam を隠す。
  • 敵対的損失を用いて、水 Stam 植え込みと抽出プロセスを同時に最適化し、水 Stam を埋め込んだモデルの重み分布が非水 Stam モデルとほぼ同一になるように保証する。
  • 従来の研究で用いられる線形水 Stam 抽出器を深層ニューラルネットワークに置き換えることで、水 Stam 抽出の容量と耐性を向上させる。
  • モデルの正確性、水 Stam の隠蔽性、抽出器の性能のバランスを取る損失関数を最適化することで、学習中に水 Stam を埋め込む。
  • 2段階の訓練プロセスを採用する:まず水 Stam の制約を含めたモデルを訓練し、次に抽出ネットワークを微調整して埋め込まれたメッセージを信頼性高く回復できるようにする。
  • 統計的偏差を最小化するための敵対的正則化を適用し、重み分布の統計的特性のずれを抑え、特性推論攻撃による検出可能性を低減する。

実験結果

リサーチクエスチョン

  • RQ1正確性の損失がなく、かつ不審性が低く、耐性があるホワイトボックス水 Stam 植え込み方式を設計可能か?
  • RQ2敵対的訓練技術を活用することで、DNNの重みに水 Stam を隠しつつ、モデル性能を維持できるか、その程度はどの程度か?
  • RQ3線形水 Stam 抽出器を深層ニューラルネットワークに置き換えることで、水 Stam 植え込み方式の耐性と容量にどのような影響が生じるか?
  • RQ4微調整、プルーニング、蒸留などの一般的なモデル変換攻撃に対して、提案手法の水 Stam はどの程度耐性を示すか?
  • RQ5顕著なモデル圧縮やパラメータ変更が加えられた後でも、水 Stam を信頼性高く抽出できるか?

主な発見

  • RIGAは、すべてのベンチマーク(CIFAR-10、SVHN、ImageNet)で正確性の損失がゼロであり、敵対的訓練と水 Stam 植え込み後もモデル性能を維持している。
  • 水 Stam を埋め込んだモデルの重み分布が非水 Stam モデルとほぼ同一であるため、特性推論攻撃によっても水 Stam は検出不可能である。
  • 水 Stam は最大99%の重みプルーニングに耐えられ、誤りビットレート(BER)は5%未満の低水準を維持し、95%のプルーニング比でも識別可能である。
  • 学習率0.01〜0.05の範囲での微調整攻撃は、モデルの正確性を著しく低下させる(例:ベンチマーク3では約40%まで低下)が、水 Stam は効果的に削除されない。
  • 深層ニューラルネットワークに基づく水 Stam 抽出器は、すべてのテスト攻撃およびモデル変換に対して、高い忠実度で埋め込まれたメッセージを正常に回復した。
  • 異なるデータセットを用いたトランスファー学習の状況下でも、水 Stam の削除は効果がなく、性能損失が著しく顕著になるため、適応ベース攻撃に対しても強い耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。