Skip to main content
QUICK REVIEW

[論文レビュー] SoK: How Robust is Image Classification Deep Neural Network Watermarking? (Extended Version)

Nils Lukas, Edward Jiang|arXiv (Cornell University)|Aug 11, 2021
Advanced Steganography and Watermarking Techniques参考文献 63被引用数 5
ひとこと要約

本論文は、画像分類用深層ニューラルネットワークの水増し技術の11通りの手法について、包括的な削除攻撃のセットに対して体系的に耐性を評価している。実際のところ、どれも耐性が保証されていないことが示された。特に、統合された転移学習とラベルスムージングを用いた適応的攻撃によって、すべての水増しが削除可能であり、現在の耐性評価手法における根本的な欠陥が露呈された。

ABSTRACT

Deep Neural Network (DNN) watermarking is a method for provenance verification of DNN models. Watermarking should be robust against watermark removal attacks that derive a surrogate model that evades provenance verification. Many watermarking schemes that claim robustness have been proposed, but their robustness is only validated in isolation against a relatively small set of attacks. There is no systematic, empirical evaluation of these claims against a common, comprehensive set of removal attacks. This uncertainty about a watermarking scheme's robustness causes difficulty to trust their deployment in practice. In this paper, we evaluate whether recently proposed watermarking schemes that claim robustness are robust against a large set of removal attacks. We survey methods from the literature that (i) are known removal attacks, (ii) derive surrogate models but have not been evaluated as removal attacks, and (iii) novel removal attacks. Weight shifting and smooth retraining are novel removal attacks adapted to the DNN watermarking schemes surveyed in this paper. We propose taxonomies for watermarking schemes and removal attacks. Our empirical evaluation includes an ablation study over sets of parameters for each attack and watermarking scheme on the CIFAR-10 and ImageNet datasets. Surprisingly, none of the surveyed watermarking schemes is robust in practice. We find that schemes fail to withstand adaptive attacks and known methods for deriving surrogate models that have not been evaluated as removal attacks. This points to intrinsic flaws in how robustness is currently evaluated. We show that watermarking schemes need to be evaluated against a more extensive set of removal attacks with a more realistic adversary model. Our source code and a complete dataset of evaluation results are publicly available, which allows to independently verify our conclusions.

研究の動機と目的

  • 最近提案されたDNN水増し手法の、広範かつ標準化された削除攻撃セットに対する耐性を体系的に評価すること。
  • モデル変更、入力前処理、モデル抽出技術を含む、既存および新規の削除攻撃を特定・分類すること。
  • 現在の耐性評価手法における欠陥を露呈すること、特に弱いまたは非適応的攻撃者を用いることの問題点。
  • 将来的なベンチマーク評価を改善するための、標準化され再現可能な評価フレームワークと公開ツールボックスの提案。
  • 水増し耐性の評価のための実用的ガイドラインの提供、特に意思決定閾値の導出とパrameterのアブレーションスタディ。

提案手法

  • 水増し手法(モデル非依存型、モデル依存型、パラメータ符号化型、アクティブ水増し)と攻撃(モデル変更、入力前処理、モデル抽出)の分類体系を構築した。
  • CIFAR-10およびImageNet上で、11通りの水増し手法と29通りの攻撃を標準化して評価できる「Watermark-Robustness-Toolbox(WRT)」を実装した。
  • 水増し手法および攻撃の主要パラメータについてのアブレーションスタディを実施し、ナッシュ均衡における耐性を評価した。
  • 特に敵対的例に依存する手法のための、意思決定閾値を経験的に導出する手法を提案した。
  • 再訓練からスクラッチで再トレーニングする時間と比較して、実行時間の測定により攻撃の効率性を評価し、実用的妥当性を検証した。
  • 複数の攻撃(例:転移学習+ラベルスムージング)を組み合わせ、累積的効果をテストし、主要な攻撃コンビネーションを同定した。

実験結果

リサーチクエスチョン

  • RQ1最近提案されたDNN水増し手法は、包括的かつ適応的攻撃セットに対して耐性を示すのか?
  • RQ2モデル抽出、モデル変更、入力前処理攻撃は、DNNからの水増しをどれほど効果的に削除できるのか?
  • RQ3複数の技術を統合した攻撃(例:転移学習+ラベルスムージング)は、異なるデータセットおよびモデルで、すべての水増しを削除できるのか?
  • RQ4実行時間、パrameter感受性、意思決定閾値の導出という観点から、現在の水増し手法の実用的限界は何か?
  • RQ5将来的には、耐性をより厳密に評価するにはどのような方法論的改善が必要か?

主な発見

  • 調査された11通りの水増し手法すべてが、すべての攻撃に対して耐性を示さず、適応的または複合攻撃によってすべて破壊された。
  • モデル抽出攻撃、特に転移学習が最も効果的であり、CIFAR-10ではすべての水増しを削除した。
  • 転移学習とラベルスムージングを組み合わせた攻撃は、CIFAR-10およびImageNetの両方で11通りすべての水増しを成功裏に削除した。
  • ImageNetでは、単一の攻撃が支配的ではなかったが、モデル抽出および変更攻撃が特に高効果であり、組み合わせることで顕著に効果が向上した。
  • 削除攻撃の実行時間は、スクラッチからの再訓練よりも顕著に短く、実用的妥当性が裏付けられた。
  • 多くの水増し手法は、全体のテスト精度指標では捉えきれない、クラス別精度の低下といった意図しない副作用を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。