Skip to main content
QUICK REVIEW

[論文レビュー] Secure Watermark for Deep Neural Networks with Multi-task Learning

Fangqi Li, Shilin Wang|arXiv (Cornell University)|Mar 18, 2021
Adversarial Robustness in Machine Learning参考文献 61被引用数 8
ひとこと要約

本稿では、微調整、プルーニング、上書き攻撃に対して耐性を持つ、深層ニューラルネットワークに著作者情報を補助タスクとして埋め込むマルチタスク学習(MTL)ベースのウォーターマーキングフレームワークを提案する。本手法は、タスク固有の正則化子と分散型検証プロトコルを用いて、高い機能保持性とセキュリティを実現し、多様なデータセットにおいて、バックドアベースの手法に比して精度、耐性、汎用性に優れている。

ABSTRACT

Deep neural networks are playing an important role in many real-life applications. After being trained with abundant data and computing resources, a deep neural network model providing service is endowed with economic value. An important prerequisite in commercializing and protecting deep neural networks is the reliable identification of their genuine author. To meet this goal, watermarking schemes that embed the author's identity information into the networks have been proposed. However, current schemes can hardly meet all the necessary requirements for securely proving the authorship and mostly focus on models for classification. To explicitly meet the formal definitions of the security requirements and increase the applicability of deep neural network watermarking schemes, we propose a new framework based on multi-task learning. By treating the watermark embedding as an extra task, most of the security requirements are explicitly formulated and met with well-designed regularizers, the rest is guaranteed by using components from cryptography. Moreover, a decentralized verification protocol is proposed to standardize the ownership verification. The experiment results show that the proposed scheme is flexible, secure, and robust, hence a promising candidate in deep learning model protection.

研究の動機と目的

  • 既存のDNNウォーターマーキング方式における形式的なセキュリティ定義と耐性の欠如に対処すること。
  • 微調整、プルーニング、および専用の検出攻撃によって削除可能な脆弱性を有するバックドアベース手法の限界を克服すること。
  • 高いモデル性能を維持しつつ、信頼性の高い分散型所有権検証を可能にするウォーターマーキングフレームワークを開発すること。
  • 微調整やニューロンプルーニングなどの一般的なモデル変更に対してもウォーターマーキングが保持されることを保証すること。
  • 画像分類タスクを超えて、多様なディープラーニング応用に応用可能なウォーターマーキングを一般化すること。

提案手法

  • ウォーターマーキングは、マルチタスク学習フレームワーク内で追加タスクとして埋め込まれる。主タスクは元のDNN目的(例:画像分類)であり、副タスクは著作者の身元を検証することである。
  • 著作者の身元を内部活性化に基づいて予測する分類器ヘッドを備えた、専用のウォーターマーキングブランチを導入する。
  • セキュリティ特性を強制するためのタスク固有の正則化子を設計する。具体的には、機能保持性、微調整およびプルーニングに対する耐性、上書き攻撃に対する抵抗性を含む。
  • 正則化子は、性能低下の低減や、敵対的変更下での高いウォーターマーキング正確性といった、セキュリティ要件を明示的に符号化する。
  • 中央機関に依存しない分散型検証プロトコルを採用し、信頼性とスケーラビリティを向上させる。
  • 改ざん防止と整合性確保のための暗号技術を統合するが、ウォーターマーキングをモデル機能から分離することで、バックドアの脆弱性を回避する。

実験結果

リサーチクエスチョン

  • RQ1微調整やニューロンプルーニングといった一般的なモデル変更に対して、DNNウォーターマーキング方式を形式的に保護することは可能か?
  • RQ2攻撃者が埋め込まれた身元を置き換える試みを行う上書き攻撃に対して、ウォーターマーキングをどのようにして耐性を持たせるか?
  • RQ3バックドアに依存せずに、著作者情報の埋め込みを実現しつつ、主タスクの正確性を高い水準で維持できるウォーターマーキングフレームワークは可能か?
  • RQ4所有権検証を標準化し、信頼できる第三者に依存しない分散型方式にすることは可能か?
  • RQ5提案されたMTLベースのアプローチは、画像分類を越えて、他のディープラーニングタスクにも一般化可能か?

主な発見

  • MNISTでは、微調整後も本手法は主タスクの正確性99.5%、ウォーターマーキング検証正確性92.5%を達成し、Liら[27](14.5%)およびZhuら[60](7.0%)を上回った。
  • CIFAR-100では、微調整後も主タスク正確性63.8%、ウォーターマーキング正確性97.0%を維持し、ベースライン(1.2%および0.8%)を著しく上回った。
  • ニューロンプルーニングの条件下でも、本手法はMNISTで2.2%の性能低下にとどまり、Zhuら[60]の1.4%およびLiら[27]の0.9%を上回り、より高い耐性を示した。
  • 上書き攻撃後もウォーターマーキングブランチの正確性は0.7の閾値を上回り、変動が4.5%以内に制限されており、鍵置き換え攻撃に対する抵抗性が確認された。
  • 本手法は優れた一般化性能を示し、分類でないタスクにも適用可能であり、正則化子の更新により新しいモデルチューニング演算子に対しても適応可能である。
  • 分散型検証プロトコルにより、信頼性のない所有権検証が可能となり、実世界への展開における実用性とスケーラビリティが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。