Skip to main content
QUICK REVIEW

[論文レビュー] Who Leaked the Model? Tracking IP Infringers in Accountable Federated Learning

Shuyang Yu, Junyuan Hong|arXiv (Cornell University)|Dec 6, 2023
Privacy-Preserving Technologies in Data被引用数 4
ひとこと要約

本稿では、バックドアベースのインジェクションを用いて、クライアント固有のウォーターマークをグローバルモデルに埋め込むことで、IP違反者を正確に追跡可能な、責任追及可能なフェデレーテッドラーニングのためのデコアブルユニークウォーターマーキング(DUW)を提案する。DUWは、異種のFL設定下でもCIFAR-10、CIFAR-100、Digitsデータセットにおいて、99%以上のウォーターマーク成功率と100%の違反者同定精度を達成しており、一般的なウォーターマーク除去攻撃に対しても耐性を示す。

ABSTRACT

Federated learning (FL) emerges as an effective collaborative learning framework to coordinate data and computation resources from massive and distributed clients in training. Such collaboration results in non-trivial intellectual property (IP) represented by the model parameters that should be protected and shared by the whole party rather than an individual user. Meanwhile, the distributed nature of FL endorses a malicious client the convenience to compromise IP through illegal model leakage to unauthorized third parties. To block such IP leakage, it is essential to make the IP identifiable in the shared model and locate the anonymous infringer who first leaks it. The collective challenges call for \emph{accountable federated learning}, which requires verifiable ownership of the model and is capable of revealing the infringer's identity upon leakage. In this paper, we propose Decodable Unique Watermarking (DUW) for complying with the requirements of accountable FL. Specifically, before a global model is sent to a client in an FL round, DUW encodes a client-unique key into the model by leveraging a backdoor-based watermark injection. To identify the infringer of a leaked model, DUW examines the model and checks if the triggers can be decoded as the corresponding keys. Extensive empirical results show that DUW is highly effective and robust, achieving over $99\%$ watermark success rate for Digits, CIFAR-10, and CIFAR-100 datasets under heterogeneous FL settings, and identifying the IP infringer with $100\%$ accuracy even after common watermark removal attempts.

研究の動機と目的

  • フェデレーテッドラーニング(FL)システムにおいて、高価値のグローバルモデルを漏洩させる悪意あるクライアントを同定するという、極めて重要な課題に取り組む。
  • モデルIPの検証可能な所有権と個々のクライアントへの追跡可能性を保証することで、責任追及可能なFLを実現する。
  • 従来のウォーターマーキング手法がクライアント固有の追跡を欠き、パラメータの露呈を要件としているという限界を克服する。
  • ウォーターマーク除去や敵対的攻撃に対して耐性を保ちつつ、高いモデル実用性を維持する。
  • 既存のFLパイプラインへの最小限の変更で実装可能な、軽量でモデルに依存しないソリューションを提供する。

提案手法

  • 各クライアント固有の鍵を、分布外(OoD)データから生成されたトリガー集合を用いてエンコードすることで、バックドアベースの技術を用いてグローバルモデルにクライアント固有のウォーターマークをインジェクションする。
  • USPS、GTSRB、ランダムノイズ、またはジャイガープズ画像などのOoDデータセットを用いて、事前学習済みエンコーダーによりクライアント固有のトリガー集合を生成する。
  • 標準的な精度を保持する目的関数を用い、トリガー集合と元の学習データを併用してグローバルモデルをファインチューニングすることで、ウォーターマークをモデル学習中に埋め込む。
  • 検証段階でデコーダーを導入し、すべてのトリガー集合に対して不正なモデルをテストすることで、ウォーターマーク成功率(WSR)が最も高いクライアントを同定することでウォーターマークをデコードする。
  • ウォーターマークの衝突による誤検出を防ぐためにデコーダーを用いることで、誤検出を低減し、追跡の信頼性を向上させる。
  • 既存のブラックボックス統合ウォーターマークと組み合わせることでハイブリッド展開を可能とし、二重検出とクライアントレベルの追跡を実現する。

実験結果

リサーチクエスチョン

  • RQ1分散環境下で、グローバルFLモデルの漏洩を引き起こしたクライアントを、ウォーターマーキング方式で一意に同定できるか?
  • RQ2本手法は、クライアント固有のウォーターマークを埋め込む際、モデル実用性をどの程度維持できるか?
  • RQ3一般的なウォーターマーク除去およびモデルファインチューニング攻撃に対して、ウォーターマークはどの程度耐性を示すか?
  • RQ4OoDデータセットの選択が、モデル精度とウォーターマーク検出性能のトレードオフにどのように影響するか?
  • RQ5多数のクライアントに対して、追跡精度やウォーターマーク検出の信頼性に劣化を来さずにスケーラブルか?

主な発見

  • 異種のFL設定下で、Digits、CIFAR-10、CIFAR-100データセットにおいて、DUWは99%を超えるウォーターマーク成功率(WSR)を達成した。
  • 一般的なウォーターマーク除去試行やモデルファインチューニング後でも、IP違反者を100%の精度で同定できた。
  • ランダムノイズやジャイガープズOoDデータセットを用いる場合、精度低下は1%未満にとどまり、高いWSRを維持するとともに、迅速な精度回復が確認された。
  • 600人のクライアントを想定した場合、DUWは73.37%のWSRと100%のトレーサビリティ精度(TAcc)を維持し、優れたスケーラビリティを示した。
  • デコーダーの導入により誤検出が低減され、TAccが100%に上昇し、衝突リスクが最小限に抑えられた。
  • 統合ブラックボックスウォーターマークとハイブリッドで組み合わせた場合、DUWの有効性は維持され、WSRは0.72%低下するのみで、統合ウォーターマーク成功率は98.82%を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。