Skip to main content
QUICK REVIEW

[論文レビュー] Differentially Private Label Protection in Split Learning

Xin Yang, Jiankai Sun|arXiv (Cornell University)|Mar 4, 2022
Privacy-Preserving Technologies in Data被引用数 17
ひとこと要約

本稿は、通信される勾配に微分プライバシーを適用することでラベルのプライバシーを保護する、新しいスプリット学習フレームワークであるTPSL(Transcript Private Split Learning)を提案する。ラプラスまたは離散ノイズを用いた標的的勾配ノイズ付与により、最小限の性能損失で$(2\epsilon, 0)$-微分プライバシーを保証する。大規模データセットにおいて、ベースラインと比較して優れたプライバシーと性能のトレードオフを達成する。

ABSTRACT

Split learning is a distributed training framework that allows multiple parties to jointly train a machine learning model over vertically partitioned data (partitioned by attributes). The idea is that only intermediate computation results, rather than private features and labels, are shared between parties so that raw training data remains private. Nevertheless, recent works showed that the plaintext implementation of split learning suffers from severe privacy risks that a semi-honest adversary can easily reconstruct labels. In this work, we propose extsf{TPSL} (Transcript Private Split Learning), a generic gradient perturbation based split learning framework that provides provable differential privacy guarantee. Differential privacy is enforced on not only the model weights, but also the communicated messages in the distributed computation setting. Our experiments on large-scale real-world datasets demonstrate the robustness and effectiveness of extsf{TPSL} against label leakage attacks. We also find that extsf{TPSL} have a better utility-privacy trade-off than baselines.

研究の動機と目的

  • スプリット学習における重大なプライバシー脆弱性、すなわちラベルが勾配から再構築可能であるという問題に取り組むこと。
  • モデル重みだけでなく、スプリット学習における共有通信トランザクション(勾配)に対しても、証明可能な微分プライバシー保証を提供すること。
  • 複雑なMPCを必要とせず、大きなオーバーヘッドを伴わずに、微分プライバシーをスプリット学習に統合できる効率的で汎用的なフレームワークを設計すること。
  • 縦型フェデレーテッドラーニングの文脈において、既存のDP手法と比較して、より優れたプライバシーと性能のトレードオフを実現すること。

提案手法

  • トレーニング中に参加者間で交換される勾配に微分プライバシーを適用するスプリット学習フレームワーク、TPSLを提案する。
  • 正解クラスの勾配の最適方向にのみノイズを追加することで、性能を維持しつつ、効果的なノイズ付与を実現するGradPerturbという勾配ノイズ付与メカニズムを導入する。
  • 多クラスラプラスまたは離散ノイズ分布を用いて、ノイズ付与勾配に対して$(\epsilon, 0)$-DPを保証する。
  • 全共有メッセージを考慮したトランザクションベースのプライバシー定義を用いて、ラベルプライバシーを測定する。
  • 勾配クリッピングや全層へのノイズ注入を回避するため、バックワードパスの勾配にのみノイズを適用する。
  • モデルパラメータだけでなく、通信トランザクション全体を微分プライバシーにすることにより、エンドツーエンドのプライバシーを確保する。

実験結果

リサーチクエスチョン

  • RQ1スプリット学習における共有勾配に微分プライバシーを効果的に適用することで、ラベル漏洩を防げるか?
  • RQ2強いプライバシー保証を達成しつつ、モデルの性能を維持できる勾配ノイズ付与メカニズムはどのように設計できるか?
  • RQ3DP強化スプリット学習フレームワークのプライバシーと性能のトレードオフは、既存のベースラインと比べてどうなるか?
  • RQ4モデル重みだけでなく、トランザクション(すなわち、すべての通信メッセージ)に対しても証明可能な微分プライバシーを達成できるか?

主な発見

  • TPSLは、形式的な脅威モデル下で、トランザクション全体に対して証明可能な$(2\epsilon, 0)$-微分プライバシーを達成し、ラベルプライバシーを保証する。
  • GradPerturbによる方向性ノイズ(方向に特化したノイズ)の使用は、等方的ノイズやベースラインDP手法と比較して、より優れたプライバシーと性能のトレードオフを実現する。
  • 大規模な実世界データセットを用いた実験により、TPSLがラベル再構築攻撃に対して効果的に耐性を示し、高いモデル精度を維持していることが確認された。
  • フレームワークは計算的および通信的オーバーヘッドが最小限に抑えられており、標準的なスプリット学習と同等のコストであるため、実世界の展開に実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。