Skip to main content
QUICK REVIEW

[論文レビュー] Similarity-based Label Inference Attack against Training and Inference of Split Learning

Junlin Liu, Xinchen Lyu|arXiv (Cornell University)|Mar 10, 2022
Privacy-Preserving Technologies in Data被引用数 15
ひとこと要約

本論文は、実用的なスプリットラーニングにおける勾配とマッシュドデータを活用して、プライベートラベルを正確に回復できる受動的クラスタリングラベル推定攻撃を提案する。攻撃はコサイン類似度およびユークリッド類似度測定を用い、ほぼ100%の正確度でラベルをクラスタリングするが、さまざまな設定や防御(例:プライバシー保護のための微分プライバシーと勾配圧縮)に対しても頑健性を保つ。

ABSTRACT

Split learning is a promising paradigm for privacy-preserving distributed learning. The learning model can be cut into multiple portions to be collaboratively trained at the participants by exchanging only the intermediate results at the cut layer. Understanding the security performance of split learning is critical for many privacy-sensitive applications. This paper shows that the exchanged intermediate results, including the smashed data (i.e., extracted features from the raw data) and gradients during training and inference of split learning, can already reveal the private labels. We mathematically analyze the potential label leakages and propose the cosine and Euclidean similarity measurements for gradients and smashed data, respectively. Then, the two similarity measurements are shown to be unified in Euclidean space. Based on the similarity metric, we design three label inference attacks to efficiently recover the private labels during both the training and inference phases. Experimental results validate that the proposed approaches can achieve close to 100% accuracy of label attacks. The proposed attack can still achieve accurate predictions against various state-of-the-art defense mechanisms, including DP-SGD, label differential privacy, gradient compression, and Marvell.

研究の動機と目的

  • スプリットラーニングにおけるラベル保護が、実用的環境下でも実際にプライベートラベルの漏洩を防止できることを検証すること。
  • さまざまなカットレイヤー位置、学習ハイパーパramータ、防御メカニズムに対応できるスケーラブルで頑健なラベル推定攻撃を開発すること。
  • マルチクラススプリットラーニングにおける勾配とマッシュドデータからのラベル漏洩を数学的に分析すること。
  • 一般的な防御策(微分プライバシーと勾配圧縮)がラベル推定攻撃に対してどの程度効果を発揮するかを評価すること。

提案手法

  • スプリットラーニングの学習および推論中に交換される勾配とマッシュドデータを用いた受動的クラスタリングラベル推定攻撃を提案する。
  • 勾配および特徴表現に基づいてデータポイントをクラスタリングするため、コサイン類似度およびユークリッド類似度測定を導入する。
  • 勾配からの4種類のラベル漏洩(クライアント側、サーバー側、および2種類の中間形態)を分析する。
  • 被害者モデルのアーキテクチャを必要としないクラスタリングベースの推定フレームワークを採用し、勾配と特徴量をラベル予測にマッピングする。
  • CIFAR-10、CIFAR-100、Fashion-MNIST、Dogs vs. Catsの複数のデータセットを対象とし、さまざまなカットレイヤー位置および学習設定で攻撃を検証する。
  • 微分プライバシー(調整可能なεを有するDP-SGD)および勾配圧縮(さまざまなプルーニング比)に対する頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1ラベル共有が制限されている状況下でも、スプリットラーニングにおける勾配とマッシュドデータからプライベートラベルを正確に回復できるか?
  • RQ2実用的なスプリットラーニング環境下で、さまざまなカットレイヤー位置、学習エポック数、バッチサイズにおいて、提案攻撃の性能はどのように変化するか?
  • RQ3微分プライバシーおよび勾配圧縮といった一般的な防御策が、ラベル推定攻撃に対してどの程度効果を発揮するか?
  • RQ4勾配と前方伝搬特徴量のどちらにラベル漏洩が顕著に現れるか、その理由は何か?

主な発見

  • 提案されたクラスタリング攻撃は、CIFAR-10、CIFAR-100、Fashion-MNIST、Dogs vs. Catsの各データセットにおいて、さまざまなカットレイヤー位置および学習ハイパーパramータ設定下で、ほぼ100%のラベル推定正確度を達成する。
  • 攻撃は勾配圧縮に対しても頑健であり、圧縮比が0.9に達するまで高い正確度を維持する。
  • 微分プライバシーはラベル保護に失敗しており、ノイズレベルが高いにもかかわらず、低ε値(例:ε < 1)でも攻撃の正確度が高く維持される。
  • 攻撃は標準的なモデル推論を上回る正確度を示しており、損失関数を通じて真値ラベルに依存するため、勾配が特徴量よりもラベル関連の情報を多く保持していることが示唆される。
  • マッシュドデータからのラベル推定は勾配からのものより効果的であり、バックプロパゲーションによって勾配が真のラベルと強い相関関係を持つようにエンコードされているためである。
  • 攻撃はスケーラブルであり、サーバー側およびクライアント側の脅威モデルの両方で有効であるため、実世界のスプリットラーニング導入において実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。