Skip to main content
QUICK REVIEW

[論文レビュー] Split Learning without Local Weight Sharing to Enhance Client-side Data Privacy

Ngoc Duy Pham, Tran Khoa Phan|arXiv (Cornell University)|Dec 1, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、マルチクライアント分散学習におけるクライント側のデータ漏洩を低減するために、クライント間でのローカル重み共有を排除するプライバシー強化型スプリットラーニング(P-SL)という新しいフレームワークを提案する。クライントがローカルモデル重みを共有しないため、モデル逆転攻撃のリスクが軽減され、標準的なスプリットラーニングと比較して、最大50%のデータ漏洩削減が達成される。これは、精度を維持したまま、非IIDおよび動的クライント到着条件下でも、サーバー側のキャッシュ機構により実現される。

ABSTRACT

Split learning (SL) aims to protect user data privacy by distributing deep models between client-server and keeping private data locally. In SL training with multiple clients, the local model weights are shared among the clients for local model update. This paper first reveals data privacy leakage exacerbated from local weight sharing among the clients in SL through model inversion attacks. Then, to reduce the data privacy leakage issue, we propose and analyze privacy-enhanced SL (P-SL) (or SL without local weight sharing). We further propose parallelized P-SL to expedite the training process by duplicating multiple server-side model instances without compromising accuracy. Finally, we explore P-SL with late participating clients and devise a server-side cache-based training method to address the forgetting phenomenon in SL when late clients join. Experimental results demonstrate that P-SL helps reduce up to 50% of client-side data leakage, which essentially achieves a better privacy-accuracy trade-off than the current trend by using differential privacy mechanisms. Moreover, P-SL and its cache-based version achieve comparable accuracy to baseline SL under various data distributions, while cost less computation and communication. Additionally, caching-based training in P-SL mitigates the negative effect of forgetting, stabilizes the learning, and enables practical and low-complexity training in a dynamic environment with late-arriving clients.

研究の動機と目的

  • ローカル重み共有に起因するマルチクライアントスプリットラーニングにおける深刻なプライバシー脆弱性を是正すること。
  • モデル精度を損なわず、通信オーバーヘッドを増加させることなく、クライント側のデータプライバシーを強化すること。
  • 特に遅れて到着するクライントを対象として、学習の忘却現象を軽減することで、動的クライント参加を可能にすること。
  • 非IIDかつ異種のデータを扱う実世界のIoTおよびモバイル環境に適した、低複雑性かつスケーラブルなトレーニングフレームワークを構築すること。
  • スプリットラーニング環境において、微分プライバシー機構よりも優れたプライバシーと精度のトレードオフを提供すること。

提案手法

  • トレーニング中にクライント間でローカルモデル重みを交換しないP-SLというスプリットラーニングの変種を提案し、これによりデータ漏洩の主要な要因が排除される。
  • 複数のサーバー側モデルインスタンスを用いた並列化されたP-SLアーキテクチャを採用し、精度を損なわずにトレーニングを高速化する。
  • 以前に訓練済みのクライントからの知識を保存・再利用するサーバー側キャッシュ機構を導入し、新規クライントの参加時における学習の安定化を実現する。
  • キャッシュを活用したトレーニング戦略を採用し、遅れて到着するクライントでのみ再トレーニングを実施することで、知識の保持を維持するとともに、クライント側の計算および通信コストを削減する。
  • 白箱設定下でモデル逆転攻撃を適用し、ローカル重み共有が標準スプリットラーニング(SL)において実際のデータ漏洩リスクを引き起こすことを実証的に検証する。
  • 実験においてクライントの順序をランダム化する戦略を採用し、異なるクライント参加パターン下での耐性を評価する。

実験結果

リサーチクエスチョン

  • RQ1スプリットラーニングにおけるクライント間のローカル重み共有が、特にモデル逆転攻撃の文脈で、どのようにデータプライバシー漏洩を悪化させるか?
  • RQ2ローカル重み共有を排除したスプリットラーニングフレームワークを設計することで、モデル精度を維持しつつ、クライント側のデータ漏洩を顕著に低減できるか?
  • RQ3P-SLを効率的に並列化することで、モデル性能を損なわずトレーニングを高速化できるか?
  • RQ4初期トレーニング後に新規クライントが参加する場合、学習の安定化と忘却現象の緩和にどのようなメカニズムが有効か?
  • RQ5非IIDデータ分布下において、P-SLは標準スプリットラーニングおよびフェデレーテッドラーニングと比較して、どのように性能を発揮するか?

主な発見

  • P-SLは、標準的なスプリットラーニング(SL)と比較して、クライント側のデータ漏洩を最大50%まで削減し、微分プライバシー機構に依存せずに顕著なプライバシー向上を達成する。
  • P-SLは、標準的なスプリットラーニング(SL)および確率的フェデレーテッドラーニング(SFL)と同等の精度を達成する。非IIDデータ下でキャッシュなし条件下でも、Fashion-MNISTでは56.1%、CIFAR-10では47.2%のテスト精度を達成する。
  • キャッシュベースのP-SLバージョンは、Fashion-MNISTで56.1%、CIFAR-10で47.2%の精度を向上させ、トレーニングの安定化と忘却効果の緩和を実証する。
  • キャッシュ機構を導入した場合、SLおよびSFLはそれぞれCIFAR-10で92.8%および83.2%の高い精度を達成する。これは、非IID環境下でキャッシュが性能向上を実現できることを示している。
  • キャッシュ機構により、保存された知識を再利用することで、遅れて到着するクライントに対する低オーバーヘッドのトレーニングが可能となり、クライント側の計算および通信コストが削減される。
  • 並列化されたP-SLは、共通のキャッシュプールを共有する複数のサーバー側モデルインスタンスを用いることで、モデル精度を維持しつつトレーニングを高速化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。