Skip to main content
QUICK REVIEW

[論文レビュー] Split Ways: Privacy-Preserving Training of Encrypted Data Using Split Learning

Tanveer Khan, Khoa Nguyen|arXiv (Cornell University)|Jan 20, 2023
Privacy-Preserving Technologies in Data参考文献 6被引用数 4
ひとこと要約

本論文は、スプリットラーニングと完全準同型暗号(HE)を組み合わせることで、モデル学習中にクライアントのデータを保護するプライバシー保護型機械学習フレームワークを提案する。クライアントは、サーバーに送信する前に活性化マップをHEで暗号化する。これにより、暗号化されたデータ上で安全に計算が可能となり、平文での学習と比較して精度低下がたった2.65%に抑えられつつ、完全なデータプライバシーを維持することができる。

ABSTRACT

Split Learning (SL) is a new collaborative learning technique that allows participants, e.g. a client and a server, to train machine learning models without the client sharing raw data. In this setting, the client initially applies its part of the machine learning model on the raw data to generate activation maps and then sends them to the server to continue the training process. Previous works in the field demonstrated that reconstructing activation maps could result in privacy leakage of client data. In addition to that, existing mitigation techniques that overcome the privacy leakage of SL prove to be significantly worse in terms of accuracy. In this paper, we improve upon previous works by constructing a protocol based on U-shaped SL that can operate on homomorphically encrypted data. More precisely, in our approach, the client applies Homomorphic Encryption (HE) on the activation maps before sending them to the server, thus protecting user privacy. This is an important improvement that reduces privacy leakage in comparison to other SL-based works. Finally, our results show that, with the optimum set of parameters, training with HE data in the U-shaped SL setting only reduces accuracy by 2.65% compared to training on plaintext. In addition, raw training data privacy is preserved.

研究の動機と目的

  • 活性化マップがクライアントの生データを再構築するために使用される可能性があるスプリットラーニングにおけるプライバシー漏洩を是正すること。
  • 完全準同型暗号(HE)をスプリットラーニングに統合し、モデル精度を損なわせることなく活性化マップを保護すること。
  • プライバシー保護型環境下で、HEパラメータの選定と学習効率、モデル性能のトレードオフを評価すること。
  • スプリットラーニングにおける暗号化された活性化マップが、高いモデル精度を維持しながらデータ機密性を保証できることを実証すること。
  • 医療AIなどの機微な応用分野向けに、従来のスプリットラーニングの実用的で安全な代替手段を提供すること。

提案手法

  • クライアントは生データ上でU字型の1次元畳み込みニューラルネットワーク(1D CNN)を学習し、活性化マップを計算してからサーバーに送信する。
  • 活性化マップは、送信前にクライアント側で完全準同型暗号(FHE)を用いて暗号化される。
  • サーバーは暗号化された活性化マップ上でバックプロパゲーションと勾配更新を実行し、復号なしで計算を実行できる。
  • U字型アーキテクチャを採用することで、通信量を削減し、スプリットラーニングにおける特徴表現を向上させる。
  • 精度、学習時間、通信コストのバランスを図るために、多項式モジュラス(P)、係数モジュラス(C)、スケーリングファクタ(Δ)を変更した5通りのHEパラメータセットを評価した。
  • 学習および評価は、MIT-BIH心拍動異常データセットを用いて、平文と完全に暗号化された活性化マップの両方で実施された。
Figure 2: Heartbeats from the processed ECG dataset.
Figure 2: Heartbeats from the processed ECG dataset.

実験結果

リサーチクエスチョン

  • RQ1完全準同型暗号がスプリットラーニングに効果的に統合可能であり、活性化マップからのプライバシー漏洩を防止できるか?
  • RQ2異なるHEパラメータ設定が、スプリットラーニングにおけるモデル精度、学習時間、通信オーバーヘッドに与える影響は何か?
  • RQ3暗号化された活性化マップで学習したモデルの精度は、平文で学習したモデルと比較してどの程度か?
  • RQ4スプリットラーニングにおけるHEの使用が、妥当なモデル性能を維持しながらデータプライバシーを保護できるか?
  • RQ5U字型の1D CNNアーキテクチャが、暗号化データを用いたスプリットラーニングにおいてプライバシーや性能を向上させられるか?

主な発見

  • 最良のHEパラメータセット(P=4096, C=[40,20,20], Δ=2^21)は、テスト精度85.41%を達成し、平文学習(88.06%)と比較してわずか2.65%の精度低下にとどまった。
  • P=8192のHEパラメータを用いた学習では85.31%の精度を達成したが、最適なP=4096設定と比較して学習時間が3.67倍に延び、通信コストは8.43倍に増加した。
  • 最小のHEパラメータセット(P=2048, C=[18,18,18], Δ=2^16)は、最も短い学習時間(5,018秒)と通信量(0.58 Tb)を要したが、精度は22.65%にまで低下した。
  • U字型のスプリットラーニングアーキテクチャは、生の入力データやラベルをサーバーと共有する必要がなくなるため、先行研究と比較してプライバシー漏洩を低減した。
  • 可視化分析の結果、平文の活性化マップは生の入力データと高い類似性を示しており、顕著なプライバシー漏洩が生じていることが判明。本手法による暗号化により、この漏洩が効果的に緩和された。
  • 結果として、最適なHEパラメータを用いたHEベースのスプリットラーニングが、プライバシー保護型学習に実用的であることが示された。最適パラメータを用いる場合、精度低下はわずか2.65%に抑えられる。
Figure 3: Results when training locally on the plaintext MIT-BIH dataset with activation maps of size $[\text{batch size},256]$ .
Figure 3: Results when training locally on the plaintext MIT-BIH dataset with activation maps of size $[\text{batch size},256]$ .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。