Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-preserving Transfer Learning via Secure Maximum Mean Discrepancy

Bin Zhang, Cen Chen|arXiv (Cornell University)|Sep 24, 2020
Privacy-Preserving Technologies in Data参考文献 22被引用数 5
ひとこと要約

本稿では、同型暗号を活用して生データを露呈せずにMMD損失を計算することで、プライバシー保護型の転移学習手法であるSecure Maximum Mean Discrepancy (SMMD)を提案する。SMMDは、非暗号化MMDとほぼ同一の性能を達成しながら情報漏洩れを防止し、複数のデータセットにおけるフェデレーテッド環境でも高い精度とセキュリティを実現している。

ABSTRACT

The success of machine learning algorithms often relies on a large amount of high-quality data to train well-performed models. However, data is a valuable resource and are always held by different parties in reality. An effective solution to such a data isolation problem is to employ federated learning, which allows multiple parties to collaboratively train a model. In this paper, we propose a Secure version of the widely used Maximum Mean Discrepancy (SMMD) based on homomorphic encryption to enable effective knowledge transfer under the data federation setting without compromising the data privacy. The proposed SMMD is able to avoid the potential information leakage in transfer learning when aligning the source and target data distribution. As a result, both the source domain and target domain can fully utilize their data to build more scalable models. Experimental results demonstrate that our proposed SMMD is secure and effective.

研究の動機と目的

  • 源領域と標的領域の分布を統合する際のプライバシー漏洩を解消すること。
  • 機関間で生データを共有せずに、フェデレーテッドラーニングにおける効果的な知識移転を可能にすること。
  • データ機密性を保持しつつ、安全で効率的かつ高精度なドメイン統合手法を開発すること。
  • 異なるカーネル関数がプライバシー保護型転移学習のパフォーマンスに与える影響を評価すること。

提案手法

  • 生データを露呈せずに分布距離を計算できる同型暗号を用いた最大平均差分(MMD)のセキュアな変種、SMMDを提案する。
  • 同型暗号を用いて、源領域および標的領域の暗号化された特徴表現上でMMD損失を安全に計算する。
  • 線形、多項式、ガウスカーネルの複数のカーネル関数を暗号化フレームワーク内で適用し、移行可能性と耐障害性を評価する。
  • 分類を目的とした深層学習モデルを設計し、畳み込み層とシグモイド出力を用い、L1=128およびL2=64のニューロンを設定する。
  • ガウスカーネルの効率的な計算を可能にするために、2次テイラー展開を用いる。
  • UCI-Credit-CardおよびUCI-Census-Incomeデータセットを用いて、F1スコア、AUC、精度といった標準指標でパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニング環境下で、生データを露呈せずにMMDに基づくドメイン統合を安全に計算できるか?
  • RQ2同型暗号は、転移学習におけるMMD計算の精度と効率にどのように影響を与えるか?
  • RQ3線形、多項式、ガウスカーネルのうち、どのカーネル関数が暗号化計算下で最も優れたパフォーマンスを示すか?
  • RQ4SMMDは、非暗号化MMDおよびソースオンリーベースラインと比較して、モデル性能にどのように差をつけるか?

主な発見

  • SMMDは非暗号化MMDとほぼ同一のパフォーマンスを達成し、暗号化線形カーネルではUCI-Credit-Cardで0.684のF1スコア(非暗号化時:0.693)を達成した。
  • ガウスカーネルが他のカーネルを上回り、UCI-Credit-Cardで非暗号化時と暗号化時で両方0.702のAUCを達成した。
  • カーネルタイプにかかわらずパフォーマンスが安定しており、暗号化による精度低下は最小限であった(例:σ=1のガウスカーネルでは0.724 AUC(非暗号化時:0.739))。
  • SMMDはFTLベースラインを顕著に上回り、UCI-Census-Incomeでは0.851の精度(ベースライン:0.845)と0.787のAUC(ベースライン:0.712)を達成した。
  • ソースオンリーベースラインは一貫して低性能であり、UCI-Credit-Cardでは0.665のF1スコアを示し、転移学習の価値を裏付けた。
  • 本手法は異なるカーネルタイプに対して頑健であり、多項式カーネルでは次数が上昇するにつれて計算の複雑性によりわずかな性能低下が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。