Skip to main content
QUICK REVIEW

[論文レビュー] Privacy Preserving PCA for Multiparty Modeling

Yingting Liu, Chaochao Chen|arXiv (Cornell University)|Feb 6, 2020
Cryptography and Data Security参考文献 13被引用数 13
ひとこと要約

本稿では、複数の機関にまたがる水平分割データに対してプライバシーを守りながら、同型暗号と秘密分散方式を用いて安全かつ損失のない次元削減を実現する、プライバシー保護型PCA(PPPCA)を提案する。この手法は、中央集権的PCAと同一のモデル精度を達成し、再暗号化を伴わずに任意の下流の機械学習モデルへの適用を可能にする。

ABSTRACT

In this paper, we present a general multiparty modeling paradigm with Privacy Preserving Principal Component Analysis (PPPCA) for horizontally partitioned data. PPPCA can accomplish multiparty cooperative execution of PCA under the premise of keeping plaintext data locally. We also propose implementations using two techniques, i.e., homomorphic encryption and secret sharing. The output of PPPCA can be sent directly to data consumer to build any machine learning models. We conduct experiments on three UCI benchmark datasets and a real-world fraud detection dataset. Results show that the accuracy of the model built upon PPPCA is the same as the model with PCA that is built based on centralized plaintext data.

研究の動機と目的

  • 複数の組織にまたがる水平分割データに対して、平文データを共有せずにPCAを実行する課題に対処すること。
  • 各機械学習モデルごとに暗号化のオーバーヘッドが生じない、汎用的なプライバシー保護型モデリングフレームワークを設計すること。
  • PCAの出力が中央集権的PCAと比較して、プライバシー保護が確保されかつ損失がないことを保証すること。
  • PPPCAフレームワーク内での2つの暗号技術(同型暗号と秘密分散)の効率性と正確性を評価すること。

提案手法

  • PPPCAは、サーバ支援型のマルチパーティ計算モデルを採用しており、各参加者が局所的に平文データを保有し、原始データを露呈させずに協働的にPCAを計算する。
  • 2つの暗号技術を用いる:同型暗号(Paillier)は暗号化された値の安全な加算に、秘密分散は分散型行列演算に使用する。
  • 浮動小数点数は(暗号化された仮数部、暗号化されていない指数部)のペアとして符号化され、同型演算における数値精度をサポートする。
  • 共分散行列と固有ベクトルを分散的に計算し、どの単一の参加者も完全なデータや中間結果を学習しないように保証する。
  • 最終的な次元削減済みデータはデータ消費者に共有され、追加の暗号処理なしに任意の機械学習モデルを直接学習可能である。
  • プロトコルは誠実だが好奇な攻撃者(honest-but-curious)の脅威モデルに従い、受動的攻撃者に対するプライバシーを保証する。

実験結果

リサーチクエスチョン

  • RQ1PPPCAの出力に基づくモデル精度は、平文データに対する中央集権的PCAと同等であるか?
  • RQ2参加者数が増加するに従い、同型暗号ベースのPPPCAと秘密分散ベースのPPPCAの計算効率はどのように比較されるか?
  • RQ3PPPCAの出力は、ロジスティック回帰、GBDT、DNNなどの多様な機械学習モデルに直接適用可能で、性能に損失がないか?
  • RQ4同型暗号(HE)と秘密分散(SS)の2つの暗号手法は、データサイズと参加者数の増加に伴いどのようにスケーリングするか?

主な発見

  • PPPCA出力に基づくモデル精度は中央集権的PCAと区別できない:不正検出のAUCは中央集権的PCAで0.9663、PPPCA-HEで0.9692、PPPCA-SSで0.9613であった。
  • APSデータセットでは、中央集権的PCAでAUC 0.9915、HEベースで0.9918、SSベースで0.9906を達成し、性能損失は無視できるほど小さい。
  • Wineデータセット(回帰)では、RMSEが中央集権的PCAで0.7122、HEベースで0.7103、SSベースで0.7126であり、損失のない変換が確認された。
  • 同型暗号ベースの手法は参加者数の増加に伴いより効率的にスケーリングした:2人参加時3.16秒から4人参加時3.36秒に増加した一方、秘密分散ベースでは2.91秒から3.42秒に増加した。
  • PPPCAは、多様なモデルへの直接適用を可能にした:GBDTのAUCは中央集権的PCAで0.9941、HEで0.9943、SSで0.9948であり、高い互換性が確認された。
  • 秘密分散手法は参加者数が少ない段階では初期速度が速かったが、参加者数の増加に伴い、行列シャッフルに伴う通信オーバーヘッドにより著しく遅くなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。