Skip to main content
QUICK REVIEW

[論文レビュー] Privacy-Preserving Feature Selection with Secure Multiparty Computation

Xiling Li, Rafael Dowsley|arXiv (Cornell University)|Feb 6, 2021
Privacy-Preserving Technologies in Data参考文献 32被引用数 20
ひとこと要約

本論文は、フィルタ法を用いたプライバシー保護型特徴選択のための、最初の安全なマルチパーティ計算(MPC)ベースのプロトコルを提示する。特に、安全なジニ不純度スコアリングメカニズムを活用している。このプロトコルにより、複数の参加者が、生データや特徴の識別子を露呈させることなく、共に上位k個の特徴を選択可能となり、セミ悪意のあるおよび悪意のある脅威モデル下でも、分類器の精度を向上させながらプライバシーを維持する。実行時間は、データサイズやセキュリティ設定に応じて数秒から1時間程度である。

ABSTRACT

Existing work on privacy-preserving machine learning with Secure Multiparty Computation (MPC) is almost exclusively focused on model training and on inference with trained models, thereby overlooking the important data pre-processing stage. In this work, we propose the first MPC based protocol for private feature selection based on the filter method, which is independent of model training, and can be used in combination with any MPC protocol to rank features. We propose an efficient feature scoring protocol based on Gini impurity to this end. To demonstrate the feasibility of our approach for practical data science, we perform experiments with the proposed MPC protocols for feature selection in a commonly used machine-learning-as-a-service configuration where computations are outsourced to multiple servers, with semi-honest and with malicious adversaries. Regarding effectiveness, we show that secure feature selection with the proposed protocols improves the accuracy of classifiers on a variety of real-world data sets, without leaking information about the feature values or even which features were selected. Regarding efficiency, we document runtimes ranging from several seconds to an hour for our protocols to finish, depending on the size of the data set and the security settings.

研究の動機と目的

  • プライバシー保護型機械学習(PPML)におけるギャップを埋めるために、安全な計算をデータ前処理フェーズ、特に特徴選択に拡張すること。
  • 生の特徴値や選択結果を露呈させることなく、プライベートな特徴順位付けを可能にする、安全で効率的なMPCプロトコルの設計。
  • 実世界のデータサイエンスのシナリオにおいて、実用的なパフォーマンスを伴う、提案されたプロトコルの実現可能性と有効性の実証。
  • モデルに依存しないフィルタベースのアプローチを用いることで、任意の下流の機械学習モデルとの統合を支援すること。
  • 将来のPPMLプロトコルの基盤を築くこと。具体的には、ハイパーパramータチューニング、外れ値検出、欠損値処理などの他の前処理タスクを対象とする。

提案手法

  • MPCを用いたジニ不純度に基づく安全な特徴スコアリングプロトコルを提案し、分散された参加者間で特徴の関連スコアをプライベートに計算可能にする。
  • Z_q(q=2^64)上で動作する3PCまたは4PCの誠実多数派設定における、フィルタベース特徴選択のためのマルチパーティ計算(MPC)プロトコルπ_GINI-FSを設計する。
  • 個々のデータポイントや特徴値を露呈させることなく、特徴の重要度を計算できる、ジニ不純度計算の安全な変種、MS-GINIを採用する。
  • MP-SPDZを用いてプロトコルを実装・ベンチマークし、セミ悪意のあるおよび悪意のある攻撃者モデル下でも正しさとセキュリティを保証する。
  • サブプロトコルに構造化する:π_MS-GINIは安全なジニ計算を、π_FILTER-FSは特徴の順位付けと選択を担当する。
  • 共同配置されたAzure仮想マシンを用いた分散環境でプロトコルを実行し、計算および通信のオーバーヘッドを測定する。

実験結果

リサーチクエスチョン

  • RQ1安全なマルチパーティ計算は、モデル学習とは独立して、機械学習における特徴のプライベート選択に効果的に適用可能か?
  • RQ2ジニ不純度は、マルチパーティ環境でどのように安全に計算可能か?これにより、生データを露呈させることなく、プライベートな特徴スコアリングが可能になるか?
  • RQ3実世界のデータサイエンスワークロードにおいて、MPCを用いたプライベートな特徴選択のパフォーマンスオーバーヘッドはどの程度か?
  • RQ4MPCを用いたプライベートな特徴選択は、プライバシーを損なうことなく、下流のモデル精度を向上させるか?
  • RQ5セキュリティモデル(セミ悪意あり vs. 惡意あり)は、プロトコルの効率性およびスケーラビリティにどのように影響を与えるか?

主な発見

  • 提案されたMPCベースの特徴選択プロトコルは、認知的負荷検出、LSVT音声リハビリテーション、スピードデートなど、複数の実世界データセットにおいて、ロジスティック回帰モデルの精度を向上させる。
  • 安全なMS-GINI法を用いた特徴選択は、ピアソン相関や相互情報量といった従来の非プライベートな特徴選択手法と同等の精度を達成する。
  • プロトコルの実行時間は、データセットのサイズやセキュリティモデルに応じて数秒から約1時間の範囲で変動し、アクティブ(悪意あり)設定ではパassive(セミ悪意あり)設定よりも時間がかかる。
  • パフォーマンスの主なボトル neck は、ジニ計算における行列乗算であり、これにはインスタンス数(m)、特徴数(p)、選択された特徴数(k)が影響する。
  • プロトコルはプライバシーを効果的に保護している:どの参加者に対しても、生の特徴値や選択された特徴に関する情報が漏洩していない。
  • MP-SPDZにおける実装により、複数の信頼できないサーバーを含む標準的な機械学習サービスパイプラインへのプライベートな特徴選択の統合可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。