Skip to main content
QUICK REVIEW

[論文レビュー] SoK: Training Machine Learning Models over Multiple Sources with Privacy Preservation

Lushan Song, Lin, Guopeng|arXiv (Cornell University)|Dec 6, 2020
Privacy-Preserving Technologies in Data参考文献 108被引用数 7
ひとこと要約

本稿は、複数のデータソースにおけるプライバシー保護型機械学習の包括的サーベイを提示しており、主にフェデレーテッドラーニング(FL)とセキュアマルチパーティーラーニング(MPL)に焦点を当てている。両アプローチをセキュリティ、効率性、データ分布、モデル精度、応用シナリオの観点から評価し、動的スケーラビリティ、複雑なモデルのサポート、強力な脅威モデルといった、主な課題と今後の研究方向性を特定している。

ABSTRACT

Nowadays, gathering high-quality training data from multiple data sources with privacy preservation is a crucial challenge to training high-performance machine learning models. The potential solutions could break the barriers among isolated data corpus, and consequently enlarge the range of data available for processing. To this end, both academic researchers and industrial vendors are recently strongly motivated to propose two main-stream folders of solutions mainly based on software constructions: 1) Secure Multi-party Learning (MPL for short); and 2) Federated Learning (FL for short). The above two technical folders have their advantages and limitations when we evaluate them according to the following five criteria: security, efficiency, data distribution, the accuracy of trained models, and application scenarios. Motivated to demonstrate the research progress and discuss the insights on the future directions, we thoroughly investigate these protocols and frameworks of both MPL and FL. At first, we define the problem of Training machine learning Models over Multiple data sources with Privacy Preservation (TMMPP for short). Then, we compare the recent studies of TMMPP from the aspects of the technical routes, the number of parties supported, data partitioning, threat model, and machine learning models supported, to show their advantages and limitations. Next, we investigate and evaluate five popular FL platforms. Finally, we discuss the potential directions to resolve the problem of TMMPP in the future.

研究の動機と目的

  • 直接的なデータ共有なしに、分散型でプライバシーに配慮したデータソースにわたる高パフォーマンスな機械学習モデルの学習を実現する課題に対処すること。
  • セキュリティ、効率性、データ分布、モデル精度、応用適合性の観点から、主な技術的アプローチとしてのフェデレーテッドラーニング(FL)とセキュアマルチパーティーラーニング(MPL)を比較・評価すること。
  • 現在のFLおよびMPLフレームワークにおける制限、特に弱い脅威モデル、アクセス制御の欠如、非IIDデータおよび複雑なモデルに対する対応の不足を特定すること。
  • プライバシー保護型機械学習を強化するための今後の研究方向性を提案・分析すること、例えば動的スケーラビリティ、システムの非均一性への耐性、高度なモデルのサポートなど。

提案手法

  • プライバシー保護型機械学習の訓練(TMMPP)を統一的な研究課題として定義すること。
  • 技術的ルート、対応可能な参加者数、データパーティショニング、脅威モデル、対応可能な機械学習モデルの観点から、既存のMPLおよびFLソリューションを分類・比較すること。
  • 5つの代表的なFLプラットフォームを評価し、実世界でのパフォーマンスと制限を検証すること。
  • MPLにおける基礎的な暗号技術(秘密分散、ヨアのガーブルド回路、SPDZプロトコルなど)を分析し、安全な計算を実現すること。
  • FLにおけるサーバーのセキュリティ強化のため、セキュアアグリゲーションとMACベースの検証の統合を提案すること。
  • MPLフレームワークにおけるアクセス制御および動的スケーラビリティの実現のため、シャミアの秘密分散の活用を検討すること。

実験結果

リサーチクエスチョン

  • RQ1FLとMPLは、セキュリティ、効率性、実世界のデータ分布への対応性において、どのように比較されるか?
  • RQ2現在のFLおよびMPLフレームワークは、非IIDデータ、システムの非均一性、動的参加者参加に対処する上で、どのような主な制限を抱えているか?
  • RQ3プライバシー保護型学習において、正当な参加者だけがグローバルモデルを取得できるように、アクセス制御をどのように実装できるか?
  • RQ4暗号技術的およびシステムレベルの最適化により、MPLおよびFLの効率性とスケーラビリティをどのように向上させられるか?
  • RQ5実用的で、安全かつスケーラブルなマルチソース機械学習を実現するための、今後の研究方向性の中で最も有望なものは何か?

主な発見

  • FLは、生データの送信ではなくモデル更新の送信により、MPLに比べて通信および計算のオーバーヘッドが低くなる傾向にある。
  • MPLは、誠実多数の仮定の下で悪意ある攻撃者に対しても強いセキュリティ保証を提供するが、通信および計算コストが非常に高いという欠点を有する。
  • 大多数のFLフレームワークは、準誠実または誠実なサーバーを仮定しており、悪意あるサーバーの脅威にはほとんど対応していない。
  • 現在のフレームワークは動的参加者参加をサポートしていないため、信頼性が不安定または接続状態が変動する実世界環境では脆弱である。
  • 非IIDデータはFLのパフォーマンスを著しく低下させるが、メタラーニングやマルチタスクラーニングなどの技術により、この問題を緩和できる。
  • LSTMや意思決定木といった複雑なモデルのサポートは、FLおよびMPLフレームワークの両方において依然として限定的であり、重要な未解決課題である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。