Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Distributed Optimization for Machine Learning from Decentralized Features

Yaochen Hu, Di Niu|arXiv (Cornell University)|Dec 16, 2018
Privacy-Preserving Technologies in Data参考文献 31被引用数 4
ひとこと要約

本稿では、同じサンプルの特徴量を複数の参加者が共有するが、生データやモデルパラメータを共有しない分散機械学習のための新規非同期確率的勾配降下フレームワークFDMLを提案する。局所的予測の交換に加え、ハイパーライニアな集約構造を活用することで、FDMLは中央集権的学習に近い性能を達成しながら、データの局所性を保ち、微分プライバシーを実現する。Tencentにおける実世界の展開において、アプリ推薦の性能が顕著に向上した。

ABSTRACT

Distributed machine learning has been widely studied in the literature to scale up machine learning model training in the presence of an ever-increasing amount of data. We study distributed machine learning from another perspective, where the information about the training same samples are inherently decentralized and located on different parities. We propose an asynchronous stochastic gradient descent (SGD) algorithm for such a feature distributed machine learning (FDML) problem, to jointly learn from decentralized features, with theoretical convergence guarantees under bounded asynchrony. Our algorithm does not require sharing the original feature data or even local model parameters between parties, thus preserving a high level of data confidentiality. We implement our algorithm for FDML in a parameter server architecture. We compare our system with fully centralized training (which violates data locality requirements) and training only based on local features, through extensive experiments performed on a large amount of data from a real-world application, involving 5 million samples and $8700$ features in total. Experimental results have demonstrated the effectiveness and efficiency of the proposed FDML system.

研究の動機と目的

  • 同じサンプルの特徴量が複数の参加者に分散している状況で、生データやモデルパラメータを共有できない場合に、共同機械学習モデルを訓練する課題に対処すること。
  • 参加者間での元の特徴量や局所モデルパラメータの送信を回避することで、データの局所性を保ち、プライバシーを強化すること。
  • 孤立した局所特徴量上で学習されたモデルを上回り、中央集権的学習に近い性能を達成するスケーラブルで効率的なシステムを開発すること。
  • 通信プロトコルに微分プライバシーを統合することで、モデル協調中における機微な情報の保護をさらに強化すること。
  • Tencentのアプリから得た実世界のデータセットを用いてフレームワークを評価し、大規模推薦システムにおける実用的有用性を示すこと。

提案手法

  • FDMLシステムは、パラメータサーバーアーキテクチャを用い、各参加者が自らの特徴量セット上で独立に局所モデルを学習する非同期更新を調整する。
  • 各参加者はミニバッチのサンプルに対して局所的予測を計算し、生データやモデルパラメータではなく、この予測のみを中央サーバーに送信する。
  • 分類タスクのための最終的共同予測へと局所的予測を集約するために、ソフトマックスに類似したハイパーライニア構造を用いる。
  • システムは、制限付き非同期性(バウンデッドアサイクロニティ)を保証するStale Synchronous Parallel(SSP)設定下でミニバッチ確率的勾配降下を採用し、理論的収束保証を有する。
  • 推論攻撃から保護するため、共有される局所的予測に適切にスケーリングされたノイズを追加することで、微分プライバシーを適用する。
  • フレームワークは任意のモデル(例:ロジスティック回帰、因子分解機械、深層ニューラルネットワーク)をサポートし、共同モデルのエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1同じサンプルの特徴量が複数の参加者に分散している状況で、生データを共有しない場合に、協調的機械学習モデルを効果的に学習できるか?
  • RQ2FDMLを介して学習された共同モデルは、データの局所性を保ちながら、中央集権的学習と同等の性能を達成できるか?
  • RQ3制限付き非同期性下でシステムはどのように動作するか? また、理論的収束速度はいかなるものか?
  • RQ4通信プロトコルに微分プライバシーを統合する際、モデル性能の低下を最小限に抑えることができる程度はどの程度か?
  • RQ5大規模で実世界のデータセットにおいて、FDMLの通信オーバーヘッドと学習効率のスケーリング特性はいかがなっているか?

主な発見

  • FDMLは、局所特徴量での学習に比べて顕著に優れた性能を示し、a9aデータセットおよびTencentの500万レコードのデータセットの両方でAUCが高く、log lossが低い結果を得た。
  • ロジスティック回帰では、ハイパーライニア構造による特徴量相互作用の制限のためわずかな差異を除き、中央集権的学習とほぼ同等の性能を達成した。
  • ニューラルネットワーク(NN)設定では、局所モデルを大幅に上回り、中央集権的学習に近い性能を達成したが、アーキテクチャ上、直接的な参加者間特徴量相互作用がないためわずかな差異が残った。
  • NN設定では、モデルサイズが大きく通信オーバーヘッドが管理可能な場合、分散計算のおかげで中央集権的学習よりも高速に動作した。
  • ノイズレベルが3までの範囲で微分プライバシーを適用しても、局所学習のみの状況よりも優れた性能を示し、強力なプライバシーと性能のトレードオフを実現した。
  • a9aのような小さなデータセットでは通信オーバーヘッドが支配的となり、FDMLは中央集権的学習より遅くなったが、より大きな実世界のデータセットではこの影響が薄れ、性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。