Skip to main content
QUICK REVIEW

[論文レビュー] ExpertMatcher: Automating ML Model Selection for Clients using Hidden Representations

Vivek Kumar Sharma, Praneeth Vepakomma|arXiv (Cornell University)|Oct 9, 2019
Privacy-Preserving Technologies in Data参考文献 14被引用数 7
ひとこと要約

本稿では、生のクライントデータを共有せずに分散システムにおける機械学習モデル選択を自動化するためのExpertMatcher-HRを提案する。クライアントとサーバーで別々に訓練された自己符号化器を用い、コサイン類似度により隠れ表現を抽出・比較することで、データ共有ベースラインとほぼ同等の性能を達成する—粗いレベルの割り当てで平均99.3%、細分化された分類で71.4%の精度を達成し、プライバシーを保ちつつ帯域幅を削減する。

ABSTRACT

Recently, there has been the development of Split Learning, a framework for distributed computation where model components are split between the client and server (Vepakomma et al., 2018b). As Split Learning scales to include many different model components, there needs to be a method of matching client-side model components with the best server-side model components. A solution to this problem was introduced in the ExpertMatcher (Sharma et al., 2019) framework, which uses autoencoders to match raw data to models. In this work, we propose an extension of ExpertMatcher, where matching can be performed without the need to share the client's raw data representation. The technique is applicable to situations where there are local clients and centralized expert ML models, but the sharing of raw data is constrained.

研究の動機と目的

  • プライバシーを守る形で、クライントデータに最も関連性の高いエキスパートMLモデルを割り当てる課題に対処すること。
  • プライバシー、セキュリティ、ストレージの懸念を引き起こすため、生のクライントデータを共有する必要がある既存のExpertMatcher手法の限界を克服すること。
  • 生のデータを転送できない分散学習フレームワーク(例:Split Learning)において、効率的かつスケーラブルなモデル選択を可能にすること。
  • 生の入力を使用せずに、中間の隠れ表現のみを用いて高いモデル割り当て精度を維持すること。
  • 画像、テキスト、センサデータ、医療画像を含む多様なデータモダリティにおいて、本手法の実現可能性と性能を示すこと。

提案手法

  • クライアントおよびサーバー側で、重複しないが同様に分布されたデータを用いて、別々の自己符号化器(AE)を訓練する。
  • クライアント側の自己符号化器を用いてクライアントデータから中間の隠れ表現を抽出し、それらの符号化済み特徴のみを共有する。
  • サーバー側でエキスパートモデルのトレーニングデータセットごとに平均隠れ表現(μk)を計算し、クライアント側でも各クライアントのデータセットごとに同様に計算する。
  • クライアントの符号化済み表現とサーバーで事前に計算された平均表現との間で最大コサイン類似度を用いてモデルを割り当てる。
  • 同じ類似度ベースのマッチング機構を用いて、粗いレベルの割り当て(データセットレベル)と細分化された割り当て(クラスレベル)を実行する。
  • クライアントおよびサーバーのAE間で重み初期化の一貫性を保つことで、独立した訓練にもかかわらず類似した表現に収束するように促進する。

実験結果

リサーチクエスチョン

  • RQ1生のクライントデータを共有せずに、隠れ表現のみを用いてエキスパートモデル選択を正確に行うことは可能か?
  • RQ2生のデータ共有を要する手法と比較して、隠れ表現を用いたモデル割り当ての性能はどの程度か?
  • RQ3異なるデータ分布上で独立して訓練された自己符号化器であっても、マッチングに適した類似した隠れ表現を生成できる程度はどの程度か?
  • RQ4クライアント側のデータ量が制限された場合、細分化されたクラス割り当て精度にどのような影響が生じるか?
  • RQ5本手法は、複数のクライントおよび多様なデータタイプに対してもスケーラブルであり、プライバシーと効率性を維持できるか?

主な発見

  • 提案手法は6つのデータセットにおいて粗いレベルのデータセット割り当てで平均99.30%の精度を達成し、生データを共有するSharmaら(2019)と同等の性能を示す。
  • MNISTにおける細分化されたクラス割り当てでは71.4%の精度を達成(ベースラインの84.36%と比較して性能低下を示すが)、これはクライアント側のトレーニングデータが少ないことに起因する。
  • 重複しないデータ上で独立して訓練されたにもかかわらず、自己符号化器はコサイン空間において非常に類似した隠れ表現を生成し、効果的なマッチングを可能にする。
  • 100%のクライアントデータプライバシーを維持しているにもかかわらず、低次元の符号化特徴のみを共有するため、性能が安定している。
  • MNIST、STL-10、HAR、Reuters、NLOS、Diabetic Retinopathyを含む多様なデータタイプにおいて、性能が強く保たれている。
  • 本手法は複数のクライントに対してもスケーラブルであり、生データの転送なしに粗いレベルおよび細分化されたモデル選択を両方サポートする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。