Skip to main content
QUICK REVIEW

[論文レビュー] Data Selection for Federated Learning with Relevant and Irrelevant Data at Clients

Tiffany Tuor, Shiqiang Wang|arXiv (Cornell University)|Jan 22, 2020
Privacy-Preserving Technologies in Data参考文献 18被引用数 20
ひとこと要約

本稿では、フェデレーテッドラーニングにおける分散型データ選択手法を提案する。この手法は、タスク固有のベンチマークモデルを用いて各クライアントの関連データサンプルを同定・利用することで、不要なデータを除外し、モデルの精度を最大25%向上させる。

ABSTRACT

Federated learning is an effective way of training a machine learning model from data collected by client devices. A challenge is that among the large variety of data collected at each client, it is likely that only a subset is relevant for a learning task while the rest of data has a negative impact on model training. Therefore, before starting the learning process, it is important to select the subset of data that is relevant to the given federated learning task. In this paper, we propose a method for distributedly selecting relevant data, where we use a benchmark model trained on a small benchmark dataset that is task-specific, to evaluate the relevance of individual data samples at each client and select the data with sufficiently high relevance. Then, each client only uses the selected subset of its data in the federated learning process. The effectiveness of our proposed approach is evaluated on multiple real-world datasets in a simulated system with a large number of clients, showing up to $25\%$ improvement in model accuracy compared to training with all data.

研究の動機と目的

  • 不要なデータがフェデレーテッドラーニングのパフォーマンスに悪影響を及えるという課題に対処すること。
  • クライアントが特定の学習タスクに関連するデータのみを同定・保持できることを可能にすること。
  • 中央集権的なデータ収集を伴わずに多数のクライアントにスケーラブルな分散型データ選択メカニズムを構築すること。
  • フェデレーテッドトレーニング中に低関連性のデータサンプルを除外することで、モデルの精度を向上させること。

提案手法

  • 各クライアントは、小規模なタスク固有データセットで事前学習されたベンチマークモデルを用いて、ローカルデータサンプルの関連性を評価する。
  • 関連性は、各データサンプルとベンチマークモデルの予測との類似性または整合性を測定することで定量化される。
  • 関連性スコアが事前に定義されたしきい値を超えるデータサンプルが、フェデレーテッドラーニングに選択される。
  • クライアントは、高関連性データのサブセットに限定してフェデレーテッドラーニングを実行する。
  • この手法は分散型に動作し、生のクライアントデータを共有しないことで、データプライバシーを保持する。

実験結果

リサーチクエスチョン

  • RQ1ベンチマークモデルは、フェデレーテッドラーニング環境下で、個々のクライアントにおける関連データサンプルを効果的に同定できるか?
  • RQ2不要なデータを除外することで、フェデレーテッドラーニングにおける最終的なモデル精度にどのような影響を与えるか?
  • RQ3大規模なクライアント環境における収束速度およびモデル一般化性能に、データ選択はどのような影響を与えるか?
  • RQ4本手法は、生のクライアントデータを共有せずに、顕著な精度向上を達成できるか?

主な発見

  • 提案手法は、全クライアントデータを用いた学習と比較して、最大25%の精度向上を実現した。
  • 複数の実世界のデータセットにおいて、シミュレーテッドフェデレーテッドシステムで一貫した精度向上が得られた。
  • 不要なデータの除外は、フェデレーテッドラーニングにおける収束速度の向上と、より優れた一般化性能をもたらした。
  • ベンチマークモデルに基づく関連性評価は、グローバルデータへのアクセスを必要とせずに、有用なサンプルを効果的に同定できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。