Skip to main content
QUICK REVIEW

[論文レビュー] Federated learning with class imbalance reduction

Miao Yang, Akitanoshou Wong|arXiv (Cornell University)|Nov 23, 2020
Privacy-Preserving Technologies in Data参考文献 17被引用数 9
ひとこと要約

本稿では、生のクライントデータにアクセスせずにクラス不均衡を低減するためのクライント選択アルゴリズムを提案する。モデル勾配からのクラス分布推定と文脈的マルチアームバンディットフレームワークを用いることで、グローバルモデルの収束と精度が向上し、非IID設定においてグリーディー法やランダム選択法を凌駆する。

ABSTRACT

Federated learning (FL) is a promising technique that enables a large amount of edge computing devices to collaboratively train a global learning model. Due to privacy concerns, the raw data on devices could not be available for centralized server. Constrained by the spectrum limitation and computation capacity, only a subset of devices can be engaged to train and transmit the trained model to centralized server for aggregation. Since the local data distribution varies among all devices, class imbalance problem arises along with the unfavorable client selection, resulting in a slow converge rate of the global model. In this paper, an estimation scheme is designed to reveal the class distribution without the awareness of raw data. Based on the scheme, a device selection algorithm towards minimal class imbalance is proposed, thus can improve the convergence performance of the global model. Simulation results demonstrate the effectiveness of the proposed algorithm.

研究の動機と目的

  • 非IIDなクライントデータ分布に起因するフェデレーテッドラーニングにおけるクラス不均衡の課題に対処すること。
  • 生のクライントデータへのアクセスを必要とせずに、クラス不均衡を最小限に抑えるクライント選択戦略を開発すること。
  • プライバシー制約およびリソース制約下でのフェデレーテッドラーニングにおけるグローバルモデルの収束速度と精度を向上させること。
  • クライント選択における探索と活用のバランスを取る学習ベースのクライント選択メカニズムを設計すること。

提案手法

  • 生のデータを露出させないよう、更新済みのモデル勾配のみを用いて各クライントにおける局所的クラス分布を推定する。
  • クライント選択問題を文脈的マルチアームバンディット(CMAB)問題として定式化し、探索と活用のバランスを取る。
  • 探索係数 α と忘却係数 ρ を有する強化学習ベースのアルゴリズムを用い、クラス構成がバランスの取れたクライントを動的に選択する。
  • 学習プロセスの安定化とクライント選択の耐障害性を確保するため、正規化係数 β を適用する。
  • 選択されたクライントが局所的に学習を行い、グローバル集約に必要なモデル重みのみを送信するよう、FedAvgフレームワークにクライント選択を統合する。
  • 局所学習には交差エントロピー損失関数と確率的勾配降下法(SGD)を用い、実験全体にわたって一貫性のあるハイパーパrameterを固定する。

実験結果

リサーチクエスチョン

  • RQ1生のクライントデータにアクセスせずに、フェデレーテッドラーニングにおけるクラス不均衡を効果的に低減できるか?
  • RQ2直接データにアクセスするのと比較して、勾配に基づくクラス分布推定方式は、正確性とプライバシーの観点でどのように異なるか?
  • RQ3グリーディー法やランダム選択法と比較して、CMABベースのクライント選択戦略は、収束速度と最終的なモデル精度をどの程度向上させるか?
  • RQ4非IIDデータ条件下でのクライント選択において、探索と活用の最適なトレードオフは何か?
  • RQ5選択クライント数が収束性能と通信効率に与える影響はどの程度か?

主な発見

  • 提案手法は、グリーディー法およびランダム選択法と比較して、より速い収束と高いグローバルテスト精度を達成する。
  • 提案手法とランダム選択法との性能差は、主により優れたクライント集合選択によるクラス不均衡の効果的緩和に起因する。
  • グリーディー法と比較して、提案手法は探索と活用のバランスをより良くとっているため、より最適なクライント組み合わせの発見に成功している。
  • 選択クライント数を増やすことで性能が向上するが、ある閾値を超えると増益が鈍り、クライント集合の拡大によるリターンの逓減が顕著になる。
  • 最適な探索係数 α(シミュレーションでは 0.2 に設定)が極めて重要である—値が低すぎると探索が不十分になり、高すぎると非最適な探索選択による性能低下を引き起こす。
  • 提案手法はIID設定ではベースライン手法と同等の性能を維持する一方、非IID設定では顕著に優れた性能を示し、不均衡状況下での有効性を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。