Skip to main content
QUICK REVIEW

[論文レビュー] LoAdaBoost: loss-based AdaBoost federated machine learning with reduced computational complexity on IID and non-IID intensive care data

Huang Li, Yifeng Yin|arXiv (Cornell University)|Nov 30, 2018
Privacy-Preserving Technologies in Data参考文献 22被引用数 14
ひとこと要約

本稿では、計算複雑性を低減し、IIDおよび非IIDの集中治療室(ICU)データにおいても予測精度を向上させる、損失に基づく適応的ブースティングを用いたフェデレーテッドラーニング手法であるLoAdaBoostを提案する。各クライアントのトレーニングエポック数を、前回ラウンドの中央値損失に対する交差エントロピー損失に基づいて動的に調整することで、LoAdaBoostはFedAvgに比べて平均30%少ないエポック数で、AUCが最大0.6548に達する。特に非IIDな状況において顕著な効果を示す。

ABSTRACT

Intensive care data are valuable for improvement of health care, policy making and many other purposes. Vast amount of such data are stored in different locations, on many different devices and in different data silos. Sharing data among different sources is a big challenge due to regulatory, operational and security reasons. One potential solution is federated machine learning, which is a method that sends machine learning algorithms simultaneously to all data sources, trains models in each source and aggregates the learned models. This strategy allows utilization of valuable data without moving them. One challenge in applying federated machine learning is the possibly different distributions of data from diverse sources. To tackle this problem, we proposed an adaptive boosting method named LoAdaBoost that increases the efficiency of federated machine learning. Using intensive care unit data from hospitals, we investigated the performance of learning in IID and non-IID data distribution scenarios, and showed that the proposed LoAdaBoost method achieved higher predictive accuracy with lower computational complexity than the baseline method.

研究の動機と目的

  • 集中治療室(ICU)データにおけるフェデレーテッドラーニングにおいて、非IIDおよび計算コストの高いデータ分布の課題に対処すること。
  • 分散型でプライバシーが重要な医療データにおいて、モデル性能を維持または向上させつつ、フェデレーテッドラーニングの計算複雑性を低減すること。
  • クライアントごとのモデルパフォーマンスに基づいてトレーニングエポック数を適応的に調整する手法を開発し、収束性と精度を向上させること。
  • データ共有戦略を含む、IIDおよび非IIDのICUデータセットにおいて、この手法を評価すること。

提案手法

  • LoAdaBoostは、各グローバルラウンドにおけるクライアントモデルの品質を評価するためのパフォーマンス指標として交差エントロピー損失を用いる。
  • 前回のラウンドにおける全クライアントの損失の中央値を計算し、モデル適合度のベースラインを確立する。
  • クライアントの損失が中央値損失に対して低い、適切な、または高い場合に応じて、それぞれ過小適合、適切適合、過剰適合と分類する。
  • トレーニングエポック数を動的に調整する:過小適合クライアントにはより多くのエポック、適切適合クライアントには少ないエポック、過剰適合クライアントには追加のトレーニングを行わない。
  • FedAvgのグローバルモデル平均化と統合され、通信効率を維持しながら、ローカルモデルの品質を向上させる。
  • 本手法はMIMIC-IIIおよびeICUデータセットに適用され、IID、非IID、およびデータ共有条件の下で評価されている。

実験結果

リサーチクエスチョン

  • RQ1損失に基づく適応的ブースティング機構は、計算コストを低減しつつ、非IIDのICUデータに対してフェデレーテッドラーニングのパフォーマンスを向上させることができるか?
  • RQ2LoAdaBoostは、IIDおよび非IIDのデータ分布において、収束速度、予測精度(AUC)、平均トレーニングエポック数という観点でFedAvgと比較してどのように異なるか?
  • RQ3中央値損失に対するクライアントの損失に基づく動的エポック割り当ては、フェデレーテッドラーニングにおけるモデル一般化性能を向上させるか?
  • RQ4どのようなデータ分布条件(IID対非IID)においてLoAdaBoostがFedAvgを上回り、データ共有戦略は依然として必要か?

主な発見

  • 非IIDなeICUデータにおいて、LoAdaBoostはAUC 0.6548 ± 0.0048を達成し、FedAvgの0.6512 ± 0.0043を上回り、平均エポック数も300対271で30%少ない。
  • IIDなeICUデータにおいて、LoAdaBoostはAUC 0.6057 ± 0.0077を達成し、FedAvgの0.5693 ± 0.0057を大きく上回り、平均エポック数は400対262で減少した。
  • データ共有ありの状況では、LoAdaBoostはAUC 0.6412 ± 0.0065を維持したが、FedAvgの0.6253 ± 0.0088よりも高いAUCを達成し、平均エポック数も350対272で少ない。
  • LoAdaBoostは、すべてのデータ分布シナリオにおいて収束が早く、AUCが高く、データの偏りに強く、計算負荷も低減された。
  • LoAdaBoostは、FedAvgに比べて平均トレーニングエポック数を最大30%まで削減した。特に、FedAvgが収束するまでに400エポックを要するIID状況において顕著な利点を示した。
  • 非IID環境下でも、データ共有がなくてもLoAdaBoostのパフォーマンスはFedAvgと同等またはそれ以上であり、適応的ブースティング機構がデータの偏りの影響を緩和していることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。