Skip to main content
QUICK REVIEW

[論文レビュー] FedPandemic: A Cross-Device Federated Learning Approach Towards Elementary Prognosis of Diseases During a Pandemic

Aman Priyanshu, Rakshit Naidu|arXiv (Cornell University)|Apr 5, 2021
Privacy-Preserving Technologies in Data参考文献 10被引用数 4
ひとこと要約

FedPandemicは、分散型で現実世界のCOVID-19データから発熱や咳などの共通する症状を検出するために、単語埋め込みとFedAvgを用いた、プライバシーを守りながらスケーラブルな症状予後予測のためのクロスデバイスフェデレーテッドラーニングフレームワークを提案する。100%のノイズ下でも高い精度を達成し、多様な世界的なデータセットにおいても頑健性を保つ。中央集権的な患者データの集約を伴わず、早期の流行発覚を可能にする。

ABSTRACT

The amount of data, manpower and capital required to understand, evaluate and agree on a group of symptoms for the elementary prognosis of pandemic diseases is enormous. In this paper, we present FedPandemic, a novel noise implementation algorithm integrated with cross-device Federated learning for Elementary symptom prognosis during a pandemic, taking COVID-19 as a case study. Our results display consistency and enhance robustness in recovering the common symptoms displayed by the disease, paving a faster and cheaper path towards symptom retrieval while also preserving the privacy of patient's symptoms via Federated learning.

研究の動機と目的

  • パンデミック期における中央集権的な症状データ収集の高コスト、高時間・高プライバシー負荷を軽減すること。
  • 分散型学習を用いて、多様な集団間で協働的かつプライバシーを守った症状検出を可能にすること。
  • 公衆衛生監視における手動によるデータ匿名化や中央集権的データ集約への依存を減らすこと。
  • 流行発覚のための軽量でスケーラブルなモデルの開発。
  • 合成ネガティブサンプリングと単語埋め込みを用いて、症状検出におけるバイアスとアンダーフィッティングを軽減すること。

提案手法

  • 分散型症状データ上でバイナリ分類器をトレーニングするため、FedAvgアルゴリズムを用いたクロスデバイスフェデレーテッドラーニングを採用する。
  • 特徴抽出器としてGloVe単語埋め込みを用い、症状のテキストを固定長のベクトルに変換してモデル入力とする。
  • 固定エポック数でデバイス上にローカルにトレーニングされた軽量クライアント側分類器を実装する。
  • 医療コーパスからの合成ネガティブサンプルを導入し、データセットのバランスをとる。
  • クライアントのデータサイズとノイズレベル(0%から100%)を変化させたシミュレーションを実施し、頑健性と収束性をテストする。
  • セキュアアグリゲーションや微分プライバシーなどの追加のプライバシー保護メカニズムとの統合をサポートする。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッドラーニングは、患者データを中央集権的に集約せずに、顕著なパンデミック症状を効果的に検出できるか?
  • RQ2分散型で現実世界の症状データにノイズが増加する状況下で、モデルのパフォーマンスはどのように変化するか?
  • RQ3合成ネガティブサンプリングは、症状分類におけるモデルの頑健性向上とバイアス低減にどの程度寄与するか?
  • RQ4軽量なフェデレーテッドモデルは、クライアントのプライバシーを守りつつ、計算コストを最小限に抑えて高い精度を達成できるか?
  • RQ5複数の国から得られた多様な世界的な症状分布において、モデルのパフォーマンスはどの程度か?

主な発見

  • 100%のノイズ下でも、発熱や咳といった症状の検出において90%を超える高い精度を達成し、強い頑健性を示した。
  • シミュレーションでは100回のグローバルエポックで一貫した収束が確認され、人口の10%以上に見られる症状では、精度が85%以上に安定した。
  • 発熱(ケニアでは90.05%)や乾性せき(74%)といった症状は、すべてのシミュレートされた国で高い精度で一貫して検出された。
  • 合成ネガティブサンプルの統合により、モデルの一般化性能が著しく向上し、まれな症状に対するアンダーフィッティングが低減した。
  • 生データを一切送信しないことでクライアントのプライバシーを効果的に保護し、手動による匿名化の必要性がなくなり、完全に排除された。
  • 低コストの計算リソースで高いパフォーマンスを維持でき、標準的なモバイルデバイスへの展開に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。