Skip to main content
QUICK REVIEW

[論文レビュー] Jointly Learning from Decentralized (Federated) and Centralized Data to Mitigate Distribution Shift

Sean Augenstein, Andrew Hard|arXiv (Cornell University)|Nov 23, 2021
Privacy-Preserving Technologies in Data参考文献 19被引用数 5
ひとこと要約

本論文は、分散型(デバイス内)データと選択的中央集権型データを組み合わせることで、学習と推論の間の分布シフトを軽減するハイブリッドフェデレーテッドラーニングフレームワークを提案する。例の転送、勾配の転送、モデル平均化といった戦略を用いることで、ユーザーのプライバシーを保ちながらモデルの汎化性能を向上させ、顔の属性予測などの下流タスクで優れた性能を達成する。

ABSTRACT

With privacy as a motivation, Federated Learning (FL) is an increasingly used paradigm where learning takes place collectively on edge devices, each with a cache of user-generated training examples that remain resident on the local device. These on-device training examples are gathered in situ during the course of users' interactions with their devices, and thus are highly reflective of at least part of the inference data distribution. Yet a distribution shift may still exist; the on-device training examples may lack for some data inputs expected to be encountered at inference time. This paper proposes a way to mitigate this shift: selective usage of datacenter data, mixed in with FL. By mixing decentralized (federated) and centralized (datacenter) data, we can form an effective training data distribution that better matches the inference data distribution, resulting in more useful models while still meeting the private training data access constraints imposed by FL.

研究の動機と目的

  • デバイス内データに推論データに存在する重要な例(例:ネガティブ例やレアケース)が欠落している場合に生じる残留分布シフトを是正すること。
  • 直接的なユーザーの生データへのアクセスを回避することで、プライバシー保護を強化しつつ、高品質な中央集権データを活用すること。
  • フェデレーテッドラーニングの制約に適合する形で、分散型と中央集権型データを戦略的に混合することで、モデルの有用性と耐性を向上させること。
  • 例の転送、勾配の転送、モデル平均化といった実用的な混合戦略を検討し、データ最小化の原則に反しない形で効果的な統合を可能とすること。

提案手法

  • プライバシー制約を尊重しながらフェデレーテッドラーニングに中央集権データを統合するための3つの戦略(例の転送、勾配の転送、モデル平均化)を提案する。
  • ベースとなるFLアルゴリズムにFedAvgを採用し、同期的にデバイス内でのモデル更新と中央集権データでの学習を交互に実行する形で変更を加える。
  • 例の転送を実装する際、中央集権データの例をサンプリングし、ローカルクライアントの更新に組み込むことで、サーバーから生データが漏出しないようにする。
  • 勾配の転送を適用し、中央集権学習からのみモデル勾配を共有することで、生データの露出を最小限に抑えつつ、知識の転送を実現する。
  • モデル平均化により、フェデレーテッドラーニングから得られるグローバルモデルと中央集権で学習されたモデルを統合し、汎化性能が向上した複合モデルを生成する。
  • 微分プライバシーとフェデレーテッドプライベート生成モデルといった、さらなる機微な中央集権データの保護を目的としたプライバシー保護技術を導入する。

実験結果

リサーチクエスチョン

  • RQ1中央集権データをどのように効果的かつプライバシー保護的にフェデレーテッドラーニングに統合できるか。特に、ユーザーのプライバシーを損なわず、分布シフトを低減できるか。
  • RQ2例の転送、勾配の転送、モデル平均化のうち、どの混合戦略が下流の推論タスクにおけるモデルの精度と耐性の観点で最も優れた性能を発揮するか。
  • RQ3分散型学習データに欠落している、もしくは不均衡なデータ(例:ネガティブ例)を、中央集権データがどの程度補填できるか。
  • RQ4中央集権データの選択的フィルタリングや標的収集を、プライバシー保護の観点からフェデレーテッドデータと組み合わせることで、モデル性能を向上させられるか。
  • RQ5時間とともに変化するデバイス内データの分布を考慮した動的で継続的学習のシナリオにおいて、混合プロセスをどのように適合できるか。

主な発見

  • ハイブリッドアプローチは、学習と推論データ間の分布シフトを顕著に軽減し、特にレアクラスや代表されていないクラスの性能向上に寄与する。
  • CelebAデータセットにおいて、例の転送とモデル平均化戦略が勾配の転送を上回る最終的なモデル精度を達成しており、特に属性予測タスクで顕著である。
  • モデル平均化が、中央集権データや勾配の直接的露出を避けるため、プライバシーと性能の最良のトレードオフを達成している。
  • 例の転送により、ネガティブ例(例:笑顔でない顔)の欠落といったラベルバイアスの保持歪みが効果的に是正され、標的の中央集権例でフェデレーテッドデータが補完される。
  • 実験では、現実のユーザー行動を反映するフェデレーテッドデータと、エキスパートやレアケースを反映するキュレートされた中央集権データを組み合わせることで、推論精度と耐性が向上したモデルが得られることを示している。
  • 本フレームワークにより、安全が求められる応用分野への実用的導入が可能となり、悪天候下の運転状況などのレアだが重要なシナリオが、訓練段階でより適切に表現されるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。