Skip to main content
QUICK REVIEW

[論文レビュー] A Principled Approach to Data Valuation for Federated Learning

Tianhao Wang, Johannes Rausch|arXiv (Cornell University)|Sep 14, 2020
Privacy-Preserving Technologies in Data参考文献 24被引用数 16
ひとこと要約

本稿では、フェデレーテッド・シャープレー値(federated SV)を提案する。これは、フェデレーテッド・ラーニングに特化した通信効率的で順序に配慮したシャープレー値の変種であり、追加の通信を伴わずにローカルモデル更新からの寄与度を計算することで、公平なデータバリュエーションを実現する。バックドア検出、ノイズの多いラベルの同定、効率的なトレーニングのためのデータ要約のタスクにおいて、ベースラインを上回る性能を示す。

ABSTRACT

Federated learning (FL) is a popular technique to train machine learning (ML) models on decentralized data sources. In order to sustain long-term participation of data owners, it is important to fairly appraise each data source and compensate data owners for their contribution to the training process. The Shapley value (SV) defines a unique payoff scheme that satisfies many desiderata for a data value notion. It has been increasingly used for valuing training data in centralized learning. However, computing the SV requires exhaustively evaluating the model performance on every subset of data sources, which incurs prohibitive communication cost in the federated setting. Besides, the canonical SV ignores the order of data sources during training, which conflicts with the sequential nature of FL. This paper proposes a variant of the SV amenable to FL, which we call the federated Shapley value. The federated SV preserves the desirable properties of the canonical SV while it can be calculated without incurring extra communication cost and is also able to capture the effect of participation order on data value. We conduct a thorough empirical study of the federated SV on a range of tasks, including noisy label detection, adversarial participant detection, and data summarization on different benchmark datasets, and demonstrate that it can reflect the real utility of data sources for FL and has the potential to enhance system robustness, security, and efficiency. We also report and analyze "failure cases" and hope to stimulate future research.

研究の動機と目的

  • 参加順序を考慮した、フェデレーテッド・ラーニングに適した原理的で通信効率的なデータバリュエーション手法の欠如に対処すること。
  • 公平性と望ましい公理的性質で知られるシャープレー値を、分散型で逐次的なフェデレーテッド・ラーニングの性質に適合させること。
  • 標準的なトレーニングに追加の通信コストを負担せずに、実用的なフェデレーテッド・ラーニングにおけるデータバリュエーションを可能にすること。
  • フェデレーテッド・SVの実用的有効性を、バックドア検出、ノイズの多いラベルの同定、データ要約といった実世界のタスクで評価すること。
  • 今後のフェデレーテッド・ラーニングにおけるデータバリュエーション研究を指向するため、限界や失敗事例を同定すること。

提案手法

  • フェデレーテッド・ラーニングにおける参加者貢献の逐次的順序を尊重する、標準シャープレー値の変種としてフェデレーテッド・シャープレー値を提案する。
  • 各トレーニングラウンドのローカルモデル更新を用いてフェデレーテッド・SVを計算し、既存のトレーニング信号を活用することで追加通信を回避する。
  • 大規模なフェデレーテッド・ラーニングにおいて計算コストを顕著に削減するため、モンテカルロ近似法を用いてフェデレーテッド・SVを効率的に推定する。
  • 参加者の更新後にグローバルモデルの性能向上を測定することで、参加順序に従ったマージナル寄与度を推定する。
  • 非IID設定におけるデータ価値分布の歪みに対して耐性を高めるために、正規化技術を適用する。
  • 制御されたデータ汚染および選択戦略を用いて、複数のタスクで実世界のベンチマークデータセット(MNIST、CIFAR-10)を用いて手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1フェデレーテッド・ラーニングに適した、データ貢献の逐次的順序を考慮した原理的データバリュエーション手法を設計可能か?
  • RQ2追加の通信コストを負担せずに、シャープレー値をフェデレーテッド・ラーニングに適合可能か?
  • RQ3フェデレーテッド・シャープレー値は、バックドアやノイズの多いラベルの検出において、データソースの真の価値をどれほど的確に反映するか?
  • RQ4フェデレーテッド・SVを用いたデータ要約は、ランダム選択やLOOベースの選択と比較して、トレーニング効率とモデル精度を向上させるか?
  • RQ5非IIDまたは極めて歪んだデータ設定において、フェデレーテッド・SVの限界や失敗事例は何か?

主な発見

  • フェデレーテッド・SVは、特に非IID設定において、フェデレーテッド・LOOを上回るバックドア検出性能を示し、正規化されたバージョンでは顕著に高い成功率を達成した。
  • MNIST(IID)では、フェデレーテッド・SVに基づくデータ要約が、ランダムおよびLOOベースラインを上回る高いテスト精度を達成し、モデル効率性の有効性を示した。
  • 非IID設定では、頻繁に選択された参加者にバイアスが生じ、低排除率の状況ではLOOよりも性能が低かった。
  • CIFAR-10では、MNISTよりもフェデレーテッド・SVの性能が低く、データセット内の再冗長性が低いため、価値のある参加者の喪失がより大きな影響を及ぼしたと考えられる。
  • 非IID設定では、選択頻度が低い参加者に対してフェデレーテッド・SVの値が負になる傾向があり、価値推定にバイアスが生じる可能性があることが示された。
  • 本研究では、非IID状況における価値分布の歪みといった主要な失敗事例を同定し、今後の研究における耐障害性の高い正規化および推定技術の開発を要請した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。