Skip to main content
QUICK REVIEW

[論文レビュー] FedCorr: Multi-Stage Federated Learning for Label Noise Correction

Jingyi Xu, Zihan Chen|arXiv (Cornell University)|Apr 10, 2022
Machine Learning and Data Classification被引用数 9
ひとこと要約

FedCorr は、事前のノイズモデル仮定なしに、異種の FL 環境においてプライバシーを守りながらラベルノイズを是正するマルチステージのフェデレーテッドラーニングフレームワークである。ノイズの多いクライアントは、予測部分空間の局所的内挿次元(LID)によって動的に同定され、各サンプルの損失を用いてラベルが是正され、適応的プロキシマル正則化が適用される。CIFAR-10/100 および Clothing1M において、多様なノイズレベルとデータの非独立同分布(non-IID)条件下でも、最先端の精度を達成する。

ABSTRACT

Federated learning (FL) is a privacy-preserving distributed learning paradigm that enables clients to jointly train a global model. In real-world FL implementations, client data could have label noise, and different clients could have vastly different label noise levels. Although there exist methods in centralized learning for tackling label noise, such methods do not perform well on heterogeneous label noise in FL settings, due to the typically smaller sizes of client datasets and data privacy requirements in FL. In this paper, we propose $ exttt{FedCorr}$, a general multi-stage framework to tackle heterogeneous label noise in FL, without making any assumptions on the noise models of local clients, while still maintaining client data privacy. In particular, (1) $ exttt{FedCorr}$ dynamically identifies noisy clients by exploiting the dimensionalities of the model prediction subspaces independently measured on all clients, and then identifies incorrect labels on noisy clients based on per-sample losses. To deal with data heterogeneity and to increase training stability, we propose an adaptive local proximal regularization term that is based on estimated local noise levels. (2) We further finetune the global model on identified clean clients and correct the noisy labels for the remaining noisy clients after finetuning. (3) Finally, we apply the usual training on all clients to make full use of all local data. Experiments conducted on CIFAR-10/100 with federated synthetic label noise, and on a real-world noisy dataset, Clothing1M, demonstrate that $ exttt{FedCorr}$ is robust to label noise and substantially outperforms the state-of-the-art methods at multiple noise levels.

研究の動機と目的

  • クライアントが異なるレベルのラベルノイズを有し、データが限られている状況におけるフェデレーテッドラーニングにおける非一様ラベルノイズの課題に対処すること。
  • データプライバシーと局所データセットの小規模さのため、中央集権的なラベルノイズ是正手法を FL に適用する際の制限を克服すること。
  • 生データやモデル重みの共有なしに、クライアント自身がノイズのあるラベルを同定・是正できるプライバシーを守った手法を開発すること。
  • 動的クライアントフィルタリングと適応的正則化を統合することで、データの非独立同分布性とラベル品質の差を同時に処理すること。
  • クライアントレベルの是正とグローバルモデルのファインチューニングを組み合わせた三段階フレームワークにより、訓練の安定性とモデルの一般化性能を向上させること。

提案手法

  • グローバルモデルへのアクセスやデータ共有を必要とせず、モデル予測部分空間の局所的内挿次元(LID)を用いて、ノイズの多いクライアントを動的に同定する。
  • ノイズの多いクライアントとして同定された各クライアントについて、各サンプルの訓練損失を計算し、グローバルモデルの予測を用いて高損失サンプルのラベルを再割り当てすることで、誤ってラベル付けされたデータを是正する。
  • 推定された局所的ノイズレベルに重み付けされた適応的ローカルプロキシマル正則化項を導入し、訓練の安定性を高め、ノイズの多いクライアントの影響を低減する。
  • 三段階の訓練プロセスを適用する:(1) ノイズの多いクライアントを検出するための分率スケジューリングによる事前処理、(2) クリーンなクライアントでのファインチューニングとノイズの多いクライアントでのラベル是正、(3) すべてのクライアントに対して標準的な FL 訓練を実施する。
  • 生データや特徴表現の交換を避けて、スカラーライクな LID スコアとモデル更新のみを送信することで、クライアントのデータプライバシーを維持する。
  • ラベル是正の初期段階でノイズが注入されるのを防ぐために、是正の前段階として FedAvg を用いたウォームアップフェーズを実施する。

実験結果

リサーチクエスチョン

  • RQ1事前のノイズモデル仮定なしに、異なるノイズレベルを持つクライアントにおいて、フェデレーテッドラーニングフレームワークがラベルノイズを効果的に同定・是正できるか?
  • RQ2FL において、クライアントが機密データやモデルパラメータを露呈せずに、どのようにしてプライバシーを守った形でラベル是正を実施できるか?
  • RQ3推定された局所的ノイズレベルに基づく適応的プロキシマル正則化は、異種の FL 環境において訓練の安定性と収束性をどの程度向上させるか?
  • RQ4FedCorr のマルチステージ設計は、高レベルのラベルノイズとデータの不均衡に対して、エンドツーエンドの FL 手法と比較してどの程度の耐性を示すか?
  • RQ5CIFAR-10 と CIFAR-100 における非独立同分布(non-IID)データ分布下でも、特に実世界のノイズのあるデータセット(例:Clothing1M)において、FedCorr は高いパフォーマンスを維持できるか?

主な発見

  • 合成ラベルノイズを伴う CIFAR-10 および CIFAR-100 において、FedCorr はすべてのベースライン、特に高ノイズレベル(例:ρ=0.8)で中央集権的手法(DivideMix や JointOpt)を上回る最先端のテスト精度を達成する。
  • ρ=0.8 および τ=0.5 の CIFAR-10 において、FedCorr は 87.86% ± 0.53 の精度を達成し、中央集権的性能(91.34% ± 0.39)の 4% 内で収束する。これは、非常に高い耐性を示している。
  • CIFAR-10 の非 IID 環境において、すべての (p, α_Dir) の設定で、FedCorr はすべてのベースラインを少なくとも 7% 以上上回る。これは、データの非独立同分布性下でも優れた一般化性能を示している。
  • 実世界のノイズのあるデータセット Clothing1M において、FedCorr は FL 環境で最高のテスト精度を達成し、JointOpt の報告された中央集権的精度をも上回っている。
  • アブレーションスタディの結果、分率スケジューリングがパフォーマンスに最も大きな正の影響を及ぼしており、最適な精度はノイズがゼロでない中程度のノイズレベル(例:ρ=0.4)で達成される。これは是正によるノイズの増幅のためである。
  • FedCorr を他の FL 手法(例:FedAvg や FedProx)と組み合わせることで、CIFAR-10/100 における複数のノイズ比において、一貫的かつ顕著な精度向上が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。