Skip to main content
QUICK REVIEW

[論文レビュー] FedSEAL: Semi-Supervised Federated Learning with Self-Ensemble Learning and Negative Learning

Jieming Bian, Zhu Fu|arXiv (Cornell University)|Oct 15, 2021
Privacy-Preserving Technologies in Data参考文献 29被引用数 5
ひとこと要約

FedSEALは、自己アンサンブル学習とネガティブ学習を活用することで、ラベルなしクライアントデータと限られたラベル付きサーバーデータを効果的に活用し、モデルの精度を向上させる、画期的な半教師付きフェデレーテッドラーニングフレームワークを提案する。動的信頼度しきい値と補完的ラベリングにより、不安定な教師なし学習を安定化・強化することで、特に初期学習ラウンドにおいて最先端の手法を大きく上回る性能を発揮する。

ABSTRACT

Federated learning (FL), a popular decentralized and privacy-preserving machine learning (FL) framework, has received extensive research attention in recent years. The majority of existing works focus on supervised learning (SL) problems where it is assumed that clients carry labeled datasets while the server has no data. However, in realistic scenarios, clients are often unable to label their data due to the lack of expertise and motivation while the server may host a small amount of labeled data. How to reasonably utilize the server labeled data and the clients' unlabeled data is thus of paramount practical importance. In this paper, we propose a new FL algorithm, called FedSEAL, to solve this Semi-Supervised Federated Learning (SSFL) problem. Our algorithm utilizes self-ensemble learning and complementary negative learning to enhance both the accuracy and the efficiency of clients' unsupervised learning on unlabeled data, and orchestrates the model training on both the server side and the clients' side. Our experimental results on Fashion-MNIST and CIFAR10 datasets in the SSFL setting validate the effectiveness of our method, which outperforms the state-of-the-art SSFL methods by a large margin.

研究の動機と目的

  • クライアントがラベルなしデータを保有し、サーバーが少量のラベル付きデータを保持するという実用的課題に、半教師付きフェデレーテッドラーニングの枠組みで対処すること。
  • 分散型のFLの性質とデータの非同一性に起因する教師なし学習における誤差蓄積の困難を克服すること。
  • サーバーのラベル付きデータを用いた教師あり学習とクライントのラベルなしデータを用いた教師なし学習を統合することで、モデルの汎化性能と学習の安定性を向上させること。
  • プライバシーと分散性を維持したまま、大量のラベルなしクライントデータを効果的に活用する手法を開発すること。
  • 既存のSSFLベースライン、特にサーバーデータに対する単純な教師あり学習をわずかに上回る手法に対比して、優れた性能を達成すること。

提案手法

  • 各クライントで履歴モデルアンサンブルを維持し、ラベルなしデータの平均信頼度スコアを計算することで、自己アンサンブル学習を実装する。
  • サーバーが設定する信頼度スコアしきい値を用いて、高品質な偽ラベル付きインスタンスをフィルタリングし、教師あり学習用のポジティブフィルタードデータセットを構築する。
  • ラベルなしデータに補完的ラベルを割り当てることでネガティブ学習を導入し、初期学習段階の安定性を高める。
  • クラスごとの動的信頼度しきい値を実装し、クラス別信頼度分布に応じて適応的に調整することで、データセットの不均衡を軽減し、ノイズの多い偽ラベルを削減する。
  • 交互に学習を実行する:サーバーではラベル付きデータを用いた教師あり学習、クライントではポジティブおよびネガティブフィルタードデータセットを用いた教師なし学習を実施する。
  • 一貫性正則化と偽ラベル付けを適用することで、初期学習ラウンドにおける汎化性能の向上と誤り伝搬の低減を実現する。

実験結果

リサーチクエスチョン

  • RQ1自己アンサンブル学習により、モデルアンサンブルを活用することで、半教師付きフェデレーテッドラーニングにおける偽ラベルの品質が向上するか?
  • RQ2補完的ラベルを用いたネガティブ学習は、フェデレーテッドラーニングの初期段階における訓練の安定性と性能をどのように向上させるか?
  • RQ3固定しきい値(例:0.9 や 0.5)と比較して、クラスごとの動的信頼度しきい値は、データ不均衡の緩和とノイズの多い偽ラベルの低減にどの程度効果を発揮するか?
  • RQ4サーバーに少量のラベル付きデータしか存在しない状況でも、FedSEALは既存のSSFL手法を顕著に上回る性能を発揮できるか?
  • RQ5自己アンサンブルとネガティブ学習の統合は、CIFAR10 や Fashion-MNIST といった実世界のデータセットにおいて、収束速度と最終的な精度にどのように影響を与えるか?

主な発見

  • CIFAR10では、FedMatch(修正済み)および FedRGD を大きく上回り、データ拡張なしのサーバー単体の教師あり学習(Server-SL)ベースラインをも凌駆する。
  • Fashion-MNISTでは、自己アンサンブル学習を有するFedSEALは、それを無しとした場合よりも収束が早く、より高いテスト精度を達成しており、アンサンブルベースのフィルタリングの有効性を示している。
  • ポジティブフィルタードデータセットにおける正しい偽ラベルの割合は、ネガティブデータセットにおける補完的ラベルの割合よりも顕著に低いことが確認され、初期学習段階の安定化のためのネガティブ学習の必要性が裏付けられた。
  • クラスごとの動的信頼度しきい値は、固定しきい値(例:0.9 や 0.5)が低信頼度クラスに対して不十分なフィルタリングを引き起こすのを防ぎ、フィルタードデータセットにおける深刻なクラス不均衡を回避する。
  • 自己アンサンブル学習の導入により、フィルタードデータセット内の高品質な偽ラベルインスタンスの数が増加し、収束が速くなり、汎化性能が向上する。
  • サーバーに1,000件のラベル付きインスタンスしか存在しない状況でも、FedSEALは優れた性能を発揮しており、低データレジームにおいてもクライントのラベルなしデータを効果的に活用できる能力を証明している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。