Skip to main content
QUICK REVIEW

[論文レビュー] RSCFed: Random Sampling Consensus Federated Semi-supervised Learning

Xiaoxiao Liang, Yiqun Lin|arXiv (Cornell University)|Mar 26, 2022
Privacy-Preserving Technologies in Data被引用数 9
ひとこと要約

RSCFedは、クライアントに対してランダムサブサンプリングを施し、複数のサブコンSENSUSモデルを蒸留した後、距離に基づいた重み付けによる集約を行うことで、Non-IID環境下でのロバスト性を向上させる、画期的なフェデレーテッド半教師あり学習フレームワークを提案する。ベンチマークデータセット上では、正解率で最大3.98%、AUCで最大3.5%の性能向上を達成し、特にラベルなしクライアントの割合が高い状況でも顕著な性能を示す。

ABSTRACT

Federated semi-supervised learning (FSSL) aims to derive a global model by training fully-labeled and fully-unlabeled clients or training partially labeled clients. The existing approaches work well when local clients have independent and identically distributed (IID) data but fail to generalize to a more practical FSSL setting, i.e., Non-IID setting. In this paper, we present a Random Sampling Consensus Federated learning, namely RSCFed, by considering the uneven reliability among models from fully-labeled clients, fully-unlabeled clients or partially labeled clients. Our key motivation is that given models with large deviations from either labeled clients or unlabeled clients, the consensus could be reached by performing random sub-sampling over clients. To achieve it, instead of directly aggregating local models, we first distill several sub-consensus models by random sub-sampling over clients and then aggregating the sub-consensus models to the global model. To enhance the robustness of sub-consensus models, we also develop a novel distance-reweighted model aggregation method. Experimental results show that our method outperforms state-of-the-art methods on three benchmarked datasets, including both natural and medical images. The code is available at https://github.com/XMed-Lab/RSCFed.

研究の動機と目的

  • ラベルあり・ラベルなしクライアントの両方が不均一なモデル信頼性を示すNon-IIDデータ環境下で、既存のフェデレーテッド半教師あり学習(FSSL)手法の一般化性能の低さを是正すること。
  • 共有相関行列や等重み集約に依存することを排除し、異種データ環境下で情報漏洩やモデル劣化のリスクを低減すること。
  • サブコンセンサスモデルとの距離に基づいて動的に重み付けを行うことで、モデルの安定性を向上させる、ロバストな集約メカニズムの開発。
  • ラベルあり/ラベルなしクライアントの比率や通信コスト制約の変動を想定した評価を通じて、実用的導入可能性を確保すること。

提案手法

  • RSCFedは、各FL同期ラウンドにおいて、ローカルクライアントに対して複数回にわたるランダムサブサンプリングを実行し、異なるサブコンセンサスモデルを生成する。
  • 各サブコンセンサスモデルは、ランダムに選択されたローカルモデルのサブセットの重みを平均化することで形成され、クライアントサブセットからのコンセンサスを模倣する。
  • 距離に基づいた重み付けによるモデル集約(DMA)モジュールは、現在のサブコンセンサスモデルに近いローカルモデルに高い重みを割り当て、ロバスト性を向上させる。
  • 最終的なグローバルモデルは、DMAによる重み付けスキームを用いてすべてのサブコンセンサスモデルを集約することで更新され、信頼性の低いまたは外れ値の影響を低減する。
  • 本手法は、クライアント間で機微な情報を共有しないため、プライバシー保護が保たれ、情報漏洩のリスクを回避する。
  • ハイパーパrameterであるM(サブサンプリング回数)とK(各サブサンプルのクライアント数)は経験的に調整され、M=3とK=5が最適な性能を示した。

実験結果

リサーチクエスチョン

  • RQ1クライアントに対してランダムサブサンプリングを施すことで、Non-IIDフェデレーテッド半教師あり学習におけるモデルコンセンサスとロバスト性が向上するか?
  • RQ2距離に基づいた重み付けによる集約は、均一またはヒューリスティックな重み付けと比較して、サブコンセンサスモデルの品質をどのように向上させるか?
  • RQ3既存手法が劣化する高比率のラベルなしクライアント環境下でも、RSCFedは優れた性能を維持できるか?
  • RQ4サブサンプリング操作に伴う通信コストはどのようにスケーリングされるか?また、通信コストを削減した状況下でも、RSCFedはベースラインを上回る性能を示せるか?

主な発見

  • ISIC 2018データセット(15クライアント)において、RSCFedは70.26%のテスト正解率と95.5%のAUCを達成し、ラベルなしクライアント比率が高い状況下でFed-Consist [28] より正解率で3.98%、AUCで3.5%高い性能を示した。
  • 10クライアント(2ラベルあり、8ラベルなし)の設定下で、RSCFedはFedIRM [21] より正解率で1.13%、AUCで0.3%、精度で0.86%、再現率で2.86%の向上を達成した。
  • Fed-Consist [28] の通信コストの0.8倍の通信量でも、RSCFedはより高い正解率とAUCを達成しており、帯域制限下でも効率的でロバストであることが示された。
  • アブレーションスタディの結果、MおよびKの異なる値に対しても性能低下が最小限に抑えられ、RSCFedがハイパーパrameterの選択に対して安定かつ不感であることが示された。
  • 距離に基づいた重み付けによる集約メカニズムは、あらゆるデータセットおよび設定で一貫した性能向上を示しており、サブコンセンサス品質の顕著な向上が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。