Skip to main content
QUICK REVIEW

[論文レビュー] Federated Learning from Only Unlabeled Data with Class-Conditional-Sharing Clients

N. Lu, Zhao Wang|arXiv (Cornell University)|Apr 7, 2022
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本稿では、クライアント間でのクラス事前分布のずれを活用することで、ラベルなしデータのみを用いて教師あり分類器を訓練できる新しいフェデレーテッドラーニングフレームワーク、FedULを提案する。クラス条件付き共有を用いてラベルなしデータをサーヴィレートラベル付きデータに変換し、固定された遷移層を組み込むことで、最適モデルへの理論的収束を保証する。FedULは、ベンチマークおよび実世界の医療画像データセットにおいて、既存の非教師ありFLベースラインを著しく上回る最先端の性能を達成する。

ABSTRACT

Supervised federated learning (FL) enables multiple clients to share the trained model without sharing their labeled data. However, potential clients might even be reluctant to label their own data, which could limit the applicability of FL in practice. In this paper, we show the possibility of unsupervised FL whose model is still a classifier for predicting class labels, if the class-prior probabilities are shifted while the class-conditional distributions are shared among the unlabeled data owned by the clients. We propose federation of unsupervised learning (FedUL), where the unlabeled data are transformed into surrogate labeled data for each of the clients, a modified model is trained by supervised FL, and the wanted model is recovered from the modified model. FedUL is a very general solution to unsupervised FL: it is compatible with many supervised FL methods, and the recovery of the wanted model can be theoretically guaranteed as if the data have been labeled. Experiments on benchmark and real-world datasets demonstrate the effectiveness of FedUL. Code is available at https://github.com/lunanbit/FedUL.

研究の動機と目的

  • 高コストなラベル付けやプライバシー制約のため、クライアントにラベルなしデータしか入手できない状況下で、正確な分類器を訓練する課題に対処すること。
  • 真のラベルが存在しない状況でも動作可能であり、既存の教師ありFL手法と互換性を持つ汎用的ソリューションを開発すること。
  • やや弱い分布的仮定の下で、ラベルなしデータから最適なグローバルモデルを理論的に回復できることを保証すること。
  • ラベル付けが高価または制限されている実世界の医療画像データセットにおいて、実験的に有効性を示すこと。

提案手法

  • 各クライアントのラベルなしデータを、各データサブセットのインデックスを一時的ラベルとして扱うことで、サーヴィレートラベル付きデータに変換する。
  • モデル出力に、クライアント固有の固定された遷移層を導入し、サーヴィレートクラス後抽層確率を真のクラス後抽層確率に変換する。
  • クライアントが把握しているクラス事前確率を用いて、モデルの忠実性を保つように単射的遷移関数を定義する。
  • 標準的な教師ありFLアルゴリズム(例:FedAvg)をサーヴィレートタスクに適用し、クライアント間でのモデル集約を可能にする。
  • 遷移層の逆関数を用いて、サーヴィレートモデルから最終的な分類器を回復させ、真のモデルへの理論的収束を保証する。
  • 遷移層を固定・学習しないことで、追加のハイパーパramータチューニングを回避し、計算効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1クライアントにラベルなしデータしか存在しない状況で、フェデレーテッドラーニングにおいて教師あり分類器を訓練できるか?
  • RQ2どのような分布的仮定のもとで、ラベルなしデータから最適グローバルモデルを回復できるか?
  • RQ3FedULは、ラベル付きデータを用いた教師ありFLと同等の性能を達成しながら、プライバシーを保護できるか?
  • RQ4データの非独立同分布性が変動する条件下でも、FedULは既存の非教師ありFLベースラインと比較して、精度およびロバスト性に優れているか?
  • RQ5FedULは、ラベル付けが困難または制限される実世界のデータ感受性分野(例:医療分野)に適用可能で有効であるか?

主な発見

  • RSNA頭部画像内出血検出データセットにおいて、FedULはFedPL、FedLLP、FedLLP-VATを常に上回り、48 Uセットの病院間で平均正解率31.55%(±0.58)を達成した。これに対してFedPLは31.44%であった。
  • CIFAR-100データセットにおいて、FedULはテスト正解率31.48%(±2.25)を達成し、同じ設定下でFedPL(31.44%)とFedLLP(30.99%)を著しく上回った。
  • FedULは、ラベル付きデータの10%のみを用いた教師ありFedAvgベースライン(正解率46.79%)と同等の性能を達成しており、優れたラベル効率性を示した。
  • M=12、24、48の異なる数のラベルなしデータセットに対して、FedULはベースラインを常に上回る一貫した性能向上を示した。
  • 理論的分析により、クラス事前確率が既知であり、クラス条件付き分布が共有されているというやや弱い条件下で、FedULから回復されたモデルが、完全にラベル付きデータで訓練された最適モデルに収束することが保証された。
  • 実世界の医療画像データに対する実験結果から、FedULがラベル付けが高価または制限されるプライバシー感受性分野における実用的妥当性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。