Skip to main content
QUICK REVIEW

[論文レビュー] SelfFed: Self-Supervised Federated Learning for Data Heterogeneity and Label Scarcity in Medical Images

Sunder Ali Khowaja, Kapal Dev|arXiv (Cornell University)|Jul 4, 2023
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本論文は、医療情報のインターネット(IoMT)におけるデータの非同一性とラベル不足の問題に対処する自己教師ありフェデレーテッドラーニングフレームワーク、SelfFedを提案する。2段階のアプローチを採用:まず、Swin変換器を用いたマスク付き自己符号化による事前学習でデータの非同一性に対処し、次に、ラベル不足を緩和するための新しい集約戦略を用いた対照的微調整を実施。非IIDデータにおいて最大8.8%の精度向上を達成し、ラベルデータがたった10%の状況でもベースラインを上回る性能を示した。

ABSTRACT

Self-supervised learning in the federated learning paradigm has been gaining a lot of interest both in industry and research due to the collaborative learning capability on unlabeled yet isolated data. However, self-supervised based federated learning strategies suffer from performance degradation due to label scarcity and diverse data distributions, i.e., data heterogeneity. In this paper, we propose the SelfFed framework for medical images to overcome data heterogeneity and label scarcity issues. The first phase of the SelfFed framework helps to overcome the data heterogeneity issue by leveraging the pre-training paradigm that performs augmentative modeling using Swin Transformer-based encoder in a decentralized manner. The label scarcity issue is addressed by fine-tuning paradigm that introduces a contrastive network and a novel aggregation strategy. We perform our experimental analysis on publicly available medical imaging datasets to show that SelfFed performs better when compared to existing baselines and works. Our method achieves a maximum improvement of 8.8% and 4.1% on Retina and COVID-FL datasets on non-IID datasets. Further, our proposed method outperforms existing baselines even when trained on a few (10%) labeled instances.

研究の動機と目的

  • IoMTの文脈における医療画像のフェデレーテッドラーニングにおいて、データの非同一性とラベル不足の二重の課題に取り組む。
  • データ分布の偏りにより伝統的なFL手法が失敗する非IIDデータ環境における性能低下を克服する。
  • 大規模なラベル付きデータセットへの依存を減らし、分散型のアプローチで限られたラベルデータを効果的に活用する。
  • 多様で分散型の医療画像クライアント間でモデル性能を維持する、耐障害性とプライバシー保護を兼ね備えたフレームワークを構築する。
  • 自己教師あり事前学習と対照的微調整、適応的集約を統合することで、フェデレーテッド医療AIの一般化性能と収束性を向上させる。

提案手法

  • 2段階のSelfFedフレームワークを提案:(1) サイニ・トランスフォーマーのエンコーダーを用いたマスク付き自己符号化(MAE)による事前学習で、分散型の方法で強固な表現を学習する。
  • 事前学習段階で16x16の画像パッチの60%にアググメンテーションマスクを適用し、強固な特徴学習を促進する。
  • 微調整段階で、同一入力の2つのビューから学習する対照的ネットワークを導入し、ラベル不足下での表現品質を向上させる。
  • 微調整中に複数回参加するクライアントの重みを低減する新しいクライアント集約戦略を設計し、過学習クライアントによるバイアスを軽減する。
  • 事前学習および微調整の両段階でAdamW最適化法を用い、コサインスケジューリングとウォームアップを適用し、フェデレーテッドおよび集中型学習の両方で一貫したハイパーパrameterを維持する。
  • クライアントが局所的に学習し、更新された重みをサーバーに送信して集約するグローバルモデル集約プロトコルを採用し、データプライバシーを保持する。

実験結果

リサーチクエスチョン

  • RQ1マスク付き自己符号化による自己教師あり事前学習は、フェデレーテッド医療画像学習におけるデータ非同一性に起因する性能低下を緩和できるか?
  • RQ2提案された対照的微調整と新しい集約戦略は、非IID環境下でのラベル不足状況で性能をどのように向上させるか?
  • RQ3限られたラベルデータで微調整された際、SelfFedはImageNet事前学習モデル(例:ViT、BEiT、MAE)を上回る性能を示せるか、その程度は?
  • RQ4非IIDおよびIIDのデータ分布において、ラベルデータの10%のみで学習した場合、提案フレームワークは耐障害性と一貫性を維持できるか?
  • RQ5新規集約戦略は、微調整中に頻繁に参加するクライアントの影響を効果的に低減でき、モデルの公平性と収束性を向上させられるか?

主な発見

  • 非IIDデータ条件下で、RetinaデータセットではImageNet事前学習ベースライン比で最大8.8%の精度向上、COVID-FLデータセットでは4.1%の向上を達成した。
  • ラベルデータがたった10%の状況でも、IIDおよび非IID両環境において、100%のラベルデータで学習したベースラインを上回った。
  • 提案されたSelfFed-MAE事前学習段階は、データ非同一性に起因する性能低下を顕著に低減し、スクラッチから訓練したSwin変換器やImageNet事前学習モデルを上回った。
  • 新しい集約戦略を用いた対照的微調整は、頻繁に参加するクライアントの影響を効果的に緩和し、モデルの安定性と公平性を向上させた。
  • CXR14データセットでは、事前学習済みのViT、BEiT、MAEモデルと比較して、SelfFedが優れた性能を維持した。これは、多様な医療画像ベンチマークにわたる耐障害性を裏付けた。
  • 複数のデータセットおよび設定において一貫した性能を示し、限られたラベルと非同一データを伴う実世界のIoMTシナリオにおける有効性を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。