Skip to main content
QUICK REVIEW

[論文レビュー] L-DAWA: Layer-wise Divergence Aware Weight Aggregation in Federated Self-Supervised Visual Representation Learning

Yasar Abbas Ur Rehman, Yan Gao|arXiv (Cornell University)|Jul 14, 2023
Privacy-Preserving Technologies in Data被引用数 6
ひとこと要約

本論文は、フェデレーテッド自己教師付き視覚表現学習における階層的分散に気づいた集約手法L-DAWAを提案する。L-DAWAは、各層におけるクライアントモデルとグローバルモデル間の角度的分散に基づいてモデル更新を重み付けすることで、クライアントバイアスを低減する。本手法は、コントラスト型および非コントラスト型SSL手法を用いて、CIFAR-10/100およびTiny ImageNetにおいて、クロスシロおよびクロスデバイス設定で、新たなSOTA性能を達成した。

ABSTRACT

The ubiquity of camera-enabled devices has led to large amounts of unlabeled image data being produced at the edge. The integration of self-supervised learning (SSL) and federated learning (FL) into one coherent system can potentially offer data privacy guarantees while also advancing the quality and robustness of the learned visual representations without needing to move data around. However, client bias and divergence during FL aggregation caused by data heterogeneity limits the performance of learned visual representations on downstream tasks. In this paper, we propose a new aggregation strategy termed Layer-wise Divergence Aware Weight Aggregation (L-DAWA) to mitigate the influence of client bias and divergence during FL aggregation. The proposed method aggregates weights at the layer-level according to the measure of angular divergence between the clients' model and the global model. Extensive experiments with cross-silo and cross-device settings on CIFAR-10/100 and Tiny ImageNet datasets demonstrate that our methods are effective and obtain new SOTA performance on both contrastive and non-contrastive SSL approaches.

研究の動機と目的

  • データの非IID性および非IIDデータ分布に起因するフェデレーテッド自己教師付き学習(F-SSL)におけるクライアントバイアスとモデル分散を是正すること。
  • FedAvgがデータ量に依存し、階層レベルの感度に欠けることによる、F-SSLにおけるグローバルモデルの性能劣化を緩和すること。
  • モデル集約に階層的分散測定を組み込むことで、下流タスクの性能を向上させること。
  • コントラスト型および非コントラスト型SSL手法を用いて、クロスシロおよびクロスデバイスFL設定でSOTAの結果を達成すること。

提案手法

  • L-DAWAは、各クライアントのモデル層とグローバルモデルの対応する層との間の角度的分散を計算し、階層的非同一性を定量化する。
  • 角度的分散に基づいて、各クライアントのモデル層に適応的な重みを割り当て、乖離またはバイアスの強いクライアントの影響を低減する。
  • 各層のグローバルモデルが、対応するクライアント層の重み付き平均として更新される階層レベルの集約を実行する。
  • 重み付け戦略は、角度的分散が小さいクライアントを優遇することで、より安定的かつ代表的なグローバルモデルの更新を保証する。
  • L-DAWAは、既存の集約戦略(FedAvg、Loss、FedU)と互換性があり、プラグイン型の強化として統合可能である。
  • 本手法は、複数のSSL手法(SimCLR、Barlow Twinsなど)およびデータセット(CIFAR-10/100、Tiny ImageNet)を対象とし、クロスシロおよびクロスデバイスFL設定の両方で評価されている。

実験結果

リサーチクエスチョン

  • RQ1階層的角分散は、フェデレーテッド自己教師付き学習におけるモデル集約にどのように影響するか?
  • RQ2階層的分散に基づいてクライアントモデル更新を重み付けすることで、クライアントバイアスを低減し、グローバルモデルの性能を向上させることができるか?
  • RQ3L-DAWAは、クロスシロおよびクロスデバイスFL設定において、異なるSSL手法でFedAvg、Loss、FedUを上回る性能を示すか?
  • RQ4L-DAWAは、データの非IID性の度合いや下流の転移学習タスクの変動にどのように一般化するか?

主な発見

  • クロスシロ設定下で、CIFAR-10において高非IID条件(α=0.1)の下で、SimCLRにおけるL-DAWAはFedAvg比で9.37%の性能向上を達成した。
  • Tiny ImageNetのクロスシロ設定において、L-DAWAはCIFAR-10で81.87%、CIFAR-100で57.81%の精度を達成し、FedAvgよりそれぞれ4.4%および5.7%高い性能を示した。
  • クロスデバイス設定では、SimCLRを用いてTiny ImageNetでL-DAWAが37.72%の精度を達成し、同条件でFedAvg(32.92%)より4.8%高い性能を示した。
  • L-DAWAをFedAvg、Loss、FedUと統合することで一貫した性能向上が得られ、L-DAWA Lossはクロスデバイス設定でCIFAR-10で68.79%、CIFAR-100で61.36%の精度を達成した。
  • L-DAWAは、非IID度合いの異なる条件においても頑健であることが示され、α=0.2でピーク性能を示しており、クラス分布とラベルの不均衡が非IID特性に影響を与えることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。