Skip to main content
QUICK REVIEW

[論文レビュー] Communication-Efficient Federated Distillation with Active Data Sampling

Lumin Liu, Jun Zhang|arXiv (Cornell University)|Mar 14, 2022
Privacy-Preserving Technologies in Data被引用数 5
ひとこと要約

本稿では、公開の補助データセットから低エントロピーのログチを選択的にアップロードすることで通信コストを削減する、通信効率の高いフェデレーテッドラーニングフレームワークであるFederated Distillation with Active Data Sampling (FAS)を提案する。エントロピーに基づくサンプリングとランダムサンプリングを組み合わせることで、非i.i.d.データおよび異種アーキテクチャ下でもモデルの精度を向上させ、極端なデータ偏り下でベースライン手法を最大10%上回るテスト精度を達成する。

ABSTRACT

Federated learning (FL) is a promising paradigm to enable privacy-preserving deep learning from distributed data. Most previous works are based on federated average (FedAvg), which, however, faces several critical issues, including a high communication overhead and the difficulty in dealing with heterogeneous model architectures. Federated Distillation (FD) is a recently proposed alternative to enable communication-efficient and robust FL, which achieves orders of magnitude reduction of the communication overhead compared with FedAvg and is flexible to handle heterogeneous models at the clients. However, so far there is no unified algorithmic framework or theoretical analysis for FD-based methods. In this paper, we first present a generic meta-algorithm for FD and investigate the influence of key parameters through empirical experiments. Then, we verify the empirical observations theoretically. Based on the empirical results and theory, we propose a communication-efficient FD algorithm with active data sampling to improve the model performance and reduce the communication overhead. Empirical simulations on benchmark datasets will demonstrate that our proposed algorithm effectively and significantly reduces the communication overhead while achieving a satisfactory performance.

研究の動機と目的

  • フェデレーテッドラーニングにおける高い通信オーバーヘッドとモデルの異種性、特に非i.i.d.データ設定下での課題に対処すること。
  • 補助データ分布やログチ集約の主要なコンポonentを体系的に分析できる統一的フレームワークを、フェデレーテッドディスティルレーション(FD)に提供すること。
  • ログチエントロピーとディスティルレーションセットサイズといった主要パラメータの実験的および理論的分析を通じて、FDのための設計原則を同定すること。
  • 帯域制限および異種クライアントモデル下でも性能を向上させる、新たな通信効率の良いFDアルゴリズムを提案すること。

提案手法

  • 既存のFD手法を統合し、パrameterの体系的分析を可能にする汎用的なメタアルゴリズムを、フェデレーテッドディスティルレーション(FD)に提案する。
  • 混合アクティブデータサンプリング戦略を導入:アップロードされるログチの半分はエントロピーが低い順(信頼性)で選択され、残り半分はランダムにサンプリングされ、探索と活用のバランスを取る。
  • 公開のラベルなし補助データセットを用いて、ローカルモデルによる疑似ラベルを生成することで、クライアントの生データを共有せずにディスティルレーションを実現する。
  • サーバー側でクライアントが提供するログチを集約し、グローバルモデルを更新する。この際、モデル重みではなくソフトラベル(ログチ)に基づく知識移行が行われる。
  • 二値分類問題にGaussian混合モデルを適用した理論的分析により、低ログチエントロピーと大きなディスティルレーションセットサイズの重要性を裏付ける。
  • 20台のクライアントがそれぞれ1,000件のプライベートサンプルを保持するCIFAR-10でResNet-8を用い、20ラウンドの通信において2,000~8,000件の公開サンプルを用いてディスティルレーションを実施する。

実験結果

リサーチクエスチョン

  • RQ1補助ディスティルレーションデータセットの分布は、フェデレーテッドディスティルレーションの性能にどのように影響するか?
  • RQ2ログチ集約戦略とログチエントロピーは、FDにおけるモデル収束と精度にどのような影響を与えるか?
  • RQ3アップロードされるログチのサイズは、通信効率と学習性能にどのように影響するか?
  • RQ4低エントロピーとランダムサンプリングを組み合わせたアクティブデータサンプリングは、非i.i.d.データ下での一般化を向上させることができるか?
  • RQ5低エントロピーのログチ選択の有効性の背後にある理論的根拠は何か?

主な発見

  • FASにおける混合アクティブサンプリング戦略は、α=0.1(極めて非i.i.d.)の条件下でCIFAR-10で0.5788のテスト精度を達成し、サンプリングなしベースラインを11.5%上回った。
  • 低エントロピーのみのサンプリングでも、α=0.1下で精度が0.4644から0.5219に向上し、スケーリングされたデータ下での信頼性ベースの選択が有効であることが示された。
  • ランダムサンプリングは非i.i.i.d.条件下で著しく劣化し、α=0.1で0.468に低下した。これは、ガイドのないサンプリングでは一般化性能が著しく低下することを示している。
  • 混合戦略は全データ分布で一貫した性能を維持し、α=100で0.7058、α=0.1で0.5498を達成した。これにより、高いロバスト性が確認された。
  • 理論的分析により、ログチエントロピーの最小化とディスティルレーションセットサイズの増大がモデル一般化を向上させることを確認し、実験的結果を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。