Skip to main content
QUICK REVIEW

[論文レビュー] Data-heterogeneity-aware Mixing for Decentralized Learning

Yatin Dandi, Anastasia Koloskova|arXiv (Cornell University)|Apr 13, 2022
Privacy-Preserving Technologies in Data被引用数 8
ひとこと要約

本稿では、データの非同一性に配慮した分散学習のための混合戦略を提案し、勾配のずれを低減し収束を加速するために、動的に通信重みを最適化する。データの非同一性とグラフトポロジーの相互作用を捉える新しい指標を用いて混合行列の設計を凸最適化問題として定式化することで、通信負荷を増加させることなく、視覚および自然言語処理のベンチマークでより高いテスト精度を達成した。

ABSTRACT

Decentralized learning provides an effective framework to train machine learning models with data distributed over arbitrary communication graphs. However, most existing approaches toward decentralized learning disregard the interaction between data heterogeneity and graph topology. In this paper, we characterize the dependence of convergence on the relationship between the mixing weights of the graph and the data heterogeneity across nodes. We propose a metric that quantifies the ability of a graph to mix the current gradients. We further prove that the metric controls the convergence rate, particularly in settings where the heterogeneity across nodes dominates the stochasticity between updates for a given node. Motivated by our analysis, we propose an approach that periodically and efficiently optimizes the metric using standard convex constrained optimization and sketching techniques. Through comprehensive experiments on standard computer vision and NLP benchmarks, we show that our approach leads to improvement in test performance for a wide range of tasks.

研究の動機と目的

  • データの非同一性と最適でない通信トポロジーが分散SGDの性能低下を引き起こす要因となることに対処する。
  • 分散学習におけるデータ分布の非同一性と混合行列設計の相乗作用を調査する。
  • リアルタイムの勾配統計に基づいて動的に混合重みを最適化する実用的で通信効率の高い手法を開発する。
  • 静的またはスペクトルギャップ最適化手法と比較して、データに配慮した混合が、より速い収束と高いテスト精度を達成することを実証する。
  • 混合行列の性質と非同一データ下での収束速度の理論的基盤を提供する。

提案手法

  • ノード間での平均化後に生じる勾配のずれの度合いを定量化する新しい指標、相対的非同一性を導入する。
  • 相対的非同一性指標を最小化するように最適な混合行列設計を凸二次計画問題として定式化する。
  • スケッチ技術を用いて、ノード間での勾配統計を効率的に低コストで計算し、リアルタイムでの混合行列更新を可能にする。
  • 通信コストを抑えるために、混合行列の定期的かつ間欠的な更新を実装する。
  • 最小限のトレーニングパイプラインの変更で、標準的なD-SGDに動的混合戦略を統合する。
  • メトロポリス=ハスティングス重みをベースラインとし、制約付き凸プログラミングによるデータ適応的最適化と比較する。

実験結果

リサーチクエスチョン

  • RQ1データ非同一性と分散SGDにおける混合行列の相互作用は何か? これにより収束にどのような影響を与えるか?
  • RQ2データに配慮した時変動型混合行列は、静的またはスレクトルギャップ最適化された混合より、非同一な分散学習で優れているか?
  • RQ3分散最適化における混合行列、データ非同一性、収束速度の理論的関係は何か?
  • RQ4高い通信コストや計算コストを伴わず、実用的に混合行列を効率的に更新する方法は何か?
  • RQ5データに配慮した混合は、多様なディープラーニングベンチマークでどれほどテスト精度を向上させるか?

主な発見

  • 提案手法は、HADSGD や勾配追跡手法を含む最先端のベースラインと比較して、複数のベンチマークでより高いテスト精度を達成した。
  • ResNet20を用いたCIFAR-10では、メトロポリス=ハスティングス重みを用いた標準的なD-SGDと比較して、トップ1精度が最大2.5%向上した。
  • ResNet-20-EvoNormを用いたImageNetでは、同じトレーニング環境下で静的混合戦略よりも1.8%の精度向上を達成した。
  • AGNewsでdistilBERTを微調整した結果、均一またはスレクトルギャップ最適化された重みと比較して、トップ1精度が3.1%向上した。
  • リング、トーラス、ソーシャルネットワークトポロジーのいずれの構造に対しても、本手法は静的およびスレクトルギャップ最適化混合を常に上回った。
  • 理論的分析により、相対的非同一性指標が収束速度をきめ細かく制御することが確認され、特にデータ非同一性が確率的ノイズを上回る場合に顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。