Skip to main content
QUICK REVIEW

[논문 리뷰] Demystifying Why Local Aggregation Helps: Convergence Analysis of Hierarchical SGD

Jiayi Wang, Shiqiang Wang|arXiv (Cornell University)|2020. 10. 24.
Energy Efficient Wireless Sensor Networks인용 수 5
한 줄 요약

이 논문은 비독립identical 분포(Non-IID), 비볼록, 확률적 설정에서 로컬 집계가 왜 훈련을 향상시키는지 설명하기 위해 '상향' 및 '하향' 발산을 사용하여 계층적 SGD(H-SGD)의 새로운 수렴 분석을 제안한다. H-SGD의 수렴 상한선이 두 개의 단일 수준 로컬 SGD 설정 사이에 위치함을 증명함으로써 '샌드위치 행동'을 입증하며, 이는 계층적 집계가 데이터 이질성을 완화하고 글로벌 수렴을 향상시키는 데 이론적 통찰을 제공한다.

ABSTRACT

Hierarchical SGD (H-SGD) has emerged as a new distributed SGD algorithm for multi-level communication networks. In H-SGD, before each global aggregation, workers send their updated local models to local servers for aggregations. Despite recent research efforts, the effect of local aggregation on global convergence still lacks theoretical understanding. In this work, we first introduce a new notion of "upward" and "downward" divergences. We then use it to conduct a novel analysis to obtain a worst-case convergence upper bound for two-level H-SGD with non-IID data, non-convex objective function, and stochastic gradient. By extending this result to the case with random grouping, we observe that this convergence upper bound of H-SGD is between the upper bounds of two single-level local SGD settings, with the number of local iterations equal to the local and global update periods in H-SGD, respectively. We refer to this as the "sandwich behavior". Furthermore, we extend our analytical approach based on "upward" and "downward" divergences to study the convergence for the general case of H-SGD with more than two levels, where the "sandwich behavior" still holds. Our theoretical results provide key insights of why local aggregation can be beneficial in improving the convergence of H-SGD.

연구 동기 및 목표

  • 비IIDs 데이터, 비볼록 목표 함수, 확률적 경사하강법 하에서 H-SGD의 로컬 집합이 수렴을 향상시키는 이유를 이론적으로 이해하는 것.
  • 데이터 이질성과 통신 효율성 제약 조건이 존재하는 실제 분산 환경에서 H-SGD에 대한 이론적 분석 부족 문제를 해결하는 것.
  • 계층적 수준 간 모델 발산을 분석할 수 있도록 '상향' 및 '하향' 발산을 통해 데이터 이질성을 특성화하는 것.
  • 다중 수준 집계의 기본적 이점을 드러내는 H-SGD의 수렴 상한선을 수립하는 것.
  • 다중 수준 H-SGD로 분석을 확장하고, 여러 계층 수준에 걸쳐 '샌드위치 행동'이 유지됨을 보여주는 것.

제안 방법

  • H-SGD의 글로벌 모델 발산을 분해하기 위해 '상향' 및 '하향' 발산을 사용하는 새로운 이론적 프레임워크를 도입한다.
  • 비IIDs 데이터, 비볼록 목표 함수, 확률적 경사하강법 하에서 이중 수준 H-SGD의 최악의 경우 수렴 상한선을 수립한다.
  • 무작위 그룹화 상황으로의 분석을 확장하여 수렴 상한선의 강건성과 일반화 능력을 입증한다.
  • H-SGD의 수렴 상한선이 각각 로컬 및 글로벌 업데이트 주기 I와 G를 가진 두 개의 단일 수준 로컬 SGD 설정의 상한선 사이에 위치함을 입증함으로써 '샌드위치 행동'을 정의한다.
  • 발산 기반 분석을 다중 수준 H-SGD(M ≥ 3 수준)로 일반화하여 고차원 계층에서 '샌드위치 행동'이 유지됨을 증명한다.
  • 이 프레임워크를 사용해 부분적 워커 참여 및 다양한 그룹 크기 하에서의 성능을 분석하고 이론적 통찰을 실험적으로 검증한다.

실험 결과

연구 질문

  • RQ1왜 비IIDs 데이터와 확률적 경사하강법 하에서도 H-SGD의 로컬 집합이 수렴을 향상시키는가?
  • RQ2다른 집계 주기 하에서 H-SGD의 수렴은 단일 수준 로컬 SGD와 어떻게 비교되는가?
  • RQ3'샌드위치 행동'—즉, H-SGD 수렴이 두 개의 로컬 SGD 제어 기간 사이에 위치하는 것—이 이론적으로 증명되고 다중 수준 시스템으로 일반화될 수 있는가?
  • RQ4'상향' 및 '하향' 발산은 계층적 통신 계층 간 모델 발산을 특성화하는 데 어떤 역할을 하는가?
  • RQ5무작위 그룹화 및 부분적 워커 참여 하에서도 로컬 집합의 이론적 이점이 유지되는가?

주요 결과

  • 비IIDs 데이터, 비볼록 목표 함수, 확률적 경사하강법 하에서 H-SGD의 제안된 수렴 상한선은 이전 연구들보다 더 날카롭고 일반적인데, 이는 이전 연구들이 일반적으로 IID 데이터를 가정하거나 전체 배치 경사하강법을 사용하기 때문이다.
  • H-SGD의 수렴 상한선은 각각 집계 주기 I과 G를 가진 두 개의 단일 수준 로컬 SGD 설정의 상한선 사이에 엄격히 위치한다—이는 '샌드위치 행동'으로 불린다.
  • '샌드위치 행동'은 다중 수준 H-SGD(M ≥ 3)에서도 유지되며, 이는 계층적 집합이 단일 수준 방법보다 체계적으로 향상된 성능을 제공함을 보여준다.
  • 무작위 그룹화 조건 하에서도 H-SGD의 수렴 상한선은 여전히 유한하고 두 개의 로컬 SGD 제어 기간 사이에 위치하여, 그룹화 전략에 대해 강건함을 시사한다.
  • FEMNIST, CelebA, CIFAR-10에서의 실험 결과, 다중 수준 집합을 사용하는 H-SGD는 특히 높은 통신 지연 조건에서 단일 수준 로컬 SGD보다 더 높은 테스트 정확도와 더 낮은 훈련 손실을 달성한다.
  • 더 큰 글로벌 주기(P₁=200, P₂=40, P₃=20)를 가진 3단계 H-SGD 설정은 더 작은 글로벌 주기를 가진 단일 수준 H-SGD보다 더 뛰어난 성능을 보이며, 계층적 집합이 통신 비용을 줄이되 수렴 성능을 훼손하지 않도록 가능하게 함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.