Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Deep Learning with Event-Triggered Communication

Jemin George, Prudhvi Gurram|arXiv (Cornell University)|2019. 09. 08.
Stochastic Gradient Optimization Techniques참고 문헌 53인용 수 8
한 줄 요약

이 논문은 비볼록 최적화를 위한 수렴성을 유지하면서 상호작용 간 통신을 줄이기 위해 이벤트 트리거드 통신을 사용하는 분산 딥러닝 알고리즘 DETSGRAD를 제안한다. 에이전트들은 국소 오차 임계값을 초과할 때마다 비주기적으로 모델 파라미터를 갱신하며, 중앙집중식 학습과 유사한 성능을 달성하면서도 통신 오버헤드를 크게 줄인다.

ABSTRACT

We develop a Distributed Event-Triggered Stochastic GRAdient Descent (DETSGRAD) algorithm for solving non-convex optimization problems typically encountered in distributed deep learning. We propose a novel communication triggering mechanism that would allow the networked agents to update their model parameters aperiodically and provide sufficient conditions on the algorithm step-sizes that guarantee the asymptotic mean-square convergence. The algorithm is applied to a distributed supervised-learning problem, in which a set of networked agents collaboratively train their individual neural networks to recognize handwritten digits in images, while aperiodically sharing the model parameters with their one-hop neighbors. Results indicate that all agents report similar performance that is also comparable to the performance of a centrally trained neural network, while the event-triggered communication provides significant reduction in inter-agent communication. Results also show that the proposed algorithm allows the individual agents to recognize the digits even though the training data corresponding to all the digits are not locally available to each agent.

연구 동기 및 목표

  • 중앙 집중식 데이터 전송으로 인한 높은 통신 비용과 프라이버시 우려를 해결하기 위해.
  • 마스터-슬레이브 의존성이 없는 완전히 분산된 피어 투 피어 학습 아키텍처를 개발하기 위해.
  • 딥러닝에서 흔한 비볼록 최적화 문제에서 확률적 경사하강법을 사용해 수렴을 보장하기 위해.
  • 이벤트 트리거드 메커니즘을 통해 통신 빈도를 줄이면서도 모델 성능을 유지하기 위해.
  • 비주기적이고 통신 효율적인 업데이트 조건 하에서 이론적 수렴 보장을 확보하기 위해.

제안 방법

  • 에이전트가 국소 오차 임계값을 초과할 때만 업데이트하는 새로운 이벤트 트리거드 통신 메커니즘을 제안한다.
  • 비볼록 최적화를 위한 분산 이벤트 트리거드 확률적 경사하강법(DETSGRAD) 알고리즘을 설계한다.
  • 이웃 에이전트 간의 파라미터 교환 시기를 결정하기 위해 국소 오차 측도를 사용한다.
  • 이론적 수렴 보장을 위해 단계 크기의 충분한 조건을 도입한다.
  • 중앙집중식 데이터와 피어 투 피어 모델 공유를 위한 분산 지도 학습 과제에 알고리즘을 적용한다.
  • 국소 업데이트와 비주기적 전역 동기화를 통해 통신 부담을 줄이기 위해 확률적 경사하강법을 활용한다.

실험 결과

연구 질문

  • RQ1이벤트 트리거드 통신은 분산 딥러닝에서 수렴성을 유지하면서 상호작용 간 통신을 줄일 수 있는가?
  • RQ2중앙 서버나 마스터 노드 없이 완전히 분산된 피어 투 피어 학습 아키텍처를 어떻게 설계할 수 있는가?
  • RQ3비주기적 업데이트를 가진 비볼록 분산 최적화에서 이론적 수렴 보장을 위한 단계 크기 조건은 무엇인가?
  • RQ4각 에이전트가 전체 훈련 데이터의 일부만 접근할 수 있을 때, 중앙집중식 학습과 유사한 성능을 달성할 수 있는가?
  • RQ5이벤트 트리거드 통신은 분산 학습 과제에서 모델 정확도를 어느 정도 유지하는가?

주요 결과

  • 모든 에이전트가 손글씨 숫자 인식에서 중앙집중식으로 훈련된 신경망과 유사한 성능을 달성했다.
  • 이벤트 트리거드 통신은 주기적 또는 연속적 통신에 비해 상호작용 간 통신을 크게 줄였다.
  • 각 에이전트가 전체 숫자 데이터셋의 일부만 접근하고 있음에도 불구하고, 모든 에이전트가 모든 숫자를 인식하는 데 성공했다.
  • 이론적 분석을 통해 적절한 단계 크기 조건 하에서 점진적 평균 제곱 수렴이 확인되었다.
  • 통신이 희박하고 비주기적일 경우에도 알고리즘이 성능을 유지했다.
  • 기대값의 기울기 노름이 0으로 수렴하는 것이 분석적으로 증명되어 효과적인 최적화임을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.