Skip to main content
QUICK REVIEW

[논문 리뷰] Asynchronous Decentralized Learning of a Neural Network

Xinyue Liang, Alireza M. Javid|arXiv (Cornell University)|2020. 04. 10.
Advanced Memory and Neural Computing참고 문헌 27인용 수 4
한 줄 요약

이 논문은 중심화된 학습과 동등한 성능을 달성하면서 통신 오버헤드를 줄이는 ARock 기반 ADMM를 사용해 자기크기 추정 피드포워드 신경망(dSSFN)의 비동기 분산 학습을 제안한다. 한쪽 방향의 활성화와 통신을 허용함으로써 비동기 dSSFN은 특히 희박한 네트워크에서 더 빠른 학습을 달성하며, 정확도 면에서도 동기적 대안과 동등하거나 이를 초월한다.

ABSTRACT

In this work, we exploit an asynchronous computing framework namely ARock to learn a deep neural network called self-size estimating feedforward neural network (SSFN) in a decentralized scenario. Using this algorithm namely asynchronous decentralized SSFN (dSSFN), we provide the centralized equivalent solution under certain technical assumptions. Asynchronous dSSFN relaxes the communication bottleneck by allowing one node activation and one side communication, which reduces the communication overhead significantly, consequently increasing the learning speed. We compare asynchronous dSSFN with traditional synchronous dSSFN in the experimental results, which shows the competitive performance of asynchronous dSSFN, especially when the communication network is sparse.

연구 동기 및 목표

  • 마스터 노드 없이도 매개변수 학습에서 중심화된 학습과 동등한 성능을 달성하는 분산 신경망을 설계하는 것.
  • 비동기적, 한쪽 방향 통신을 통해 분산 학습의 통신 병목 현상을 줄이는 것.
  • 처리 속도가 서로 다른 이종 노드에 적합한 저복잡도이자 확장 가능한 학습 프레임워크를 개발하는 것.
  • 비볼록 최적화 설정 하에서 수렴성과 중심화된 학습과의 성능 동등성을 확보하는 것.
  • 네트워크의 희박성과 구조가 학습 효율성과 확장성에 미치는 영향을 평가하는 것.

제안 방법

  • 자기크기 추정 피드포워드 신경망(SSFN)을 위한 계층별 학습 접근법을 사용하며, 가중치 행렬을 무작위 행렬과 최적화되는 부분행렬으로 분해한다.
  • 부분행렬 성분의 볼록 최적화는 ADMM를 통해 해결되며, 이는 중심화된 학습과의 동등성을 보장하고 분산 및 비동기 계산과도 호환된다.
  • ARock 알고리즘을 사용해 비동기 ADMM를 구현함으로써 노드들이 오래된 정보를 사용해도 업데이트하고, 단방향으로만 통신할 수 있도록 하여 동기화 지연을 줄인다.
  • 각 노드는 자체 데이터를 사용해 국소 업데이트를 수행하고 이웃 노드와는 부분 정보만 교환함으로써 통신 오버헤드를 최소화한다.
  • 알고리즘은 고정된 단계 크기 η = 0.5를 사용해 모든 ADMM 반복에서 반복적으로 적용된다.
  • 프레임워크는 고리형 및 원형 네트워크 구조를 모두 지원하며, 다양한 네트워크 차수와 노드 수에서 성능이 평가된다.

실험 결과

연구 질문

  • RQ1비동기 분산 학습이 비볼록 신경망 학습 환경에서 중심화된 학습과 동등한 성능을 달성할 수 있는가?
  • RQ2ARock 기반 ADMM에서의 한쪽 방향 활성화 및 통신은 분산 신경망의 학습 속도와 수렴성에 어떤 영향을 미치는가?
  • RQ3네트워크의 희박성과 구조는 분산 딥 러닝 모델의 학습 효율성에 어떤 영향을 미치는가?
  • RQ4다양한 데이터셋에서 비동기 dSSFN은 동기 dSSFN에 비해 정확도와 학습 시간 측면에서 어떻게 비교되는가?
  • RQ5제안된 방법은 분산 시스템에서 통신 오버헤드를 줄이면서도 경쟁적인 성능을 유지할 수 있는가?

주요 결과

  • 비동기 dSSFN은 중심화된 학습과 동등한 성능을 달성하며, 모든 데이터셋에서 중심화된 SSFN과 동등하거나 略적으로 높은 테스트 정확도를 기록한다.
  • Vowel 데이터셋에서 비동기 dSSFN은 7.8초 만에 61.2%의 정확도를 달성했으며, 동기 dSSFN(34.9초에 61.3%)보다 학습 시간이 빠르게 나타났다.
  • Caltech101 데이터셋에서 비동기 dSSFN은 27.4초 만에 75.4%의 정확도를 달성했고, 동기 dSSFN은 427.5초에 74.2%의 정확도를 기록했다.
  • 고리형 네트워크(d=2)에서는 비동기 dSSFN의 학습 시간이 노드 수 증가에 따라 약간만 증가했지만, 동기 dSSFN은 통신 오버헤드로 인해 학습 시간이 계속 증가하는 경향을 보였다.
  • 희박한 네트워크(낮은 d)에서는 비동기 dSSFN이 동기 dSSFN보다 학습 속도에서 뚜렷한 우월성을 보이며, 낮은 연결성에 대해서도 강건함을 입증했다.
  • 비동기 업데이트에도 불구하고 MNIST, NORB, Letter, Satimage 등 다양한 데이터셋에서 높은 정확도 유지를 보이며 경쟁적인 성능를 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.