Skip to main content
QUICK REVIEW

[논문 리뷰] Layer-Parallel Training of Deep Residual Neural Networks

Stefanie Günther, Lars Ruthotto|arXiv (Cornell University)|2018. 12. 11.
Advanced Neural Network Applications참고 문헌 48인용 수 9
한 줄 요약

이 논문은 깊은 잔차 신경망(ResNets)의 백프로파게이션을 최적 제어 문제로 재구성하고, 시간에 따른 다중 격자 방법(MGRIT)을 적용하여 네트워크 계층 간 동시 계산을 가능하게 하는 계층 병렬 학습을 제안한다. 기존의 계층 순차 학습 대비 최대 8.5배의 속도 향상을 달성하면서도 유사한 모델 정확도를 유지하여, 새로운 계층 간 병렬성으로 인해 확장 가능한 학습을 실현한다.

ABSTRACT

Residual neural networks (ResNets) are a promising class of deep neural networks that have shown excellent performance for a number of learning tasks, e.g., image classification and recognition. Mathematically, ResNet architectures can be interpreted as forward Euler discretizations of a nonlinear initial value problem whose time-dependent control variables represent the weights of the neural network. Hence, training a ResNet can be cast as an optimal control problem of the associated dynamical system. For similar time-dependent optimal control problems arising in engineering applications, parallel-in-time methods have shown notable improvements in scalability. This paper demonstrates the use of those techniques for efficient and effective training of ResNets. The proposed algorithms replace the classical (sequential) forward and backward propagation through the network layers by a parallel nonlinear multigrid iteration applied to the layer domain. This adds a new dimension of parallelism across layers that is attractive when training very deep networks. From this basic idea, we derive multiple layer-parallel methods. The most efficient version employs a simultaneous optimization approach where updates to the network parameters are based on inexact gradient information in order to speed up the training process. Using numerical examples from supervised classification, we demonstrate that the new approach achieves similar training performance to traditional methods, but enables layer-parallelism and thus provides speedup over layer-serial methods through greater concurrency.

연구 동기 및 목표

  • 깊은 ResNets 학습 시 계층 간 순차적 전파 및 역전파로 인한 확장성 저하 문제를 해결하기 위해.
  • ResNet 학습과 시간에 따라 변화하는 동적 시스템의 최적 제어 간 수학적 유사성을 활용해 시간에 따른 병렬 방법을 적용하기 위해.
  • 계층 차원에서의 비선형 다중 격자 반복을 통해 순차적 전파를 대체하여 계층 간 새로운 병렬성 확보하기 위해.
  • 학습 속도, 수렴성 및 최종 모델 정확도 측면에서 계층 병렬 학습의 성능 및 효율성 평가하기 위해.
  • 불완전한 기울기 정보와 동시 최적화를 활용해 학습을 추가로 가속화할 수 있는지 탐색하기 위해.

제안 방법

  • 신경망 가중치를 비선형 초기값 문제에서 시간에 따라 변화하는 제어로 간주하는 최적 제어 문제로 ResNet 학습을 재구성하기 위해.
  • 시간에 따른 다중 격자(MGRIT) 방법을 적용해 계층 간 상태 및 수반 방정식을 동시에 풀어 순차적 전방 및 역방향 전파를 대체하기 위해.
  • 두 가지 변종 개발: (1) 기존 백프로파게이션 대체를 위한 MGRIT 기반 방법, (2) 불완전한 기울기 정보를 사용하는 동시 계층 병렬 접근 방식.
  • 비선형 다중 격자 순환을 사용해 계층별 방정식 시스템을 효율적으로 해결하고 계층 블록 간 동시 업데이트 가능하게 하기 위해.
  • 아키텍처 변경 없이도 표준 학습 프레임워크(예: 확률적 경사 하강법(SGD))에 통합 가능하게 하기 위해.
  • 일반적인 순차 기반 기준 대비 효율성 정의하며, MGRIT의 비침습적 성격으로 인해 관측된 병렬 효율성이 감소할 수 있으나 여전히 상당한 런타임 성과를 달성할 수 있음을 인정하기 위해.

실험 결과

연구 질문

  • RQ1MGRIT와 같은 시간에 따른 병렬 방법이 계층을 시간 단위로 간주함으로써 깊은 잔차 신경망 학습에 효과적으로 적용될 수 있는가?
  • RQ2MGRIT를 사용한 계층 병렬 학습이 계층 순차 학습 대비 상당한 속도 향상을 달성하면서도 모델 정확도를 유지하는가?
  • RQ3동시 계층 병렬 접근 방식에서 불완전한 전방 및 역방향 전파가 학습 성능에 어느 정도 영향을 미치는가?
  • RQ4네트워크 깊이와 컴퓨팅 코어 수 증가에 따라 제안된 방법의 확장성은 어떠한가?
  • RQ5TensorFlow나 PyTorch와 같은 기존 딥러닝 프레임워크에 큰 수정 없이 통합 가능한가?

주요 결과

  • MNIST 데이터셋에서 128개 코어를 사용할 경우 계층 병렬 학습이 계층 순차 학습 대비 최대 8.5배의 속도 향상을 달성하여 학습 시간을 619분에서 71분으로 단축시켰다.
  • Peaks 및 Indian Pines 데이터셋에서 각각 256개 및 128개 코어를 사용할 경우 6.0배 및 4.4배의 속도 향상을 관찰하여 네트워크 깊이에 따라 확장 가능함을 입증했다.
  • MGRIT 대체 및 동시 계층 병렬 접근 모두 표준 계층 순차 학습과 유사한 학습 손실 및 검증 정확도를 달성했다.
  • 동시 접근 방식에서 불완전한 기울기 정보를 사용하면 내부 반복의 정확도가 감소하지만 학습 성능은 유지되며 각 반복의 가속화를 달성했다.
  • 이 방법은 진정으로 계층 병렬성을 가능하게 하여 깊은 신경망에서 순차적 계층 전파의 선형 확장성 저하 문제를 해결한다.
  • 결과적으로 더 빠른 학습이 더 효율적인 초모수 탐색을 가능하게 하며, 실무에서 더 나은 종합 모델 성능을 이끌어낼 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.