Skip to main content
QUICK REVIEW

[논문 리뷰] Interlocking Backpropagation: Improving depthwise model-parallelism

Aidan N. Gomez, Oscar Key|arXiv (Cornell University)|2020. 10. 08.
Advanced Neural Network Applications참고 문헌 8인용 수 5
한 줄 요약

이 논문은 깊이 방향 모델 병렬화의 계산 효율성을 향상시키기 위해 정기적인 간격으로 깊은 네트워크에 보조 분류 헤드를 삽입함으로써, 전방전파와 역전파를 혼합하는 전략인 상호 연결 역전파(backpropagation)를 제안한다. 이는 기울기 흐름을 제한하여 계산 효율성을 높인다. 종단 간 역전파보다 훨씬 빠른 훈련 속도를 달성하면서도 순수 국소 학습에서 잃어버린 대부분의 성능을 복구하며, 고정된 시간 제약 조건 하에서 ResNets와 Transformers에서 훈련 효율성과 테스트 정확도 측면에서 모두 뛰어난 성능을 발휘한다.

ABSTRACT

The number of parameters in state of the art neural networks has drastically increased in recent years. This surge of interest in large scale neural networks has motivated the development of new distributed training strategies enabling such models. One such strategy is model-parallel distributed training. Unfortunately, model-parallelism can suffer from poor resource utilisation, which leads to wasted resources. In this work, we improve upon recent developments in an idealised model-parallel optimisation setting: local learning. Motivated by poor resource utilisation in the global setting and poor task performance in the local setting, we introduce a class of intermediary strategies between local and global learning referred to as interlocking backpropagation. These strategies preserve many of the compute-efficiency advantages of local optimisation, while recovering much of the task performance achieved by global optimisation. We assess our strategies on both image classification ResNets and Transformer language models, finding that our strategy consistently out-performs local learning in terms of task performance, and out-performs global learning in training efficiency.

연구 동기 및 목표

  • 전역 모델 병렬 훈련에서 자원 활용도가 낮은 문제와 국소 학습에서 성능이 저하되는 문제를 해결하기 위해.
  • 국소와 전역 역전파 사이의 중간 전략을 개발하여 계산 효율성을 유지하면서 작업 성능을 향상시키기 위해.
  • 대규모 분산 훈련에서 훈련 속도와 모델 정확도 사이의 상호 교환 관계를 평가하기 위해.
  • 이러한 상호 연결 역전파 전략을 연구하기 위한 일반적이고 오픈소스 프레임워크를 제공하기 위해.

제안 방법

  • 깊은 네트워크에 정기적인 간격으로 보조 분류 헤드를 추가하여 국소 훈련 신호를 생성하는 n-방향 상호 연결 역전파를 도입한다.
  • 모듈 간 기울기 흐름을 제한하여 전체 역전파 경로 의존성을 방지하고, 더 이른 시점의 가중치 갱신을 가능하게 한다.
  • 보조 헤드에서 생성된 국소 손실을 사용해 각 모듈을 독립적으로 훈련시어, 유휴 시간과 통신 병목 현상을 줄인다.
  • 고정된 시간 기반 훈련 시 perspect를 적용하여 성능을 평가하며, 단위 단계 시간이 짧은 전략을 우선시한다.
  • ResNets와 기반 Transformer 언어 모델에 이 방법을 적용하여 Adam으로 훈련하고, 퍼플렉서티를 측정한다.
  • 마이크로배치 처리와 TPU 기반 분산 훈련을 사용해 여러 가속기에서 실험을 확장한다.

실험 결과

연구 질문

  • RQ1국소 학습과 전역 학습 사이의 하이브리드 훈련 전략이 깊이 방향 모델 병렬 훈련에서 훈련 효율성과 모델 성능을 모두 향상시킬 수 있는가?
  • RQ2상호 연결 역전파가 종단 간 훈련과 1-방향 국소 학습에 비해 훈련 속도와 테스트 정확도 측면에서 어떻게 비교되는가?
  • RQ3보조 분류 헤드가 순수 국소 학습에서 잃어버린 성능을 어느 정도 복구할 수 있는가?
  • RQ4고정된 시간 제약 조건 하에서, 상호 연결 역전파가 트랜스포머와 같은 대규모 모델로 효과적으로 확장될 수 있는가?

주요 결과

  • 2-방향 상호 연결 역전파는 4모듈 트랜스포머 모델에서 표준 종단 간 훈련보다 훈련 단계 시간을 절반 이하로 줄이며, 유사한 테스트 퍼플렉서티를 달성한다.
  • 고정된 시간 제약 조건 하에서, 상호 연결 역전파는 더 많은 가중치 갱신을 가능하게 하여 종단 간 훈련보다 모델 성능에서 뛰어나다.
  • CIFAR-10과 CIFAR-100에서 2-방향 상호 연결 역전파는 더 빠른 훈련에도 불구하고 종단 간 훈련과 1-방향 훈련 모두를 테스트 정확도에서 능가한다.
  • 트랜스포머 기반 언어 모델에서 상호 연결 역전파는 1-방향 훈련과 종단 간 훈련 사이의 성능 격차를 크게 줄이며, 퍼플렉서티 측면에선 종단 간 훈련을 초월하지는 않는다.
  • 이 방법은 n-방향 상호 연결의 n 매개변수를 다양하게 조정함으로써 계산 효율성과 모델 성능 사이의 부드러운 트레이드오프를 제공함을 보여준다.
  • https://github.com/oscarkey/interlocking-backprop 에서 제공하는 오픈소스 프레임워크는 이 최적화 알고리즘 유형의 재현 가능한 연구를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.