Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Gradient-Free Deep Learning with Recursive Local Representation Alignment

Alexander G. Ororbia, Ankur Mali|arXiv (Cornell University)|2020. 02. 10.
Domain Adaptation and Few-Shot Learning참고 문헌 59인용 수 5
한 줄 요약

이 논문은 기울기 없이, 계층 간 국소 표현을 순환 피드백을 통해 정렬함으로써 병렬적이고 생물학적으로 타당한 가중치 갱신을 가능하게 하는 기울기 없는 딥러닝 알고리즘인 순환 국소 표현 정렬(rec-LRA)을 제안한다. 실험 결과, rec-LRA는 CIFAR-10과 ImageNet에서 역전파와 유사한 성능를 달성하면서도, 병렬 처리가 가능한 성질 덕분에 수렴 속도가 빠르고 훈련 시간이 현저히 단축되어, 역전파 없이도 대규모 데이터셋에 대해 확장 가능한 성능을 보여준다.

ABSTRACT

Training deep neural networks on large-scale datasets requires significant hardware resources whose costs (even on cloud platforms) put them out of reach of smaller organizations, groups, and individuals. Backpropagation, the workhorse for training these networks, is an inherently sequential process that is difficult to parallelize. Furthermore, it requires researchers to continually develop various tricks, such as specialized weight initializations and activation functions, in order to ensure a stable parameter optimization. Our goal is to seek an effective, neuro-biologically-plausible alternative to backprop that can be used to train deep networks. In this paper, we propose a gradient-free learning procedure, recursive local representation alignment, for training large-scale neural architectures. Experiments with residual networks on CIFAR-10 and the large benchmark, ImageNet, show that our algorithm generalizes as well as backprop while converging sooner due to weight updates that are parallelizable and computationally less demanding. This is empirical evidence that a backprop-free algorithm can scale up to larger datasets.

연구 동기 및 목표

  • 대칭적인 역전파 경로가 필요 없이 생물학적으로 타당한 기울기 없는 역전파 대체 기법을 개발하기 위해.
  • 계층 간 국소 표현 정렬을 활용해 딥 네트워크에서 효율적이고 병렬 처리 가능한 가중치 갱신을 가능하게 하기 위해.
  • 역전파 없이도 ImageNet과 같은 대규모 벤치마크에 대해 경쟁적인 일반화 성능을 달성할 수 있음을 입증하기 위해.
  • 특수한 가중치 초기화나 비선형 활성화 함수 조정과 같은 히وري스틱 기법에 의존하는 것을 줄이기 위해, 더 안정적인 국소 학습 규칙을 사용하기 위해.
  • 더 빠른 훈련을 위해 합성곱 연산을 학습 가능한 필터가 아닌 고정된 노이즈 매핑(pconv)으로 대체할 수 있는지 탐색하기 위해.

제안 방법

  • 알고리즘은 인접한 계층 간 국소 표현을 정렬함으로써, 역전파 없이도 책임 할당이 가능하도록 순환 피드백을 사용한다.
  • 에러 신호가 국소 정렬 단계의 시퀀스를 통해 전파되는 순환 피드백 메커니즘을 도입하여, 표현 유사도에 기반해 가중치를 갱신한다.
  • 가중치 갱신은 출력 계층에서 유도된 목표 표현과 은닉 계층 표현을 정렬하는 국소적 헤브 방식의 규칙을 사용한다.
  • 표준 역전파를 고정된 랜덤 행렬을 사용해 기울기를 근사하는 피드백 루프로 대체함으로써, 계산 및 메모리 오버헤드를 감소시킨다.
  • 학습 가능한 필터 대신 고정된 노이즈 매핑을 사용하는 가짜 합성곱(pconv)을 도입하여 훈련 속도를 가속화하면서도 성능를 유지한다.
  • 알고리즘은 비가역적 활성화 함수를 지원하며, 국소적이고 순차적이지 않은 갱신 메커니즘 덕분에 기울기 소실/폭발 문제에 강건하다.

실험 결과

연구 질문

  • RQ1기울기 없는 학습 알고리즘이 ImageNet과 같은 대규모 데이터셋에서 역전파 성능과 유사한 일반화 성능를 달성할 수 있는가?
  • RQ2순환적이고 국소적인 표현 정렬 메커니즘이 역전파보다 더 빠른 수렴과 더 짧은 훈련 시간을 가능하게 하는가?
  • RQ3역전파나 복잡한 하이퍼파rameter 튜닝 없이도 깊은 아키텍처에 효과적으로 확장 가능한가?
  • RQ4학습 가능한 합성곱 대신 고정된 노이즈 매핑(pconv)을 사용할 경우 모델 성능와 훈련 속도에 어떤 영향을 미치는가?
  • RQ5비가역적 활성화 함수를 사용할 경우 알고리즘이 얼마나 안정적이고 효과적인가?

주요 결과

  • ImageNet에서 rec-LRA는 상위-1 오차 30.48%와 상위-5 오차 11.97%를 기록했으며, 이는 역전파 기준선(28.15%, 9.81%)에 매우 가까운 성능였다.
  • 8개의 V100 GPU에서 rec-LRA 훈련은 3시간 12분이 걸렸고, 역전파 훈련은 3시간 45분이 소요되어, 1에포크당 2.127분의 속도 향상을 기록했다.
  • CIFAR-10에서 rec-LRA는 피드백 정렬이나 타겟 전파와 같은 다른 기울기 없는 방법보다 뛰어난 성능를 보이며, 역전파 성능에 근접했다.
  • 알고리즘은 역전파로 훈련된 ResNet보다 더 매끄럽게 수렴했고, MNIST와 FMNIST에서도 더 빠른 수렴 속도를 보였다.
  • 표준 합성곱 대신 64개의 고정된 노이즈 마스크를 사용한 pconv를 적용했을 때 성능 저하가 거의 없었고, 미니배치당 0.73초의 속도 향상이 있었다.
  • rec-LRA는 비가역적 활성화 함수에 대해 강건했으며, 특수한 가중치 초기화나 활성화 함수 엔지니어링이 필요 없음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.