Skip to main content
QUICK REVIEW

[논문 리뷰] Solving internal covariate shift in deep learning with linked neurons

Carles Roger Riera Molina, Oriol Pujol|arXiv (Cornell University)|2017. 12. 07.
Advanced Memory and Neural Computing참고 문헌 8인용 수 3
한 줄 요약

이 논문은 가중치를 공유하고, 적어도 한 명의 구성원이 비영인 기울기 흐름을 제공하도록 제약를 두어 내부 공변량 이동을 암묵적으로 해결하고 죽은 뉴런 문제를 제거하는 새로운 아키텍처인 연결 뉴런(linked neurons)을 소개한다. 이 방법은 배치 정규화나 입력 표준화 없이도 깊은 네트워크를 훈련시킬 수 있게 하며, 훈련 시간을 최대 2배까지 단축시키고, CIFAR-10에서 최신 기술을 초월한다.

ABSTRACT

This work proposes a novel solution to the problem of internal covariate shift and dying neurons using the concept of linked neurons. We define the neuron linkage in terms of two constraints: first, all neuron activations in the linkage must have the same operating point. That is to say, all of them share input weights. Secondly, a set of neurons is linked if and only if there is at least one member of the linkage that has a non-zero gradient in regard to the input of the activation function. This means that for any input in the activation function, there is at least one member of the linkage that operates in a non-flat and non-zero area. This simple change has profound implications in the network learning dynamics. In this article we explore the consequences of this proposal and show that by using this kind of units, internal covariate shift is implicitly solved. As a result of this, the use of linked neurons allows to train arbitrarily large networks without any architectural or algorithmic trick, effectively removing the need of using re-normalization schemes such as Batch Normalization, which leads to halving the required training time. It also solves the problem of the need for standarized input data. Results show that the units using the linkage not only do effectively solve the aforementioned problems, but are also a competitive alternative with respect to state-of-the-art with very promising results.

연구 동기 및 목표

  • 배치 정규화나 입력 정규화에 의존하지 않고 딥 러닝에서 내부 공변량 이동과 죽은 뉴런 문제를 해결하고자 한다.
  • 백프로파게이션 중 일관된 기울기 흐름을 보장하는 뉴런 수준의 아키텍처 메커니즘을 개발하고자 한다.
  • 아키텍처나 알고리즘적 기법 없이도 임의로 깊고 넓은 네트워크를 훈련시킬 수 있도록 하고자 한다.
  • 다양한 활성화 함수와 네트워크 아키텍처에서 연결 뉴런의 성능을 평가하고자 한다.
  • 연결 뉴런이 배치 정규화를 대체할 수 있으며, 훈련 속도와 일반화 성능을 향상시킬 수 있음을 입증하고자 한다.

제안 방법

  • 모든 구성원이 동일한 입력 가중치를 공유하는 링크리스트(linkages)로 뉴런을 그룹화하여 동일한 작동 지점이 보장된다.
  • 링크리스트가 활성화되는 조건은 그 그룹 내 적어도 한 뉴런이 활성화 함수의 입력에 대해 비영인 기울기를 가지는 경우이다.
  • 이 제약 조건은 임의의 입력에 대해 적어도 한 뉴런이 활성화 함수의 평탄하지 않고 일정하지 않은 영역에서 작동하도록 보장한다.
  • 이 방법은 각 층을 통해 기울기가 사라지지 않도록 유지함으로써 내부 데이터 분포를 암묵적으로 안정화시킨다.
  • 이 방법은 ReLU, PReLU, SELU와 같은 어떤 활성화 함수와도 호환된다.
  • 이 프레임워크는 배치 정규화나 입력 표준화 없이도 훈련이 가능하게 하여 계산 오버헤드를 줄인다.

실험 결과

연구 질문

  • RQ1뉴런 수준의 아키텍처 제약 조건이 명시적 정규화 레이어 없이 내부 공변량 이동을 암묵적으로 해결할 수 있는가?
  • RQ2적어도 한 뉴런이 링크리스트당 비영인 기울기 흐름을 가지도록 보장하면 죽은 뉴런 문제를 방지할 수 있는가?
  • RQ3연결 뉴런은 배치 정규화나 입력 정규화 없이도 깊고 넓은 네트워크를 효과적으로 훈련시킬 수 있는가?
  • RQ4연결 뉴런의 수렴 속도는 배치 정규화를 사용하는 모델과 비교해 어떻게 되는가?
  • RQ5연결 뉴런은 다양한 아키텍처와 활성화 함수에서 최신 기술 수준의 성능을 달성하는가?

주요 결과

  • AllCNN에서 연결 ReLU가 가장 높은 정확도를 기록했으며, 그 다음으로 PReLU가 뒤를 이었다. 이는 표준 ReLU와 SELU를 모두 초월했다.
  • ResNet50에서는 연결 SELU가 모든 다른 변종보다 뛰어난 성능을 보였으며, 표준 SELU와 ReLU를 포함한 모든 대안보다 뛰어났다.
  • ResNet50에서 배치 정규화를 제거해도 연결 뉴런 모델은 영향을 거의 받지 않았으며, LK-ReLU와 LK-SELU는 높은 성능 유지를 보였다.
  • ReLU를 사용할 경우 연결 뉴런 모델은 배치 정규화보다 2.08배 더 빠르게 훈련되었고, SELU를 사용할 경우 1.5배 더 빠르게 훈련되었다.
  • 이 방법은 정규화되지 않은 데이터와 배치 정규화 없이도 훈련이 가능하게 하였으며, 정확도를 유지하거나 향상시켰다.
  • 연결 뉴런의 기울기 역전파 특성은 더 안정적이었으며, 이는 더 빠른 수렴과 학습률 선택에 대한 민감도 감소를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.