Skip to main content
QUICK REVIEW

[논문 리뷰] The Shallow End: Empowering Shallower Deep-Convolutional Networks through Auxiliary Outputs

Yong Guo, Jian Chen|arXiv (Cornell University)|2016. 11. 06.
Advanced Neural Network Applications참고 문헌 58인용 수 8
한 줄 요약

이 논문은 다중 보조 손실을 중간층에 추가하고 각 손실에 대해 별도의 역전파를 수행함으로써 얕은 딥 컨volution 네트워크의 성능을 향상시키는 Multi-way Backpropagation (MW-BP)를 제안한다. 학습 중 감쇠하는 감독 신호 문제를 완화함으로써 MW-BP는 훨씬 더 컴act한 모델을 생성한다. 예를 들어, MwResNet-44는 파arameter 수가 적고 상태기준 모델 압축 기법보다 높은 정확도를 기록하며 CIFAR-10과 CIFAR-100에서 ResNet-110을 능가한다.

ABSTRACT

Depth is one of the key factors behind the success of convolutional neural networks (CNNs). Since ResNet, we are able to train very deep CNNs as the gradient vanishing issue has been largely addressed by the introduction of skip connections. However, we observe that, when the depth is very large, the intermediate layers (especially shallow layers) may fail to receive sufficient supervision from the loss due to the severe transformation through a long backpropagation path. As a result, the representation power of intermediate layers can be very weak and the model becomes very redundant with limited performance. In this paper, we first investigate the supervision vanishing issue in existing backpropagation (BP) methods. And then, we propose to address it via an effective method, called Multi-way BP (MW-BP), which relies on multiple auxiliary losses added to the intermediate layers of the network. The proposed MW-BP method can be applied to most deep architectures with slight modifications, such as ResNet and MobileNet. Our method often gives rise to much more compact models (denoted by "Mw+Architecture") than existing methods. For example, MwResNet-44 with 44 layers performs better than ResNet-110 with 110 layers on CIFAR-10 and CIFAR-100. More critically, the resultant models even outperform the light models obtained by state-of-the-art model compression methods. Last, our method inherently produces multiple compact models with different depths at the same time, which is helpful for model selection.

연구 동기 및 목표

  • 깊은 컨volution 네트워크에서 장거리 역전파 경로로 인해 중간층에 충분한 기울기 신호가 도달하지 못하는 감독 신호 감쇠 문제를 조사한다.
  • 구조적 효율성에도 불구하고 높은 파라미터 수, 큰 모델 크기, 높은 추론 비용을 초래하는 딥 네트워크의 모델 중복 문제를 해결한다.
  • 학습 중에 더 강력하고 직접적인 감독을 제공하기 위해 보조 손실을 도입함으로써 중간층의 표현 능력을 향상시킨다.
  • 동일한 아키텍처에서 다양한 깊이를 가진 다수의 컴팩트 모델을 동시에 학습할 수 있는 학습 프레임워크를 개발한다.
  • 현존하는 모델 압축 기법보다 훨씬 적은 파라미터 수와 낮은 추론 비용으로 더 높은 정확도를 달성함으로써 승리한다.

제안 방법

  • 다중 보조 손실에 대해 별도의 역전파를 수행함으로써 중간층에 고유한 기울기 신호를 유지하는 Multi-way Backpropagation (MW-BP)를 제안한다. 이는 한 번의 순방향 전파 후에 각 손실에 대해 별도의 역전파를 수행한다.
  • 다양한 감독 신호에서 유도된 기울기 간 갈등을 줄이기 위해 보조 손실에 대한 적응형 가중치 부여 방식을 도입한다.
  • ResNet, MobileNet, DenseNet, Inception 등의 깊은 아키텍처에 중간층에 보조 출력을 적용하며, 아키텍처 수정을 최소화한다.
  • 학습률 감쇠에 따라 손실 가중치를 조정하는 동적 가중치 전략(Adaptive-I 및 Adaptive-II)을 사용하여 학습 안정성과 중간 모델 성능을 향상시킨다.
  • 모든 손실에 대해 공유된 순방향 전파를 사용하여 계산 효율성을 유지하면서도 각 손실에 대해 독립적인 기울기 업데이트를 가능하게 한다.
  • 동일한 학습 과정에서 서로 다른 보조 손실에 해당하는 다양한 깊이의 컴팩트 모델을 추출함으로써 모델 선택을 가능하게 한다.

실험 결과

연구 질문

  • RQ1표준 역전파로 학습하는 매우 깊은 컨volution 네트워크에서 감독 신호 감쇠 현상이 중간층의 표현 능력에 어떤 영향을 미치는가?
  • RQ2구조적 재설계 없이도 보조 손실을 통해 모델 중복을 크게 줄이고 성능을 향상시킬 수 있는가?
  • RQ3다양한 보조 손실을 역전파 과정에서 조합할 최적의 전략은 무엇인가? 기울기 갈등을 피하고 학습 수렴을 향상시킬 수 있는가?
  • RQ4MW-BP는 더 깊은 표준 모델과 현재 최고 수준의 압축 모델을 모두 능가하는 정확도와 효율성을 가진 컴팩트 모델을 생성할 수 있는가?
  • RQ5MW-BP는 한 번의 학습 실행에서 다양한 깊이를 가진 다수의 컴팩트 모델을 동시에 생성할 수 있는가?

주요 결과

  • 44층의 MwResNet-44는 CIFAR-10에서 5.67% 오차율, CIFAR-100에서 27.35% 오차율을 기록하며, 170만 파라미터를 가진 ResNet-110(110층)을 능가한다.
  • MwResNet-56-5(model-45)의 중간 모델은 85만 파라미터에 불과함에도 불구하고 CIFAR-10과 CIFAR-100에서 ResNet-110보다 뛰어난 성능을 기록한다.
  • 최대 5개의 보조 손실을 추가할 경우 최적의 성능을 기록하며, 더 많은 손실(예: 10개 또는 25개)은 간섭과 느린 학습으로 인해 성능 저하를 초래한다.
  • 적응형 가중치 전략(Adaptive-I 및 Adaptive-II)은 고정 가중치 대비 중간 모델의 성능 향상에 특히 효과적이다.
  • 5개의 보조 손실을 가진 MwResNet-56-5는 CIFAR-10에서 5.53% 오차율을 기록하여 표준 ResNet-56(6.08%)와 두 개의 손실을 가진 MwResNet-56(5.77%)보다 뛰어나다.
  • 제안된 방법은 더 작은 모델 크기와 낮은 추론 비용을 유지하면서도 최고 수준의 모델 압축 기법을 능가하는 정확도를 기록하는 모델을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.