Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Strict Identity Mappings in Deep Residual Networks

Xin Yu, Zhiding Yu|arXiv (Cornell University)|2018. 04. 05.
Advanced Neural Network Applications참고 문헌 52인용 수 6
한 줄 요약

이 논문은 잔차 응답이 임계값 $\epsilon$ 이하일 경우 엄격한 항등 맵핑을 강제함으로써 초과 잔차 블록을 자동으로 제거하는 $\epsilon$-ResNet을 제안한다. 몇 개의 추가 ReLU 유닛을 사용하여 훈련 중에 층 제거를 가능하게 하며, 성능 저하 없이 CIFAR 및 SVHN 데이터셋에서 최대 80%의 파라미터 감소를 달성하고, ImageNet에서는 최소한의 정확도 손실로 36%의 제거를 이룬다.

ABSTRACT

A family of super deep networks, referred to as residual networks or ResNet, achieved record-beating performance in various visual tasks such as image recognition, object detection, and semantic segmentation. The ability to train very deep networks naturally pushed the researchers to use enormous resources to achieve the best performance. Consequently, in many applications super deep residual networks were employed for just a marginal improvement in performance. In this paper, we propose epsilon-ResNet that allows us to automatically discard redundant layers, which produces responses that are smaller than a threshold epsilon, with a marginal or no loss in performance. The epsilon-ResNet architecture can be achieved using a few additional rectified linear units in the original ResNet. Our method does not use any additional variables nor numerous trials like other hyper-parameter optimization techniques. The layer selection is achieved using a single training process and the evaluation is performed on CIFAR-10, CIFAR-100, SVHN, and ImageNet datasets. In some instances, we achieve about 80% reduction in the number of parameters.

연구 동기 및 목표

  • 높은 계산 비용에 비해 성능 향상이 미미한 초초기 잔차 네트워크의 비효율성을 해결하기 위해.
  • 재학습이나 하이퍼파rameter 튜닝 없이도 잔차 네트워크 내에서 초과되는 층을 자동으로 식별하고 제거할 수 있는 방법을 개발하기 위해.
  • 잔차 출력이 임계값 $\epsilon$ 이하인 블록들에 대해 동적으로 잔차 블록을 제거하여 엄격한 항등 맵핑을 구현하기 위해.
  • 다양한 벤치마크 데이터셋에서 성능 저하 없이 또는 최소한의 성능 저하로 심각한 모델 압축을 달성하기 위해.

제안 방법

  • 모든 응답이 $\epsilon$ 이하일 경우 잔차 출력을 0으로 설정하는 스파르스파이저 함수 $\mathcal{S}(\mathcal{F}(x))$ 를 도입하며, 그렇지 않으면 $\mathcal{F}(x)$ 를 그대로 통과시킨다.
  • 스파르스파이저 함수를 구현하기 위해 표준 잔차 블록에 추가적인 ReLU 유닛을 통합하여, 자동 층 제거가 가능한 엔드 투 엔드 훈련을 가능하게 한다.
  • 각 층 제거 후 학습률을 재설정하여 최적화를 안정화시키는 적응형 학습률 스케줄링을 사용하는 단일 훈련 프로세스를 적용한다.
  • 네트워크 중간층에서 계수 0.1의 보조 지도 학습을 적용하여 가중치 감쇠를 장려하고 제거 안정성을 향상시킨다.
  • 모든 데이터셋에서 표준 데이터 증강 및 SGD를 사용하며 배치 정규화, 가중치 감쇠, 관성 항목을 포함한다.
  • CIFAR-10, CIFAR-100, SVHN, ImageNet에서 훈련을 수행하며, 각 층 제거 후 학습률 감쇠를 가속화하는 수정된 학습률 스케줄링을 적용한다.

실험 결과

연구 질문

  • RQ1초기 잔차 네트워크 내의 초과 잔차 블록을 성능 저하 없이 자동으로 식별하고 제거할 수 있는가?
  • RQ2잔차 응답에 대해 임계값 $\epsilon$ 을 적용해 엄격한 항등 맵핑을 강제하면 효과적이고 안정적인 모델 압축이 가능한가?
  • RQ3추가 하이퍼파rameter 튜닝이나 반복적인 재학습 없이도 단일 훈련 런으로 제거 과정을 달성할 수 있는가?
  • RQ4제거된 층의 분포가 네트워크 깊이에 따라 어떻게 변화하는가? 그리고 더 깊은 층에 더 많이 제거되는가?
  • RQ5표준 비전 벤치마크에서 경쟁적인 정확도를 유지하면서 얼마나 모델 크기를 줄일 수 있는가?

주요 결과

  • CIFAR-100에서 $\epsilon$-ResNet은 3.2배의 압축 비율(752층에서 약 235층으로 감소)을 달성했으며, 검증 오차는 24.8%에서 23.8%로 감소했다.
  • CIFAR-10, CIFAR-100, SVHN에서 $\epsilon$-ResNet은 원본 ResNet과 비교해 성능 저하 없이 최대 80%의 파라미터 감소를 달성했다.
  • ImageNet에서 101층 및 152층의 $\epsilon$-ResNet은 20.12%에서 36.23%의 층 제거를 달성했으며, 정확도 손실은 극히 미미했다.
  • 훈련 중에 엄격한 항등 맵핑 비율이 증가하여 최종적으로 전체 네트워크 성능와 일치하는 수준으로 안정화되었다.
  • 더 깊은 층에서 더 적극적인 제거가 이루어졌으며, 출력에 가까운 곳에서 더 많은 블록이 제거되어 비중요한 구성 요소를 우선적으로 제거하는 경향을 보였다.
  • 보조 지도 학습은 가중치 감쇠와 제거 안정성을 향상시켰지만, $\epsilon$-ResNet은 성능 손실 없이 표준 ResNet보다 더 높은 압축 효율성을 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.