Skip to main content
QUICK REVIEW

[논문 리뷰] Incremental Training of Deep Convolutional Neural Networks

Roxana Istrate, A. Cristiano I. Malossi|arXiv (Cornell University)|2018. 03. 27.
Neural Networks and Applications인용 수 15
한 줄 요약

이 논문은 사전 훈련된 네트워크를 하위 네트워크로 분할하고, 수렴성을 향상시키기 위해 새로운 '미리 보는' 초기화 방법을 사용해 순차적으로 훈련하는 딥 컨volution 신경망(CNN)을 위한 점진적 훈련 방법을 제안한다. 이 방법은 표준 훈련과 비교해 유사하거나 뛰어난 정확도를 달성하면서 파라미터 수와 FLOPs를 줄이며, 성능을 희생시키지 않고도 효율성을 위해 조기 정지가 가능하다.

ABSTRACT

We propose an incremental training method that partitions the original network into sub-networks, which are then gradually incorporated in the running network during the training process. To allow for a smooth dynamic growth of the network, we introduce a look-ahead initialization that outperforms the random initialization. We demonstrate that our incremental approach reaches the reference network baseline accuracy. Additionally, it allows to identify smaller partitions of the original state-of-the-art network, that deliver the same final accuracy, by using only a fraction of the global number of parameters. This allows for a potential speedup of the training time of several factors. We report training results on CIFAR-10 for ResNet and VGGNet.

연구 동기 및 목표

  • 특정 데이터셋에 대해 네트워크 아키텍처가 최적일 수 없는 경우, 깊은 CNN을 처음부터 훈련하는 데 발생하는 비효율성을 해결하기 위해.
  • 필요할 때만 네트워크를 동적으로 확장함으로써 훈련 시간과 계산 비용을 줄이기 위해.
  • 각 하위 네트워크 확장의 성능 향상을 정량화함으로써 네트워크 확장에서의 조기 정지를 가능하게 하기 위해.
  • 깊이를 점진적으로 추가하면서 얕은 네트워크의 지식을 유지하고, 다시 처음부터 훈련할 필요 없이 진행하기 위해.

제안 방법

  • 기존 CNN을 K개의 하위 네트워크로 분할하며, 각 하위 네트워크에는 최소한 하나의 훈련 가능한 레이어가 포함되며, 분류기 헤드는 분할에서 제외된다.
  • 하위 네트워크는 순차적으로 훈련된다: 얕은 네트워크를 초기 훈련한 후, 새로운 하위 네트워크를 '미리 보는' 방법을 사용해 초기화함으로써 지식을 전달한다.
  • 미리 보는 초기화는 미래 레이어의 통계적 특징을 사용해 현재 하위 네트워크의 초기화를 안내함으로써, 무작위 초기화보다 수렴 성능을 향상시킨다.
  • 훈련은 단계별로 진행되며, 각 하위 네트워크가 수렴할 때까지 훈련된 후 다음 네트워크가 추가되므로 네트워크의 부드러운 동적 성장을 유지한다.
  • 각 하위 네트워크의 경계 정확도 향상 정도를 모니터링할 수 있어, 사용자가 정의한 정확도와 복잡도 간의 트레이드오���을 기반으로 조기 정지를 가능하게 한다.
  • 하이퍼파라미터는 최소한으로 유지된다(예: 고정된 학습률, RMSProp 옵티마이저), 실험 전반에 걸쳐 일관되게 데이터 증강이 적용된다.

실험 결과

연구 질문

  • RQ1CIFAR-10에서 표준 훈련과 비교해 유사하거나 뛰어난 정확도를 달성할 수 있는가?
  • RQ2수렴 속도와 최종 정확도 측면에서 무작위 초기화와 비교해 '미리 보는' 초기화가 어떻게 성능을 높이는가?
  • RQ3기본 정확도를 유지하면서 얼마나 네트워크를 압축할 수 있는가?
  • RQ4점진적 방법이 정확도 향상에 기여가 적은 하위 네트워크를 식별하여 조기 정지와 계산 자원 절약을 가능하게 하는가?
  • RQ5성능을 희생시키지 않고 총 FLOPs와 파라미터 수를 줄일 수 있는가?

주요 결과

  • 미리 보는 초기화는 특히 ResNet-56에서 무작위 초기화보다 검증 정확도에서 뛰어난 성능을 보였으며, ResNet-56에서 무작위 초기화보다 1.04% 향상된 결과를 기록했다.
  • VGGNet에서는 1500만 파라미터로 기준 정확도(90.06% 테스트 오차)에 도달했으며, 전체 3500만 파라미터 모델 대비 57% 감소한 결과를 얻었다.
  • 점진적 훈련은 90% 정확도에 도달하기 위해 오직 0.8 PFLOPs가 소요되었으며, 전체 VGGNet의 경우 1.4 PFLOPs가 필요해 43% 감소한 결과를 기록했다.
  • VGGNet의 파라미터 중 5%(175만)만으로도 85% 정확도에 도달했으며, 전체 모델의 90.06% 테스트 오차를 달성하기 위해선 42%(1470만)가 충분했다.
  • 점진적 방법은 조기 정지를 가능하게 했다: VGGNet의 마지막 두 하위 네트워크는 정확도 향상이 1% 미만이었지만 추론 비용은 16% 증가하고 파라미터 수는 80% 증가시켰다.
  • 더 큰 배치 크기와 더 높은 학습률을 초기 하위 네트워크에서 사용함으로써, 초기 훈련 단계에서 더 빠른 수렴을 보였으며, 이는 훈련 과정을 가속화했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.