Skip to main content
QUICK REVIEW

[논문 리뷰] Universally Slimmable Networks and Improved Training Techniques

Jiahui Yu, Thomas S. Huang|arXiv (Cornell University)|2019. 03. 12.
Advanced Neural Network Applications참고 문헌 23인용 수 16
한 줄 요약

이 논문은 연속적인 폭 범위 내에서 어떤 너비로도 효율적으로 추론할 수 있는 단일 신경망을 훈련하는 데 목적이 있는 보편적 슬림 네트워크(US-Nets)를 제안한다. 이는 사전 정의된 이산적 폭 외에도 가능한 것이다. 샌드위치 규칙과 인플레이스 디스틸레이션을 도입함으로써, 개별적으로 훈련된 모델이나 이산적 슬림 네트워크보다 모든 폭에서 뛰어난 정확도를 달성하면서도 추론 및 훈련 시 최소한의 계산 비용을 유발한다.

ABSTRACT

Slimmable networks are a family of neural networks that can instantly adjust the runtime width. The width can be chosen from a predefined widths set to adaptively optimize accuracy-efficiency trade-offs at runtime. In this work, we propose a systematic approach to train universally slimmable networks (US-Nets), extending slimmable networks to execute at arbitrary width, and generalizing to networks both with and without batch normalization layers. We further propose two improved training techniques for US-Nets, named the sandwich rule and inplace distillation, to enhance training process and boost testing accuracy. We show improved performance of universally slimmable MobileNet v1 and MobileNet v2 on ImageNet classification task, compared with individually trained ones and 4-switch slimmable network baselines. We also evaluate the proposed US-Nets and improved training techniques on tasks of image super-resolution and deep reinforcement learning. Extensive ablation experiments on these representative tasks demonstrate the effectiveness of our proposed methods. Our discovery opens up the possibility to directly evaluate FLOPs-Accuracy spectrum of network architectures. Code and models are available at: https://github.com/JiahuiYu/slimmable_networks

연구 동기 및 목표

  • 슬림 네트워크를 연속적 폭 스펙트럼으로 확장하여, 이산적 폭 외에도 임의의 폭에서 작동할 수 있도록 신경망을 가능하게 한다.
  • 기본적으로 훈련-추론 통계 불일치로 인해 실패하는 배치 정규화를 고려하여 보편적 슬림 네트워크를 효과적으로 처리하는 방법을 해결한다.
  • 새로운 훈련 기법을 통해 보편적 슬림 네트워크의 훈련 효율성과 테스트 정확도를 향상시킨다.
  • 다수의 개별적으로 훈련된 모델이 필요 없이 단일 모델을 통해 FLOPs-정확도 트레이드오��� 스펙트럼을 직접 평가할 수 있도록 한다.

제안 방법

  • 모델 가중치가 고정된 후에 소규모 데이터 세트(예: 1,024장의 이미지)에서 배치 통계의 이동 평균 또는 정확한 평균을 계산하는 후처리 배치 정규화 통계 계산 방법을 제안한다. 이는 정확하고 빠른 추론을 가능하게 한다.
  • 샌드위치 규칙을 도입한다: 훈련 중에 각 반복마다 여러 폭(예: 4개 폭)을 샘플링하고, 각각에 대해 손실를 계산한 후 가중 평균을 통해 손실를 조합함으로써 훈련 안정성과 일반화 성능을 향상시킨다.
  • 인플레이스 디스틸레이션을 개발한다: 훈련 중에 더 넓은 하위망으로부터 더 얇은 망으로 지식을 디스틸레이션하여 성능을 향상시키는 기법으로, 추가적인 추론 비용 없이 모든 폭에서 정확도를 향상시킨다.
  • 훈련 중에 각 폭의 통계를 축적하지 않고, 대신 소규모 대표 데이터 세트를 사용해 모든 배치 정규화 통계를 훈련 후에 계산함으로써 배치 정규화를 개선한다.
  • 더 넓은 네트워크가 더 얇은 네트워크보다 성능이 열 劣하지 않다는 이론적 근거를 제공하기 위해 유한 잔차 오차 공식을 사용한다. 이는 보편적 슬림 네트워크의 타당성을 뒷받침한다.
  • 하드웨어 정렬(예: GPU 워프 크기)을 고려해 채널 수를 정렬하기 위해 폭 나누기 요소(d=8)를 사용한다. 이는 추론 속도 향상과 MobileNet과의 공정한 FLOPs 비교를 보장한다.

실험 결과

연구 질문

  • RQ1사전에 정의된 이산적 폭 외에도 연속적인 폭 범위 내에서 어떤 폭이든 정확하게 작동할 수 있도록 단일 신경망을 훈련시킬 수 있는가?
  • RQ2보편적 슬림 네트워크에서 배치 정규화를 효과적으로 처리하여 모든 폭에서 정확도를 유지할 수 있는가?
  • RQ3개별적으로 훈련된 모델이나 이산적 슬림 네트워크 기반 모델에 비해 보편적 슬림 네트워크의 성능을 향상시키기 위한 훈련 전략은 무엇인가?
  • RQ4단일 모델을 사용하여 네트워크의 FLOPs-정확도 스펙트럼을 직접 평가할 수 있으며, 이는 모델 배포에 어떤 영향을 미치는가?
  • RQ5폭의 하한, 폭 나누기 요소, 반복당 샘플링된 폭의 수와 같은 하이퍼파라미터가 US-Nets의 성능에 어떤 영향을 미치는가?

주요 결과

  • 샌드위치 규칙과 인플레이스 디스틸레이션을 사용해 훈련한 US-Nets는 단일 모델로 ImageNet에서 28.2%의 Top-1 오차를 기록했으며, 모든 폭에서 개별적으로 훈련된 MobileNet v1 모델과 4스위치 슬림 네트워크 기반 모델보다 뛰어난 성능을 보였다.
  • 단지 1,024장의 이미지에서 후처리 배치 정규화 통계를 계산하면 전체 배치 통계와 거의 동일한 성능을 달성하여, 빠르고 정확한 추론이 가능하다.
  • US-Net의 성능은 그 최소 폭(k₀)에 의해 본질적으로 제한되며, 0.25×에서 1.0×까지 훈련된 모델은 k₀가 더 높은 경우(예: 0.35× 또는 0.05×)보다 더 높은 정확도를 기록한다.
  • d=8의 폭 나누기 요소를 사용하면 성능이 약간 향상되고 하드웨어 우수한 채널 수를 보장하며, d=1과 비교해 정확도에 큰 하락이 없다.
  • 반복당 4개의 폭을 샘플링해 훈련할 경우 최적의 정확도-효율성 트레이드오프를 달성하며, 5개 폭은 약간의 성능 향상만 제공하고 3개 폭은 성능이 열 劣한다.
  • 인플레이스 디스틸레이션은 추가적인 추론 비용 없이 모든 폭에서 테스트 정확도를 크게 향상시켜, 견고한 슬림 네트워크 훈련을 위한 핵심 요소임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.