Skip to main content
QUICK REVIEW

[논문 리뷰] PareCO: Pareto-aware Channel Optimization for Slimmable Neural Networks

R Chin, Ari S. Morcos|arXiv (Cornell University)|2021. 05. 04.
Advanced Neural Network Applications참고 문헌 58인용 수 8
한 줄 요약

이 논문은 FLOPs 및 메모리 제약 조건 하에서 정확도를 향상시키기 위해 다양한 너비 배수를 각 레이어에 대해 병행으로 학습하고 공유 가중치를 함께 최적화하는 파레토 인식 채널 최적화 방법인 PareCO를 제안한다. MobileNetV2 기반으로 FLOPs 목표에서 최대 1.7%, 메모리 목표에서 최대 8%의 ImageNet top-1 정확도 향상을 달성한다.

ABSTRACT

Slimmable neural networks provide a flexible trade-off front between prediction error and computational cost (such as the number of floating-point operations or FLOPs) with the same storage cost as a single model. They have been proposed recently for resource-constrained settings such as mobile devices. However, current slimmable neural networks use a single width-multiplier for all the layers to arrive at sub-networks with different performance profiles, which neglects that different layers affect the network's prediction accuracy differently and have different FLOP requirements. Hence, developing a principled approach for deciding width-multipliers across different layers could potentially improve the performance of slimmable networks. To allow for heterogeneous width-multipliers across different layers, we formulate the problem of optimizing slimmable networks from a multi-objective optimization lens, which leads to a novel algorithm for optimizing both the shared weights and the width-multipliers for the sub-networks. We perform extensive empirical analysis with 15 network and dataset combinations and two types of cost objectives, i.e., FLOPs and memory footprint, to demonstrate the effectiveness of the proposed method compared to existing alternatives. Quantitatively, improvements up to 1.7% and 8% in top-1 accuracy on the ImageNet dataset can be attained for MobileNetV2 considering FLOPs and memory footprint, respectively. Our results highlight the potential of optimizing the channel counts for different layers jointly with the weights for slimmable networks.

연구 동기 및 목표

  • 기존의 슬림가능 네트워크에서 레이어 간에 균일한 너비 배수를 사용하는 것의 한계를 해결하기 위해, 정확도 및 계산 비용에 대한 레이어별 영향을 고려하지 못하는 문제를 해결한다.
  • 공유 가중치와 레이어별 너비 배수를 동시에 최적화하는 원칙적인 다목적 최적화 프레임워크를 개발한다.
  • 레이어 간 비균일한 채널 스케일링을 가능하게 하여 슬림가능 네트워크의 정확도와 계산 비용 간의 트레이드오프를 향상시킨다.
  • FLOPs 및 메모리 프로파일을 포함한 두 가지 비용 목표 하에서 다양한 아키텍처와 데이터셋에서 방법을 평가한다.

제안 방법

  • 예측 정확도와 계산 비용(FLOPs 또는 메모리 프로파일)을 균형 잡는 다목적 문제로 슬림가능 네트워크 최적화를 공식화한다.
  • 공유 네트워크 가중치와 레이어별 너비 배수를 동시에 학습하는 파레토 인식 최적화 전략을 도입한다.
  • 레이어 중요도 및 비용 민감도에 기반한 비균일한 스케일링을 가능하게 하기 위해, 미분 가능하고 기울기 기반의 방법을 사용하여 레이어 간 너비 배수를 최적화한다.
  • 외부 루프가 너비 배수를 최적화하고 내부 루프가 현재 배수 설정 하에서 공유 가중치를 훈련하는 이중 최적화 프레임워크를 사용한다.
  • 파레토 최적 해를 근사하기 위해 목표의 가중합을 적용하여 기울기 하강법을 사용한 엔드 투 엔드 훈련을 가능하게 한다.
  • 기울기 기반 탐색 전략을 사용하여 정확도-계산 트레이드오프를 향상시키는 최적의 너비 배수 구성 설정을 식별한다.

실험 결과

연구 질문

  • RQ1균일한 스케일링과 비교해 레이어 간 비균일한 너비 배수는 슬림가능 신경망의 성능 향상에 기여하는가?
  • RQ2가중치와 너비 배수를 병행 최적화하면 슬림가능 네트워크에서 정확도-FLOPs 및 정확도-메모리 트레이드오프에 어떤 영향을 미치는가?
  • RQ3파레토 인식 최적화는 다양한 계산 비용 제약 조건 하에서 top-1 정확도에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 다양한 네트워크 아키텍처와 데이터셋에 대해 어떻게 일반화되는가?

주요 결과

  • FLOPs 제약 조건 하에서 MobileNetV2 기반 기준 슬림가능 네트워크 대비 PareCO는 ImageNet에서 최대 1.7% 높은 top-1 정확도를 달성한다.
  • 메모리 프로파일을 비용 목표로 삼을 경우, PareCO는 MobileNetV2 기반으로 ImageNet에서 최대 8% 높은 top-1 정확도를 확보한다.
  • 15개의 다양한 네트워크 및 데이터셋 조합에서 일관된 성능 향상을 보이며, 강력한 일반화 능력을 입증한다.
  • 실험 결과는 비균일한 너비 배수 설정이 특히 메모리 제약 조건 하에서 균일한 스케일링보다 더 나은 트레이드오프를 제공함을 확인한다.
  • 가중치와 너비 배수의 병행 최적화가 파레토 최적 해를 크게 향상시켜 동일한 계산 비용에서 더 높은 정확도를 가능하게 한다.
  • 절단 실험 결과는 제안된 다목적 공식화가 다양한 설정에서 정확도와 효율성을 효과적으로 균형 잡는 데 기여함을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.