Skip to main content
QUICK REVIEW

[논문 리뷰] Growing Efficient Deep Networks by Structured Continuous Sparsification

Xin Yuan, Pedro Savarese|arXiv (Cornell University)|2020. 07. 30.
Multimodal Machine Learning Applications참고 문헌 49인용 수 9
한 줄 요약

이 논문은 아키텍처 결정의 미분 가능 릴랙세이션과 확률적 샘플링을 통해 훈련 중에 구조적 연속성 희소화를 통한 딥 네ural 네트워크의 동적 성장 및 제거 방법을 제안한다. 이는 정확도와 효율성 양면에서 최적화한다. ImageNet에서 ResNet-50 대비 추론 시 49.7% 적은 FLOPs, 훈련 시 47.4% 적은 FLOPs를 달성하면서도 피팅 튜닝 없이도 75.2%의 top-1 정확도를 유지한다.

ABSTRACT

We develop an approach to growing deep network architectures over the course of training, driven by a principled combination of accuracy and sparsity objectives. Unlike existing pruning or architecture search techniques that operate on full-sized models or supernet architectures, our method can start from a small, simple seed architecture and dynamically grow and prune both layers and filters. By combining a continuous relaxation of discrete network structure optimization with a scheme for sampling sparse subnetworks, we produce compact, pruned networks, while also drastically reducing the computational expense of training. For example, we achieve $49.7\%$ inference FLOPs and $47.4\%$ training FLOPs savings compared to a baseline ResNet-50 on ImageNet, while maintaining $75.2\%$ top-1 accuracy -- all without any dedicated fine-tuning stage. Experiments across CIFAR, ImageNet, PASCAL VOC, and Penn Treebank, with convolutional networks for image classification and semantic segmentation, and recurrent networks for language modeling, demonstrate that we both train faster and produce more efficient networks than competing architecture pruning or search methods.

연구 동기 및 목표

  • 최적화 과정 중에 네트워크 아키텍처를 동적으로 성장시키고 제거함으로써 딥 네트워크 훈련의 계산 비용을 줄이는 것.
  • 신경망 아키텍처 탐색 및 희소화에서 대규모 슈퍼넷 아키텍처나 훈련 후 피팅 튜닝이 필요 없도록 하는 것.
  • 최소한의 시드 아키텍처에서 시작하여 자원 제약 조건 하에서 적응적으로 아키텍처를 성장시킴으로써 모델 효율성과 훈련 속도를 향상시키는 것.
  • 가중치와 아키텍처를 종합적으로 최적화함으로써 기존의 희소화 및 NAS 방법보다 더 나은 정확도-효율성 트레이드오프를 달성하는 것.
  • 점진적으로 네트워크 크기를 증가시킴으로써 더 빠른, 더 큰 배치 크기의 훈련을 가능하게 하여 월클럭 타임과 GPU 시간을 줄이는 것.

제안 방법

  • 필터와 레이어에 대한 지시 변수를 사용하여 네트워크 아키텍처를 구성 공간으로 매개변수화함으로써 이산적인 구조적 결정보다 연속적인 릴랙세이션을 가능하게 한다.
  • 가중치와 아키텍처 구성 요소를 함께 최적화하기 위해 확률적 경사 하강법을 사용하며, 별도의 피팅 튜닝 단계가 없다.
  • Gumbel-Softmax 샘플링을 통한 미분 가능 릴랙세이션을 활용하여 아키텍처 성장 및 제거를 제어하는 보조 마스크 변수를 훈련한다.
  • 구조적 온도 스케줄링 전략을 통해 안정적인 수렴을 보장하며, 초기 에포크에는 고온 샘플링을, 점차 딱딱한 결정으로 경량화한다.
  • 학습된 마스크 파rameter를 사용하여 유연한 아키텍처에서 희소 서브넷을 샘플링함으로써 효율적인 훈련과 추론을 가능하게 한다.
  • 이 방법은 필터(채널 기반)와 전체 레이어 모두를 성장시킬 수 있어 훈련 중에 깊이와 너비를 동적으로 재구성할 수 있다.

실험 결과

연구 질문

  • RQ1고정된 대규모 아키텍처에서 시작하는 것보다 최적화 과정 중에 아키텍처를 동적으로 성장시킴으로써 딥 네트워크를 더 효율적으로 훈련시킬 수 있는가?
  • RQ2어떻게 아키텍처 탐색과 희소화를 하나의 종단 간 미분 가능한 훈련 절차로 통합할 수 있는가?
  • RQ3정확도와 희소성 목표에 따라 네트워크를 작게 시작하고 성장시키면 훈련 비용을 얼마나 줄일 수 있는가?
  • RQ4직접 최종 컴팩트 아키텍처를 훈련시키는 것과 비교해 동적 아키텍처 진화가 더 나은 일반화나 정규화를 이끌어낼 수 있는가?
  • RQ5정확도와 파라미터 효율성 측면에서, 구조적 연속성 희소화는 무작위 또는 균일한 희소화 기준선과 비교해 어떻게 다른가?

주요 결과

  • ImageNet에서 ResNet-50 대비 추론 시 49.7% 적은 FLOPs, 훈련 시 47.4% 적은 FLOPs를 달성하면서도 피팅 튜닝 없이도 75.2%의 top-1 정확도를 유지한다.
  • CIFAR-10에서 이 방법은 VGG-16 기반으로 0.754M 파라미터만으로 92.50%의 검증 정확도를 달성하여 랜덤 희소화 기준선(90.01% 정확도)과 직접 재훈련 기준선을 모두 능가한다.
  • ResNet-20에 대해 160 에포크 후 92.36%의 검증 정확도를 달성하여 AutoGrow의 360 에포크에서의 84.65%를 뛰어넘어 더 빠른 수렴을 보였다.
  • 구조적 온도 스케줄러를 사용함으로써 글로벌 온도 제어에서 발생하는 조기 수렴 문제를 방지했으며, WideResNet-28-10에서 정확도 저하를 최대 2.5% 감소시켰다.
  • NAS 기준선 대비 GPU 탐색 시간을 45% 감소시켰으며, 유사하거나 더 나은 정확도-파라미터 트레이드오프를 달성했다.
  • 절단 분석에서 이 방법은 모든 예산 설정에서 균일한 희소화 및 랜덤 샘플링 기준선을 모두 압도하여 구성 공간과 성장 메커니즘의 효과를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.