Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Prune Deep Neural Networks via Reinforcement Learning

Manas Gupta, Siddharth Aravindan|arXiv (Cornell University)|2020. 07. 09.
Advanced Neural Network Applications참고 문헌 14인용 수 7
한 줄 요약

이 논문은 강화학습 기반의 신경망 구조 축소 방법인 PuRL을 제안한다. PuRL은 각 구조 축소 단계에서 조밀한 보상(reward)을 사용하여 학습 속도를 빠르게 하고 샘플 효율성을 향상시킨다. PuRL은 ResNet-50에서 80.27%의 희박성(sparsity)을 달성하면서 ImageNet에서 Top-1 정확도 75.37%를 기록했으며, 기존 AMC 방법의 400개의 강화학습 학습 에피소드를 55개로 줄였다. 이는 최신 기술 수준의 성능을 유지를 하면서도 85%의 에피소드 수 감소를 이룬 것이다.

ABSTRACT

This paper proposes PuRL - a deep reinforcement learning (RL) based algorithm for pruning neural networks. Unlike current RL based model compression approaches where feedback is given only at the end of each episode to the agent, PuRL provides rewards at every pruning step. This enables PuRL to achieve sparsity and accuracy comparable to current state-of-the-art methods, while having a much shorter training cycle. PuRL achieves more than 80% sparsity on the ResNet-50 model while retaining a Top-1 accuracy of 75.37% on the ImageNet dataset. Through our experiments we show that PuRL is also able to sparsify already efficient architectures like MobileNet-V2. In addition to performance characterisation experiments, we also provide a discussion and analysis of the various RL design choices that went into the tuning of the Markov Decision Process underlying PuRL. Lastly, we point out that PuRL is simple to use and can be easily adapted for various architectures.

연구 동기 및 목표

  • 강화학습을 활용한 자동화된 신경망 구조 축소를 통해 효율성과 확장성을 향상시키는 것.
  • 에피소드 종료 시에만 제공되는 희박한 보상에 의존하는 기존 강화학습 기반의 구조 축소 방법의 느린 수렴 문제를 해결하는 것.
  • 조밀한 보상과 효율적인 행동 공간을 갖춘 마르코프 결정 과정(MDP)을 설계하여 더 빠르고 효과적인 구조 축소 정책 학습을 가능하게 하는 것.
  • ResNet-50, MobileNet-V2, EfficientNet-B2 등 다양한 아키텍처에서 PuRL의 성능을 평가하여 일반화 능력과 적응 용이성을 입증하는 것.
  • MDP 구성 요소(상태, 행동, 보상)에 대한 분석 연구를 통해 향후 강화학습 기반의 구조 축소 설계를 안내하는 것.

제안 방법

  • 상태, 행동, 보상, 전이, 할인 요소를 포함한 마르코프 결정 과정(MDP)으로 신경망 구조 축소를 수식화한다.
  • 각 구조 축소 단계 이후에 피드백을 제공하는 조밀한 보상 함수를 사용하여, 에피소드 종료 시 보상만 제공하는 기존 방법보다 빠른 정책 학습을 가능하게 한다.
  • 가중치 표준편차에서 유도된 임계값을 사용하는 크기 기반 구조 축소 기준을 적용한다: |w| < ασ(w) 인 가중치는 제거된다.
  • α 값(예: 0.0, 0.1, ..., 2.2)에 대한 이산 행동 공간을 도입하고, 탐색 복잡도를 줄이기 위해 단계 크기를 0.2로 증가시켜 실험한다.
  • 점진적인 희박성 목표와 피니팅(fine-tuning)을 통한 반복적 구조 축소를 적용하여 압축 과정 중 정확도를 유지한다.
  • 두 가지 상태 표현 방식을 사용한다: 저차원 튜플(레이어 인덱스, 정확도, 제거 비율)과 고차원의 레이어별 정확도 및 희박성 벡터.

실험 결과

연구 질문

  • RQ1각 구조 축소 단계에서 조밀한 보상을 제공할 경우, 에피소드 종료 시에만 보상을 주는 희박한 보상과 비교해 학습 효율성과 수렴 속도가 크게 향상되는가?
  • RQ2다양한 상태 표현 방식이 에이전트의 효과적인 구조 축소 정책 학습 능력에 미치는 영향은 어떠한가?
  • RQ3행동 공간의 행동 수를 줄이면 탐색 능력과 정책 학습이 향상되어 성능 향상에 기여하는가?
  • RQ4제안된 방법이 ResNet-50 외에도 MobileNet-V2 및 EfficientNet-B2와 같은 효율적인 아키텍처로 일반화되는가?
  • RQ5보상 형상화, 행동 공간 설계, 상태 표현이 최종 희박성과 정확도에 미치는 상대적 영향은 어떠한가?

주요 결과

  • PuRL은 ResNet-50에서 AMC의 400개의 강화학습 에피소드를 55개로 줄여 85%의 에피소드 수 감소를 이뤘으며, 경쟁 가능한 정확도를 유지했다.
  • 조밀한 보상은 희박한 보상 대비 최종 정확도를 24%p 향상시키고 희박성도 4%p 향상시켜 뛰어난 학습 효율성을 입증했다.
  • 행동 단계 크기를 0.1에서 0.2로 증가시킨 결과, 기준 대비 파레토 우월한 해를 도출하여 희박성과 정확도 양쪽을 향상시켰다.
  • PuRL은 ResNet-50에서 80.27%의 희박성과 ImageNet에서 75.37%의 Top-1 정확도를 달성했으며, 최신 기술 수준의 성능을 유지도했다.
  • 효율적인 아키텍처로의 일반화 능력이 뛰어나, MobileNet-V2와 EfficientNet-B2에서 AMC 대비 초과 1.5배의 희박성을 달성했으며, 하이퍼파rameter 조정 없이도 성능을 유지를 하였다.
  • 분석 연구 결과, 조밀한 보상과 축소된 행동 공간이 빠른 수렴과 높은 성능에 핵심적인 역할을 하며, 상태 표현 방식의 선택에 따른 영향은 미미한 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.