Skip to main content
QUICK REVIEW

[논문 리뷰] GST: Group-Sparse Training for Accelerating Deep Reinforcement Learning

Juhyoung Lee, Sangyeob Kim|arXiv (Cornell University)|2021. 01. 24.
Reinforcement Learning in Robotics참고 문헌 31인용 수 9
한 줄 요약

이 논문은 블록 순환 행렬 압축과 보상 인지형 프루닝을 조합한 새로운 가중치 압축 방법인 그룹 스 parser 트레이닝(GST)을 제안한다. 이는 딥 강화학습(DRL) 학습을 가속화한다. GST는 초기 학습 반복 단계에서도 높은 압축 비율을 유지하며, 보상 피드백에 기반해 동적으로 스파arsity를 조정함으로써 안정적인 학습을 가능하게 한다. TD3를 사용한 Mujoco 환경에서 성능 저하 없이 평균 압축 비율을 25–41.5%포인트 높여낸다.

ABSTRACT

Deep reinforcement learning (DRL) has shown remarkable success in sequential decision-making problems but suffers from a long training time to obtain such good performance. Many parallel and distributed DRL training approaches have been proposed to solve this problem, but it is difficult to utilize them on resource-limited devices. In order to accelerate DRL in real-world edge devices, memory bandwidth bottlenecks due to large weight transactions have to be resolved. However, previous iterative pruning not only shows a low compression ratio at the beginning of training but also makes DRL training unstable. To overcome these shortcomings, we propose a novel weight compression method for DRL training acceleration, named group-sparse training (GST). GST selectively utilizes block-circulant compression to maintain a high weight compression ratio during all iterations of DRL training and dynamically adapt target sparsity through reward-aware pruning for stable training. Thanks to the features, GST achieves a 25 \%p $\sim$ 41.5 \%p higher average compression ratio than the iterative pruning method without reward drop in Mujoco Halfcheetah-v2 and Mujoco humanoid-v2 environment with TD3 training.

연구 동기 및 목표

  • 자원이 제한된 엣지 디바이스에서 장시간 소요되는 DRL 학습 문제를 해결한다.
  • 반복적 프루닝 방법에서 초기 학습 단계에서 낮은 압축 비율을 해결한다.
  • 고정된 스파arsity 스케줄 대신 보상 인지형 동적 스파arsity 조정을 통해 DRL 학습을 안정화한다.
  • 큰 모델 파라미터로 인한 메모리 대역폭 제약을 줄여 모바일 및 엣지 디바이스에서 효율적인 DRL 학습을 가능하게 한다.
  • 다양한 DRL 벤치마크, 즉 Atari, Google Research Football, ImageNet 분류 작업 등에서의 일반화 능력을 입증한다.

제안 방법

  • 초기 학습 반복 단계에서 블록 순환 압축을 선택적으로 적용하여 높은 초기 압축 비율을 유지한다.
  • 학습 보상 추세에 기반해 목표 스파arsity를 동적으로 조정하는 보상 인지형 프루닝을 사용하여 고정된 스케줄로 인한 불안정성을 방지한다.
  • 스파arsity 증가 시점 제어를 위한 단계 이동 파라미터 $ S_{\text{shift}} $ 를 도입하여, 블록 순환에서 프루닝된 가중치로의 부드러운 전환을 가능하게 한다.
  • 압축과 성능의 균형을 맞추기 위해 세 가지 블록 크기 변환 방법—투영, block4 友好的 block2, block4 友好的 block4—을 구현한다.
  • 첫 번째 및 마지막 레이어를 제외한 네트워크 파라미터의 94–99%에 대해 GST를 선택적으로 적용하여 중요한 특징 표현을 유지한다.
  • 블록 변환 중 파라미터 값의 이동을 최소화하기 위해 유저 프렌들리 행렬 변환을 도입하여 학습 안정성을 확보한다.

실험 결과

연구 질문

  • RQ1반복적 프루닝과 효과적으로 조합된 블록 순환 압축은 DRL 학습 全 과정에서 높은 압축 비율을 유지할 수 있는가?
  • RQ2고정된 스파arsity 스케줄 대비 보상 인지형 동적 스파arsity 스케줄링이 DRL에서 학습 안정성을 향상시키는가?
  • RQ3GST는 최종 성능 저하 없이 반복적 프루닝보다 더 높은 평균 압축 비율을 달성할 수 있는가?
  • RQ4GST는 연속 제어(Mujoco), 이산 제어(Atari), 복잡한 환경(Google Research Football)를 포함한 다양한 DRL 벤치마크에서 어떻게 성능을 내는가?
  • RQ5GST는 분류 작업과 같은 비-DRL 작업으로까지 일반화 가능한가? 더 넓은 적용 가능성을 입증하는가?

주요 결과

  • TD3를 사용한 Mujoco Halfcheetah-v2 및 Humanoid-v2 환경에서 GST는 반복적 프루닝보다 평균 압축 비율을 25–41.5%포인트 높여, 보상 저하 없이 성능을 유지했다.
  • Mujoco Humanoid-v2에서 block4 友好的 block2 방법과 $ S_{\text{shift}} = 0.25 $ 를 사용할 경우 GST는 보상 감소 없이 최대 66.5%의 압축 비율을 달성했다.
  • A2C를 사용한 Atari Breakout에서 $ B=2 $ 이고 $ S_{\text{shift}} = 1.0 $ 일 때 GST는 보상 감소 없이 평균 71.9%의 압축 비율을 달성했다.
  • PPO를 사용한 Google Research Football에서 $ B=4 $ 이고 $ S_{\text{shift}} = 1.0 $ 일 때 GST는 보상 손실 없이 평균 73.6%의 압축 비율을 달성했다.
  • ResNet-32를 사용한 CIFAR-10에서 GST는 68.2%의 압축을 달성했고, 정확도는 91.4%(기본값 대비 0.8% 저하)를 기록하여 분류 작업으로의 일반화 능력을 입증했다.
  • AlexNet를 사용한 ImageNet에서 GST는 62.9%의 압축을 달성했고, 정확도는 55.8%(기본값 대비 0.4% 저하)를 기록하여 다양한 모델 아키텍처에서의 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.