Skip to main content
QUICK REVIEW

[논문 리뷰] ConfuciuX: Autonomous Hardware Resource Assignment for DNN Accelerators using Reinforcement Learning

Sheng-Chun Kao, Geonhwa Jeong|arXiv (Cornell University)|2020. 09. 04.
Advanced Neural Network Applications참고 문헌 83인용 수 10
한 줄 요약

ConfuciuX는 강화학습 기반 방법을 통해 DNN 가속기에서 최소 지연과 에너지 소비를 위한 하드웨어 자원 할당(계산 및 메모리)을 자동으로 최적화한다. REINFORCE를 활용하고 성능 비용 모델을 세밀하게 설계하며, 유전 알고리즘을 통한 미세조정을 수행한다. 이로 인해 기존 최적화 기법 대비 4.7–24배 빠른 수렴을 달성한다.

ABSTRACT

DNN accelerators provide efficiency by leveraging reuse of activations/weights/outputs during the DNN computations to reduce data movement from DRAM to the chip. The reuse is captured by the accelerator's dataflow. While there has been significant prior work in exploring and comparing various dataflows, the strategy for assigning on-chip hardware resources (i.e., compute and memory) given a dataflow that can optimize for performance/energy while meeting platform constraints of area/power for DNN(s) of interest is still relatively unexplored. The design-space of choices for balancing compute and memory explodes combinatorially, as we show in this work (e.g., as large as O(10^(72)) choices for running \mobilenet), making it infeasible to do manual-tuning via exhaustive searches. It is also difficult to come up with a specific heuristic given that different DNNs and layer types exhibit different amounts of reuse. In this paper, we propose an autonomous strategy called ConfuciuX to find optimized HW resource assignments for a given model and dataflow style. ConfuciuX leverages a reinforcement learning method, REINFORCE, to guide the search process, leveraging a detailed HW performance cost model within the training loop to estimate rewards. We also augment the RL approach with a genetic algorithm for further fine-tuning. ConfuciuX demonstrates the highest sample-efficiency for training compared to other techniques such as Bayesian optimization, genetic algorithm, simulated annealing, and other RL methods. It converges to the optimized hardware configuration 4.7 to 24 times faster than alternate techniques.

연구 동기 및 목표

  • 성능과 에너지 효율성에 매우 중요하지만 대부분 미해결된 DNN 가속기에서의 片상 계산 및 메모리 할당 최적화 문제를 해결한다.
  • 모든 가능한 조합을 검색하기에 비현실적인 복잡도(예: MobileNet-V2 기준 약 O(10^72))를 가지는 설계 공간의 조합 폭발 문제를 해결한다.
  • 플랫폼 제약 조건 하에 레이어 순차적(LS) 및 레이어 파이ipel라인(LP) 배포 시나리오 모두에서 하드웨어 자원 할당 과정을 자동화한다.
  • 기존의 베이지안 최적화, 시뮬레이티드 어닐링, 기타 강화학습 기법과 비교해 설계 공간 탐색의 샘플 효율성을 향상시킨다.
  • 고정된 데이터플로우 선택을 넘어서 하드웨어 구성과 데이터플로우 스타일을 동시에 탐색함으로써 성능 향상을 추가로 달성한다.

제안 방법

  • 세밀한 하드웨어 성능 비용 모델을 사용해 보상을 추정함으로써, 거대한 하드웨어 구성 공간을 전역적으로 탐색할 수 있도록 REINFORCE 강화학습 알고리즘을 적용한다.
  • 거의적인 해를 확보한 후 국소적 미세조정을 위해 유전 알고리즘(GA)을 통합하여 최종 구성의 성능을 추가로 향상시킨다.
  • 각 DNN 레이어에 대해 처리 요소(PE)와 버퍼를 할당하는 동작이 해당하는 이산적이고 비정규적인 최적화 문제로 자원 할당 문제를 수식화한다.
  • 전체 지연과 에너지 소비를 기반으로 한 보상 함수를 사용하며, 면적 및 전력 제약 조건을 고려하여 강화학습 정책이 최적의 구성으로 수렴하도록 이끈다.
  • 레이어 순차적(LS) 및 레이어 파이ipel라인(LP) 배포 모델을 모두 지원하며, 각각에 맞는 별도의 자원 할당 전략을 적용한다.
  • 실제 합성 없이도 하드웨어 동작을 시뮬레이션할 수 있도록 사전 학습된 성능 비용 모델을 활용하여 강화학습 에이전트의 빠르고 확장 가능한 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1강화학습이 DNN 가속기의 막대하고 조합적인 하드웨어 자원 할당 설계 공간을 효과적으로 탐색할 수 있는가?
  • RQ2이러한 맥락에서 베이지안 최적화, 시뮬레이티드 어닐링, 유전 알고리즘과 비교해 REINFORCE 기반 강화학습의 샘플 효율성은 어떻게 되는가?
  • RQ3하드웨어 구성과 데이터플로우 스타일을 동시에 탐색함으로써 고정된 데이터플로우 선택을 넘어서 성능 향상을 얼마나 달성할 수 있는가?
  • RQ4강화학습을 통한 전역 탐색과 유전 알고리즘을 통한 국소 미세조정을 조합한 하이브리드 접근 방식이 단독으로 사용되는 방법보다 우수한 성능을 낼 수 있는가?
  • RQ5ConfuciuX는 다양한 DNN 모델, 데이터플로우 스타일, 플랫폼 제약 조건(예: IoT 대비 클라우드)에 걸쳐 어떻게 성능을 발휘하는가?

주요 결과

  • 모든 평가된 최적화 기법 중에서 ConfuciuX가 가장 높은 샘플 효율성을 확보하였으며, 기존 기법 대비 최적 또는 근접 최적 구성으로 수렴하는 데 4.7~24배 더 빠르게 성능을 달성한다.
  • REINFORCE 기반 강화학습 방법(Con’X(global))은 하드웨어 구성과 데이터플로우 스타일을 동시에 탐색하여 고정된 데이터플로우 기반 베이스라인 대비 성능을 4%에서 69%까지 향상시켰다.
  • 초기 강화학습 최적화 이후 통합된 유전 알고리즘이 최고의 구성에 대해 국소적 미세조정을 통해 성능을 7%에서 93%까지 추가로 향상시켰다.
  • 128개의 PE와 128개의 버퍼를 가진 MobileNet-V2 기준 설계 공간은 약 O(10^72)개의 가능한 구성이 존재하여, 전수 검색이 비현실적임을 확인한다.
  • 기존 논문에서 언급된 연구 결과에 따르면, 하드웨어 자원 할당이 데이터플로우 선택보다 가속기 성능에 더 큰 영향을 미칠 수 있음을 입증한다.
  • ConfuciuX는 다양한 모델과 배포 시나리오(모두 LS 및 LP 모드 포함)에 걸쳐 자동화된 고효율 설계 공간 탐색을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.