Skip to main content
QUICK REVIEW

[논문 리뷰] FIXAR: A Fixed-Point Deep Reinforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism

Je Yang, Seongmin Hong|arXiv (Cornell University)|2021. 02. 24.
Reinforcement Learning in Robotics참고 문헌 20인용 수 5
한 줄 요약

FIXAR는 양자화 인식 훈련과 적응형 FPGA 가속을 활용한 고정점 강화학습 플랫폼으로, 연속 제어 작업에서 단정밀도 고정점 산술을 사용해 전체 훈련 정확도를 유지하면서도 초당 25,293.3 인퍼런스(IPS)의 처리량과 2,638.0 IPS/W의 에너지 효율을 달성한다. 이는 CPU-GPU 플랫폼 대비 2.7배 빠르고 15.4배 더 에너지 효율적인 성능이다.

ABSTRACT

In this paper, we present a deep reinforcement learning platform named FIXAR which employs fixed-point data types and arithmetic units for the first time using a SW/HW co-design approach. Starting from 32-bit fixed-point data, Quantization-Aware Training (QAT) reduces its data precision based on the range of activations and performs retraining to minimize the reward degradation. FIXAR proposes the adaptive array processing core composed of configurable processing elements to support both intra-layer parallelism and intra-batch parallelism for high-throughput inference and training. Finally, FIXAR was implemented on Xilinx U50 and achieves 25293.3 inferences per second (IPS) training throughput and 2638.0 IPS/W accelerator efficiency, which is 2.7 times faster and 15.4 times more energy efficient than those of the CPU-GPU platform without any accuracy degradation.

연구 동기 및 목표

  • 기존에 고비용 단정밀도 부동점 산술에 의존하는 깊이 강화학습(DRL) 훈련의 높은 계산 비용을 해결한다.
  • 복잡한 환경에서 장기 정책 학습에 심각한 영향을 줄 수 있는 정밀도 손실을 초래할 수 있는 DRL에 데이터 양자화를 적용하는 과제를 극복한다.
  • 정확도 저하 없이 이중 고정점 정밀도(32비트 및 16비트)를 사용해 훈련과 추론을 모두 지원하는 하드웨어-소프트웨어 공동 설계 플랫폼을 설계한다.
  • DNN 연산을 위한 적응형 데이터플로우와 병렬 처리를 활용해 DRL 워크로드에서 높은 처리량과 에너지 효율을 달성한다.
  • 특히 복잡한 연속 제어 작업에서 기존 CPU-GPU 및 FPGA 기반 DRL 가속기 대비 뛰어난 성능과 효율성을 입증한다.

제안 방법

  • 정해진 훈련 스텝 수 이후에 고정점 정밀도를 32비트에서 16비트로 동적으로 감소시키는 양자화 인식 훈련 알고리즘을 제안하여 모델 정확도를 유지한다.
  • 가변 데이터 경로와 이중 정밀도 고정점 산술을 지원하는 가변 어레이 처리(AAP) 코어를 갖춘 FPGA 기반 가속기를 설계하여 전방 및 역방향 전파를 모두 지원한다.
  • AAP 코어에서 계층 내 및 배치 내 병렬 처리를 구현하여 다양한 배치 크기에서 하드웨어 활용도와 처리량을 극대화한다.
  • 외부 메모리 액세스를 최소화하고 훈련 중 지연과 에너지 소비를 감소시키기 위해 片상 메모리 구조를 통합한다.
  • CPU가 MuJoCo 환경을 에뮬레이트하고 FPGA가 모든 DNN 추론 및 훈련 작업을 가속화하는 CPU-FPGA 공동 설계 아키텍처를 사용한다.
  • 플로ating 포인트 유닛을 저정밀도 고정점 산술 유닛으로 대체하여 에너지 효율을 최적화하고 전력 소비를 줄이며 처리량을 증가시킨다.

실험 결과

연구 질문

  • RQ1동적 정밀도 감소를 적용한 고정점 산술이 정책 정확도를 손상시키지 않고 깊이 강화학습 훈련에 안전하게 적용될 수 있는가?
  • RQ2이중 고정점 정밀도로 DRL에서 훈련과 추론을 효율적으로 지원할 수 있는 FPGA 기반 가속기 아키텍처는 어떻게 설계할 수 있는가?
  • RQ3DRL 워크로드에서 양자화 인식 훈련과 적응형 데이터플로우 및 병렬 처리를 조합했을 때 달성할 수 있는 성능 및 에너지 효율 수준은 어느 정도인가?
  • RQ4연속 제어 작업에서 FIXAR 플랫폼은 CPU-GPU 및 기존 FPGA 기반 DRL 가속기 대비 처리량과 에너지 효율에서 어떻게 비교되는가?
  • RQ5적응형 병렬 처리와 片상 메모리 최적화는 DRL 훈련에서 하드웨어 활용도를 향상시키고 시스템 수준의 병목 현상을 줄이는 데 어느 정도 기여하는가?

주요 결과

  • FIXAR는 시스템 수준의 훈련 처리량이 25,293.3 인퍼런스/초(IPS)에 달하며, 이는 CPU-GPU 플랫폼 대비 2.7배 빠른 성능이다.
  • FPGA 가속기 자체는 동일한 워크로드에서 GPU의 9,786.7 IPS 대비 53,826.8 IPS의 처리량을 기록하여 뚜렷한 성능 우위를 보였다.
  • FIXAR 가속기는 2,638.0 IPS/W의 에너지 효율을 달성했으며, 이는 Titan RTX GPU의 171.3 IPS/W 대비 15.4배 높은 효율이다.
  • 가변 어레이 처리 코어의 효과적인 계층 내 및 배치 내 병렬 처리 덕분에 모든 배치 크기에서 하드웨어 활용도가 92.4%로 높게 유지되었다.
  • 특정 훈련 스텝 이후에 데이터 정밀도를 32비트에서 16비트 고정점으로 감소시켜도 전체 훈련 정확도를 유지함으로써, 양자화 인식 훈련 방법의 효과성을 입증했다.
  • 최신 기술의 FPGA 기반 DRL 가속기 중에서도 FIXAR는 연속 행동 공간에서 가장 복잡한 DNN 모델을 대상으로 하더라도 최고의 성능과 에너지 효율을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.