Skip to main content
QUICK REVIEW

[논문 리뷰] An FPGA-Based On-Device Reinforcement Learning Approach using Online Sequential Learning

Hirohisa Watanabe, Mineto Tsukada|arXiv (Cornell University)|2020. 05. 10.
Machine Learning and ELM참고 문헌 13인용 수 5
한 줄 요약

이 논문은 자원이 제한된 엣지 디바이스에서 경량이고 실시간 추론을 위한 FPGA 가속화된 현장 내 강화학습 프레임워크를 제안한다. OS-ELM를 사용하여 백프로파게이션을 대체하고, L2 정규화와 스펙트럴 정규화를 적용함으로써, CartPole-v0 환경에서 64개의 은닉 유닛을 사용할 때 DQN 대비 89.40배 빠른 학습을 달성하여 PYNQ-Z1 FPGA 플랫폼에서 안정적이고 저지연의 구현을 가능하게 한다.

ABSTRACT

DQN (Deep Q-Network) is a method to perform Q-learning for reinforcement learning using deep neural networks. DQNs require a large buffer and batch processing for an experience replay and rely on a backpropagation based iterative optimization, making them difficult to be implemented on resource-limited edge devices. In this paper, we propose a lightweight on-device reinforcement learning approach for low-cost FPGA devices. It exploits a recently proposed neural-network based on-device learning approach that does not rely on the backpropagation method but uses OS-ELM (Online Sequential Extreme Learning Machine) based training algorithm. In addition, we propose a combination of L2 regularization and spectral normalization for the on-device reinforcement learning so that output values of the neural network can be fit into a certain range and the reinforcement learning becomes stable. The proposed reinforcement learning approach is designed for PYNQ-Z1 board as a low-cost FPGA platform. The evaluation results using OpenAI Gym demonstrate that the proposed algorithm and its FPGA implementation complete a CartPole-v0 task 29.77x and 89.40x faster than a conventional DQN-based approach when the number of hidden-layer nodes is 64.

연구 동기 및 목표

  • 저비용이며 자원이 제한된 FPGA 플랫폼, 예를 들어 PYNQ-Z1에서 실시간으로 현장 내 강화학습을 가능하게 하기 위해.
  • 백프로파게이션과 경험 재현 오버헤드로 인해 엣지 디바이스에서 DQN의 계산이 비현실적이므로 이를 해결하기 위해.
  • 정규화 기법을 통해 단일 은닉층 OS-ELM 네트워크에서 Q-값 출력을 안정화하기 위해.
  • 강화학습 파이프라인 내 순차적 연산을 FPGA로 오프로딩하여 추론 및 학습을 가속화하기 위해.

제안 방법

  • 제안된 방법은 DQN의 백프로파게이션을 대체하여 한 번의 연산으로 출력 가중치를 해석적으로 계산하는 OS-ELM를 사용한다. 이로 인해 반복 최적화 과정이 제거된다.
  • 계산 복잡도를 줄이기 위해 단일 은닉층과 고정된 입력 가중치를 갖는 간소화된 Q-네트워크 아키텍처를 사용한다.
  • 출력 가중치에 대한 L2 정규화와 입력 가중치에 대한 스펙트럴 정규화를 동시에 적용하여 리프시츠 상수를 제약하고 Q-값 예측을 안정화시킨다.
  • OS-ELM Q-네트워크는 CPU-FPGA 하이브리드 아키텍처를 사용하여 PYNQ-Z1에 구현되며, FPGA가 predict_seq 및 train_seq 내 행렬 연산을 가속화한다.
  • CPU-FPGA 간 데이터 전송을 위해 AXI 버스와 DMA를 사용하며, float32 전송에 대해 1 사이클 지연을 가정한다.
  • 성능 향상을 위해 학습 및 추론을 FPGA로 오프로딩하고, 초기화 및 제어 논리 제어는 CPU에서 수행한다.

실험 결과

연구 질문

  • RQ1백프로파게이션 없이 OS-ELM 기반 현장 내 학습이 저비용 FPGA에서 안정적이고 빠른 강화학습을 달성할 수 있는가?
  • RQ2L2 정규화와 스펙트럴 정규화의 조합이 단일층 OS-ELM 네트워크에서 Q-값 출력을 안정화하는 데 얼마나 효과적인가?
  • RQ3FPGA 가속화가 기존 DQN 대비 현장 내 강화학습의 추론 및 학습 속도를 어느 정도 향상시킬 수 있는가?
  • RQ4은닉층 크기가 증가함에 따라 성능 및 안정성 측면에서 시스템은 어떻게 스케일링되는가?

주요 결과

  • 제안된 OS-ELM-L2-Lipschitz 방법은 CartPole-v0 환경에서 64개의 은닉층 노드를 사용할 때 DQN 대비 29.77배 빠른 학습을 달성했다.
  • FPGA 가속화 구현은 64개의 은닉 유닛을 사용할 때 DQN 대비 89.40배의 속도 향상을 달성하여 CartPole-v0 작업을 완료했다.
  • 합성 정규화 덕분에 다양한 은닉층 크기에서 안정적이고 효과적인 성능 유지를 보였으며, Q-값 발산을 방지했다.
  • OS-ELM 방법에서 성능의 주요 병목은 train_seq 연산이었으며, 이는 행렬 크기 ∼ℝ^(N×N)×ℝ^(N×N) 비례로 증가하므로 FPGA 가속화가 매우 유용하다.
  • OS-ELM-L2-Lipschitz 및 FPGA 버전의 실행 시간은 은닉층 크기가 증가함에 따라 증가했지만, DQN에 비해 여전히 크게 빠르게 유지되었으며, DQN은 더 적은 스케일링 향상을 보였다.
  • FPGA 구현은 64개의 은닉 유닛에서 총 실행 시간을 DQN의 2208.90초에서 24.71초로 단축시켜 강력한 하드웨어 가속 성과를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.