Skip to main content
QUICK REVIEW

[論文レビュー] FIXAR: A Fixed-Point Deep Reinforcement Learning Platform with Quantization-Aware Training and Adaptive Parallelism

Je Yang, Seongmin Hong|arXiv (Cornell University)|Feb 24, 2021
Reinforcement Learning in Robotics参考文献 20被引用数 5
ひとこと要約

FIXAR は、量子化感知学習と適応型FPGAアクセラレーションを活用した固定小数点深層強化学習プラットフォームであり、連続的制御タスクにおける半精度固定小数点算術を用いても完全な学習精度を維持しながら、25,293.3インフェレンス/秒(IPS)のスループットと2,638.0 IPS/Wのエネルギー効率を達成した。これはCPU-GPUプラットフォームと比較して2.7倍速く、15.4倍もエネルギー効率に優れている。

ABSTRACT

In this paper, we present a deep reinforcement learning platform named FIXAR which employs fixed-point data types and arithmetic units for the first time using a SW/HW co-design approach. Starting from 32-bit fixed-point data, Quantization-Aware Training (QAT) reduces its data precision based on the range of activations and performs retraining to minimize the reward degradation. FIXAR proposes the adaptive array processing core composed of configurable processing elements to support both intra-layer parallelism and intra-batch parallelism for high-throughput inference and training. Finally, FIXAR was implemented on Xilinx U50 and achieves 25293.3 inferences per second (IPS) training throughput and 2638.0 IPS/W accelerator efficiency, which is 2.7 times faster and 15.4 times more energy efficient than those of the CPU-GPU platform without any accuracy degradation.

研究の動機と目的

  • 従来の高価な単精度浮動小数点算術に依存する深層強化学習(DRL)学習における高い計算コストに対処すること。
  • 複雑な環境において長期的な方策学習に深刻な影響を及ぼす可能性がある精度損失を伴うデータ量子化をDRLに適用する課題を克服すること。
  • 精度の低下を伴わずに、二重固定小数点精度(32ビットおよび16ビット)を用いて学習と推論の両方をサポートするハードウェア・ソフトウェア共同設計プラットフォームを設計すること。
  • DNN演算におけるFPGAベースの適応型データフローと並列処理を活用して、DRLワークロードにおける高いスループットとエネルギー効率を達成すること。
  • 特に複雑な連続的制御タスクにおいて、既存のCPU-GPUおよびFPGAベースのDRLアクセラレータと比較して優れたパフォーマンスと効率を示すこと。

提案手法

  • 定められた学習ステップ数後に固定小数点精度を32ビットから16ビットへ動的に低下させる量子化感知学習アルゴリズムを提案し、モデルの精度を保持すること。
  • 可変データパスと二重精度固定小数点算術を備えた、学習と推論の両方をサポートする、適応型アレイ処理(AAP)コアを有するFPGAベースのアクセラレータを設計すること。
  • AAPコアにおいて層内およびバッチ内並列処理を実装し、さまざまなバッチサイズにおいてもハードウェアの利用効率とスループットを最大化すること。
  • 外部メモリへのアクセスを最小限に抑えるためにオンチップメモリ構造を統合し、学習中の遅延とエネルギー消費を削減すること。
  • CPUがMuJoCo環境をエミュレートし、FPGAがすべてのDNN推論および学習処理を加速する、CPU-FPGA共同設計アーキテクチャを採用すること。
  • 浮動小数点ユニットを低精度固定小数点算術ユニットに置き換えることで、エネルギー効率を最適化し、消費電力を低減するとともにスループットを向上させること。

実験結果

リサーチクエスチョン

  • RQ1動的精度低下を伴う固定小数点算術を、方策の精度に影響を与えることなく、深層強化学習の学習に安全に適用できるか?
  • RQ2FPGAベースのアクセラレータをどのようにアーキテクチャ設計すれば、二重固定小数点精度を用いてDRLにおける学習と推論の両方を効率的にサポートできるか?
  • RQ3量子化感知学習と適応型データフローおよび並列処理を組み合わせることで、DRLワークロードにおいてどの程度のパフォーマンスとエネルギー効率が達成できるか?
  • RQ4FIXARプラットフォームは、連続的制御タスクにおいてCPU-GPUおよび既存のFPGAベースのDRLアクセラレータと比較して、スループットとエネルギー効率の点でどの程度優れているか?
  • RQ5適応型並列処理とオンチップメモリ最適化は、DRL学習におけるハードウェア利用効率の向上とシステム全体のボトルネック低減にどの程度寄与するか?

主な発見

  • FIXAR は、25,293.3インフェレンス/秒(IPS)のシステムレベルの学習スループットを達成し、これはCPU-GPUプラットフォームの2.7倍に相当する。
  • FPGAアクセラレータ単体で53,826.8 IPSのスループットを達成し、同じワークロード下でGPUの9,786.7 IPSを大きく上回った。
  • FIXARアクセラレータは2,638.0 IPS/Wのエネルギー効率を達成し、Titan RTX GPUの171.3 IPS/Wと比較して15.4倍も優れている。
  • 適応型アレイ処理コアにおける効果的な層内およびバッチ内並列処理のおかげで、全バッチサイズにおいて92.4%という高いハードウェア利用効率を維持した。
  • ある一定の学習ステップ数を経過した後、32ビットから16ビットの固定小数点精度にデータ精度を低下させても、プラットフォームは完全な学習精度を維持した。これにより、量子化感知学習手法の有効性が裏付けられた。
  • 最先端のFPGAベースのDRLアクセラレータと比較して、FIXARは、連続的アクション空間における最も複雑なDNNモデルをターゲットとしても、最高のパフォーマンスとエネルギー効率を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。