Skip to main content
QUICK REVIEW

[論文レビュー] Quantized Reinforcement Learning (QuaRL)

Srivatsan Krishnan, Sharad Chitlangia|arXiv (Cornell University)|Jan 1, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 21
ひとこと要約

本論文では、多様な強化学習(RL)タスクやモデルにおいて報酬の低下なしに8ビット推論を可能にする、QuaRLと呼ばれる強化学習の量子化フレームワークを提案する。ActorQアルゴリズムと量子化分散学習用システムを導入することで、フルプレシジョン学習と比較してエンドツーエンドで1.5倍~2.5倍の高速化を達成しながら、収束性を維持し、計算コストを削減する。

ABSTRACT

Deep reinforcement learning has achieved significant milestones, however, the computational demands of reinforcement learning training and inference remain substantial. Quantization is an effective method to reduce the computational overheads of neural networks, though in the context of reinforcement learning, it is unknown whether quantization's computational benefits outweigh the accuracy costs introduced by the corresponding quantization error. To quantify this tradeoff we perform a broad study applying quantization to reinforcement learning. We apply standard quantization techniques such as post-training quantization (PTQ) and quantization aware training (QAT) to a comprehensive set of reinforcement learning tasks (Atari, Gym), algorithms (A2C, DDPG, DQN, D4PG, PPO), and models (MLPs, CNNs) and show that policies may be quantized to 8-bits without degrading reward, enabling significant inference speedups on resource-constrained edge devices. Motivated by the effectiveness of standard quantization techniques on reinforcement learning policies, we introduce a novel quantization algorithm, extit{ActorQ}, for quantized actor-learner distributed reinforcement learning training. By leveraging full precision optimization on the learner and quantized execution on the actors, extit{ActorQ} enables 8-bit inference while maintaining convergence. We develop a system for quantized reinforcement learning training around extit{ActorQ} and demonstrate end to end speedups of $>$ 1.5 $ imes$ - 2.5 $ imes$ over full precision training on a range of tasks (Deepmind Control Suite). Finally, we break down the various runtime costs of distributed reinforcement learning training (such as communication time, inference time, model load time, etc) and evaluate the effects of quantization on these system attributes.

研究の動機と目的

  • 深層強化学習における量子化の計算的利点が、量子化誤差に起因する精度損失を上回るかどうかを調査すること。
  • 幅広いRLタスク、アルゴリズム、アーキテクチャに対して、標準的な量子化技術(トレーニング後量子化(PTQ)と量子化感知学習(QAT))を評価すること。
  • 8ビット推論を維持しつつ収束性を保つ分散エージェント・リーダー型RLフレームワーク向けに、新規の量子化感知学習アルゴリズムであるActorQを開発すること。
  • 量子化RL学習のためのフルスタックシステムを構築し、分散学習における主要なシステムレベルコストへの量子化の影響を分析すること。

提案手法

  • アトラスやGymなどの多様なRL環境、A2C、DQN、PPO、DDPG、D4PGなどのアルゴリズム、MLPやCNNなどのモデルに、トレーニング後量子化(PTQ)と量子化感知学習(QAT)を適用する。
  • 学習者(learner)ではフルプレシジョン最適化、エージェント(actor)では量子化推論を実行する新しいトレーニングアルゴリズムであるActorQを導入し、トレーニング中にも8ビットポリシー実行を可能にする。
  • 混合精度実行をサポートするActorQを基盤とする分散RL学習システムを設計し、メモリおよび計算オーバーヘッドを低減する。
  • 分散RL学習におけるランタイムコスト(通信、推論、モデルロード)を分解・測定するためのシステムレベルのプロファイリング手法を採用する。
  • 動的範囲と対称量子化を用いて重みおよび活性化の量子化を実施し、微分可能シミュレーションを介して学習パイプラインに統合する。
  • DeepMind Control Suiteを含む複数のベンチマークを用いてフレームワークを検証し、エンドツーエンドのトレーニング高速化とポリシー性能を測定する。

実験結果

リサーチクエスチョン

  • RQ1PTQ や QAT といった標準的な量子化技術を、報酬の著しい低下を伴わずに、深層強化学習ポリシーに効果的に適用できるか?
  • RQ28ビット量子化ポリシーは、多様なRLタスクやアーキテクチャにおいて、どの程度の性能を維持できるか?
  • RQ3ActorQ のような新規トレーニングアルゴリズムは、分散学習中に8ビット推論を可能にしつつ、収束性とポリシー性能を維持できるか?
  • RQ4分散RLにおける通信、推論、モデルロードといった主要なトレーニングボトル neck に、量子化がどのようなシステムレベルのパフォーマンス影響を与えるか?
  • RQ5強化学習における計算コストの削減と、精度損失の潜在的トレードオフを比較すると、どちらが優位か?

主な発見

  • アトラスやGym環境において、ポリシーを8ビットに量子化しても性能に劣化が生じず、エッジデバイスでの推論高速化が顕著に達成できる。
  • ActorQは、学習者でのフルプレシジョン最適化とエージェントでの量子化実行を分離することで、8ビット推論を伴う安定した学習を可能にする。
  • 提案されたシステムは、DeepMind Control Suiteにおいて、フルプレシジョン学習と比較してエンドツーエンドで1.5倍~2.5倍の高速化を達成する。
  • 量子化により推論時間およびモデルロード時間は顕著に短縮されるが、分散学習における通信オーバーヘッドへの影響は最小限に抑えられる。
  • 計算コストの削減と精度損失のトレードオフは有利であり、多様なRLアルゴリズムや環境において、ポリシー性能が維持されている。
  • システムレベルのプロファイリングにより、推論とモデルロードが主要コスト要因であることが確認され、両者ともに量子化によって効果的に削減されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。