Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Distributional Reinforcement Learning

Yuguang Yue, Zhendong Wang|arXiv (Cornell University)|Jul 13, 2020
Reinforcement Learning in Robotics参考文献 44被引用数 5
ひとこと要約

本稿では、深層生成ネットワーク(DGNs)を用いて割引累積報酬の分布をモデル化し、柔軟な方策学習のための準暗黙的アーキテクチャ(SIA)を採用する、オフポリシー強化学習アルゴリズムである暗黙的分布的アクタ・クリティック(IDAC)を提案する。2重遅延DGN構造を統合することで過大評価を緩和し、OpenAI Gymにおける連続的制御タスクでSAC や SDPG などのベースラインを上回る最先端の性能を達成した。

ABSTRACT

To improve the sample efficiency of policy-gradient based reinforcement learning algorithms, we propose implicit distributional actor-critic (IDAC) that consists of a distributional critic, built on two deep generator networks (DGNs), and a semi-implicit actor (SIA), powered by a flexible policy distribution. We adopt a distributional perspective on the discounted cumulative return and model it with a state-action-dependent implicit distribution, which is approximated by the DGNs that take state-action pairs and random noises as their input. Moreover, we use the SIA to provide a semi-implicit policy distribution, which mixes the policy parameters with a reparameterizable distribution that is not constrained by an analytic density function. In this way, the policy's marginal distribution is implicit, providing the potential to model complex properties such as covariance structure and skewness, but its parameter and entropy can still be estimated. We incorporate these features with an off-policy algorithm framework to solve problems with continuous action space and compare IDAC with state-of-the-art algorithms on representative OpenAI Gym environments. We observe that IDAC outperforms these baselines in most tasks. Python code is provided.

研究の動機と目的

  • 分布的強化学習と確率的方策学習を組み合わせることで、連続的制御RLにおけるサンプル効率を向上させること。
  • 深層生成ネットワーク(DGNs)を用いた暗黙的分布により、割引累積報酬の全分布をモデル化すること。
  • 解析的密度関数に依存せずに、歪度、尖度、共分散構造を捉えることのできる柔軟で複雑な方策分布を可能にすること。
  • 2重遅延DGN構造を導入し、ソート済み出力の要素ごとの最小値を用いることで、価値ベースRLで一般的な過大評価問題を緩和すること。
  • 標準的な連続的制御環境におけるアブレーションスタディおよびベンチマーク比較を通じて、各構成要素の有効性を検証すること。

提案手法

  • 分布的クリティックは、状態-行動ペアとランダムノイズを入力として受ける2つの深層生成ネットワーク(DGNs)を用い、報酬分布を暗黙的にモデル化し、分布を表す値の集合を出力する。
  • DGNsは、ターゲット分布と予測分布の間の Wasserstein 距離を最小化する分布的ベルヌーイ更新を用いて訓練される。
  • 方策は、学習可能な方策パラメータと再パラメトリゼーション可能なノイズ分布を組み合わせた準暗黙的アーキテクチャ(SIA)として実装され、推定可能なエントロピーとパラメータを持つ暗黙の周辺方策分布を可能にする。
  • 2重遅延DGN構造を導入:2つのDGNがソート済みの報酬値ベクトルを出力し、ターゲット値がこれらの2つのベクトルの要素ごとの最小値として計算される。これにより過大評価が軽減される。
  • アルゴリズムはオフポリシーのアクタ・クリティックフレームワーク内に構築され、訓練の安定化のためリプレイバッファとターゲットネットワークが使用される。
  • 閉形式密度が存在しないにもかかわらず、暗黙の方策のスコア関数を用いて方策勾配を計算し、確率的勾配降下法によるエンドツーエンドの学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1暗黙的分布による累積報酬の全分布モデル化が、連続的制御RLにおけるサンプル効率と性能向上に寄与するか?
  • RQ2歪度や共分散を捉えることのできる柔軟な分布的性質を持つ準暗黙的方策は、標準的な対角ガウス方策を上回る性能を示すか?
  • RQ32重遅延DGN構造は、DQN や SAC での成功に類似した形で、分布的RLにおける過大評価問題を効果的に緩和できるか?
  • RQ4IDACの構成要素(DGNベースのクリティック、SIA方策、2重遅延構造)が、性能向上にそれぞれどの程度寄与しているか?
  • RQ5IDACは多様な連続的制御環境に一般化できるか?SAC や SDPG といった最先端のアルゴリズムを上回る性能を示すか?

主な発見

  • IDACは、OpenAI Gymの連続的制御環境の大多数で、SAC や SDPG といった最先端のアルゴリズムを上回り、優れたサンプル効率と最終的な性能を示した。
  • アブレーションスタディにより、2重遅延DGN構造が顕著に性能向上に寄与することが確認され、単一DGNを用いたバージョンに比べて大幅な性能向上が達成された。
  • 準暗黙的アーキテクチャ(SIA)は、複数の行動サンプリングを追加したガウス方策に対しても顕著な性能向上をもたらし、複雑な分布モデリングの価値を示した。
  • IDAC-Gaussian(ガウス方策を採用するがDGNベースのクリティックを有する)でさえもSACを上回った。これは、DGNベースのクリティックそのものが強い利点を提供していることを示している。
  • DGNベースのクリティックによる性能向上は、行動サンプリングの増加によるものではなく、分布モデリングそのものに起因する。SACに複数の行動を追加しても性能向上が得られず、IDACの向上は分布モデリングに起因することが確認された。
  • 2つのソート済みDGN出力の要素ごとの最小値は、過大評価を効果的に軽減し、すべての評価済み環境で訓練の安定化と収束の改善をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。