Skip to main content
QUICK REVIEW

[論文レビュー] Recurrent Off-policy Baselines for Memory-based Continuous Control

Zhihan Yang, Van‐Dinh Nguyen|arXiv (Cornell University)|Oct 25, 2021
Reinforcement Learning in Robotics参考文献 31被引用数 13
ひとこと要約

本論文は、部分的に観測可能な連続的制御タスクを扱うために、RNNを用いた記憶ベースの時系列表現を可能にするDQN、TD3、SACの拡張版として、RDPG、RTD3、RSACという再帰的オフポリシー深層強化学習アルゴリズムを提案する。RSACは、多様なタスクでほぼ最適性能を達成する信頼性の高いベースラインとして浮上するが、体系的な探索の課題は依然として残っている。

ABSTRACT

When the environment is partially observable (PO), a deep reinforcement learning (RL) agent must learn a suitable temporal representation of the entire history in addition to a strategy to control. This problem is not novel, and there have been model-free and model-based algorithms proposed for this problem. However, inspired by recent success in model-free image-based RL, we noticed the absence of a model-free baseline for history-based RL that (1) uses full history and (2) incorporates recent advances in off-policy continuous control. Therefore, we implement recurrent versions of DDPG, TD3, and SAC (RDPG, RTD3, and RSAC) in this work, evaluate them on short-term and long-term PO domains, and investigate key design choices. Our experiments show that RDPG and RTD3 can surprisingly fail on some domains and that RSAC is the most reliable, reaching near-optimal performance on nearly all domains. However, one task that requires systematic exploration still proved to be difficult, even for RSAC. These results show that model-free RL can learn good temporal representation using only reward signals; the primary difficulty seems to be computational cost and exploration. To facilitate future research, we have made our PyTorch implementation publicly available at https://github.com/zhihanyang2022/off-policy-continuous-control.

研究の動機と目的

  • 部分的に観測可能な環境における記憶ベースの連続的制御のためのモデルフリーでオフポリシーなベースラインのギャップを埋めること。
  • 完全な観測-行動履歴を用いる再帰的バージョンのDDPG、TD3、SAC(RDPG、RTD3、RSAC)の実装と評価を行うこと。
  • オフポリシー強化学習における、共有再帰表現やRNNアーキテクチャ(LSTM、GRU、VRNN)といった重要な設計選択の影響を調査すること。
  • 将来の履歴に基づく深層強化学習研究のための信頼性の高い、公開可能な実装を確立すること。
  • 密度の高い報酬ドメインでは優れた性能を示すが、報酬が疎で体系的な探索を要するタスクでは、モデルフリー強化学習の限界を評価すること。

提案手法

  • RNNを用いて全履歴 $ h_t = \{o_{1:t}, a_{1:t-1}\} $ を処理するようにDDPG、TD3、SACを拡張し、RDPG、RTD3、RSACを構築する。
  • 再帰的エージェントに適した標準的な経験リプレイを変更し、全履歴を保存するとともに、RNNの隠れ状態を用いて時系列的文脈を維持する。
  • RSAC-Shareを提案:エージェントと2つのクライアントに共通の再帰的エンコーダーを設け、報酬損失のみで最適化することで、計算効率と表現品質を向上させる。
  • RNN、エージェント、クライアントのエンドツーエンド学習のため、時系列に沿った勾配バックプロパゲーション(BPTT)を用いる。
  • LSTM、GRU、VRNNといった異なるRNNタイプの性能と学習安定性を、記憶ベースの制御タスクにおいて比較する。
  • DrQ [21] の知見を応用し、画像ベースの強化学習で共通のCNNを共有する手法を、RNNに対しても同様の原理を適用してパラメータ効率と表現学習を向上させる。

実験結果

リサーチクエスチョン

  • RQ1RNNを備えたオフポリシー深層強化学習アルゴリズムは、部分的に観測可能な環境において、僅かな報酬信号からの有効な時系列表現を学習できるか?
  • RQ2共有再帰表現やRNNアーキテクチャ(LSTM対比GRU対比VRNN)といった設計選択が、学習安定性と性能に与える影響は何か?
  • RQ3エージェントとクライアント間で再帰的エンコーダーを共有することで、サンプル効率と性能が向上するか?また、トレーニングダイナミクスにおけるトレードオフは何か?
  • RQ4短期間および長期間の部分的に観測可能な制御タスクにおいて、RDPG、RTD3、RSACの信頼性と漸近的性能はどのように比較されるか?
  • RQ5報酬が疎で体系的な探索を要するタスクにおいて、POMDPにおけるモデルフリー強化学習の持続的な課題は何か?

主な発見

  • RSACは、テストされたほぼすべての部分的に観測可能な連続的制御ドメインでほぼ最適な性能を達成し、RDPGやRTD3を上回る。
  • RDPGとRTD3は、特定のタスクで予期しない失敗を示しており、オフポリシー手法であっても、価値の過大評価やポリシーの崩壊が依然として深刻な問題であることが示された。
  • RSAC-Share(共通の再帰的エンコーダーを用い、クライアントの損失のみで最適化)は、RSACと同等の性能を達成しながら、RNN計算量を半減させ、トレーニング時間を顕著に短縮した。
  • RSAC-Shareは、2つのクライアントのQ値の相関が高くなる(共有表現のおかげ)が、これはクリッピングされた二重Q学習の有効性を低下させる可能性がある。
  • RSAC-LSTMとRSAC-GRUは、漸近的性能で同等の水準に達したが、RSAC-VRNNは著しく性能が低く、長期間のシーケンスにおける勾配消失/爆発の問題が原因とされる。
  • 密度の高い報酬タスクでは優れた性能を示すが、体系的な探索を要する1つのタスクで、すべてのモデルが困難を示した。これは、POMDPにおけるモデルフリー強化学習の持続的な課題を浮き彫りにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。