Skip to main content
QUICK REVIEW

[論文レビュー] Safety-Guided Deep Reinforcement Learning via Online Gaussian Process Estimation

Jiameng Fan, Wenchao Li|arXiv (Cornell University)|Mar 6, 2019
Gaussian Processes and Bayesian Inference参考文献 31被引用数 16
ひとこと要約

本論文は、オンラインのガウス過程(GP)推定を用いて軌道ベースの安全コストをリャプノフ関数候補としてモデル化する、安全を考慮した深層強化学習フレームワークを提案する。これにより、探索中の証明可能な安定性と災害の低減が可能になる。本手法は、ヴァナイルな DDPG と比較して、訓練を著しく高速化し、安全でない行動を減少させる。半チータータスクにおいて、本手法は 50,000 ステップでベースライン性能に到達したのに対し、DDPG は 700,000 ステップを要した。

ABSTRACT

An important facet of reinforcement learning (RL) has to do with how the agent goes about exploring the environment. Traditional exploration strategies typically focus on efficiency and ignore safety. However, for practical applications, ensuring safety of the agent during exploration is crucial since performing an unsafe action or reaching an unsafe state could result in irreversible damage to the agent. The main challenge of safe exploration is that characterizing the unsafe states and actions is difficult for large continuous state or action spaces and unknown environments. In this paper, we propose a novel approach to incorporate estimations of safety to guide exploration and policy search in deep reinforcement learning. By using a cost function to capture trajectory-based safety, our key idea is to formulate the state-action value function of this safety cost as a candidate Lyapunov function and extend control-theoretic results to approximate its derivative using online Gaussian Process (GP) estimation. We show how to use these statistical models to guide the agent in unknown environments to obtain high-performance control policies with provable stability certificates.

研究の動機と目的

  • 安全な探索の課題に取り組むこと。特に、安全でない行動が不可逆的損傷を引き起こす可能性がある、連続的かつ高次元の状態・行動空間における深層強化学習において。
  • 未知の環境において、高確率の軌道ベースの安全保証を提供するモデルフリーの強化学習アルゴリズムを開発すること。
  • オンラインのガウス過程を用いて、累積的安全コストをリャプノフ関数候補としてモデル化することで、ポリシー最適化に安全を統合すること。
  • 標準のオフポリシー DRL 法(例:DDPG)と比較して、サンプル効率を向上させ、訓練中の災害を低減すること。

提案手法

  • 安定性認証を可能にするために、安全コストの状態-行動価値関数をリャプノフ関数候補として定式化する。
  • 安全コスト価値関数の微分を推定するために、オンラインのガウス過程回帰を用い、統計的不確実性の境界を提供する。
  • 訓練中に収集した新しい軌道データ(状態、行動、次の状態、報酬、安全コスト)を反復的に用いて、GP モデルを更新する。
  • 期待報酬を最大化するとともに、推定された累積的安全コストを最小化する目的関数を用いてポリシーを最適化する。
  • GP モデルからの信頼区間をポリシー更新に組み込み、安全な探索を優先する。
  • 効率性を確保するため、固定された初期安全軌道を用いて GP モデルをブートストラップし、2,000 サンプルの上限を持つデータセットを維持する。

実験結果

リサーチクエスチョン

  • RQ1統計的関数近似を用いて、オンライン GP 推定を用いて軌道ベースの安全を効果的にモデル化し、深層 RL に統合できるか?
  • RQ2未知の環境におけるポリシー学習中に、オンライン GP 推定が安全と安定性をどのように向上させるか?
  • RQ3安全コスト価値関数から導出されたリャプノフ関数を用いることで、証明可能な安定性と安全性を持つポリシーが得られるか?
  • RQ4オンライン GP による適応と固定 GP モデルとを比較した場合、時間経過に伴う安全性とパフォーマンスの維持において、どちらが優れるか?
  • RQ5本手法は、複雑な歩行タスクにおいて、訓練中の災害数を低減し、収束を高速化できるか?

主な発見

  • 提案手法は、半チータータスクにおいて、ヴァナイルな DDPG が要する 700,000 ステップと比較して、約 50,000 ステップでベースライン性能に到達した。
  • オンライン GP を用いた安全ガイドド DDPG は、学習中における訓練時災害(例:転倒)をゼロにまで低減したのに対し、ヴァナイルな DDPG ではそのような低減が見られなかった。
  • オンライン GP 適応は固定 GP モデルを著しく上回り、訓練が進行するに従い、固定 GP の性能劣化が観察された。
  • 同じウォールタイム内において、本手法はより高い累積報酬と低い安全コストを達成した。
  • 初期安全軌道の使用により、初期の GP 推定の信頼性が向上し、学習開始から安定した学習が可能になった。
  • GP モデルからの統計的不確実性をポリシー最適化中に活用することで、高確率の安定性証明を提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。