Skip to main content
QUICK REVIEW

[論文レビュー] Constrained Model-based Reinforcement Learning with Robust Cross-Entropy Method

Zuxin Liu, Hongyi Zhou|arXiv (Cornell University)|Oct 15, 2020
Reinforcement Learning in Robotics参考文献 32被引用数 14
ひとこと要約

本論文は、モデルの不確実性とスパarsな制約違反信号の下で制御シーケンスを最適化するために、頑健なクロスエントロピー法(RCE)を用いた制約付きモデルベース強化学習アルゴリズムを提案する。不確実性を考慮したニューラルネットワークアンサンブルとモデル予測制御を統合することで、Safety Gymベンチマークにおいて制約違反をほぼゼロに抑え、従来の最先端のモデルフリーおよびモデルベースベースラインを上回る優れたサンプル効率を達成した。

ABSTRACT

This paper studies the constrained/safe reinforcement learning (RL) problem with sparse indicator signals for constraint violations. We propose a model-based approach to enable RL agents to effectively explore the environment with unknown system dynamics and environment constraints given a significantly small number of violation budgets. We employ the neural network ensemble model to estimate the prediction uncertainty and use model predictive control as the basic control framework. We propose the robust cross-entropy method to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach learns to complete the tasks with a much smaller number of constraint violations than state-of-the-art baselines. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared with constrained model-free RL approaches. The code is available at \url{https://github.com/liuzuxin/safe-mbrl}.

研究の動機と目的

  • システムのダイナミクスや制約関数の事前知識がなくても動作する制約付きモデルベース強化学習アルゴリズムの開発を目的とする。
  • 制約違反のスパarsなインジケータ信号と限られた不正なサンプルしか得られない状況において、安全な方策を学習する課題に対処することを目的とする。
  • 解析的制約式が不適切な高次元の観測空間において、サンプル効率と制約の満たし方を向上させることを目的とする。
  • モデルの不確実性に対してロバストな最適化手法を設計し、学習中に不正な方策更新を防ぐことを目的とする。
  • 安全で重要な環境において、近似的に最適なタスクパフォーマンスを達成するとともに、制約違反を最小限に抑えることを目的とする。

提案手法

  • ダイナミクスモデルにおける予測不確実性を推定するためにニューラルネットワークアンサンブルを用い、不確実性を考慮した計画を可能にする。
  • 制御フレームワークとしてモデル予測制御(MPC)を採用し、有限時間窓内で制御シーケンスを最適化する。
  • 行動シーケンスを最適化するために、ロバスト・クロスエントロピー(RCE)法を導入し、安全なエリートサンプルのみを選択することで、不正な軌道によるバイアスを低減する。
  • RCEは、分布更新時に不正なサンプルを破棄するが、標準的なCEMはペナルティ付きの不正なエリートを含めるため、安全性が向上する。
  • 不確実性推定値と制約インジケータ信号を活用して、タスク報酬と制約の満たし方を同時に最適化する。
  • 解析的表現が不明な動的および制約関数を仮定せず、制約付きマルコフ決定過程(CMDP)フレームワーク内で動作する。

実験結果

リサーチクエスチョン

  • RQ1ダイナミクスと制約の両方が未知である状況下で、モデルベース強化学習アプローチが、制約違反をほぼゼロに抑えつつ高いタスクパフォーマンスを達成できるか?
  • RQ2標準的なCEMやモデルフリーのベースラインと比較して、ロバスト・クロスエントロピー(RCE)は安全性とサンプル効率をどのように向上させるか?
  • RQ3スパarsな制約フィードバックを持つ環境において、不確実性を考慮したダイナミクスモデルは、不正な探索をどれほど低減できるか?
  • RQ4制約違反の予算が限られている状況で、提案手法は制約の満たし方とタスク報酬の両面で、他の手法と比べてどの程度優れているか?
  • RQ5解析的制約関数が不適切な高次元のセンサリード観測環境において、RCEは性能を維持できるか?

主な発見

  • Point Goal 1 タスクでは、MPC-RCEは最初の10,000ステップでたった16.00件の制約違反を記録した。これはMPC-CEM(184.33)やMPC-random(169.0)と比べて顕著に少ない。
  • Car Goal 2 タスクでは、MPC-RCEは96.00件の違反を記録したが、MPC-CEM(578.00)やMPC-random(509.33)と比べて、はるかに優れた安全性を示した。
  • 制約付きモデルフリー強化学習手法と比較して、サンプル効率が数個のオーダーも向上した。後者ははるかに多くの不正なサンプルを必要としていた。
  • RCEは、CEMが不正なエリートにペナルティを課すことでサンプリング分布にバイアスが生じるのを避けることで、CEMを上回った。これにより、後続の反復で不正な行動が増加するのを防いだ。
  • より安全でない手法と同等のタスク報酬を達成しながら、はるかに低い制約違反数を維持したため、安全で重要な環境への適用に適していることがわかった。
  • 結果から、制約違反の許容予算が限られている状況下でも、RCEが標準的なCEMやモデルフリー手法よりも制約違反の低減に効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。