Skip to main content
QUICK REVIEW

[論文レビュー] Safe Model-based Reinforcement Learning with Robust Cross-Entropy Method.

Zuxin Liu, Hongyi Zhou|arXiv (Cornell University)|Oct 15, 2020
Reinforcement Learning in Robotics参考文献 13被引用数 8
ひとこと要約

本論文は、不確実性を考慮したニューラルネットワークアンサンブルを用いてダイナミクスをモデル化し、違反信号から制約を推定する、安全なモデルベース強化学習手法を提案する。モデル予測制御フレームワーク内に、モデル不確実性下での制御シーケンス最適化を目的としたロバストな交差エントロピー法を採用し、Safety Gym環境において、ベースライン手法に比べて優れた制約満足度とサンプル効率を達成する。

ABSTRACT

This paper studies the safe reinforcement learning (RL) problem without assumptions about prior knowledge of the system dynamics and the constraint function. We employ an uncertainty-aware neural network ensemble model to learn the dynamics, and we infer the unknown constraint function through indicator constraint violation signals. We use model predictive control (MPC) as the basic control framework and propose the robust cross-entropy method (RCE) to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach achieves better constraint satisfaction than baseline safe RL methods while maintaining good task performance. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared to constrained model-free RL approaches. The code is available at this https URL.

研究の動機と目的

  • システムのダイナミクスや制約関数に関する事前知識なしに安全な強化学習を実現すること。
  • モデル不確実性と安全制約を同時に取り扱うモデルベース強化学習フレームワークの構築。
  • 制約付きモデルフリー強化学習アプローチに比べて、サンプル効率を向上させること。
  • 連続的制御環境において、バイナリの違反信号のみを用いて、高い制約満足度を達成すること。

提案手法

  • 不確実性の定量化を可能にするニューラルネットワークアンサンブルを用いて、システムのダイナミクスを学習する。
  • 制約違反のバイナリインジケータ信号から、未知の制約関数を推定する。
  • 逐次的意思決定のための制御フレームワークとして、モデル予測制御(MPC)を適用する。
  • モデル不確実性および安全制約下での制御シーケンス最適化のため、ロバストな交差エントロピー法(RCE)を導入する。
  • 不確実性推定を活用して、安全制約を尊重したまま制御行動をロバストに探索する。
  • 不確実性を考慮したダイナミクスモデリングと制約推定を統合し、安全な探索と制御をガイドする。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習アプローチは、システムのダイナミクスや制約関数に関する事前知識なしに安全な制御を達成できるか?
  • RQ2バイナリの違反信号のみから、制約関数をどの程度効果的に推定できるか?
  • RQ3不確実性を考慮したモデリングは、安全強化学習における制約満足度をどの程度向上させるか?
  • RQ4提案手法のRCEベースMPCは、モデルフリーの制約付きRLベースラインに比べて、どの程度サンプル効率が優れているか?
  • RQ5モデル不確実性下でのロバスト最適化は、安全性とパフォーマンスのトレードオフをどのように改善できるか?

主な発見

  • 提案手法は、Safety Gymベンチマークにおいて、ベースラインの安全強化学習手法に比べて顕著に優れた制約満足度を達成した。
  • ダイナミクスや制約に関する事前知識がなくても、高いタスクパフォーマンスを維持しながら安全な制御を実現した。
  • 制約付きモデルフリー強化学習ベースラインに比べて、数オーダーの優れたサンプル効率を示した。
  • 不確実性を考慮したアンサンブルモデルの使用により、制御最適化におけるモデル誤差に対するロバストネスが向上した。
  • ロバストな交差エントロピー法は、モデル不確実性下でも探索と安全性のバランスを効果的に実現した。
  • バイナリ信号のみからの制約推定が、複雑な環境においても安全なポリシー学習をガイドするのに十分であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。