Skip to main content
QUICK REVIEW

[論文レビュー] Model-Based Offline Planning with Trajectory Pruning

Xianyuan Zhan, Xiangyu Zhu|arXiv (Cornell University)|May 16, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

MOPPは、動作方針のガイドランスとQ値ベースの行動選択を用いて軌道ロールアウトの攻撃性を高めるとともに、ダイナミクスモデルの不確実性を用いて分布外の軌道を pruning する、軽量でモデルベースのオフライン計画フレームワークである。MOPPは、最先端のオフライン強化学習およびモデルベース計画法と比較して競争力のある性能を達成しており、実世界の応用における優れた制御の柔軟性を提供する。

ABSTRACT

The recent offline reinforcement learning (RL) studies have achieved much progress to make RL usable in real-world systems by learning policies from pre-collected datasets without environment interaction. Unfortunately, existing offline RL methods still face many practical challenges in real-world system control tasks, such as computational restriction during agent training and the requirement of extra control flexibility. The model-based planning framework provides an attractive alternative. However, most model-based planning algorithms are not designed for offline settings. Simply combining the ingredients of offline RL with existing methods either provides over-restrictive planning or leads to inferior performance. We propose a new light-weighted model-based offline planning framework, namely MOPP, which tackles the dilemma between the restrictions of offline learning and high-performance planning. MOPP encourages more aggressive trajectory rollout guided by the behavior policy learned from data, and prunes out problematic trajectories to avoid potential out-of-distribution samples. Experimental results show that MOPP provides competitive performance compared with existing model-based offline planning and RL approaches.

研究の動機と目的

  • モデルベースのオフライン強化学習における過剰に制限された計画の課題に取り組み、性能と探索の制限を緩和する。
  • 実世界のロボティクスや産業制御システムに一般的に見られる計算制約下でも高性能な計画を実現する。
  • 再訓練を伴わずに、動的報酬の変更や状態に基づく制約の適用が可能な制御の柔軟性を導入する。
  • 動作方針のガイドランスと不確実性に基づく軌道 pruning を組み合わせることで、探索と安全性のバランスを図る。
  • ベンチマーク制御タスクにおいて、オフライン強化学習およびモデルベース計画法のベースラインと比較して、競争力のある性能を達成する。

提案手法

  • オフラインデータセットからシステムのダイナミクスと動作方針を学習するために、自己回帰的ダイナミクスモデル(ADM)のアンサンブルを用いる。
  • 動作方針に従って軌道ロールアウトを行うが、制御されたずれを加えることで探索を促進する。
  • 各計画ステップでグリーディなmax-Q操作を実行し、オフラインQ値推定に基づいて高報酬行動を優先する。
  • ダイナミクスモデルの予測における不確実性を評価することで、未知の状態・行動ペアを含む軌道を pruning する。
  • 不確実性のしきい値(L)を統合し、探索と安全性のバランスを図り、分布外(OOD)サンプルを回避する。
  • 勾配フリー最適化手法(例:CEM)を用いたモデル予測制御(MPC)を活用し、効率的でリアルタイムな計画を実現する。

実験結果

リサーチクエスチョン

  • RQ1モデルベースのオフライン計画フレームワークとして、既存の手法で一般的な過剰な制限を避けながら高い性能を達成できるか?
  • RQ2オンライン相互作用なしに、不確実性に基づく軌道 pruning が、安全性と性能の両面でどのように向上するか?
  • RQ3動作方針のガイドランスとQ値推定に基づく攻撃的なロールアウトが、オフライン制御タスクにおけるサンプル効率と報酬の向上にどの程度寄与するか?
  • RQ4MOPPは、標準的な強化学習手法と比較して、報酬関数や制約の変更に対し、どの程度の性能と柔軟性を維持できるか?
  • RQ5オフライン計画において、サンプリングのずれによる探索と、不確実性による pruning による安全性の間で、最適なトレードオフは何か?

主な発見

  • MOPPは、最先端のオフライン強化学習およびモデルベース計画法と比較して、競争力のある性能を達成しており、多数のベンチマークでMBOPを上回っている。
  • max-Q操作により、価値関数のみに依存する場合と比較して、特に短いホライズン計画において顕著な性能向上が得られた。
  • 最適な不確実性しきい値(L=2.0)を用いた軌道 pruning が、最高の性能と最小の分散を達成したが、あまりに厳密すぎたり緩すぎたりするしきい値では結果が劣化した。
  • MOPPは短い計画ホライズン(H=2,4)でも高い性能を維持しており、効率性とロバストネスを示している。
  • MOPPは効果的な制御の柔軟性を提供する:Q値の再評価や pruning の再適用により、再訓練を伴わず新しい報酬関数や制約に適応できる。
  • 制約付きタスクでは、不確実性に基づく pruning を用いたMOPP-RCが、制約違反を効果的に低減しながら高い性能を維持しており、報酬ペナルティのみのアプローチを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。