Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Combat Compounding-Error in Model-Based Reinforcement Learning

Chenjun Xiao, Yifan Wu|arXiv (Cornell University)|Dec 24, 2019
Reinforcement Learning in Robotics参考文献 18被引用数 16
ひとこと要約

この論文では、時系列差分学習を用いて学習された状態に依存するモデル誤差推定に基づき、モデルベース強化学習における計画ホライズンを適応的に選択するAdaMVEを提案する。誤差が大きいモデル領域での誤差の累積を避けるために、ロールアウトホライズンを動的に調整することで、サンプル効率が著しく向上し、グリッドワールドおよび連続制御タスクにおいて、モデルフリーおよび非適応的モデルベースのベースラインを上回る性能を発揮する。

ABSTRACT

Despite its potential to improve sample complexity versus model-free approaches, model-based reinforcement learning can fail catastrophically if the model is inaccurate. An algorithm should ideally be able to trust an imperfect model over a reasonably long planning horizon, and only rely on model-free updates when the model errors get infeasibly large. In this paper, we investigate techniques for choosing the planning horizon on a state-dependent basis, where a state's planning horizon is determined by the maximum cumulative model error around that state. We demonstrate that these state-dependent model errors can be learned with Temporal Difference methods, based on a novel approach of temporally decomposing the cumulative model errors. Experimental results show that the proposed method can successfully adapt the planning horizon to account for state-dependent model accuracy, significantly improving the efficiency of policy learning compared to model-based and model-free baselines.

研究の動機と目的

  • モデルが不正確な場合に生じる誤差の累積問題に対処すること。
  • 固定ホライズンではなく、局所的なモデルの精度に基づいて計画ホライズンを適応的に選択する手法を開発すること。
  • グローバルなモデルが不完全であっても、局所的に正確なモデルコンポーネントを活用できるようにすること。
  • モデルが信頼できない領域ではモデルベース計画とモデルフリー更新を組み合わせることで、サンプル効率を向上させること。
  • 時系列差分学習を用いて効率的にモデル誤差推定を学習し、計画ホライズンのリアルタイムな適応を可能にすること。

提案手法

  • 計画ホライズンにおける累積的モデル誤差の新しい時系列的分解を導入し、状態に依存する誤差推定のTD学習を可能にする。
  • モデルロールアウト上のTD更新を用いて訓練されたニューラルネットワークにより、累積的モデル誤差関数 $\hat{\mathcal{E}}(s, h)$ を学習する。
  • 学習済み誤差推定に基づき、各状態における計画ホライズンを適応的に選択し、誤差が大きい領域では短いホライズンを優先する。
  • 固定ホライズンを状態に依存するホライズンに置き換えることで、Model-based Value Expansion (MVE) を拡張する。
  • オンライン学習中にモデル品質を向上させるための選択的モデル学習戦略を導入し、予測誤差が低いデータのみを用いる。
  • モデル誤差関数 $\hat{\mathcal{E}}$ は参照方策を用いて学習され、安定的かつ一般化可能な誤差推定を提供し、モデル学習のガイドラインとして機能する。

実験結果

リサーチクエスチョン

  • RQ1モデルが不正確な場合に、状態に依存する計画ホライズンは、モデルベースRLにおける誤差の累積を低減できるか?
  • RQ2時系列差分学習は、複数の計画ステップにわたる累積的モデル誤差を効果的に推定できるか?
  • RQ3適応的ホライズン選択は、固定ホライズンまたはモデルフリー手法と比較してサンプル効率を向上させるか?
  • RQ4モデルがオンラインで学習され、しばしば不正確である状況でも、本手法は性能を維持できるか?
  • RQ5学習された誤差関数は、選択的モデル学習をガイドすることで、全体のポリシー性能を向上させられるか?

主な発見

  • 不正確なモデルを有するグリッドワールドの迷路において、AdaMVEはモデルフリーのDDPGおよび非適応的MVEを著しく上回り、特にモデルが不正確な領域で顕著な性能向上を示す。
  • HalfCheetah や Swimmer などの連続制御タスクにおいて、事前学習済みモデルを用いたAdaMVEは、DDPGおよびMVEを上回り、サンプル効率の向上を実証する。
  • オンラインモデル学習においては、本手法の基礎的バージョン(vanilla AdaMVE)は、リアルタイムのモデル誤差を追跡する不安定性のため、ベースラインを改善できない。
  • 提案された選択的モデル学習(SML_AdaMVE)戦略により、オンラインモデルでも顕著な性能向上が達成され、すべてのベースライン(STEVEを含む)を上回る。
  • 本手法は、アンサンブルや確率的計画を必要とせず、効率的な適応的ホライズン選択を可能にする、1つの微分可能なモデル誤差関数を学習する。
  • 実験的結果から、MVEの最適な固定ホライズンはしばしば H=1 であることが示され、固定ホライズンアプローチの限界と適応的アプローチの優位性が明確になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。