Skip to main content
QUICK REVIEW

[論文レビュー] Selective Dyna-style Planning Under Limited Model Capacity

Zaheer Abbas, Samuel Sokota|arXiv (Cornell University)|Jul 5, 2020
Artificial Intelligence in Games参考文献 43被引用数 6
ひとこと要約

本稿では、不完全なモデルにおける有害な計画を避けるために予測不確実性を用いた選択的ダイナスタイル計画を提案する。異分散回帰を用いてモデルの不適切さを検出するとともに、パrameter不確実性と組み合わせることで、モデル容量が限られた状況下でもロバストで、サンプル効率の高い学習を可能にし、非選択的計画およびアンサンブルベースの不確実性推定を上回る性能を発揮する。

ABSTRACT

In model-based reinforcement learning, planning with an imperfect model of the environment has the potential to harm learning progress. But even when a model is imperfect, it may still contain information that is useful for planning. In this paper, we investigate the idea of using an imperfect model selectively. The agent should plan in parts of the state space where the model would be helpful but refrain from using the model where it would be harmful. An effective selective planning mechanism requires estimating predictive uncertainty, which arises out of aleatoric uncertainty, parameter uncertainty, and model inadequacy, among other sources. Prior work has focused on parameter uncertainty for selective planning. In this work, we emphasize the importance of model inadequacy. We show that heteroscedastic regression can signal predictive uncertainty arising from model inadequacy that is complementary to that which is detected by methods designed for parameter uncertainty, indicating that considering both parameter uncertainty and model inadequacy may be a more promising direction for effective selective planning than either in isolation.

研究の動機と目的

  • 不完全なモデルを用いるモデルベース強化学習における課題に取り組むこと。特に、劣悪なモデルが学習を損なう可能性がある状況を想定する。
  • モデルが信頼できる領域でのみ利用する選択的計画メカニズムを構築すること。モデルが不正確な領域を回避する。
  • モデル容量が限られた状況下で、パrameter不確実性とは異なる、モデルの不適切さが予測不確実性の主要因であることを調査すること。
  • パrameter不確実性とモデルの不適切さを組み合わせることで、単独で用いる場合よりも計画のロバスト性が向上するかを評価すること。
  • 異分散回帰から学習された分散が、標準的な不確実性評価手法では捉えきれないモデルの不適切さを示す可能性があることを実証すること。

提案手法

  • 本手法は、入力に依存する予測分散を推定する異分散回帰を用い、モデル容量が限られた状況下でモデルの不適切さに起因する不確実性を捉える。
  • 選択的MVE(モデルベース価値拡張)は、学習済み分散に基づいて多ステップTDターゲットの重みを調整し、高不確実性領域でのモデル依存度を低減する。
  • 異分散回帰による不確実性推定とアンサンブル分散を組み合わせることで、よりロバストな性能を実現する。
  • モデルは、予測分散が入力に応じて変化することを許容する異分散損失関数で訓練され、モデルが不適切な領域を検出可能になる。
  • 再プレイバッファ上で真の二乗誤差との相関を用いて、不確実性の質を検証する。
  • 実験では、学習済み分散を用いた選択的MVEと、アンサンブル分散を用いたバージョンおよび非選択的MVEを比較する。

実験結果

リサーチクエスチョン

  • RQ1モデル容量が限られた状況下で、モデルの不適切さに起因する予測不確実性は、効果的に検出可能であり、選択的計画の指針として利用可能か?
  • RQ2異分散回帰による不確実性とアンサンブルによる不確実性を組み合わせることで、単独で用いる場合と比較して計画のロバスト性が向上するか?
  • RQ3学習済み分散を用いた選択的計画は、モデルが不完全な状況下でも、モデルベース価値拡張における壊滅的失敗を回避できるか?
  • RQ4限られたモデル容量の設定下で、アンサンブル分散の性能は時間経過とともにどのように低下するのか。その理由は何か?
  • RQ5異分散回帰による予測不確実性は、パrameter不確実性と補完的であるか。選択的計画の指針として有効か?

主な発見

  • 異分散回帰は、標準的なパrameter不確実性手法では捉えきれない、モデルの不適切さに起因する予測不確実性を検出可能である。
  • 学習済み分散を用いた選択的MVEは、非選択的MVEを上回り、モデルが不正確であっても計画の失敗を防げる。
  • アンサンブル分散は初期段階では良好に機能するが、学習が進むにつれて予測が収束することで性能が低下し、信頼性が低下する。
  • アンサンブルと異分散回帰の両方の分散を組み合わせた場合、全訓練プロセスにわたり、真の誤差との相関が、単独で用いる場合よりも強く保たれる。
  • 結果として、モデル容量が限られた状況下で、モデルの不適切さが不確実性の主要因であることが示され、効果的な選択的計画の実現には、パrameter不確実性と併せてこれを取り扱う必要があることが明らかになった。
  • 提案手法により、不完全なモデルを用いてもサンプル効率の高い学習が可能であり、包括的な不確実性推定に基づく選択的計画が、非選択的またはアンサンブルのみのアプローチよりも優れていることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。