Skip to main content
QUICK REVIEW

[論文レビュー] Trust the Model When It Is Confident: Masked Model-based Actor-Critic

Feiyang Pan, Jia He|arXiv (Cornell University)|Oct 10, 2020
Reinforcement Learning in RoboticsComputer Science参考文献 21被引用数 19
ひとこと要約

本稿では、不確実性に基づくマスクを用いて、モデルの信頼性が高い状態行動ペアに制限して方策最適化を行うことで、不正確なモデルのシミュレーションに依存するのを減らす、新しいモデルベース強化学習アルゴリズムであるMasked Model-based Actor-Critic(M2AC)を提案する。M2ACは、特に長時間のシミュレーションやノイジーな環境において、高いサンプル効率とロバスト性を達成しており、MBPOなどの最先端手法を上回る性能を示す。

ABSTRACT

It is a popular belief that model-based Reinforcement Learning (RL) is more sample efficient than model-free RL, but in practice, it is not always true due to overweighed model errors. In complex and noisy settings, model-based RL tends to have trouble using the model if it does not know when to trust the model. In this work, we find that better model usage can make a huge difference. We show theoretically that if the use of model-generated data is restricted to state-action pairs where the model error is small, the performance gap between model and real rollouts can be reduced. It motivates us to use model rollouts only when the model is confident about its predictions. We propose Masked Model-based Actor-Critic (M2AC), a novel policy optimization algorithm that maximizes a model-based lower-bound of the true value function. M2AC implements a masking mechanism based on the model's uncertainty to decide whether its prediction should be used or not. Consequently, the new algorithm tends to give robust policy improvements. Experiments on continuous control benchmarks demonstrate that M2AC has strong performance even when using long model rollouts in very noisy environments, and it significantly outperforms previous state-of-the-art methods.

研究の動機と目的

  • モデルベース強化学習における根本的課題である、モデルの信頼性を判断する方法、特にノイジーな環境やデータが少ない状況での信頼性判断に寄与すること。
  • モデル誤差が蓄積される長時間のモデルシミュレーションを用いる場合に、既存のモデルベース手法の性能が低下する問題を克服すること。
  • モデルが信頼できる状況でのみモデル生成データを活用することで、サンプル効率とロバスト性を向上させること。
  • 不確実性に配慮したマスクを用いて、モデルベースのシミュレーションと現実の環境経験のバランスを取る実用的なアルゴリズムを開発すること。
  • モデルの誤差が小さい領域でのみモデルを使用することで、真の価値関数に対するタイトなバウンディングが達成され、方策性能が向上することを示すこと。

提案手法

  • モデルの不確実性に基づいて、モデルが生成した遷移をフィルタリングするマスク機構を提案し、信頼性の高い予測のみを方策学習に使用することを可能にする。
  • 不確実性を考慮した真の価値関数のモデルベース下界を導入し、マスクされたシミュレーション結果を安全に用いた方策最適化を可能にする。
  • 予測の不一致を測定し、マスクの意思決定を支援するために、一対多(OvR)不確実性推定を用いたアンサンブルモデルを採用する。
  • シミュレーションの深さが深くなるに従い、モデルシミュレーションへの依存を段階的に減らすために、線形減少するマスク率 $ w_h = \frac{H_{\text{max}} - h}{2(H_{\text{max}} + 1)} $ を実装する。
  • マスクされたモデルシミュレーションと実環境の経験リプレイをハイブリッドなアクタ・クリティックフレームワークで統合し、学習の安定化と一般化性能の向上を図る。
  • 探索と活用のバランスを取るためにペナルティ係数 $ \alpha $ を適用し、アブレーションスタディで $ \alpha = 0.001 $ が最適であると特定された。

実験結果

リサーチクエスチョン

  • RQ1高信頼性の予測に限定してモデルベースのシミュレーションを実行することで、モデルと現実環境の報酬の差を縮小できるか?
  • RQ2不確実性に基づくマスクは、ノイジーまたは複雑な環境におけるサンプル効率とロバスト性にどのように影響するか?
  • RQ3連続制御タスクにおける長時間のモデルシミュレーションにおいて、最適なマスク戦略(例:マスク率、モード)は何か?
  • RQ4不確実性推定手法の選択(例:OvR対比 vs. OvA対比 vs. 負の尤度)がアルゴリズムの性能に与える影響は?
  • RQ5高いダイナミクスノイズを伴う環境でも、長時間のシミュレーションを用いるモデルベース強化学習アルゴリズムは、依然として高い性能を維持できるか?

主な発見

  • M2ACは、HalfCheetah-noisy2環境においてMBPOやその他の最先端手法を顕著に上回り、MBPOが失敗する20ステップのモデルシミュレーションでも高い報酬を達成する。
  • HalfCheetahおよびWalker2dタスクにおいて、M2ACはノイズレベルやシミュレーション長が変化しても安定した性能を維持するが、MBPOの性能はノイズ増加に伴い急激に低下する。
  • マスク率 $ w = 0.25 $(線形減衰により)は、さまざまな環境やシミュレーション長でロバストな性能を発揮し、長時間シミュレーションでは $ w = 0.9 $ でもわずかな性能低下にとどまる。
  • ストップしないマスクされたシミュレーションモード(non-stop)は、より多様な仮想遷移の分布を提供するため、ハードストップモードを上回る性能を示し、方策の一般化を向上させる。
  • 低データ環境では、OvR不確実性推定がOvA不一致や負の尤度よりも優れた性能を発揮する。これは、OvRがモデルの不一致をより適切に捉えているためである。
  • $ \alpha = 0.001 $ の場合、M2ACは探索と活用のバランスが最良となり、モデルへの過剰適合を回避しながらも、その予測を効果的に活用できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。