Skip to main content
QUICK REVIEW

[論文レビュー] Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification

Daniel J. Mankowitz, Dan A. Calian|arXiv (Cornell University)|Oct 20, 2020
Reinforcement Learning in Robotics参考文献 29被引用数 4
ひとこと要約

本稿では、状態の摂動が予期しない場合に、制約を満たしつつもその影響に強いポリシーを学習できるようにする、連続制御における制約付きモデル誤表示問題に対処するため、R3CおよびRC強化学習目的を提案する。ロバスト制約付きMDPを定式化し、対応するベルマン作用素を定義することで、収束性を保証するとともに、6つのMuJoCoタスクにおいてベースラインと比較して制約満たしの向上と報酬のロバスト性が向上することを示した。

ABSTRACT

Many real-world physical control systems are required to satisfy constraints upon deployment. Furthermore, real-world systems are often subject to effects such as non-stationarity, wear-and-tear, uncalibrated sensors and so on. Such effects effectively perturb the system dynamics and can cause a policy trained successfully in one domain to perform poorly when deployed to a perturbed version of the same domain. This can affect a policy's ability to maximize future rewards as well as the extent to which it satisfies constraints. We refer to this as constrained model misspecification. We present an algorithm that mitigates this form of misspecification, and showcase its performance in multiple simulated Mujoco tasks from the Real World Reinforcement Learning (RWRL) suite.

研究の動機と目的

  • 訓練時に観測されなかった状態の摂動が生じる状況下で、名目環境で学習したポリシーが失敗するという、制約付きモデル誤表示(CMM)の課題に対処すること。
  • 実稼働環境で摂動が加わった際に、性能の低下や制約違反の両方に対して、ポリシーがロバストであることを保証すること。
  • 不確実性下で報酬と制約満たしの両方を同時に最適化できる統合された強化学習フレームワークの構築。
  • D4PGやDMPOといった最先端の連続制御アルゴリズムに、新たな価値関数およびベルマン作用素の定義を導入することで、モデル摂動に対するロバスト性を付与すること。

提案手法

  • 状態遷移における不確実性を遷移確率のあいまいさ集合としてモデル化するロバスト制約付きMDP(RC-MDP)の定式化を提案する。
  • 最悪ケースの報酬と制約満たしを最適化する2つの新しい強化学習目的、ロバスト報酬のロバスト制約(R3C)とロバスト制約(RC)を定義する。
  • アクタ・クリティックアルゴリズムにおけるポリシー評価の過程で固定点への収束を保証する、R3CおよびRC用のベルマン作用素を導入する。
  • D4PGおよびDMPOの上位にR3CおよびRCのアルゴリズム変種を実装し、ポリシー評価ステップにロバスト価値関数の更新を統合する。
  • 制約の違反と報酬最大化のバランスを取るために、ラグランジュ乗数を動的に調整するラグランジュ緩和を用いる。
  • 未知の摂動が加わる実世界の運用を想定し、ホールドアウトセットとしての摂動付き環境を用いてロバスト性を評価する。

実験結果

リサーチクエスチョン

  • RQ1訓練時に観測されなかった摂動が加わる状況下でも、制約を満たし続けるように強化学習エージェントを学習させることは可能か?
  • RQ2モデル誤表示の下で、報酬と制約満たしのロバスト最適化が、学習の安定性および性能に与える影響は何か?
  • RQ3提案されたR3CおよびRC目的は、標準的な制約付き強化学習と比較して、未知の摂動付き環境への一般化性能を向上させるか?
  • RQ4ロバスト性の導入は、制約の過剰な厳密さ(過剰に慎重な行動)を引き起こすか?
  • RQ5ロバスト制約満たしを最適化する過程で、ラグランジュ乗数はどのように変化するか?

主な発見

  • R3C-DMPOおよびRC-DMPOアルゴリズムは、6つのMuJoCoタスクにおいて、名目環境およびホールドアウトの摂動付き環境の両方で、すべてのベースラインを上回る制約満たし性能を達成した。
  • ロバストな変種(R3C-DMPO、RC-DMPO)は、ホールドアウトセットにおける制約報酬(J_C^π)が顕著に向上しており、未知の摂動に対して優れたロバスト性を示した。
  • 非ロバストなベースライン(C-DMPO、R-DMPO)は、名目環境では成功したが、ホールドアウト環境では制約を満たせなかった。
  • 名目環境で制約が満たされていても、ロバストなアルゴリズムではラグランジュ乗数がゼロでないまま維持されており、不確実性下での制約の積極的 enforcing を示している。
  • 学習曲線から、ロバストなアルゴリズムは制約処理においてより慎重なポリシーに収束しており、制約報酬が常に閾値β未満に保たれていることが示され、過剰に慎重な行動の可能性が示唆された。
  • R3CおよびRC用に提案されたベルマン作用素は固定点に収束することが確認され、本手法の理論的基盤の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。