Skip to main content
QUICK REVIEW

[論文レビュー] Value Iteration in Continuous Actions, States and Time

Michael Lutter, Shie Mannor|arXiv (Cornell University)|May 10, 2021
Reinforcement Learning in Robotics参考文献 51被引用数 8
ひとこと要約

この論文では、既知の制御アフィンダイナミクスモデルを用いて、連続状態および連続行動空間への価値反復の拡張を可能にする連続的適合価値反復(cFVI)を提案する。連続時間の定式化と閉形式の最適行動計算を活用することで、cFVIはシミュレーションにおいて深層強化学習と同等の性能を達成し、ドメインランダム化なしに物理系においても優れた耐障害性を示し、アクタクリティックベースラインを上回る。

ABSTRACT

Classical value iteration approaches are not applicable to environments with continuous states and actions. For such environments, the states and actions are usually discretized, which leads to an exponential increase in computational complexity. In this paper, we propose continuous fitted value iteration (cFVI). This algorithm enables dynamic programming for continuous states and actions with a known dynamics model. Leveraging the continuous-time formulation, the optimal policy can be derived for non-linear control-affine dynamics. This closed-form solution enables the efficient extension of value iteration to continuous environments. We show in non-linear control experiments that the dynamic programming solution obtains the same quantitative performance as deep reinforcement learning methods in simulation but excels when transferred to the physical system. The policy obtained by cFVI is more robust to changes in the dynamics despite using only a deterministic model and without explicitly incorporating robustness in the optimization. Videos of the physical system are available at \url{https://sites.google.com/view/value-iteration}.

研究の動機と目的

  • 離散化に起因する古典的価値反復の連続状態および連続行動空間における限界を解消すること。
  • 既知のダイナミクスモデルを用いて、連続環境における動的計画法の実現を可能にすること。
  • 深層RLベースラインと比較して、耐障害性およびsim2real移行性能の向上を図ること。
  • 連続時間、制御アフィン系における最適制御の閉形式解を提供すること。
  • 方策勾配最適化を用いずに、価値反復を連続ドメインに効率的に拡張できることを示すこと。

提案手法

  • 割引定数 ρ と連続時間報酬 r_c を用いて、強化学習問題を連続時間で定式化する。
  • 連続時間における最適制御の基盤として、ハミルトニアン・ジャコビ・ベルマン(HJB)方程式を用いる。
  • 制御アフィンダイナミクス下での最適行動の閉形式解を導出し、解析的方策計算を可能にする。
  • 閉形式行動を用いて価値関数ターゲットを計算することで、繰り返し価値反復を実行し、方策ネットワークの最適化を回避する。
  • 関数近似(例:ニューラルネットワーク)を用いて価値関数を表現し、連続ドメインにおけるスケーラブルな学習を可能にする。
  • 連続時間定式化を活用して、時間離散化に起因するアーチファクトを回避し、物理系への移行における安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1離散化や方策勾配最適化を用いずに、価値反復を連続状態および連続行動空間に拡張できるか?
  • RQ2閉形式最適行動を有する連続時間定式化は、sim2real移行における耐障害性を向上させるか?
  • RQ3物理系において、cFVIは深層RL手法と比較して性能および方策品質でどのように差をつけるか?
  • RQ4明示的な耐障害性正則化なしに、決定的モデルが確率的深層RLアプローチよりもより耐障害性の高い方策を生成できるか?
  • RQ5連続時間定式化は、非線形制御タスクにおける滑らかで対称的な方策を達成するために果たす役割は何か?

主な発見

  • cFVIは、Furutaの振り子やカートポールなどの非線形制御タスクにおいて、シミュレーションで深層強化学習手法と同等の性能を達成する。
  • 物理系において、cFVIは均一な初期状態分布を用いた深層RLベースラインを著しく上回り、特に初期状態分布が大きい場合に顕著である。
  • cFVIが学習する方策は対称的かつ滑らかであり、深層RL手法が生成する非対称方策とは異なり、振り子の両側からのスイングアップを成功させる。
  • cFVIは不安定な平衡点付近で価値関数に鋭いリッジを生成しており、臨界状態付近での精密な制御を示している。
  • cFVIで用いられる決定的モデルは、ドメインランダム化や明示的な耐障害性正則化なしに、深層RL手法よりもより耐障害性の高い方策を生成する。
  • 連続時間定式化により、回帰による直接的HJB残差最小化と比較して、より安定的かつ効率的な最適化が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。