Skip to main content
QUICK REVIEW

[論文レビュー] Hamilton-Jacobi Deep Q-Learning for Deterministic Continuous-Time Systems with Lipschitz Continuous Controls

Jeongho Kim, Jae-Uk Shin|arXiv (Cornell University)|Oct 27, 2020
Adaptive Dynamic Programming Control参考文献 55被引用数 15
ひとこと要約

本稿では、リプシッツ連続な制御を伴う決定論的連続時間最適制御のためのモデルフリー強化学習手法であるハミルトニアン・ジャコビ・ディープQラーニング(HJ DQN)を提案する。動的計画法に基づくQ関数から導出された半離散的ハミルトニアン・ジャコビ・ベルマン(HJB)方程式を定式化することで、システムダイナミクスの離散化を回避しつつデータ駆動型学習を可能にし、リプシッツ制御条件下で最適Q関数への収束を達成する。

ABSTRACT

In this paper, we propose Q-learning algorithms for continuous-time deterministic optimal control problems with Lipschitz continuous controls. Our method is based on a new class of Hamilton-Jacobi-Bellman (HJB) equations derived from applying the dynamic programming principle to continuous-time Q-functions. A novel semi-discrete version of the HJB equation is proposed to design a Q-learning algorithm that uses data collected in discrete time without discretizing or approximating the system dynamics. We identify the condition under which the Q-function estimated by this algorithm converges to the optimal Q-function. For practical implementation, we propose the Hamilton-Jacobi DQN, which extends the idea of deep Q-networks (DQN) to our continuous control setting. This approach does not require actor networks or numerical solutions to optimization problems for greedy actions since the HJB equation provides a simple characterization of optimal controls via ordinary differential equations. We empirically demonstrate the performance of our method through benchmark tasks and high-dimensional linear-quadratic problems.

研究の動機と目的

  • リプシッツ連続な制御を伴う連続時間の決定論的最適制御のためのモデルフリーRL手法の不足を解消すること。
  • 細かい時間離散化を要し、不安定性や非効率性に悩まされる離散時間RL手法の限界を克服すること。
  • ハミルトニアン・ジャコビ・ベルマン方程式を状態-行動価値関数に適用することで、連続時間システムに適した理論的裏付けのあるQラーニングフレームワークを構築すること。
  • HJB方程式による最適制御の特徴付けを活用することで、エージェントネットワークや反復的最適化を必要とせず、実装を簡素化すること。
  • 高次元線形二次(LQ)問題およびMuJoCoベンチマークで性能を実証し、安定的かつデータ効率の良い学習を実現すること。

提案手法

  • 動的計画法の原則を用いて、連続時間Q関数のための新規な半離散的HJB方程式を導出することで、システムダイナミクスの明示的離散化を回避する。
  • ロビンズ・モンローの確率的近似に基づくモデルフリーな更新ルールを定式化し、離散時間遷移サンプルを用いてQ関数を更新する。
  • ハミルトニアン・ジャコビDQN(HJ DQN)アルゴリズムを導入し、HJB方程式を直接用いてODEによってグリーディ行動を定義することで、深層Qネットワークを連続時間制御に拡張する。
  • 最適制御の選択をHJB方程式の特徴付けにより保証する:$ \dot{a} = L \frac{\nabla_{\bm{a}} Q}{|\nabla_{\bm{a}} Q|} $ により、別個の最適化やエージェントネットワークの必要性を排除する。
  • 半離散的HJB定式化における正則性と安定性を保証するため、制御にリプシッツ制約($ |\bm{b}| \leq L $)を導入する。
  • 関数近似に深層ニューラルネットワークを用い、経験再生、ターゲットネットワーク、DQNおよびDDPGベンチマークからの標準ハイパーパrameterを実装する。

実験結果

リサーチクエスチョン

  • RQ1リプシッツ連続な制御を伴う連続時間の決定論的最適制御問題に対して、モデルフリーのQラーニングアルゴリズムを開発可能か?
  • RQ2Q関数のための半離散的HJB方程式は、システムダイナミクスの離散化を回避しつつ、安定的かつ収束的な学習を可能にするか?
  • RQ3HJB方程式を用いることで、追加の最適化やエージェントネットワークを必要とせずに、最適制御を直接特徴付けられるか?
  • RQ4提案手法HJ DQNは、DQNやDDPGなどの既存の深層RLベースラインと比較して、高次元連続制御タスクでどのように性能を発揮するか?
  • RQ5学習の安定性と効率性に大きな影響を与えるハイパーパラメータ(例:サンプリング間隔、リプシッツ定数)は何か?

主な発見

  • 制御入力がリプシッツ連続であるという条件下で、HJ DQNアルゴリズムは最適Q関数に収束することが示された。
  • ハイパーパラメータを各環境に合わせてチューニングした結果、MuJoCoベンチマークタスク(HalfCheetah-v2, Hopper-v2, Walker2d-v2, Swimmer-v2)において安定した学習が達成された。
  • 高次元線形二次(LQ)問題において、割引率を $ \gamma = -\log(0.99999)/h $ に設定することで、HJ DQNは近似的に最適なポリシーを学習に成功した。この設定は連続時間ダイナミクスと整合的である。
  • HJ DQNは、特に高次元および連続制御設定において、DQNやDDPGに比べてサンプル効率と訓練安定性に優れた性能を示した。
  • HJB方程式を直接用いてグリーディ行動を定義することで、エージェントネットワークや反復的制御最適化の必要性が排除された。
  • 実験的結果から、サンプリング間隔 $ h $ およびリプシッツ定数 $ L $ の選択が学習性能に顕著な影響を与えることが示され、チューニングされた $ h $ が収束性を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。