Skip to main content
QUICK REVIEW

[論文レビュー] Convex Q-Learning, Part 1: Deterministic Optimal Control

Prashant G. Mehta, Sean Meyn|arXiv (Cornell University)|Aug 8, 2020
Reinforcement Learning in Robotics参考文献 61被引用数 4
ひとこと要約

この論文は、決定論的最適制御のための新しい強化学習アルゴリズムである凸Q学習を紹介する。Q関数の近似を凸最適化問題として定式化することで、過剰パラメータ化と制約を用いてベルマン方程式を凸化し、収束性と安定性を保証する。DQNのような非凸手法とは異なり、理論的保証が欠如しているが、類似した経験的行動を示す。

ABSTRACT

It is well known that the extension of Watkins' algorithm to general function approximation settings is challenging: does the projected Bellman equation have a solution? If so, is the solution useful in the sense of generating a good policy? And, if the preceding questions are answered in the affirmative, is the algorithm consistent? These questions are unanswered even in the special case of Q-function approximations that are linear in the parameter. The challenge seems paradoxical, given the long history of convex analytic approaches to dynamic programming. The paper begins with a brief survey of linear programming approaches to optimal control, leading to a particular over parameterization that lends itself to applications in reinforcement learning. The main conclusions are summarized as follows: (i) The new class of convex Q-learning algorithms is introduced based on the convex relaxation of the Bellman equation. Convergence is established under general conditions, including a linear function approximation for the Q-function. (ii) A batch implementation appears similar to the famed DQN algorithm (one engine behind AlphaZero). It is shown that in fact the algorithms are very different: while convex Q-learning solves a convex program that approximates the Bellman equation, theory for DQN is no stronger than for Watkins' algorithm with function approximation: (a) it is shown that both seek solutions to the same fixed point equation, and (b) the ODE approximations for the two algorithms coincide, and little is known about the stability of this ODE. These results are obtained for deterministic nonlinear systems with total cost criterion. Many extensions are proposed, including kernel implementation, and extension to MDP models.

研究の動機と目的

  • Q学習における関数近似の理論的整合性の欠如、特に非線形システムにおいての課題を解決すること。
  • 線形関数近似の下で、射影ベルマン方程式が安定で有用な解を持つかどうかという根本的課題を解消すること。
  • 理論的収束性と明確に定義された最適化目的を持つ強化学習アルゴリズムを開発すること。
  • 動的計画法の線形プログラミングおよび二次計画法の定式化を活用することで、凸解析と強化学習の間に接続を確立すること。
  • マーカフ決定過程(MDPs)およびカーネルベースの関数近似に適用可能な凸RLアルゴリズムの基盤を築くこと。

提案手法

  • Q関数を過剰パラメータ化し、Q ≥ J(Jは価値関数)を保証する制約を課すことにより、ベルマン方程式を凸計画問題として定式化する。
  • 非凸なQ学習問題を凸最適化問題に変換するため、ベルマン方程式の凸緩和を用いる。線形および二次制約を伴う。
  • 損失関数を平均二乗ベルマン誤差として定義するバッチ学習アプローチを採用するが、凸性と安定性を保証する制約を課す。
  • Q関数および価値関数の非負性を維持するための正の罰則項とパラメータ制約を導入し、物理的・数学的整合性を確保する。
  • 経験的状態-行動ペアを用いたガラーキン型緩和を採用し、観測された軌道上でベルマン誤差が非負になるように制約を課す。
  • MATLABのquadprogなど標準的な凸ソルバーを用いて、制約が多数(例:10^4個)存在する場合でも、得られた最適化問題を解く。

実験結果

リサーチクエスチョン

  • RQ1線形関数近似の下で、射影ベルマン方程式は解を持ち、それが安定的かつ整合的か?
  • RQ2ベルマン方程式の凸緩和は、理論的収束性と意味のある方策への収束を保証する強化学習アルゴリズムを導くことができるか?
  • RQ3理論的安定性およびODE近似ダイナミクスの観点から、凸Q学習はDQNとどのように比較できるか?
  • RQ4凸家族の確率測度を用いて、確率的方策を伴うMDPに凸定式化を拡張できるか?
  • RQ5過剰パラメータ化と制約の強制は、Q学習問題の凸性と安定性を保証するために果たす役割は何か?

主な発見

  • 提案された凸Q学習アルゴリズムは、線形関数近似を含む一般条件の下で収束し、理論的に一貫性があることが示された。
  • アルゴリズムはベルマン方程式を近似する凸計画問題を解くことが示されたが、DQNとは異なり、理論的保証が欠如している。
  • 凸Q学習とDQNの両者とも、同一の固定点方程式の解を求め、同一のODE近似を持つが、凸Q学習は安定な凸最適化フレームワークを有する。
  • 実験的結果から、特に二次基底関数を用いた場合、凸Q学習はベースライン手法を上回り、状態遷移部などの困難な領域で真の価値関数をよりよく捉えている。
  • 標準的な凸ソルバーを用いて、複雑な制約と大規模データ(例:10^4個の観測)を効果的に処理し、コンsumerラップトップ上でも1時間未満で収束を達成した。
  • 制約の緩和と観測された軌道を用いた経験的制約の導入により、すべてのサンプルでベルマン誤差が非負のままであることが保証され、耐障害性と安定性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。