Skip to main content
QUICK REVIEW

[論文レビュー] Constrained Reinforcement Learning Has Zero Duality Gap

Santiago Paternain, Luiz F. O. Chamon|arXiv (Cornell University)|Oct 29, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 10
ひとこと要約

この論文は、方策が一般の分布族によって記述される場合、制約付き強化学習(CRL)問題が双対ギャップをゼロに持つことを確立している。これは双対問題が凸であり、正確な最適解が得られることを意味する。著者らはさらに、ニューラルネットワークなどのパラメータ化された方策に対してもこの結果が近似的に成り立つことを示し、弱い仮定の下でプライマル・デュアルアルゴリズムが最適解に収束することを証明している。

ABSTRACT

Autonomous agents must often deal with conflicting requirements, such as completing tasks using the least amount of time/energy, learning multiple tasks, or dealing with multiple opponents. In the context of reinforcement learning~(RL), these problems are addressed by (i)~designing a reward function that simultaneously describes all requirements or (ii)~combining modular value functions that encode them individually. Though effective, these methods have critical downsides. Designing good reward functions that balance different objectives is challenging, especially as the number of objectives grows. Moreover, implicit interference between goals may lead to performance plateaus as they compete for resources, particularly when training on-policy. Similarly, selecting parameters to combine value functions is at least as hard as designing an all-encompassing reward, given that the effect of their values on the overall policy is not straightforward. The later is generally addressed by formulating the conflicting requirements as a constrained RL problem and solved using Primal-Dual methods. These algorithms are in general not guaranteed to converge to the optimal solution since the problem is not convex. This work provides theoretical support to these approaches by establishing that despite its non-convexity, this problem has zero duality gap, i.e., it can be solved exactly in the dual domain, where it becomes convex. Finally, we show this result basically holds if the policy is described by a good parametrization~(e.g., neural networks) and we connect this result with primal-dual algorithms present in the literature and we establish the convergence to the optimal solution.

研究の動機と目的

  • 手動での報酬設計やハイパーパrameterチューニングなしに、相互に矛盾する目的をバランスさせる挑戦に取り組む。
  • 報酬関数の設計が困難で、訓練中に目的が干渉する多目的RLの限界を克服する。
  • 広く使われているが収束保証のない制約付きRLにおけるプライマル・デュアルアルゴリズムに理論的根拠を与える。
  • 一般の方策分布に対して双対ギャップがゼロであることを確立し、凸双対最適化によって正確な解が得られることを示す。
  • ニューラルネットワークなどのパラメータ化された方策へとゼロ双対ギャップの結果を拡張し、普遍近似性の下で収束が保たれることを示す。

提案手法

  • 複数の報酬関数とハード制約を備えた制約付きマルコフ決定過程(CMDP)として制約付きRLを定式化する。
  • ラグランジュの双対性を適用し、非凸なプライマル問題を双対変数(ラグランジュ乗数)に関して凸となる双対問題に変換する。
  • 一般の分布クラスに属する方策に対して双対ギャップがゼロであることを証明し、プライマルとデュアル解が正確に等価であることを示す。
  • 方策クラスの近似誤差に依存するサブ最適性バインドを示すことにより、パラメータ化された方策へのゼロ双対ギャップ結果の拡張を行う。
  • この結果を活用してプライマル・デュアルアルゴリズムを分析し、弱い仮定の下で最適解への収束を証明する。
  • グリッドワールドナビゲーションの実験を通じて、正確なおよび近似されたプライマル最適化下での双対ギャップの挙動を実証的に検証する。

実験結果

リサーチクエスチョン

  • RQ1方策が一般の分布族によって記述される場合、制約付き強化学習はゼロ双対ギャップを持つのか?
  • RQ2ゼロ双対ギャップの結果は、ニューラルネットワークなどのパラメータ化された方策へと拡張可能か?また、近似誤差はギャップにどのように影響するか?
  • RQ3既存の制約付きRLにおけるプライマル・デュアルアルゴリズムは最適解に収束するのか?どのような条件下で?
  • RQ4方策のパラメータ化の選択(例:状態アグリゲーション)は、双対ギャップおよび学習パフォーマンスにどのように影響するか?
  • RQ5パラメータ最適化(手動による乗数選択)による正則化RLと、制約付きRLとの間で、パレート最適フロントに同等性があるか?

主な発見

  • 一般の分布クラスに属する方策に対して、制約付きRL問題は双対ギャップがゼロであり、双対問題が正確な最適解をもたらす。
  • ニューラルネットワークなどのパラメータ化された方策では、双対ギャップが方策クラスの近似誤差によって上限付けられ、クラスが普遍近似器に近づくにつれてその上限はゼロに収束する。
  • 弱い仮定の下で、制約付きRLのプライマル・デュアルアルゴリズムは、デュアルドメインにおけるゼロ双対ギャップのおかげで最適解に収束する。
  • 実証的結果から、正確なプライマル最大化(例:ダイクストラ法による)は双対ギャップをゼロに収束させるのに対し、近似プライマルステップ(例:ポリシー勾配)では双対ギャップがゼロの近傍に収束することが分かった。
  • 粗い方策パラメータ化(例:状態アグリゲーション)では双対ギャップが大きくなり、極端に粗い場合(例:非常に粗い場合)にはエージェントが実行可能な方策を学習できなくなる。
  • 理論的枠組みにより、制約付きRLと正則化RLとの間でパレート最適フロントに同等性があることが確立され、双対法が手動による報酬重み付けの代替として原理的根拠を持つことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。