Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning of Markov Decision Processes with Peak Constraints

Ather Gattami|arXiv (Cornell University)|Jan 23, 2019
Reinforcement Learning in Robotics参考文献 18被引用数 5
ひとこと要約

本稿では、ピーク制約付きのマーケフ決定過程(MDP)におけるメモリ効率の良い強化学習アルゴリズムを提案する。制約付き問題をラグランジュ緩和とクリッピングを用いて有界で制約なしの最適化問題に変換することで、制約関数の値を保存せずに最適方策への収束を保証する。未知の動的特性と報酬関数のもとでも、実行可能性と最適性を達成する。

ABSTRACT

In this paper, we consider reinforcement learning of Markov Decision Processes (MDP) with peak constraints, where an agent chooses a policy to optimize an objective and at the same time satisfy additional constraints. The agent has to take actions based on the observed states, reward outputs, and constraint-outputs, without any knowledge about the dynamics, reward functions, and/or the knowledge of the constraint-functions. We introduce a game theoretic approach to construct reinforcement learning algorithms where the agent maximizes an unconstrained objective that depends on the simulated action of the minimizing opponent which acts on a finite set of actions and the output data of the constraint functions (rewards). We show that the policies obtained from maximin Q-learning converge to the optimal policies. To the best of our knowledge, this is the first time learning algorithms guarantee convergence to optimal stationary policies for the MDP problem with peak constraints for both discounted and expected average rewards.

研究の動機と目的

  • リアルタイムで制約を満たさなければならないが、制約関数が未知であるMDPにおける強化学習を扱う。
  • すべての状態行動ペアにおける制約値を保存しないため、メモリコストをO(S×A×J)から最小限に抑える学習アルゴリズムを開発する。
  • 割引報酬基準および平均報酬基準の両方において、最適かつ実行可能な定常方策への漸近的収束を保証する。
  • 制約違反が許されない安全が重要な応用分野(例:無線通信や医療分野)における実用的導入を可能にする。

提案手法

  • 双対変数を用いたラグランジュ緩和により、元の制約付きMDPを等価な制約なし問題に変換する。
  • 有界性を保証し、Q学習の安定性を向上させるために、報酬関数をR(s,a) = max(−C, minλ≥0 R(s,a,λ))とクリッピングする。
  • クリッピングされた報酬を用いてQ学習更新を適用し、最適Q値関数Q*(s,a)を反復的に学習する。
  • 学習済みQ値から得られる最適方策π*(s) = argmaxπ∈Π E[Q*(s,π(s))]を用いる。
  • クリッピング報酬の定式化が元の問題の最適性と実行可能性を保つことを証明することで収束を保証する。
  • 理論的結果を活用し、変換された問題の解が、実行可能であれば元の問題の最適方策に一致することを示す。

実験結果

リサーチクエスチョン

  • RQ1制約関数が未知であるMDPに強化学習を適用し、最適かつ実行可能な方策への収束を保証できるか?
  • RQ2制約関数が事前に分かっていない状況で、制約付き強化学習におけるメモリ使用量を最小限に抑える方法は何か?
  • RQ3目的関数のどの変換が、有界性と元の制約付き問題への同等性の両方を保証するか?
  • RQ4提案手法は、割引報酬基準および平均報酬基準の両方において最適性と実行可能性を維持するか?
  • RQ5すべての制約関数値(s,a)↦rj(s,a)を保存しなくても、依然として可能性集合A(s)を学習できるか?

主な発見

  • 提案手法は、ピーク制約付きの割引報酬基準および期待平均報酬基準のMDPにおいて、最適定常方策への収束を保証する。
  • 制約関数値rj(s,a)をすべての(s,a)ペアに対して保存する必要がなくなるため、メモリ効率が向上する。
  • クリッピングされたラグランジュ報酬R(s,a) = max(−C, minλ≥0 R(s,a,λ))を用いた変換により、有界性が保証され、標準的なQ学習が収束可能になる。
  • 学習済みQ値から導かれる最適方策は、問題が実行可能であれば、元の制約付き問題において、証明可能な最適性と実行可能性を有する。
  • 理論的分析により、変換された問題の解が、標準的なMDP仮定のもとで、元の制約付きMDPの解と同等であることが確認された。
  • 無線電力制御や検索エンジンランク付けといった、安全制約を厳密に守る必要がある実世界の問題に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。