[論文レビュー] Upper Confidence Primal-Dual Reinforcement Learning for CMDP with Adversarial Loss
本稿では、遷移モデルの事前知識が不要で、サンプル軌道のみを用いる、敵対的損失を伴うエピソード的制約付きマルコフ決定過程(CMDP)に対して、上位信頼プライマル・デュアル強化学習アルゴリズムを提案する。$\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ のレグレットおよび制約違反バウンドを達成し、ラグランジュ乗数の高確率ドリフト解析を新たに導入することで、不確実性の下での楽観主義の原則を制約付きオンライン学習へ拡張する。
We consider online learning for episodic stochastically constrained Markov decision processes (CMDPs), which plays a central role in ensuring the safety of reinforcement learning. Here the loss function can vary arbitrarily across the episodes, and both the loss received and the budget consumption are revealed at the end of each episode. Previous works solve this problem under the restrictive assumption that the transition model of the Markov decision processes (MDPs) is known a priori and establish regret bounds that depend polynomially on the cardinalities of the state space $\mathcal{S}$ and the action space $\mathcal{A}$. In this work, we propose a new \emph{upper confidence primal-dual} algorithm, which only requires the trajectories sampled from the transition model. In particular, we prove that the proposed algorithm achieves $\widetilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ upper bounds of both the regret and the constraint violation, where $L$ is the length of each episode. Our analysis incorporates a new high-probability drift analysis of Lagrange multiplier processes into the celebrated regret analysis of upper confidence reinforcement learning, which demonstrates the power of "optimism in the face of uncertainty" in constrained online learning.
研究の動機と目的
- 遷移モデル、損失関数、制約関数が未知であり、エピソードごとに敵対的に変化するエピソード的CMDPにおけるオンライン学習を扱う。
- MDPの遷移ダイナミクスの事前知識を必要とせず、サブ線形レグレットおよび制約違反を達成する、証明可能に効率的なアルゴリズムの開発。
- ラグランジュ乗数プロセスの新規ドリフト解析を通じて、非制約付きから制約付き強化学習への「不確実性の下での楽観主義」の原則の拡張。
- エピソード長 $L$、状態空間サイズ $|\mathcal{S}|$、行動空間サイズ $|\mathcal{A}|$、およびホライズン $T$ にスケーリングするタイトなレグレットおよび制約違反バウンドの確立。
提案手法
- サンプル軌道を用いて報酬、制約、遷移推定値の上位信頼バッファを維持する、上位信頼プライマル・デュアルアルゴリズムを導入。
- 敵対的損失および制約関数の下で、ラグランジュ乗数プロセスの高確率ドリフト解析を用いて、双対変数の進化を制御。
- エピソードごとに変化する制約および損失関数に適応する、時間変動型の双対変数更新ルールを採用。
- プライマル・デュアル最適化フレームワークを適用し、推定報酬および制約の信頼区間に基づいて方策を更新。
- エポックベースの更新を通じて、双対変数の全変動に関する新規バウンドを組み込み、エポック数 $\tilde{\mathcal{O}}(\sqrt{T|\mathcal{S}||\mathcal{A}|}\log T)$ を活用。
- UCBスタイルの楽観主義と双対変数ダイナミクスの安定性解析を組み合わせることで、レグレットおよび制約違反バウンドを導出。
実験結果
リサーチクエスチョン
- RQ1遷移モデルが未知であり、損失関数および制約関数が時間的に変化し、敵対的であるエピソード的CMDPに対して、証明可能に効率的なRLアルゴリズムを設計できるか?
- RQ2ラグランジュ乗数プロセスの高確率ドリフト解析を通じて、「不確実性の下での楽観主義」の原則を制約付きオンライン学習へ拡張できるか?
- RQ3このような状況下で、レグレットと制約違反の最適なトレードオフは何か? また、サンプル軌道のみを用いて達成可能か?
- RQ4アルゴリズムの性能は、エピソード長 $L$、状態空間サイズ $|\mathcal{S}|$、行動空間サイズ $|\mathcal{A}|$、およびエピソード数 $T$ に対してどのようにスケーリングするか?
主な発見
- 提案アルゴリズムは、敵対的損失および未知の遷移を伴うCMDPに対して、$\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ のレグレットおよび制約違反を達成し、これは同種のCMDPに対して初めてのバウンドである。
- アルゴリズムのレグレットおよび制約違反バウンドは、$L$、$|\mathcal{S}|$、$|\mathcal{A}|$ に対して多項式的であり、$T$ に対してはサブ線形的であるため、スケーラビリティを示す。
- 本分析では、不確実性下での双対変数進化を制御するために、ラグランジュ乗数プロセスの新規高確率ドリフト解析を導入している。
- アルゴリズムは、遷移モデルの事前知識を一切必要とせず、環境からのサンプル軌道のみを用いてこれらのバウンドを達成する。
- アルゴリズムのエポック数は、$\tilde{\mathcal{O}}(\sqrt{T|\mathcal{S}||\mathcal{A}|}\log T)$ で有界であり、双対変数のリセット回数を制限する。
- 導出されたバウンドは、非制約付きRLの最先端水準に一致しており、最小限の仮定の下で敵対的損失を伴う制約付き設定に拡張されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。