[論文レビュー] Upper confidence primal-dual optimization: Stochastically constrained Markov decision processes with adversarial losses and unknown transitions
本稿では、敵対的損失と未知の遷移ダイナミクスを伴うエピソード型確率的制約付きマルコフ決定過程(CMDP)に対して、上界の確信度を有するプライマル・デュアル(UC-PD)アルゴリズムを提案する。不確実性の面前での楽観主義と、ラグランジュ乗数の確率的ドリフト解析の新規なアプローチを活用することで、遷移モデルの事前知識に依存せずに、$\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ のレグレットと制約違反のバウンディングを達成する。
We consider online learning for episodic stochastically constrained Markov decision processes (CMDP), which plays a central role in ensuring the safety of reinforcement learning. Here the loss function can vary arbitrarily across the episodes, whereas both the loss received and the budget consumption are revealed at the end of each episode. Previous works solve this problem under the restrictive assumption that the transition model of the Markov decision processes (MDP) is known a priori and establish regret bounds that depend polynomially on the cardinalities of the state space $\mathcal{S}$ and the action space $\mathcal{A}$. In this work, we propose a new \emph{upper confidence primal-dual} algorithm, which only requires the trajectories sampled from the transition model. In particular, we prove that the proposed algorithm achieves $\widetilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ upper bounds of both the regret and the constraint violation, where $L$ is the length of each episode. Our analysis incorporates a new high-probability drift analysis of Lagrange multiplier processes into the celebrated regret analysis of upper confidence reinforcement learning, which demonstrates the power of optimism in the face of uncertainty in constrained online learning.
研究の動機と目的
- 遷移ダイナミクスが未知であり、エピソードごとに損失が敵対的に変化するエピソード型確率的制約付きMDPにおけるオンライン学習を扱う。
- 従来のCMDPアルゴリズムで制限的とされる、遷移モデルが既知であるという仮定を排除し、実用的適用性を高める。
- 不確実性と敵対的損失シーケンスに直面しても、低レグレットと制約違反の有界性を両立する手法を開発する。
- 制約付き強化学習における不確実性の面前での楽観主義とプライマル・デュアル最適化を統合する。
- 状態空間と行動空間のサイズに有効にスケーリングする、レグレットと制約違反に関する理論的保証を確立する。
提案手法
- 提案されたUC-PDアルゴリズムは、価値関数の上界の確信度を用いて、未知のダイナミクスがある中での探索と活用のバランスを図る。
- 制約処理のためのラグランジュ乗数を維持し、その時間的変化を制御するための新規な高確率ドリフト解析を適用する。
- アルゴリズムは環境からのサンプル軌道にのみ依存し、遷移モデルの事前知識を一切必要としない。
- 上界の確信度強化学習からの楽観主義の原則とプライマル・デュアル更新を組み合わせることで、同時にレグレットの最小化と制約の強制を実現する。
- エピソード報酬と制約違反の経験的平均および分散を用いて、価値推定の信頼区間を導出する。
- 主な技術的イノベーションは、ラグランジュ乗数のドリフト解析と上界の確信度学習のレグレット解析を結合することであり、安定性と収束性を保証する。
実験結果
リサーチクエスチョン
- RQ1遷移モデルの事前知識がなくても動作する、CMDPのためのオンライン学習アルゴリズムを設計できるか?
- RQ2敵対的損失シーケンスと未知のダイナミクスがある中で、サブラインアーのレグレットと制約違反を達成できるか?
- RQ3不確実性の面前での楽観主義を、制約付きMDPにおけるプライマル・デュアル最適化と効果的に統合できるか?
- RQ4これらの緩和された仮定のもとで、レグレットと制約違反についてどのような理論的バウンディングを示せるか?
- RQ5ラグランジュ乗数の高確率ドリフト解析によって、安定的かつ有界な制約強制を保証できるか?
主な発見
- UC-PDアルゴリズムは、$\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ の上界を、レグレットと制約違反の両方について達成する。ここで、$L$ はエピソード長、$|\mathcal{S}|$ は状態空間のサイズ、$|\mathcal{A}|$ は行動空間のサイズ、$T$ はエピソード数を表す。
- レグレットと制約違反のバウンディングは、遷移モデルの濃度に依存しないため、遷移確率が未知であっても適用可能である。
- アルゴリズムの理論的保証は、ラグランジュ乗数プロセスの新規な高確率ドリフト解析を通じて確立される。
- 楽観主義とプライマル・デュアル学習の統合に成功し、制約付きオンライン学習における楽観主義の有効性を示している。
- 解析により、敵対的損失シーケンス下でも、制約違反が有界に保たれながらレグレットが最小化されることを示している。
- 従来の研究から、遷移モデルが既知であるという仮定を排除することで、実世界の安全な強化学習設定への適用範囲を広げた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。