[論文レビュー] Constrained Variational Policy Optimization for Safe Reinforcement Learning
本稿では、期待最大化フレームワークを用いて安全強化学習を確率的推論問題に定式化する、新しい安全強化学習アルゴリズムである制約付き変分的方策最適化(CVPO)を提案する。Eステップでは凸最適化により閉形式で最適な非パrametricな変分分布を計算し、Mステップでは信頼領域正則化付きの教師あり学習により方策を改善することで、安定かつサンプル効率の高い学習が可能となり、最適性と制約満足の保証を備えた、オンポリシーのベースラインと比較して最大1000倍のサンプル効率を達成する。
Safe reinforcement learning (RL) aims to learn policies that satisfy certain constraints before deploying them to safety-critical applications. Previous primal-dual style approaches suffer from instability issues and lack optimality guarantees. This paper overcomes the issues from the perspective of probabilistic inference. We introduce a novel Expectation-Maximization approach to naturally incorporate constraints during the policy learning: 1) a provable optimal non-parametric variational distribution could be computed in closed form after a convex optimization (E-step); 2) the policy parameter is improved within the trust region based on the optimal variational distribution (M-step). The proposed algorithm decomposes the safe RL problem into a convex optimization phase and a supervised learning phase, which yields a more stable training performance. A wide range of experiments on continuous robotic tasks shows that the proposed method achieves significantly better constraint satisfaction performance and better sample efficiency than baselines. The code is available at https://github.com/liuzuxin/cvpo-safe-rl.
研究の動機と目的
- 既存のプライマルデュアルアプローチにおける不安定さと最適性の保証の欠如を解消すること。
- 制約満足を保証しながらも高いサンプル効率を維持する安全強化学習手法の開発。
- 確率的推論を活用して制約付き強化学習を凸最適化および教師あり学習問題に再定式化すること。
- 制約違反のバウンディングと方策改善のロバストネスに関する理論的保証の提供。
- 連続制御タスクにおけるサンプル効率の向上を実現するため、オフポリシー学習を有効に統合すること。
提案手法
- 安全強化学習を確率的推論問題に定式化し、制約を変分推論の目的関数に変換する。
- 期待最大化フレームワークを導入:Eステップでは凸最適化により閉形式解を有する最適な非パrametricな変分分布を計算する。
- Mステップでは、最適な変分分布上で信頼領域正則化付きの教師あり学習を実行し、オフポリシー更新を可能にする。
- 安全制約の強制のためにラグランジュ緩和を用いた双対変数の定式化を採用する。
- 効率的な凸Eステップ最適化問題の解法として、粒子ベースのサンプリングとSLSQPを用いる。
- Mステップでポリアク平均化とKL制約を適用し、学習の安定性と分布シフトに対するロバストネスを確保する。
実験結果
リサーチクエスチョン
- RQ1安全強化学習を確率的推論問題に再定式化することで、より高い安定性と最適性が達成可能か?
- RQ2凸最適化を用いたEステップと教師あり学習を用いたMステップを持つ2段階のEMスタイルのアルゴリズムが、制約満足度とサンプル効率の向上に寄与するか?
- RQ3Eステップにおける閉形式解が標準仮定のもとで最適性と一意性を保証するか?
- RQ4オフポリシー学習を制約付き方策最適化に効果的に統合でき、ロバストネスの保証が得られるか?
- RQ5提案手法はオンポリシーおよびオフポリシーのベースラインと比較して、制約違反とサンプル効率の点でどのように優れているか?
主な発見
- CVPOは連続制御タスクにおいて、オンポリシーのベースラインと比較して最大1000倍のサンプル効率を達成する。
- 既存のプライマルデュアルおよびポリシーグラデントアプローチと比較して、著しく安定した学習ダイナミクスを示す。
- CVPOは優れた制約満足度を達成し、収束時の累積コストがベースラインよりも一貫して低くなる。
- Eステップの閉形式解は、双対問題の厳密凸性のおかげで、理論的に最適かつ一意であることが保証される。
- 信頼領域Mステップは、最悪ケースの制約違反バウンディングを提供し、学習の不安定性に対してもロバストである。
- 実験結果から、CVPOは報酬、制約満足度、学習安定性の点で、オンポリシーおよびオフポリシーのベースラインをすべて上回ることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。