[論文レビュー] Safe Policy Search for Lifelong Reinforcement Learning with Sublinear Regret
本稿では、サブラインレグレットを有する方策勾配法に基づく安全な生涯強化学習アルゴリズムを提案する。敵対的オンラインマルチタスク学習と安全制約を活用し、$Ó(\sqrt{R})$ のレグレットを$R$ラウンドで達成。制約付き最適化により安全な方策を強制し、ベンチマークシステムおよびクアッドローター制御において、標準的PGおよびPG-ELLAよりも学習速度と安全遵守性で優れる。
Lifelong reinforcement learning provides a promising framework for developing versatile agents that can accumulate knowledge over a lifetime of experience and rapidly learn new tasks by building upon prior knowledge. However, current lifelong learning methods exhibit non-vanishing regret as the amount of experience increases and include limitations that can lead to suboptimal or unsafe control policies. To address these issues, we develop a lifelong policy gradient learner that operates in an adversarial set- ting to learn multiple tasks online while enforcing safety constraints on the learned policies. We demonstrate, for the first time, sublinear regret for lifelong policy search, and validate our algorithm on several benchmark dynamical systems and an application to quadrotor control.
研究の動機と目的
- 経験の蓄積に伴い消えないレグレットが生じる生涯強化学習の問題に対処すること。
- 高次元制御タスクにおける安全な方策学習を可能にし、移行中に深刻な失敗を回避すること。
- 知識をタスク間で共有しながら、サブラインレグレットを維持する生涯方策勾配法を開発すること。
- 制約に配慮した最適化により方策の安全性を保証し、無制限または有害な制御方策を回避すること。
- 動的システムおよびクアッドローター制御において手法を検証し、収束速度の向上と安全遵守性の両面で実証すること。
提案手法
- レグレットを最小化するため、敵対的タスク順序を用いたオンラインマルチタスク学習として生涯学習を定式化する。
- 方策をパラメータ化するために、共有基底行列 $\bm{L}$ とタスク固有の係数 $\bm{s}_{t}$ で表される潜在的知識ベースを用いる。
- 各タスクごとに $\bm{L}$ と $\bm{s}_{t}$ を交互に最適化することで、効率的な知識共有を実現する。
- 安全制約を方策パラメータに課し、実行可能領域への投影によって不適切な行動を防止する。
- 局所最適方策の周囲における2次テイラー展開に基づく重み付き二次近似を用いた方策勾配目的関数を採用する。
- 理論的分析により、$R$ラウンドにおけるレグレットが $\mathcal{O}(\sqrt{R})$ に比例することを証明し、サブラインレグレットを達成することが示された。
実験結果
リサーチクエスチョン
- RQ1生涯方策勾配学習は、オンラインマルチタスク設定においてサブラインレグレットを達成できるか?
- RQ2政策移行中に深刻な失敗を回避するために、安全制約を効果的に強制する方法は何か?
- RQ3共有された潜在的表現は、多様なタスク間で収束速度の向上と性能の向上を実現できるか?
- RQ4学習速度と安全性の観点から、非制約PGおよびPG-ELLAと比較して本手法はどのように差をつけるか?
- RQ5交互最適化の反復回数を増加させると、収束性および制約遵守性にどのような影響を与えるか?
主な発見
- 提案手法は $R$ ラウンドで $\mathcal{O}(\sqrt{R})$ のレグレットを達成し、非ゼロレグレットを示す手法よりも顕著に優れた性能を示した。
- シンプルマスやカートポールといったベンチマークシステムにおいて、初期性能と学習速度の両面で、標準的PGおよびPG-ELLAを上回った。
- すべての制約付きタスクにおいて、安全制約を適切に守った。一方、標準的PGおよびPG-ELLAは頻繁に制約違反を起こした。
- クアッドローター制御において、本手法は1回の観測で安全な方策を習得したのに対し、PG-ELLAおよび標準的PGでは510~545回の観測を要した。
- 交互最適化の反復回数を増やすことで、最適方策への到達経路がより直接的になり、収束効率が向上した。
- 実験的結果から、本手法は複数の連続的タスクにおいても高い性能を維持し、安全遵守性とサブラインレグレットの両方を満たしていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。