[論文レビュー] Simultaneous Perturbation Algorithms for Batch Off-Policy Search
本稿では、コスト・トゥ・ゴー関数の勾配およびヘッセ行列の推定に、同時摂動確率的近似(SPSA)および滑らか化機能(SF)手法を用いて、連続的状態空間および行動空間における新しいバッチ・オフポリシー強化学習アルゴリズムを提案する。この手法は、関数近似を用いない非パrametricなポリシー評価器(MFMC)と一次および二次の最適化を組み合わせ、関数近似を用いずに最適ポリシーへの収束を達成する。1次元連続制御問題において実証された。
We propose novel policy search algorithms in the context of off-policy, batch mode reinforcement learning (RL) with continuous state and action spaces. Given a batch collection of trajectories, we perform off-line policy evaluation using an algorithm similar to that by [Fonteneau et al., 2010]. Using this Monte-Carlo like policy evaluator, we perform policy search in a class of parameterized policies. We propose both first order policy gradient and second order policy Newton algorithms. All our algorithms incorporate simultaneous perturbation estimates for the gradient as well as the Hessian of the cost-to-go vector, since the latter is unknown and only biased estimates are available. We demonstrate their practicality on a simple 1-dimensional continuous state space problem.
研究の動機と目的
- 関数近似を用いずに、連続的状態空間および行動空間におけるオフポリシー・バッチモード強化学習の課題に対処すること。
- 正確なコスト・トゥ・ゴー推定のため、モンテカルロに類似したポリシー評価を活用するポリシー探索アルゴリズムの開発。
- 閉形式表現が得られない場合に、同時摂動を用いて勾配およびヘッセ行列を推定する一次および二次の最適化手法の導入。
- MFMC推定値にバイアスが存在する場合でも、ポリシー・パラメータが近似的に最適解に収束することを保証すること。
- 無限時間割引マルコフ決定過程(MDP)設定下での理論的収束保証とともに、1次元連続制御問題における実用性の実証。
提案手法
- バッチの軌道と状態空間および行動空間のメトリクスを用いてコスト・トゥ・ゴーを推定する非パrametricなポリシー評価手法(MFMC)を提案する。
- コスト・トゥ・ゴー関数の勾配およびヘッセ行列の推定に、同時摂動確率的近似(SPSA)および滑らか化機能(SF)技術を用いる。
- SPSAまたはSFによる勾配推定値を用いてポリシー・パラメータを更新する一次ポリシー勾配アルゴリズム(MCPG-SPSA、MCPG-SF)を設計する。
- ヘッセ行列推定値を組み込んだニュートン型の二次アルゴリズム(MCPN-SPSA、MCPN-SF)を開発し、収束を高速化する。
- ポリシー・パラメータが許容可能な集合内に留まるように、射影に基づく更新を適用する。
- MFMC推定値のバイアスが有界であるという弱い仮定のもとで、アルゴリズムが漸近的に安定な均衡点の集合に確率1で収束することを証明する。
実験結果
リサーチクエスチョン
- RQ1未知のダイナミクスを持つオフポリシー・バッチ強化学習において、同時摂動法を用いて勾配およびヘッセ行列を効果的に推定できるか?
- RQ2関数近似を用いずに、連続的状態空間および行動空間におけるポリシー評価をどのように実行できるか?
- RQ3MFMC推定値にバイアスが存在する場合でも、SPSA/SFに基づく一次および二次のポリシー探索アルゴリズムが最適ポリシーに収束するか?
- RQ4これらのアルゴリズムの理論的収束挙動は、無限時間割引MDP設定下でどのようになるか?
- RQ5提案手法は、価値関数近似を用いずに、連続制御問題において実用的な性能を達成できるか?
主な発見
- 提案された MCPG-SPSA および MCPG-SF アルゴリズムは、MFMC推定器のバイアスが有界である限り、確率 1 − η で漸近的に安定な均衡点の集合に収束する。
- MCPN-SPSA および MCPN-SF アルゴリズムは、ニュートン更新ODEの漸近的に安定な均衡点の集合に、確率 1 − η で収束する。
- SPSAに基づくアルゴリズムにおけるヘッセ行列推定値は、δ → 0 のときほとんど確実に真のヘッセ行列に収束する。
- 勾配およびヘッセ行列推定器は、極限において一貫性を示し、バイアスが漸近的に消えることが示された。
- 本手法は、関数近似を用いずに1次元連続制御問題において実用的な性能を達成し、その実現可能性を示した。
- コスト・トゥ・ゴー関数を厳密なリャプノフ関数として用いるODEベースの解析により、理論的収束が確立された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。