[論文レビュー] Doubly Robust Off-Policy Actor-Critic: Convergence and Optimality
本稿では、値関数と密度比推定誤差からのバイアスを低減するために二重に頑健な方策勾配推定器を活用する、シングルタイムスケールのオフポリシー方策評価・評価法であるDR-Off-PACを提案する。近似的誤差に対して堅牢なまま、有限時間収束を達成するサンプル複雑性の境界を保証し、二重に頑健な最適性を有するシングルタイムスケールのオフポリシーAC法における、初めての全体的なサンプル複雑性解析を確立する。
Designing off-policy reinforcement learning algorithms is typically a very challenging task, because a desirable iteration update often involves an expectation over an on-policy distribution. Prior off-policy actor-critic (AC) algorithms have introduced a new critic that uses the density ratio for adjusting the distribution mismatch in order to stabilize the convergence, but at the cost of potentially introducing high biases due to the estimation errors of both the density ratio and value function. In this paper, we develop a doubly robust off-policy AC (DR-Off-PAC) for discounted MDP, which can take advantage of learned nuisance functions to reduce estimation errors. Moreover, DR-Off-PAC adopts a single timescale structure, in which both actor and critics are updated simultaneously with constant stepsize, and is thus more sample efficient than prior algorithms that adopt either two timescale or nested-loop structure. We study the finite-time convergence rate and characterize the sample complexity for DR-Off-PAC to attain an $ε$-accurate optimal policy. We also show that the overall convergence of DR-Off-PAC is doubly robust to the approximation errors that depend only on the expressive power of approximation functions. To the best of our knowledge, our study establishes the first overall sample complexity analysis for a single time-scale off-policy AC algorithm.
研究の動機と目的
- オフポリシー強化学習における分布不一致の課題に対処し、オフポリシーのデータを用いた方策勾配推定がしばしば不安定性と高いバイアスを引き起こすことを解決する。
- 値関数と密度比の両方の推定が不正確であるために高いバイアスを生じる、従来のオフポリシー方策評価・評価法の限界を克服する。
- 無限時間割合割引MDPに対して、4つのネイジュー関数のうち少なくとも2つが正確に推定される場合にバイアスを低減する、新しい二重に頑健な方策勾配推定器を開発する。
- 無限時間オフポリシー設定において、ネイジュー関数(密度比、Q値、その微分など)を効率的に再帰的に推定できる、モデルフリーでシングルタイムスケールのコーチアーキテクチャを設計する。
- 二重に頑健な収束保証を持つシングルタイムスケールのオフポリシー方策評価・評価法における、初めての有限時間サンプル複雑性解析を確立する。
提案手法
- 4つのネイジュー関数のうち少なくとも2つが正確に推定される場合にバイアス低減が保証される、値関数と密度比推定値を組み合わせた二重に頑健な方策勾配推定器を提案する。
- 時系列差分学習を用いて、無限時間オフポリシー設定においてネイジュー関数(密度比、Q値、その微分など)を再帰的に推定する手法を導入する。
- 定常ステップサイズを用いて、エージェントとコーチが同時に更新される、シングルタイムスケールのアーキテクチャを設計し、二段階タイムスケールやネストドループ法よりもサンプル効率を向上させる。
- 重要度重み付けと値関数補正を介して分布シフトを是正する二重に頑健な推定器を用いた方策勾配更新を定式化する。
- コーチ推定誤差、エージェント更新誤差、およびサンプリング分散の相互作用を分析することで、推定誤差と収束の理論的境界を導出する。
- リャプノフ風の解析を用いて最適性ギャップをバウンディングし、収束速度が時間の平方根とデータセットサイズの逆数に依存することを示し、正確なネイジュー推定の下では残余バイアス項が消滅することを示す。
実験結果
リサーチクエスチョン
- RQ1二重に頑健な方策勾配推定器は、モデルフリーなオフポリシー設定における無限時間割合割引MDPに効果的に拡張可能か?
- RQ2シングルタイムスケールのアーキテクチャに二重に頑健な推定器を組み込むことで、全体の収束において二重に頑健な性質が保持されるか、すなわち最適性ギャップが近似的誤差に対して堅牢か?
- RQ3二重に頑健な推定を用いたシングルタイムスケールのオフポリシー方策評価・評価法の有限時間サンプル複雑性は何か?
- RQ4提案されたアルゴリズムの収束速度は、時間TとデータセットサイズNに関してどのようにスケーリングされるか?
- RQ5提案されたコーチアーキテクチャは、無限時間オフポリシー設定において、必要なネイジュー関数(密度比や価値関数の微分など)を再帰的かつ効率的に推定可能か?
主な発見
- 提案されたDR-Off-PACアルゴリズムは、反復回数TとデータセットサイズNを用いて、最適性ギャップが$\Theta(1/\sqrt{T}) + \Theta(1/\sqrt{N}) + \Theta(\epsilon_{\rho}\epsilon_{d_q} + \epsilon_{d_\rho}\epsilon_q + \epsilon_{\rho}\epsilon_q)$でバウンデッドする有限時間収束レートを達成する。
- アルゴリズムの収束は二重に頑健である:4つのネイジュー関数(密度比、価値関数、その微分)のうち少なくとも2つが正確に推定されれば、最適性ギャップは消滅する。
- シングルタイムスケールのオフポリシー方策評価・評価法の文脈において、DR-Off-PACのサンプル複雑性が初めて確立された。標準仮定の下で収束速度$O(1/\sqrt{T})$を達成する。
- 個々のネイジュー推定器の正確さに依存する程度を低減する二重に頑健な勾配推定器を活用することで、安定性と低バイアスを維持する。
- 理論的解析により、全体の収束誤差がネイジュー関数の推定誤差の積に依存することを確認し、個々のコンポonentが不完全であっても堅牢性を保証する。
- 再帰的コーチ設計により、無限時間設定においてすべての必要なネイジュー関数を効率的にモデルフリーで推定可能であり、アルゴリズムの実用的導入を支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。