[論文レビュー] Exploration-Exploitation Trade-off in Reinforcement Learning on Online Markov Decision Processes with Global Concave Rewards
本稿では、時間経過に伴うベクトル値の結果をバランスさせる必要があるオンラインMDPにおけるグローバルな凹関数報酬を想定した、レギュレートなしのアルゴリズムToc-UCRL2を提案する。更新を遅らせる新しい勾配閾値手順を導入することで、非定常な方策が探索と活用のトレードオフを効果的に管理でき、平均報酬設定において近似的に最適なレギュレートバウンド $ O(T^{-1/3}) $ を達成する。
We consider an agent who is involved in a Markov decision process and receives a vector of outcomes every round. Her objective is to maximize a global concave reward function on the average vectorial outcome. The problem models applications such as multi-objective optimization, maximum entropy exploration, and constrained optimization in Markovian environments. In our general setting where a stationary policy could have multiple recurrent classes, the agent faces a subtle yet consequential trade-off in alternating among different actions for balancing the vectorial outcomes. In particular, stationary policies are in general sub-optimal. We propose a no-regret algorithm based on online convex optimization (OCO) tools (Agrawal and Devanur 2014) and UCRL2 (Jaksch et al. 2010). Importantly, we introduce a novel gradient threshold procedure, which carefully controls the switches among actions to handle the subtle trade-off. By delaying the gradient updates, our procedure produces a non-stationary policy that diversifies the outcomes for optimizing the objective. The procedure is compatible with a variety of OCO tools.
研究の動機と目的
- オンラインMDPにおけるベクトル値の結果とグローバルな凹関数報酬を伴う場合の、微妙な探索と活用のトレードオフを扱う。
- 非漸近的設定下で、平均的ベクトル値報酬の非線形でグローバルな目的関数を最適化する、ノーレギュレート学習アルゴリズムを設計する。
- 複数の再帰的クラスを有するMDPにおいて、定常方策の劣化を克服するため、制御された行動切り替えを可能にする。
- オンライン凸最適化(OCO)ツールとUCRL2を統合し、複雑な報酬構造下でもスケーラブルで適応的な方策学習を実現する。
- 状態遷移中の目的関数性能の損失を最小限に抑えるために、更新を遅らせる勾配閾値手順を開発する。
提案手法
- UCRL2によるモデル学習とOCOによる報酬バランスの両方を統合したハイブリッドアルゴリズムToc-UCRL2を提案する。
- 行動間遷移中の性能損失を低減するために、勾配更新を遅らせる新しい勾配閾値手順を導入する。
- 双対変数の更新における安定性と収束を保証するため、1強凸なミラー写像を用いたミラー降下を採用する。
- 信頼区間を用いて、不確実性が閾値を超えた際に方策更新をトリガーするエピソードベースの学習を採用する。
- 累積勾配変動に基づく停止条件を適用し、行動切り替えのタイミングを制御することで、目的関数の劣化を最小限に抑える。
- 勾配変動によって引き起こされるエピソード数($ M^{ ext{TMD}}_{ ext{Ψ}}(T) $)と訪問回数($ M^{ ext{TMD}}_{ u}(T) $)の分析を通じて、レギュレートバウンドを導出する。
実験結果
リサーチクエスチョン
- RQ1定常方策が劣化する状況下で、グローバルな凹関数報酬を有するオンラインMDPに対して、ノーレギュレートアルゴリズムを設計できるか?
- RQ2状態間の行動切り替えをどのように制御すれば、性能損失を最小限に抑えつつ、ベクトル値の結果をバランスさせられるか?
- RQ3複数の再帰的クラスを有するMDPにおいて、探索、活用、結果のバランスの最適なトレードオフは何か?
- RQ4非定常方策は、平均報酬設定下で、ベクトル値の非線形目的関数に対して近似的に最適なレギュレートを達成できるか?
- RQ5オンライン凸最適化ツールは、凹関数報酬関数を有するMDPの構造的複雑性に対応するために、どのように適合可能か?
主な発見
- 提案されたToc-UCRL2アルゴリズムは、$ O\big((L' + \frac{\tilde{L}D}{\tilde{Q}} + \tilde{L}\tilde{Q}) \norm{\bm{1}_K} T^{-1/3} + \tilde{L}\norm{\bm{1}_K} D \norm{\bm{1}_K} \frac{1}{\tilde{T}^{1/2}} \big) $ のレギュレートバウンドを達成し、これは非線形かつ近似的に最適である。
- 勾配閾値手順により、更新の遅延が成功裏に実現され、状態遷移中の性能損失が低減され、目的関数に影響を与えることなく、ベクトル値の結果のバランスが効果的に実現された。
- 勾配変動によって引き起こされるエピソード数は、$ 1 + \tilde{L}' / \tilde{Q} \times T^{2/3} $ で有界であり、これは方策更新の頻度を制御し、安定性を保証する。
- 本アルゴリズムは、平均報酬設定下で $ O(T^{-1/3}) $ のレギュレートを達成し、非定常的かつベクトル値のMDPにおいて、先行研究を改善した。
- 本手法は多様なOCOツールと互換性があり、オンライン凸最適化の適用範囲を凹関数報酬を有する構造的MDPに拡張した。
- 解析により、複数の再帰的クラスを有するMDPにおいて、定常方策は一般的に劣化することが確認され、非定常的かつ適応的な方策の必要性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。