[論文レビュー] Provably Efficient Representation Selection in Low-rank Markov Decision Processes: From Online to Offline RL
本稿では、低ランクマルコフ決定過程における表現選択のための証明可能に効率的なアルゴリズムReLEXを提案する。オンラインRLおよびオフラインRLの両方で複数の表現を動的に活用可能であり、オンラインRLではより良いレグレットバウンドを達成し、オフラインRLではカバレッジ仮定のもとで定数のサンプル複雑度を達成する。単一表現手法を上回る性能を発揮する。
The success of deep reinforcement learning (DRL) lies in its ability to learn a representation that is well-suited for the exploration and exploitation task. To understand how the choice of representation can improve the efficiency of reinforcement learning (RL), we study representation selection for a class of low-rank Markov Decision Processes (MDPs) where the transition kernel can be represented in a bilinear form. We propose an efficient algorithm, called ReLEX, for representation learning in both online and offline RL. Specifically, we show that the online version of ReLEX, called ReLEX-UCB, always performs no worse than the state-of-the-art algorithm without representation selection, and achieves a strictly better constant regret if the representation function class has a "coverage" property over the entire state-action space. For the offline counterpart, ReLEX-LCB, we show that the algorithm can find the optimal policy if the representation class can cover the state-action space and achieves gap-dependent sample complexity. This is the first result with constant sample complexity for representation learning in offline RL.
研究の動機と目的
- 強化学習において、複数の表現が利用可能な状況で、異なる状態-行動ペアに対して最適な表現を選択する課題に対処すること。
- 各状態-行動ペアに対して最良の表現を動的に選択することで、オンラインおよびオフラインRLにおけるサンプル効率を向上させること。
- 特に双線形遷移カーネルの下で、低ランクMDPにおける表現選択に対して理論的保証を確立すること。
- オフラインRLにおける表現学習のギャップを埋めるために、表現選択を伴う初めての定数サンプル複雑度の結果を提供すること。
- 実験的に、固定表現よりも表現選択が顕著に性能を向上させることを示すこと。
提案手法
- ReLEXは、オンラインRLでは楽観的Q値を最小化する表現を選択する(ReLEX-UCB)、オフラインRLでは懐疑的Q値を最大化する(ReLEX-LCB)表現選択メカニズムを採用する。
- 遷移カーネルを $ \mathbb{P}(s'\mid s,a) = \bm{\phi}(s,a)^\top \mathbf{M}^* \bm{\psi}(s') $ の双線形形式でモデル化することで、低ランク構造の活用を可能にする。
- オンラインRLでは、ReLEX-UCBが上界信頼区間を用いて探索と表現選択のバランスを図り、表現クラスのカバレッジが十分であれば、より良いレグレットバウンドを達成する。
- オフラインRLでは、ReLEX-LCBが分布シフトに対処するため懐疑的戦略を適用し、カバレッジ仮定のもとで最適方策の同定を保証する。
- 表現推定における不確実性を制御するために、行列集中と自己正規化マルティンググール不等式を用いる。
- 表現選択誤差をバウンドし、ギャップ依存型および定数のサンプル複雑度結果を導出するための新規な分析フレームワークを導入する。
実験結果
リサーチクエスチョン
- RQ1状態-行動ペアにわたる動的表現選択は、オンラインおよびオフライン強化学習におけるサンプル効率を向上させることができるか?
- RQ2表現選択は、固定表現手法よりもオンラインRLで厳密に良いレグレットバウンドを達成するか?
- RQ3カバレッジ仮定のもとで、表現選択を用いるオフラインRLアルゴリズムは定数のサンプル複雑度を達成できるか?
- RQ4表現カバレッジは、低ランクMDPにおけるRLアルゴリズムの性能と一般化能力にどのように影響するか?
- RQ5提案されたアルゴリズムReLEXは、オンラインおよびオフライン設定の両方で単一表現ベースラインを上回るか?
主な発見
- ReLEX-UCBは、表現選択なしの最先端アルゴリズムと同等以下のレグレットバウンドを達成し、表現クラスが状態-行動空間全体をカバーする場合には、それを厳密に上回る。
- ReLEX-LCBはギャップ依存型のサンプル複雑度のもとで最適方策を同定し、行動方策のカバレッジ仮定のもとで定数のサンプル複雑度を達成する。
- オフラインRLにおける定数のサンプル複雑度は、表現学習分野で初めての結果であり、理論的進展として顕著である。
- 実験的評価により、ReLEXはさまざまなMDPにおいて、オンラインおよびオフライン設定の両方で任意の単一表現を上回ることが確認された。
- 表現クラスに最適方策の状態-行動分布をカバーする関数が含まれている場合、アルゴリズムの性能向上が最も顕著に現れた。
- 理論的分析により、表現選択メカニズムが不確実性を効果的に低減し、よりタイトな一般化バウンドをもたらすことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。