Skip to main content
QUICK REVIEW

[論文レビュー] Logarithmic Regret for Reinforcement Learning with Linear Function Approximation

Jiafan He, Dongruo Zhou|arXiv (Cornell University)|Nov 23, 2020
Advanced Bandit Algorithms Research参考文献 41被引用数 21
ひとこと要約

本稿は、正のサブ最適性ギャップを活用することで、2つの線形MDO仮定—線形MDOおよび線形混合MDO—の下で、強化学習における線形関数近似に対する最初の対数的レギュレートバウンドを確立した。線形MDO仮定の下ではLSVI-UCBが$\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$のレギュレートを達成し、線形混合MDO仮定の下ではUCRL-VTRが$\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$のレギュレートを達成した。これは、従来の$\sqrt{T}$型のバウンドと比べて顕著に改善されたものである。

ABSTRACT

Reinforcement learning (RL) with linear function approximation has received increasing attention recently. However, existing work has focused on obtaining $\sqrt{T}$-type regret bound, where $T$ is the number of interactions with the MDP. In this paper, we show that logarithmic regret is attainable under two recently proposed linear MDP assumptions provided that there exists a positive sub-optimality gap for the optimal action-value function. More specifically, under the linear MDP assumption (Jin et al. 2019), the LSVI-UCB algorithm can achieve $ ilde{O}(d^{3}H^5/ ext{gap}_{ ext{min}}\cdot \log(T))$ regret; and under the linear mixture MDP assumption (Ayoub et al. 2020), the UCRL-VTR algorithm can achieve $ ilde{O}(d^{2}H^5/ ext{gap}_{ ext{min}}\cdot \log^3(T))$ regret, where $d$ is the dimension of feature mapping, $H$ is the length of episode, $ ext{gap}_{ ext{min}}$ is the minimal sub-optimality gap, and $ ilde O$ hides all logarithmic terms except $\log(T)$. To the best of our knowledge, these are the first logarithmic regret bounds for RL with linear function approximation. We also establish gap-dependent lower bounds for the two linear MDP models.

研究の動機と目的

  • 標準的な$\sqrt{T}$レギュレートバウンドと、線形関数近似を用いた強化学習におけるよりタイトなインスタンス依存バウンドの間のギャップを埋める。
  • 正のサブ最適性ギャップが存在する場合、最近の線形MDO仮定の下で対数的レギュレートが達成可能かどうかを調査する。
  • 問題依存構造を考慮した線形MDOおよび線形混合MDO設定におけるレギュレートの上界と下界を両方確立する。
  • モデルフリーおよびモデルベースの強化学習アルゴリズムにおける線形関数近似を用いた、最初のギャップ依存レギュレート解析を提供する。

提案手法

  • 線形関数近似におけるギャップ依存解析フレームワークを提案し、最小サブ最適性ギャップ$\text{gap}_{\text{min}}$に焦点を当てる。
  • 線形MDO仮定の下でLSVI-UCBアルゴリズムを適用し、$\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$のレギュレートバウンドを導出する。
  • 線形混合MDO仮定の下でUCRL-VTRアルゴリズムを適用し、$\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$のレギュレートを達成する。
  • マーティングールの差分を制御するため、アズマ=ホイーディングおよびフレッドマンの集中不等式を用いる。
  • サブ最適性ギャップのインタバルに基づく再帰的分解を用いて、エピソード全体にわたる累積誤差をバウンドする。
  • 線形MDOおよび線形混合MDOモデルの両方に対して、$\Omega(dH/\text{gap}_{\text{min}})$の下界を導出し、上界のタイトさを示す。

実験結果

リサーチクエスチョン

  • RQ1線形MDO仮定の下で、線形関数近似を用いた強化学習において、対数的レギュレートが達成可能か?
  • RQ2より一般的な線形混合MDO仮定の下でも、同じ対数的レギュレートスケーリングが達成可能か?
  • RQ3最小サブ最適性ギャップ$\text{gap}_{\text{min}}$は、線形関数近似RLにおけるレギュレートにどのように影響するか?
  • RQ4線形MDOおよび線形混合MDO設定におけるインスタンス依存のレギュレート下界は何か?
  • RQ5$T$に依存する点で、提案されたバウンドは、既存の$\sqrt{T}$型レギュレートバウンドと比べてどのように異なるか?

主な発見

  • 線形MDO仮定の下でLSVI-UCBは$\widetilde{O}(d^3H^5/\text{gap}_{\text{min}} \cdot \log T)$のレギュレートを達成し、モデルフリーRLにおける線形関数近似の最初の対数的レギュレートバウンドを示した。
  • 線形混合MDO仮定の下でUCRL-VTRは$\widetilde{O}(d^2H^5/\text{gap}_{\text{min}} \cdot \log^3 T)$のレギュレートを達成し、モデルベースRLにおける線形関数近似の最初のこのような結果をもたらした。
  • 本稿は、線形MDOおよび線形混合MDOモデルの両方に対して$\Omega(dH/\text{gap}_{\text{min}})$のギャップ依存下界を確立し、上界がほぼタイトであることを示した。
  • 結果は、サブ最適性ギャップがゼロから離れている場合、レギュレートにおける$T$への依存を$\sqrt{T}$から$\log T$に削減可能であることを示した。
  • 解析により、次元$d$、ホライズン$H$、最小ギャップ$\text{gap}_{\text{min}}$がレギュレートを決定づける重要な要因であり、特に$\text{gap}_{\text{min}}$が対数的スケーリングを可能にする中心的役割を果たすことが明らかになった。
  • 導出されたバウンドはインスタンス依存であり、最適行動とサブ最適行動のギャップが大きい問題では、従来の$\sqrt{T}$型バウンドと比べて著しくタイトである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。