Skip to main content
QUICK REVIEW

[論文レビュー] Near-optimal Representation Learning for Linear Bandits and Linear RL

Jiachen Hu, Xiaoyu Chen|arXiv (Cornell University)|Feb 8, 2021
Advanced Bandit Algorithms Research参考文献 36被引用数 6
ひとこと要約

本稿では、複数のタスクに共通する低次元表現を活用することで、マルチタスク線形バンディットおよびエピソード的強化学習におけるサンプル効率の良いアルゴリズム、MTLR-OFULを提案する。線形バンディットでは $ ilde{O}(M\sqrt{dkT} + d\sqrt{kMT})$ の近似的最適なリグレットバウンドを達成し、エピソード的強化学習では $ ilde{O}(HM\sqrt{dkT} + Hd\sqrt{kMT} + HMT\sqrt{d}\mathcal{I})$ を達成する。独立学習のベースラインと比較して顕著な改善を示し、タイトな下界の証明も行う。

ABSTRACT

This paper studies representation learning for multi-task linear bandits and multi-task episodic RL with linear value function approximation. We first consider the setting where we play $M$ linear bandits with dimension $d$ concurrently, and these bandits share a common $k$-dimensional linear representation so that $k\ll d$ and $k \ll M$. We propose a sample-efficient algorithm, MTLR-OFUL, which leverages the shared representation to achieve $ ilde{O}(M\sqrt{dkT} + d\sqrt{kMT} )$ regret, with $T$ being the number of total steps. Our regret significantly improves upon the baseline $ ilde{O}(Md\sqrt{T})$ achieved by solving each task independently. We further develop a lower bound that shows our regret is near-optimal when $d > M$. Furthermore, we extend the algorithm and analysis to multi-task episodic RL with linear value function approximation under low inherent Bellman error \citep{zanette2020learning}. To the best of our knowledge, this is the first theoretical result that characterizes the benefits of multi-task representation learning for exploration in RL with function approximation.

研究の動機と目的

  • M 個のタスクに共通する低次元表現を持つマルチタスク線形バンディットのためのサンプル効率の良いアルゴリズムの開発。
  • 線形価値関数近似と低固有ベルナウリ誤差を備えたマルチタスクエピソード的強化学習にこのアルゴリズムを拡張すること。
  • 関数近似を伴う順序的意思決定における探索のための表現学習の利点を理論的に確立すること。
  • 提案されたアルゴリズムの近的最適なリグレットバウンドと下界を証明すること。

提案手法

  • 共有された低次元表現とタスク固有のパラメータの両方を同時に最適化するマルチタスク線形バンディットアルゴリズム MTLR-OFUL を提案。正則化最小二乗推定器を用いる。
  • OFUL と同様の信頼楕円体アプローチを採用するが、共有表現学習に適応させ、タスク間で低ランク構造を促進する新しい正則化を導入。
  • 共有された $k$ 次元表現を活用し、表現に配慮した正則化を施した LSVI スタイルの更新を適用する、マルチタスクエピソード的強化学習のための新しいアルゴリズムフレームワークを提案。
  • 推定誤差と表現誤差の新しい分解を用いてリグレットバウンドを導出。共有部分空間構造の正確な取り扱いを含む。
  • 単一タスク設定に還元可能な困難なインスタンス構築により下界を確立。リグレットバウンドのタイトさを証明。
  • 近似誤差 $\zeta$ の観点からモデル不適合へのロバストネスを分析。

実験結果

リサーチクエスチョン

  • RQ1共通する低次元表現を持つタスク間で、マルチタスク表現学習が線形バンディットにおけるリグレットを顕著に低減できるか?
  • RQ2共有された $k$ 次元表現を持つマルチタスク線形バンディットにおけるリグレットの根本的限界は何か? また、提案されたアルゴリズムは近的最適か?
  • RQ3共有表現学習の利点は、線形関数近似を伴うマルチタスクエピソード的強化学習へ拡張可能か?
  • RQ4固有ベルナウリ誤差 $\mathcal{I}$ は、共有表現を用いたマルチタスク強化学習のサンプル効率にどのように影響するか?
  • RQ5提案されたアルゴリズムはモデル不適合に対してロバストか? また、近似誤差 $\zeta$ はリグレットにどのように影響するか?

主な発見

  • 提案された MTLR-OFUL アルゴリズムは、マルチタスク線形バンディットにおいて $\tilde{O}(M\sqrt{dkT} + d\sqrt{kMT})$ のリグレットバウンドを達成し、独立学習ベースラインの $\tilde{O}(Md\sqrt{T})$ よりも優れている。
  • リグレットバウンドは、$d > M$ の場合に $\Omega(Mk\sqrt{HT} + d\sqrt{HkMT})$ の下界と一致するため、対数要因を除いて近的最適であることが示された。
  • 線形価値関数近似を伴うマルチタスクエピソード的強化学習では、アルゴリズムが $\tilde{O}(HM\sqrt{dkT} + Hd\sqrt{kMT} + HMT\sqrt{d}\mathcal{I})$ のリグレットを達成し、独立学習の ELEANOR ベースラインと比べ顕著な改善を示した。
  • 真のパrameterが $k$ 次元部分空間から $\zeta$ の誤差内にある場合、アルゴリズムはリグレット $\tilde{O}(M\sqrt{dkT} + d\sqrt{kMT} + MT\sqrt{d}\zeta)$ を達成し、モデル不適合に対してもロバストである。
  • 本稿では、共有表現学習に基づく探索のための最初の理論的サンプル効率性を持つアルゴリズムを確立。タイトなリグレットバウンドが情報理論的下界と一致する。
  • 理論的分析により、共有表現学習が関数近似を伴う線形バンディットおよびエピソード的強化学習の両方において、顕著なデータ効率の向上を実現可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。