Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Reinforcement Learning for High Dimensional Linear Quadratic Systems

Morteza Ibrahimi, Adel Javanmard|arXiv (Cornell University)|Mar 24, 2013
Advanced Bandit Algorithms Research参考文献 13被引用数 17
ひとこと要約

本論文は、スパースなダイナミクスを有する高次元線形二次(LQ)システムに対する適応的強化学習アルゴリズムを提案し、$O(p\sqrt{T})$ のレグレットバウンドを達成した。これは、従来の $O(p^{p+r+2}\sqrt{T})$ のバウンドに比べ顕著な改善である。システム行列のスパarsityを活用し、楽観的パrameter推定を用いることで、$ p $ に関する多項対数時間の内に $ (1+\epsilon) $-最適な平均コストを達成でき、オンライン広告のような高次元設定でも効率的な制御が可能である。

ABSTRACT

We study the problem of adaptive control of a high dimensional linear quadratic (LQ) system. Previous work established the asymptotic convergence to an optimal controller for various adaptive control schemes. More recently, for the average cost LQ problem, a regret bound of ${O}(\sqrt{T})$ was shown, apart form logarithmic factors. However, this bound scales exponentially with $p$, the dimension of the state space. In this work we consider the case where the matrices describing the dynamic of the LQ system are sparse and their dimensions are large. We present an adaptive control scheme that achieves a regret bound of ${O}(p \sqrt{T})$, apart from logarithmic factors. In particular, our algorithm has an average cost of $(1+\eps)$ times the optimum cost after $T = \polylog(p) O(1/\eps^2)$. This is in comparison to previous work on the dense dynamics where the algorithm requires time that scales exponentially with dimension in order to achieve regret of $\eps$ times the optimal cost. We believe that our result has prominent applications in the emerging area of computational advertising, in particular targeted online advertising and advertising in social networks.

研究の動機と目的

  • 高次元線形二次(LQ)システムにおける既存の強化学習アルゴリズムのスケーリングの悪さ、特に状態次元 $ p $ に伴いレグレットが指数関数的に増加する問題に対処すること。
  • 状態次元 $ p \gg 1 $ の高次元設定において、最小限のレグレットで近似的最適なパフォーマンスを達成する適応的制御方式の開発。
  • システム行列 $ A^0 $ および $ B^0 $ のスパarsityを活用し、$ O(\log(p+r)) $ の観測数でのみ、正確で効率的なパrameter推定を可能とすること。
  • 次元 $ p $ に対して滑らかにスケーリングするレグレットバウンドを確立し、$ \text{polylog}(p) \cdot O(1/\epsilon^2) $ 時間で $ (1+\epsilon) $-最適なコストを達成すること。

提案手法

  • 不確実性に対する楽観主義(OFU)の原則を用い、信頼集合内での最も楽観的なパラメータ推定を選択することで、探索を促進し最適制御への収束を保証する。
  • 推定されたシステムパラメータ $ \widetilde{\Theta}_t $ のまわりに信頼集合 $ \Omega_t $ を構築し、高確率で $ \Theta^0 \in \Omega_t $ となるようにする。
  • 累積コストと最適コストとの関係を、三つの誤差項 $ C_1, C_2, C_3 $ を介して分解するコスト分解技術を採用し、高確率事象下でこれらを有界化する。
  • 高確率でのレグレットバウンドを導出するための二つの重要な事象 $ \mathcal{E}_1 $(真のパラメータが信頼集合内)および $ \mathcal{E}_2 $(ノイズが有界)を導入する。
  • 集中不等式およびリカチ演算子 $ K(\widetilde{\Theta}_t) $ のスペクトルノルムのバウンドを用い、推定誤差および制御誤差の成長を制御する。
  • $ A^0 $ および $ B^0 $ のスパarsityを活用することで、有効なパラメータ数を削減し、少数のサンプルでの正確な推定を可能とし、レグレットのスケーリングを改善する。

実験結果

リサーチクエスチョン

  • RQ1高次元LQシステムにおいて、強化学習アルゴリズムが次元 $ p $ に対して多項式的にスケーリングするレグレットバウンドを達成できるか?
  • RQ2システムダイナミクスにおけるスパarsityを活用することで、適応的制御アルゴリズムのサンプル効率およびレグレットスケーリングが顕著に向上するか?
  • RQ3OFUに基づくアルゴリズムが、指数関数的時間ではなく $ p $ に関して多項対数時間内に $ (1+\epsilon) $-最適なパフォーマンスを達成できるか?
  • RQ4システム行列がスパースな場合、密度行列の場合と比較して、次元に伴うレグレットのスケーリングはどのように変化するか?

主な発見

  • 提案されたアルゴリズムは、対数因子を除き $ O(p\sqrt{T}) $ のレグレットバウンドを達成した。これは、密度行列のシステムに対しては従来の $ O(p^{p+r+2}\sqrt{T}) $ のバウンドに比べ顕著な改善である。
  • アルゴリズムは、$ T = \text{polylog}(p) \cdot O(1/\epsilon^2) $ 時間ステップの後に平均コストを最適コストの $ (1+\epsilon) $ 以内に達成でき、高次元における高速収束を可能にする。
  • スパースなシステム行列の仮定のもとでは、$ O(\log(p+r)) $ の観測数でのみ正確なパラメータ推定が可能であり、効率的な学習が実現できる。
  • レグレットバウンドは、三つの誤差項 $ C_1, C_2, C_3 $ への高確率分解を通じて導出され、集中不等式およびスペクトルノルム技術を用いてそれぞれを有界化した。
  • 解析により、スパarsityの活用と注意深く設計された信頼集合のおかげで、レグレットが次元 $ p $ に対して線形にスケーリングすることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。