Skip to main content
QUICK REVIEW

[論文レビュー] Episodic Linear Quadratic Regulators with Low-rank Transitions

Tianyu Wang, Lin F. Yang|arXiv (Cornell University)|Nov 3, 2020
Advanced Bandit Algorithms Research参考文献 42被引用数 4
ひとこと要約

本稿では、低ランクのシステムダイナミクスを有するエピソード的線形二次調節器(LQR)のためのモデルベース強化学習アルゴリズムを提案する。主成分分析(PCA)を用いた低ランク近似と楽観的制御を組み合わせることで、$\widetilde{\mathcal{O}}(m^{3/2}\sqrt{K})$ のレグレットバウンドを達成する。ここで $m$ はシステムの内部ランクであり、環境状態次元 $d$ に依存しない。これにより、画像ベース制御のような高次元設定でも効率的な学習が可能になる。

ABSTRACT

Linear Quadratic Regulators (LQR) achieve enormous successful real-world applications. Very recently, people have been focusing on efficient learning algorithms for LQRs when their dynamics are unknown. Existing results effectively learn to control the unknown system using number of episodes depending polynomially on the system parameters, including the ambient dimension of the states. These traditional approaches, however, become inefficient in common scenarios, e.g., when the states are high-resolution images. In this paper, we propose an algorithm that utilizes the intrinsic system low-rank structure for efficient learning. For problems of rank-$m$, our algorithm achieves a $K$-episode regret bound of order $\widetilde{O}(m^{3/2} K^{1/2})$. Consequently, the sample complexity of our algorithm only depends on the rank, $m$, rather than the ambient dimension, $d$, which can be orders-of-magnitude larger.

研究の動機と目的

  • 環境状態次元 $d$ に多項式的に依存する既存のLQR学習アルゴリズムの非効率性、特に画像ベース制御のような高次元設定における課題に対処すること。
  • システムダイナミクスに低ランク構造が存在する場合に、その特徴を活用することで、サンプル複雑性を低減できるかを調査すること。
  • 内部ランク $m$ にのみ依存するサブラインレグレットを達成するオンライン学習アルゴリズムを設計すること。環境次元 $d$ に依存しない。
  • 状態が高次元でも内部次元が低いエピソード的LQR問題において、効率的な学習を可能にすること。

提案手法

  • アルゴリズムはモデルベースのアプローチを採用し、収集した軌道に基づいて最小二乗回帰によりシステムダイナミクス $M = [A\; B]$ を推定する。
  • 主成分分析(PCA)を用いて、状態-行動データをランク $m$ の低次元部分空間に射影し、内在的なダイナミクスを捉える。
  • 低ランクモデル上の不確実性推定値を用いて楽観的制御方策を計算し、OFU(不確実性の面前での楽観主義)の原則に従い、探索と活用のバランスをとる。
  • すべてのデータポイントを最終エピソードからのPCA部分空間に射影することで、エピソード間での部分空間推定を安定化する。
  • 累積不確実性をバウンドするため、自己正規化ランダム過程の解析を用いる。これにより、環境次元 $d$ に依存しないレグレット保証が得られる。
  • 最終的なレグレットバウンドは、行列の行列式不等式と対数トレースバウンドを用いて導出され、低ランク構造を活用して $d$ への依存を分離する。

実験結果

リサーチクエスチョン

  • RQ1システムの内部ランク $m$ にのみ依存するLQR学習アルゴリズムを設計できるか。環境次元 $d$ に依存しない。
  • RQ2低ランク近似とオンライン制御学習を効果的に組み合わせることで、レグレット保証を維持できるか。
  • RQ3システムダイナミクスが低ランクであるが観測空間が高次元である場合に、得られる根本的なレグレットバウンドは何か。
  • RQ4内部状態空間が低次元である場合でも、観測状態が高次元である場合に、エピソード的LQRでサブラインレグレットを維持できるか。
  • RQ5逐次的学習設定において、エピソードごとに変化するPCA部分空間が引き起こす不安定性をどのように処理できるか。

主な発見

  • 提案アルゴリズムは、$K$ エピソードのレグレットバウンドとして $\widetilde{\mathcal{O}}(m^{3/2}\sqrt{K})$ を達成し、システムダイナミクスの内部ランク $m$ にのみ依存する。
  • レグレットバウンドは環境状態次元 $d$ に依存せず、画像のような高次元入力に対しても適している。
  • アルゴリズムのサンプル複雑性は $m$ に対して多項式的であり、従来の方法が $\mathrm{poly}(d)$ に依存するのと比べて顕著に改善されている。
  • 分析により、ランク不足の自己正規化プロセスの行列式に対する新しいバウンドが確立され、これがレグレットにおける $m$ 依存性の根拠となった。
  • 画像ベース制御タスク(例:カート・ポール)における実験結果から、高次元観測に対しても一般化性能が良好であることが確認された。
  • 内部システムが低次元である場合、標準的なLQR学習ベースラインに比べて、本手法はサンプル効率に優れている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。