Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Control in Metric Space with Optimal Regret

Lin F. Yang, Chengzhuo Ni|arXiv (Cornell University)|May 5, 2019
Advanced Bandit Algorithms Research参考文献 21被引用数 14
ひとこと要約

本稿では、任意の状態空間および行動空間(距離関数を備えたもの)を有する有限ホライズンの決定的制御系に対して、単純な上位信頼強化学習アルゴリズムを提案する。近傍法による構築を用いて関数近似オракルで楽観的Q関数を推定することで、$ O(HL(KH)^{(d-1)/d}) $ のレグレットを達成する。ここで $ d $ は状態行動空間のダブリング次元を表し、メトリック連続性の仮定の下で近似的に一致する下界を確立し、最適性を示している。

ABSTRACT

We study online reinforcement learning for finite-horizon deterministic control systems with {\it arbitrary} state and action spaces. Suppose that the transition dynamics and reward function is unknown, but the state and action space is endowed with a metric that characterizes the proximity between different states and actions. We provide a surprisingly simple upper-confidence reinforcement learning algorithm that uses a function approximation oracle to estimate optimistic Q functions from experiences. We show that the regret of the algorithm after $K$ episodes is $O(HL(KH)^{\frac{d-1}{d}}) $ where $L$ is a smoothness parameter, and $d$ is the doubling dimension of the state-action space with respect to the given metric. We also establish a near-matching regret lower bound. The proposed method can be adapted to work for more structured transition systems, including the finite-state case and the case where value functions are linear combinations of features, where the method also achieve the optimal regret.

研究の動機と目的

  • 動的システムや報酬関数にパrametric仮定を置かない一般化されたオンライン強化学習アルゴリズムの開発。
  • 状態行動空間に定義されたメトリック構造を活用し、限られた経験からの有効な一般化を可能にする。
  • 環境の埋め込み次元ではなく、内在次元(ダブリング次元)に依存する非線形レグレットを達成する。
  • メトリック連続性の仮定の下で、タイトな上界および下界の両方のレグレット境界を確立する。
  • 有限状態MDPや線形関数近似といった構造的ケースに適応し、それぞれで最適なレグレットを達成する。

提案手法

  • アルゴリズムは経験バッファを用いて過去の遷移を保存し、各エピソード後に関数近似オーケストラルを再計算して楽観的Q関数を算出する。
  • オーケストラルは観測データに近傍推定器をフィットさせることで、未到達領域に対しても楽観的であるQ関数を構築する。
  • 遷移関数および報酬関数が、状態行動空間上の与えられたメトリックに関してリプシッツ連続であると仮定する。
  • 情報理論的アプローチを用いてレグレットを分析し、性能とメトリック空間のダブリング次元を結びつける。
  • 線形モデルの場合、関数近似器は未観測特徴に対して上界をとる線形回帰に適応され、有界なレグレットを保証する。
  • アルゴリズムは楽観的Q関数に基づいてポリシーを動的に更新し、不確実性の高い領域の探索を促進する。

実験結果

リサーチクエスチョン

  • RQ1パrametric仮定なしに、単純でメトリックに基づく強化学習アルゴリズムが非線形レグレットを達成できるか?
  • RQ2メトリック連続性の下で、状態行動空間の内在次元(ダブリング次元)に応じて、レグレットはどのようにスケーリングされるか?
  • RQ3提案されたレグレット境界は最適であり、一致する下界を確立できるか?
  • RQ4本手法は、有限状態MDPや線形関数近似といった構造的モデルに適応可能で、最適な性能を達成できるか?
  • RQ5関数近似オーケストラルは、メトリック空間における楽観性と一般化を可能にする役割を果たすか?

主な発見

  • アルゴリズムは $ O(HL(KH)^{(d-1)/d}) $ のレグレット境界を達成する。ここで $ d $ は状態行動空間のダブリング次元、$ L $ は滑らかさパラメータ、$ H $ はホライズンである。
  • 近似的に一致するレグレット下界 $ ilde{ heta}( ext{min}(| ext{covering set}|, K) imes H ) $ が確立され、上界が対数要因を除いて最適であることが証明された。
  • 有限状態・行動の場合、レグレットは $ O(SAH) $ に簡略化され、既知の境界と一致し、本手法が表形式RLの一般化であることを検証した。
  • 次元 $ d $ の線形MDPでは、レグレットは $ O(Hd) $ となり、最先端の結果と一致し、最適性を達成する。
  • 関数近似器が線形モデルや他の構造的クラスに置き換えられても、本手法は依然として最適なレグレットスケーリングを維持する。
  • 近傍法に基づく楽観的関数近似の使用により、連続的なメトリック空間における効果的な一般化と探索が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。