Skip to main content
QUICK REVIEW

[論文レビュー] Provably Efficient Reward-Agnostic Navigation with Linear Value Iteration

Andrea Zanette, Alessandro Lazaric|arXiv (Cornell University)|Aug 18, 2020
Robotic Path Planning Algorithms参考文献 43被引用数 13
ひとこと要約

本稿では、線形価値関数近似を用いて報酬に依存しない強化学習のための証明可能に効率的で計算的に扱いやすいアルゴリズムを提示する。低固有ベルマン誤差と報酬フリー探索フレームワークを活用することで、報酬が後から明らかになる場合や探索データから推定される場合を含め、任意の線形報酬関数に対して近似的最適方策の学習においてPACサンプル複雑度の上限を達成する。

ABSTRACT

There has been growing progress on theoretical analyses for provably efficient learning in MDPs with linear function approximation, but much of the existing work has made strong assumptions to enable exploration by conventional exploration frameworks. Typically these assumptions are stronger than what is needed to find good solutions in the batch setting. In this work, we show how under a more standard notion of low inherent Bellman error, typically employed in least-square value iteration-style algorithms, we can provide strong PAC guarantees on learning a near optimal value function provided that the linear space is sufficiently "explorable". We present a computationally tractable algorithm for the reward-free setting and show how it can be used to learn a near optimal policy for any (linear) reward function, which is revealed only once learning has completed. If this reward function is also estimated from the samples gathered during pure exploration, our results also provide same-order PAC guarantees on the performance of the resulting policy for this setting.

研究の動機と目的

  • LSPI や LSVI などのバッチ強化学習手法で一般的な低固有ベルマン誤差仮定の下で、計算的に効率的かつ統計的に妥当な強化学習のためのアルゴリズムを開発すること。
  • 報酬の事前知識なしに、単一の純粋探索フェーズのみを用いて、任意の線形報酬関数に対して近的最適方策を学習可能にする。
  • 報酬が学習後に明らかにされるか、同じ探索データから推定される場合に、得られる方策のPAC一般化保証を提供すること。
  • 先行研究における楽観的閉包仮定の制限を克服し、より標準的でバッチに適した仮定に依拠すること。

提案手法

  • 固定方策の下で実行される報酬フリー探索フェーズを用いて、状態-行動空間の十分なカバレッジを確保する。
  • 最小二乗推定器を用いた線形価値反復により、価値関数を近似し、固有ベルマン誤差を最小化する。
  • 特徴共分散行列の双対ノルムを用いて、報酬の事前知識なしに効率的な探索を可能にする新しい探索ボーナスを導出する。
  • 価値関数近似が低次元の線形空間内に保たれることで、計算的に取り扱いやすい最適化を実現する。
  • 集中不等式(例:カイ二乗分布およびアズマ=フーディング不等式)を用いて、推定誤差および一般化の高確率境界を導出する。
  • 遷移モデルの全推定や複雑なオンライン最適化問題の解法を避けることで、計算的に取り扱いやすいように設計する。

実験結果

リサーチクエスチョン

  • RQ1標準的な低固有ベルマン誤差仮定の下で、楽観的閉包に依存せずに、線形MDPにおける証明可能に効率的な学習が可能か。
  • RQ2単一の純粋探索フェーズの後で、任意の線形報酬関数に対して近的最適方策を学習可能な計算的に効率的なアルゴリズムを設計可能か。
  • RQ3報酬が後から明らかになる場合と探索データから推定される場合の両方において、このような報酬に依存しない学習フレームワークで達成可能なサンプル複雑度の上限は何か。
  • RQ4アルゴリズムの性能は、特徴空間の次元および信頼水準に関してどのようにスケーリングするか。

主な発見

  • アルゴリズムは、特徴空間の次元および報酬ギャップの逆数に比例するPACサンプル複雑度の上限を達成し、既知の下界と対数要因を除いて一致する。
  • 楽観的閉包を要件としない、報酬フリー設定下でPAC保証を持つ最初の計算的に取り扱いやすいアルゴリズムを提供する。
  • 報酬が同じ探索データから推定される場合でも、真の報酬が事前に分かっている場合と同程度のPAC性能保証を達成する。
  • 理論的解析により、ガウス分布およびカイ二乗分布に従う変数に対する集中不等式を用いて、価値関数の推定誤差の高確率境界を確立する。
  • 探索ボーナスが特徴ベクトルの双対ノルムに比例することを保証し、状態-行動空間の効果的カバレッジを実現する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。