Skip to main content
QUICK REVIEW

[論文レビュー] Tightening Exploration in Upper Confidence Reinforcement Learning

Hippolyte Bourel, Odalric-Ambrym Maillard|arXiv (Cornell University)|Apr 20, 2020
Advanced Bandit Algorithms Research参考文献 33被引用数 8
ひとこと要約

本稿では、分散に配慮した集中不等式と遷移分布の適応的サポート推定を用いて、探索を厳密化することで、UCRL2を改善した上位信頼強化学習アルゴリズムUCRL3を提案する。自信集合の精緻化と不要な探索の低減により、局所ダイヤメーターや有効サポートを組み込んだよりタイトなレグレットバウンドを達成し、理論的最適性を維持したまま数値実験でUCRL2を上回る高速な学習収束を実現した。

ABSTRACT

The upper confidence reinforcement learning (UCRL2) algorithm introduced in (Jaksch et al., 2010) is a popular method to perform regret minimization in unknown discrete Markov Decision Processes under the average-reward criterion. Despite its nice and generic theoretical regret guarantees, this algorithm and its variants have remained until now mostly theoretical as numerical experiments in simple environments exhibit long burn-in phases before the learning takes place. In pursuit of practical efficiency, we present UCRL3, following the lines of UCRL2, but with two key modifications: First, it uses state-of-the-art time-uniform concentration inequalities to compute confidence sets on the reward and (component-wise) transition distributions for each state-action pair. Furthermore, to tighten exploration, it uses an adaptive computation of the support of each transition distribution, which in turn enables us to revisit the extended value iteration procedure of UCRL2 to optimize over distributions with reduced support by disregarding low probability transitions, while still ensuring near-optimism. We demonstrate, through numerical experiments in standard environments, that reducing exploration this way yields a substantial numerical improvement compared to UCRL2 and its variants. On the theoretical side, these key modifications enable us to derive a regret bound for UCRL3 improving on UCRL2, that for the first time makes appear notions of local diameter and local effective support, thanks to variance-aware concentration bounds.

研究の動機と目的

  • UCRL2は理論的レグレット保証が強くても、中程度のサイズのMDPにおいて長時間のバーンインフェーズと低い実効的性能を示す問題に対処すること。
  • より良い自信集合構築による、上位信頼強化学習の実用的効率の向上を図ること。
  • グローバルパラメータではなく、局所ダイヤメーターや有効サポートといった局所MDP構造を反映した、より良いレグレットバウンドの導出。
  • 適応的サポート推定による探索の低減が、理論的性能を損なわず学習速度を向上させることの実証。
  • UCRL3とUCRL2、PSRLを実験的に比較し、スパarsely-rewaredおよび大規模状態空間環境における優位性を示すこと。

提案手法

  • 標準の集中不等式に代えて、時間に一様で分散に配慮した境界を用い、報酬および遷移確率のよりタイトな自信集合を計算する。
  • 観測データに基づき低確率遷移を除外する適応的サポート推定を導入し、遷移分布の有効サポートを低減する。
  • 拡張価値反復(EVI)手順を変更し、縮小されたサポート集合上で最適化することで、楽観的性を維持しつつ計算効率を向上させる。
  • サポートのラージ更新戦略を採用し、Lステップごとにのみサポートを更新(実験ではL=5)することで、計算オーバーヘッドを低減する。
  • PSRLとの比較のため、ベイジアンバージョンとして遷移および報酬分布にディリクレおよびベータ事前分布を採用する。
  • 再現性およびベンチマークのため、OpenAI Gym環境と互換性を持つ実用的でオープンソースのPythonコードベースを実装する。

実験結果

リサーチクエスチョン

  • RQ1分散に配慮した集中不等式に基づくよりタイトな自信区間は、UCRL2スタイルのアルゴリズムにおける探索を低減し、学習速度を向上させ得るか?
  • RQ2遷移分布の適応的サポート推定は、MDPにおける収束速度と実効的性能を向上させるか?
  • RQ3局所ダイヤメーターや有効サポートといった局所構造的性質を組み込むことで、UCRL3のレグレットバウンドを改善できるか?
  • RQ4スパース報酬および密報酬環境を含むさまざまなMDP構造において、UCRL3とPSRLのレグレットおよび学習速度の比較で、どちらが優れているか?
  • RQ5特定のMDP(例:報酬豊富な環境)においてPSRLが実験的に失敗する原因は、頻度主義的レグレット保証の欠如と、劣悪な自信集合構築に起因するのだろうか?

主な発見

  • UCRL3は、局所ダイヤメーターや局所有効サポートに明示的に依存するレグレットバウンドを達成し、UCRL2のグローバルD依存バウンドを改善した。
  • 数値実験では、UCRL3が6状態のRiverSwim、2部屋、4部屋、100状態MDPにおいてバーンインフェーズを顕著に短縮し、UCRL2を上回ることを示した。
  • 100状態のスパース報酬MDPでは、初期段階を除きUCRL3がPSRLを上回り、より優れた長期的学習安定性を示した。
  • 10状態の報酬豊富なMDPではPSRLが著しく性能を発揮しなかったため、密度の高い報酬構造下での探索戦略の限界が示された。
  • UCRL3における適応的サポート推定は、不要な探索を低減し、理論的保証を損なわず収束を高速化した。
  • 分散に配慮した集中不等式の使用により、特に単一状態の繰り返し観測のようなエッジケースにおいても、よりタイトな自信集合が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。