Skip to main content
QUICK REVIEW

[論文レビュー] No-Regret Exploration in Goal-Oriented Reinforcement Learning

Jean Tarbouriech, Evrard Garcelon|arXiv (Cornell University)|Dec 7, 2019
Advanced Bandit Algorithms Research参考文献 24被引用数 8
ひとこと要約

本稿では、ループフリーの仮定がなくてもよい一般の確率的最短経路(SSP)問題に対する、初めてのノーレグレット強化学習アルゴリズムであるUC-SSPを提案する。本手法は、遅い方策を遮断し、より速い代替手段に切り替える、新しいピボット・ホライズンに基づく停止ルールを用いることで、$ otimes\widetilde{\mathcal{O}}(DS\sqrt{ADK})$ のレグレットバウンドを達成し、目的志向のMDPにおける効率的な探索を可能にする。

ABSTRACT

Many popular reinforcement learning problems (e.g., navigation in a maze, some Atari games, mountain car) are instances of the episodic setting under its stochastic shortest path (SSP) formulation, where an agent has to achieve a goal state while minimizing the cumulative cost. Despite the popularity of this setting, the exploration-exploitation dilemma has been sparsely studied in general SSP problems, with most of the theoretical literature focusing on different problems (i.e., fixed-horizon and infinite-horizon) or making the restrictive loop-free SSP assumption (i.e., no state can be visited twice during an episode). In this paper, we study the general SSP problem with no assumption on its dynamics (some policies may actually never reach the goal). We introduce UC-SSP, the first no-regret algorithm in this setting, and prove a regret bound scaling as $\displaystyle \widetilde{\mathcal{O}}( D S \sqrt{ A D K})$ after $K$ episodes for any unknown SSP with $S$ states, $A$ actions, positive costs and SSP-diameter $D$, defined as the smallest expected hitting time from any starting state to the goal. We achieve this result by crafting a novel stopping rule, such that UC-SSP may interrupt the current policy if it is taking too long to achieve the goal and switch to alternative policies that are designed to rapidly terminate the episode.

研究の動機と目的

  • ループフリーの仮定や既知の有限ホライズンがない一般の確率的最短経路(SSP)問題において、ノーレグレット探索アルゴリズムが不足しているという問題に対処すること。
  • 有限ホライズンおよび無限ホライズンの強化学習設定が、目標に到達するまでの期待コストを最小化する真のSSPの目的を十分に捉えていないという制限を克服すること。
  • 目標に到達するのにあまりに時間がかかっている方策を遮断し、より効率的な代替手段に迅速に切り替える停止ルールを設計すること。
  • ループフリー性や既知のホライズンといった制限的な仮定を設けない一般のSSP設定において、非線形レグレットバウンドを証明すること。
  • 到達時間のフェーズ型分布解析と楽観的計画法を組み合わせることで、SSPにおける探索に関する理論的ギャップを埋めること。

提案手法

  • 遷移確率の推定値にベルンシュタイン不等式を適用して得られる信頼区間を用いた楽観的価値反復に基づくUC-SSPを提案する。
  • 動的に調整される時間閾値に基づくピボット・ホライズンに依存する、新しい停止ルールを導入する。このルールは、現在の方策が時間的に遅れている場合にエピソードの終了をトリガーする。
  • 二段階戦略を採用する:段階①では、不確実性が大きい楽観的方策による探索を実施し、段階②では、推定到達時間の低い方策を用いてエピソードを迅速に終了する。
  • 非適正方策を回避し、期待到達時間が有限になるように保証するため、コストに摂動(例:$c(s,a) = \max\{c(s,a), \epsilon\}$)を加える。
  • 楽観的方策の到達時間分布をモデル化するために、離散的フェーズ型分布を用い、探索と適切な終了のバランスを取る停止基準を設計する。
  • 経験的遷移推定値に対するベルンシュタイン型の境界を用いて信頼集合を定義することで、不確実性下での計画を可能にする拡張価値反復を活用する。

実験結果

リサーチクエスチョン

  • RQ1ループフリーの動的特性や既知の有限ホライズンを仮定しない一般のSSP問題に対して、ノーレグレット探索アルゴリズムを設計できるか?
  • RQ2SSP設定において、コストの最小化と目標到達までの時間の最小化という二重の目的をどのようにバランスさせるか?
  • RQ3エピソード長が無限になり得る、非適正方策を含むSSPにおいて、効率的な探索を可能にする停止基準とは何か?
  • RQ4ピボット・ホライズンに基づくエピソード終了ルールは、標準的な訪問回数に基づくルールに比べ、SSPにおいてより良いレグレットバウンドを達成できるか?
  • RQ5到達時間推定を組み込んだ楽観的計画法の使用は、一般のSSPにおいてレグレット性能をどのように向上させるか?

主な発見

  • 任意の未知のSSP(状態数$S$、行動数$A$、SSP直径$D$、正のコスト)に対して、$K$エピソード後、UC-SSPは$ otimes\widetilde{\mathcal{O}}(DS\sqrt{ADK})$ のレグレットバウンドを達成する。
  • 特に$c_{\min} = 0$ の場合、ピボット・ホライズン停止ルールのおかげでUCRL-SSPよりも優れた性能を示す。
  • UC-SSPの段階②(迅速な終了に特化)は主に学習初期段階で発生し、後続の段階ではレグレットにほとんど寄与しない。
  • ベルンシュタイン不等式を用いた信頼集合により、遷移確率推定の境界がより厳密に保証され、楽観的計画の精度が向上する。
  • $ olimits\epsilon = S^2A/K$ でコストに摂動を加えることで、初期段階での学習が安定化し、非適正方策が探索を支配するのを防ぐ。
  • 実験的結果から、不確実性と摂動が低下するにつれ、UC-SSPの推定到達時間が急速に減少することが示され、最適方策への収束が有効であることが裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。