Skip to main content
QUICK REVIEW

[論文レビュー] Discovering Options for Exploration by Minimizing Cover Time

Yuu Jinnai, Jee Won Park|arXiv (Cornell University)|Mar 2, 2019
Reinforcement Learning in Robotics参考文献 32被引用数 11
ひとこと要約

本稿では、強化学習におけるオプション発見のための「カバーイング・オプション」を提案する。この手法は、MDPの全状態を訪問するまでにかかる期待的カバー時間(ランダムウォークが全状態を訪問するまでのステップ数)を最小化することを目的としている。初期探索を一様ランダムウォークとしてモデル化し、スぺクトルグラフ理論を用いて代数的連結度を用いてカバー時間の上界を最小化することで、スパースリワード環境における探索を加速する。実験的評価において、従来の最先端手法を上回る性能を示した。

ABSTRACT

One of the main challenges in reinforcement learning is solving tasks with sparse reward. We show that the difficulty of discovering a distant rewarding state in an MDP is bounded by the expected cover time of a random walk over the graph induced by the MDP's transition dynamics. We therefore propose to accelerate exploration by constructing options that minimize cover time. The proposed algorithm finds an option which provably diminishes the expected number of steps to visit every state in the state space by a uniform random walk. We show empirically that the proposed algorithm improves the learning time in several domains with sparse rewards.

研究の動機と目的

  • スパースリワードを伴う強化学習における効率的探索の課題に取り組む。
  • 遠く離れた未知の報酬状態に到達するために必要なステップ数の期待値を低減する。
  • 探索中に報酬信号に依存しないオプション発見手法を開発する。
  • MDPの状態遷移グラフ上のランダムウォークの期待カバー時間を形式的にバウンディングする。
  • 期待カバー時間を最小化することで、スパースリワードドメインにおける学習速度の向上が実証できることを実験的に検証する。

提案手法

  • 初期探索をMDPの状態遷移グラフ上の一様ランダムウォークとしてモデル化する。
  • 期待カバー時間の上界をバウンディングするための代理指標として、グラフラプラシアンの代数的連結度を用いる。
  • Ghosh & Boyd (2006) のヒューリスティック手法を適用し、期待カバー時間の上界を最小化する。
  • カバー時間の上界を低減する点オプション(単一状態で開始および終了)を構築する。
  • 事前知識が限られている状況では、状態遷移グラフのインシデント行列を用いてオプション生成をガイドする。
  • 内在的報酬を用いたQ学習にオプションを統合し、オンラインでのオプション発見とポリシー学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1期待カバー時間を最小化することは、MDPにおける遠く離れたスパースリワードの迅速な発見に寄与するか?
  • RQ2探索中に報酬信号に依存せずにオプションをどのように発見できるか?
  • RQ3代数的連結度を用いてカバー時間の上界を低減することで、スパースリワードタスクにおける学習効率が向上するか?
  • RQ4エイゲンオプションやバウンダリティオプションといった既存のオプション発見ベースラインと比較して、本手法はどのように異なるか?
  • RQ5カバー時間最小化を用いたオンラインオプション発見は、リアルタイム設定におけるポリシー学習の加速に寄与するか?

主な発見

  • カバーイング・オプションは、スパースリワード環境であるパールの迷路において、エイゲンオプションやバウンダリティオプションを著しく上回る学習速度を達成した。
  • ハンズ・オブ・ハノイおよびタクシーのドメインでは、プリミティブアクションのみを用いたエージェントと比較して、カバーイング・オプションがより速く収束した。
  • 本手法は、特に代数的連結度を含むスぺクトルグラフ特性を活用することで、期待カバー時間を低減した。
  • カバーイング・オプションを用いたオンラインオプション発見により、プリミティブアクションのみのエージェントが失敗したパールの迷路でも、エージェントは確実にゴールに到達できた。
  • 本手法は、テストされたすべてのスパースリワードベンチマークで最先端の性能を達成し、強力でスケーラブルであることが示された。
  • 報酬情報が事前に与えられていない状況でも、MDPの遷移構造のみに依存して、本手法は効果的にオプションを生成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。