Skip to main content
QUICK REVIEW

[論文レビュー] Delegative Reinforcement Learning: learning to avoid traps with a little help

Vanessa Kosoy|arXiv (Cornell University)|Jul 19, 2019
Advanced Bandit Algorithms Research参考文献 8被引用数 6
ひとこと要約

本稿では、代理人が時々人間のアドバイザーに行動を任せる仕組みを導入することで、強化学習における危険な「トラップ」(不可逆的状態)を回避できるDelegative Reinforcement Learning (DRL)というフレームワークを提案する。後方確率推定とデリゲートサブルーチンを組み合わせることで、有限の仮説をもつ無限時間、非エピソード型のマルコフ決定過程においても、トラップが存在する状況下で部分線形なレグレットを達成する。これは、自律システムや手術など、高リスクな応用分野における実用的解決策を提供する。

ABSTRACT

Most known regret bounds for reinforcement learning are either episodic or assume an environment without traps. We derive a regret bound without making either assumption, by allowing the algorithm to occasionally delegate an action to an external advisor. We thus arrive at a setting of active one-shot model-based reinforcement learning that we call DRL (delegative reinforcement learning.) The algorithm we construct in order to demonstrate the regret bound is a variant of Posterior Sampling Reinforcement Learning supplemented by a subroutine that decides which actions should be delegated. The algorithm is not anytime, since the parameters must be adjusted according to the target time discount. Currently, our analysis is limited to Markov decision processes with finite numbers of hypotheses, states and actions.

研究の動機と目的

  • 強化学習における根本的限界、すなわちトラップ(不可逆的状態)が生じると線形なレグレットが生じ、非エピソード型の設定では学習が不可能になるという問題に取り組むこと。
  • トラップの存在を仮定せず、繰り返し致命的な誤りを許容しない学習フレームワークを構築すること。これは、現実世界の安全が求められる応用分野にとって不可欠である。
  • 代理人が外部のアドバイザーに行動を任せる設定を形式的に定式化・分析し、有限状態・行動・仮説をもつマルコフ決定過程における安全な探索を可能にする。
  • 幾何的時間割引を用いる連続的で無限時間の強化学習設定において、デリゲートを安全メカニズムとして用いる非アラタイムアルゴリズムのレグレットバウンドを導出すること。

提案手法

  • 本アルゴリズムは、後方確率推定強化学習(PSRL)の一種であり、代理人は可能なMDPの後方信念分布から仮説をサンプリングする。
  • デリゲートサブルーチンは、いつアドバイザーを起動するかを決定する:特定の仮説下ですべての行動に対する期待効用がゼロである場合、または不確実性が高くなった場合。
  • タイムラインは長さ $ O((1- u)^{-1/4}) $ の区間に分割され、ここで $ \nu = \gamma $ は時間割引係数である。これにより、定期的な信念更新とデリゲート意思決定が可能になる。
  • 代理人は有限個のMDP仮説の集合に対して、ベイズ更新メカニズムを用いて信念分布を維持し、現在の信念下ですべての行動の期待効用が不確実または危険と判断された場合にのみデリゲートを行う。
  • 情報理論的ツール、特に代理人の行動と真の仮説との間の相互情報量を用いてレグレットをバウンドする。これにより、探索とデリゲートの頻度を制御する。
  • 集中不等式とエントロピー差を用いた分析により、信念更新の速度と仮説数を用いて期待レグレットをバウンドする。

実験結果

リサーチクエスチョン

  • RQ1トラップが存在する非エピソード的で無限時間のMDP設定において、強化学習の代理人が部分線形なレグレットを達成できるか?
  • RQ2人間のアドバイザーへのデリゲートを、無傷の誤りを防ぐために強化学習フレームワークに形式的に統合する方法は何か?
  • RQ3有限の仮説空間において、後方確率推定戦略とデリゲートを組み合わせた場合に達成可能な理論的レグレットバウンドは何か?
  • RQ4代理人が不確実性のためすべてのトラップを回避できない場合でも、計画時間の長さに対してレグレットが部分線形に保たれるか?
  • RQ5デリゲートメカニズムは、学習プロセスにおける収束速度と情報取得にどのように影響を与えるか?

主な発見

  • 提案されたDRLアルゴリズムは、レグレットバウンド $ O\left(\bar{\mathfrak{t}} \cdot \frac{1-\gamma}{1-\gamma^T} + \sqrt{\frac{(1-\gamma^T)\ln N}{\eta}} + \frac{(1-\gamma^T)\ln N}{\eta^2 \epsilon} \right) $ を達成する。ここで $ \eta $ は探索を制御するパラメータであり、$ \bar{\mathfrak{t}} $ は不確実性を解消するための期待時間である。
  • 代理人が信頼できるアドバイザーにデリゲートできる限り、トラップが存在する状況下でも、エピソード数 $ N $ に対してレグレットが部分線形に増加する。
  • アルゴリズムはアラタイムではない。これは、目標となる時間割引 $ \gamma $ に応じてパラメータ(例:区間長 $ T $)を調整する必要があるためであるが、実用的導入には問題ない。
  • 分析から、デリゲートは代理人の信念分布が極めて不確実な場合に最も効果的であり、行動と仮説との間の相互情報量が信念更新の速度とレグレットを制御していることが示された。
  • 主な洞察は、必要な場合にのみデリゲートすることで、代理人はトラップを回避しつつも、情報源からの情報獲得の速度に応じて効率的に学習を進められ、結果としてレグレットが情報獲得速度によってバウンドされることである。
  • 本フレームワークは、有限のMDP、有限の仮説、状態、行動をもつ設定において形式的に検証されており、現実世界の応用における安全な強化学習の理論的基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。