Skip to main content
QUICK REVIEW

[論文レビュー] Conservative Exploration in Reinforcement Learning

Evrard Garcelon, Mohammad Ghavamzadeh|arXiv (Cornell University)|Feb 8, 2020
Advanced Bandit Algorithms Research参考文献 30被引用数 8
ひとこと要約

本稿は、平均報酬および有限時限のMDPにおける強化学習における保守的探索を導入し、(高確率で) エージェントの累積的パフォーマンスがベースライン方策より低下しないことを保証する2つの楽観的アルゴリズムを提案する。この手法は、レグレット性能に犠牲を払わず安全な学習を実現し、保守的探索が学習効率を妨げないことを示す理論的レグレットバウンドを達成する。

ABSTRACT

While learning in an unknown Markov Decision Process (MDP), an agent should trade off exploration to discover new information about the MDP, and exploitation of the current knowledge to maximize the reward. Although the agent will eventually learn a good or optimal policy, there is no guarantee on the quality of the intermediate policies. This lack of control is undesired in real-world applications where a minimum requirement is that the executed policies are guaranteed to perform at least as well as an existing baseline. In this paper, we introduce the notion of conservative exploration for average reward and finite horizon problems. We present two optimistic algorithms that guarantee (w.h.p.) that the conservative constraint is never violated during learning. We derive regret bounds showing that being conservative does not hinder the learning ability of these algorithms.

研究の動機と目的

  • オンライン強化学習におけるパフォーマンス保証の欠如、特に中間方策が最低限のパフォーマンス基準を満たさなければならない実世界の応用分野において、その問題に対処すること。
  • バンドイットから状態遷移を伴う逐次意思決定へと拡張されたMDPにおける保守的探索を形式化すること。
  • 学習プロセス全体を通じて、与えられたベースライン方策以上にパフォーマンスが低下しないことを保証するアルゴリズムを開発すること。
  • 保守的探索が学習効率を損なわないことを示す、レグレットバウンドの分析を行うこと。

提案手法

  • エージェント方策の累積報酬がベースライン方策の報酬の (1−α) 倍以上であるという保守的制約を定義し、パフォーマンスの安全性を保証する。
  • UCRL2に保守的信頼区間を組み込んだことで、平均報酬MDP用のCUCRL2および有限時限問題用の変種を設計する。
  • 報酬および遷移確率の簡略化されたベルンシュタイン型信頼区間を用いて、探索と安全性のバランスを取る。
  • システムの動的進化を考慮した状態依存の信頼区間を導入し、時間経過に伴う安全性を保証する。
  • 信頼水準δに応じて調整された、エージェントの期待累積報酬とベースラインの比較に基づくしきい値ベースの保守的条件を採用する。
  • 理論的分析を適用し、標準UCRL2と同程度にスケーリングするレグレットバウンドを導出する。これにより、保守的探索が学習効率を損なわないことが証明される。

実験結果

リサーチクエスチョン

  • RQ1MDPにおける保守的探索条件をどのように定義すれば、学習中にエージェント方策がベースライン方策を下回らないことを保証できるか?
  • RQ2状態遷移を伴うオンラインRLにおいて、このような保守的制約を実装するために必要なアルゴリズム的修正は何か?
  • RQ3標準探索アルゴリズムと比較して、顕著にレグレットが増加しない形で保守的探索を達成できるか?
  • RQ4価値推定の信頼区間をどのように調整すれば、安全性と学習効率の両方を維持できるか?
  • RQ5平均報酬MDPにおける保守的探索に対して、どのような理論的保証(例:レグレットバウンド)を導出できるか?

主な発見

  • 合成実験において、提案されたCUCRL2アルゴリズムは、初期段階で53%のエピソードで標準UCRL2が制約違反を起こす中、保守的制約に違反しない。
  • グリッドワールド環境では、UCB-VIは最初の300エピソードの83%で保守的条件に違反したが、CUCB-VIは全期間を通じてそれを維持した。
  • CUCRL2のレグレットはUCRL2と同様にスケーリングされることから、保守的探索が顕著なレグレットペナルティをもたらさないことが示された。
  • コストベースのメンテナンス問題において、CUCRL2は安全(システム障害なし)を維持しながら、競争力のあるレグレットを達成したのに対し、UCRL2は複数回の障害を経験した。
  • 理論的分析により、保守的アルゴリズムのレグレットが標準UCRL2と同程度の速度で増加することが確認され、保守的性質が学習効率を妨げないことが証明された。
  • 簡略化されたベルンシュタイン信頼区間の使用により、理論的保証を保持しつつ、計算の効率性も達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。