Skip to main content
QUICK REVIEW

[論文レビュー] Expert-Supervised Reinforcement Learning for Offline Policy Learning and Evaluation

Aaron Sonabend-W, Junwei Lu|arXiv (Cornell University)|Jun 23, 2020
Reinforcement Learning in Robotics参考文献 24被引用数 9
ひとこと要約

本稿では、仮説検定を用いてデータがそれを裏付ける場合にのみ、専門家の行動から安全に逸脱できるようにするベイジアンオフライン強化学習フレームワーク、Expert-Supervised Reinforcement Learning (ESRL) を提案する。後方分布とオフポリシー価値関数推定を用いて不確実性を考慮した解釈可能な方策を提供し、リスク回避性やデータ品質に依存しないレグレットバウンドを達成する。

ABSTRACT

Offline Reinforcement Learning (RL) is a promising approach for learning optimal policies in environments where direct exploration is expensive or unfeasible. However, the adoption of such policies in practice is often challenging, as they are hard to interpret within the application context, and lack measures of uncertainty for the learned policy value and its decisions. To overcome these issues, we propose an Expert-Supervised RL (ESRL) framework which uses uncertainty quantification for offline policy learning. In particular, we have three contributions: 1) the method can learn safe and optimal policies through hypothesis testing, 2) ESRL allows for different levels of risk averse implementations tailored to the application context, and finally, 3) we propose a way to interpret ESRL's policy at every state through posterior distributions, and use this framework to compute off-policy value function posteriors. We provide theoretical guarantees for our estimators and regret bounds consistent with Posterior Sampling for RL (PSRL). Sample efficiency of ESRL is independent of the chosen risk aversion threshold and quality of the behavior policy.

研究の動機と目的

  • 高リスク分野におけるオフライン強化学習の解釈可能性と不確実性の定量化の欠如に対処する。
  • 直接的な環境との相互作用が不可能または倫理的に問題である場合の、方策評価と安全な探索の課題を克服する。
  • データの信頼性に基づいて、専門家の行動からの逸脱の許容度をカスタマイズ可能なリスク回避型の方策学習を可能にする。
  • 不確実性を反映し、臨床意思決定を支援する、事後分布に基づく解釈可能な方策意思決定を提供する。
  • 一貫性がありバイアスのない推定が得られる、理論的根拠に基づいたオフポリシー価値関数推定手法を開発する。

提案手法

  • 統計的証拠に基づいて、専門家の行動から逸脱するかどうかを決定するため、ベイジアン強化学習と仮説検定を統合する。
  • Q値の事後分布を用いて不確実性を定量化し、方策行動の信用区間を計算する。
  • 代替行動が専門家の行動よりも優れているという帰無仮説を設定し、事後サンプルを用いて仮説を検証する。
  • 仮説検定からのp値に基づいて、専門家方策と学習された最適行動の間で方策を選択する。
  • 事後予測分布を用いてオフポリシー価値関数の事後分布を計算し、任意の方策の不確実性を考慮した評価を可能にする。
  • リスク回避性や行動方策の品質に依存しない、理論的保証としてのベイジアンレグレットバウンド $\tilde{\mathcal{O}}(\tau S\sqrt{AT})$ を確保する。

実験結果

リサーチクエスチョン

  • RQ1仮説検定は、オフライン強化学習における専門家の行動からの逸脱を安全かつ信頼性を持って決定するために効果的に用いられるか?
  • RQ2価値関数推定における不確実性は、どのように定量化され、方策の解釈可能性と意思決定の質を向上させるために活用されるか?
  • RQ3この手法の性能は、行動方策の品質やデータカバレッジの水準にどの程度依存するか?
  • RQ4Q値の事後分布は、低データ環境においても意味のある、解釈可能な方策意思決定の洞察を提供できるか?
  • RQ5安全性、一般化性能、価値関数推定の正確性の観点から、本手法は最先端のオフライン強化学習ベースラインと比較してどの程度優れているか?

主な発見

  • ESRLは、リスク回避の閾値や行動方策の品質に依存しない、ベイジアンレグレットバウンド $\tilde{\mathcal{O}}(\tau S\sqrt{AT})$ を達成する。
  • 低データ状態では、Q値の事後分布の分散が大きくなり、仮説検定が帰無仮説を棄却しないため、方策は専門家の行動を維持する。
  • 高データ状態では、より狭い事後分布により、仮説検定が帰無仮説をより頻繁に棄却でき、データがそれを裏付ける場合に安全に専門家の行動から逸脱できる。
  • 事後分布と信用区間を通じて、解釈可能な方策意思決定を生成し、臨床医がリスクと信頼性を評価できる。
  • 敗血症治療ベンチマークにおいて、ESRLはDQN、BCQ、DQNE、BCを上回り、データ不足に起因する一般化の制限がある状況でも安全性と価値推定の両面で優れる。
  • 特定の状態クラスタでは、医師の行動からの逸脱が著しく有害であることが示され、ESRLは高い不確実性のためその逸脱を回避することで、耐性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。