Skip to main content
QUICK REVIEW

[論文レビュー] Epistemic Risk-Sensitive Reinforcement Learning

Hannes Eriksson, Christos Dimitrakakis|arXiv (Cornell University)|Jun 14, 2019
Reinforcement Learning in Robotics参考文献 27被引用数 7
ひとこと要約

本稿は、βパラメータで制御される効用関数を用いて、認識的不確実性に対するリスクセンシティブ性をモデル化するベイジアン強化学習フレームワークを提案する。これにより、リスク回避的、リスクニュートラル、リスク求心的行動を実現可能となる。動的計画法および方策勾配アルゴリズムを提案し、効用に基づくリターン最適化によりリスクを制御する。離散的および連続的状態空間を持つ不確実なMDPにおいて、リスク回避的方策が探索を減少させ、耐性性を向上させることを示した。

ABSTRACT

We develop a framework for interacting with uncertain environments in reinforcement learning (RL) by leveraging preferences in the form of utility functions. We claim that there is value in considering different risk measures during learning. In this framework, the preference for risk can be tuned by variation of the parameter $β$ and the resulting behavior can be risk-averse, risk-neutral or risk-taking depending on the parameter choice. We evaluate our framework for learning problems with model uncertainty. We measure and control for \emph{epistemic} risk using dynamic programming (DP) and policy gradient-based algorithms. The risk-averse behavior is then compared with the behavior of the optimal risk-neutral policy in environments with epistemic risk.

研究の動機と目的

  • 認識的不確実性下でのリスクセンシティブ強化学習の統一的フレームワークの構築を目的とし、不確実性はMDPの不完全な知識に起因する。
  • パラメータβを用いてリスク好みを調整可能な効用関数を用いて、リスクセンシティブ性をモデル化すること。
  • モデル不確実性下でのリスク回避的方策とリスクニュートラル方策の比較を目的とする。
  • 離散的(グリッドワールド)および連続的(オプションプライシング)環境における、効用ベースのリスクセンシティブ性の性能評価を目的とする。
  • リスク回避的方策が認識的不確実性下で探索を減少させ、耐性性を向上させることを示すこと。

提案手法

  • 報酬Rの期待効用を用いてリスクセンシティブ性を形式化し、凹関数の効用関数はリスク回避的行動を誘導し、凸関数はリスク求心的行動を誘導する。
  • MDPμのベイジアン信念ξを用い、最適方策を ∫ℳ 𝔼μ^π[U(R)] dξ(μ) を最大化するπとして定式化し、モデル不確実性を統合する。
  • 離散的MDPには動的計画法(ADP)を、連続的状態空間にはベイジアン方策勾配(EBPG)アルゴリズムを適用する。
  • 報酬関数および遷移カーネルにガウス過程事前分布を適用し、環境の認識的不確実性をモデル化する。
  • 効用関数U(R) = -exp(-βR)におけるβの調整によりリスク好みを制御し、β > 0 はリスク回避、β = 0 はリスクニュートラル、β < 0 はリスク求心を意味する。
  • 事後信念からのMDPのモンテカルロサンプリングを用い、期待効用を推定し、方策を更新する。

実験結果

リサーチクエスチョン

  • RQ1認識的不確実性に対するリスクセンシティブ性は、部分的に観測可能なMDPにおける方策学習および探索行動にどのように影響を与えるか?
  • RQ2調整可能なβパラメータを有する効用ベースのリスクセンシティブ性は、活用と探索のトレードオフを効果的に制御できるか?
  • RQ3モデル不確実性下で、リスク回避的方策とリスクニュートラル方策のレグレットと障害率において、どのように比較されるか?
  • RQ4連続的状態空間環境における、効用ベースのリスクセンシティブ性は学習の安定性および収束性にどのような影響を与えるか?
  • RQ5追加の報酬形状付けやエントロピー正則化なしに、効用関数を用いて構造的探索を誘導できるか?

主な発見

  • リスク回避的方策(β > 0)は、リスクニュートラル方策と比較して顕著に探索が減少し、グリッドワールド環境ではレグレットが低減した。
  • グリッドワールド実験では、リスク回避的方策がリスクニュートラル方策とほぼ同等の性能を達成しており、障害数(失敗回数)の増加もわずかであった。
  • β = -0.001の場合、方策はあまりに慎重になりすぎたが、β = -0.01およびβ = -0.1では、リスクニュートラルPGと同様の行動を示し、リスク求心的行動に閾値効果が見られた。
  • ベイジアン方策勾配(EBPG)アルゴリズムは、連続的状態空間環境においてリスクセンシティブ方策を効果的に学習したが、MDPサンプリングのコストが高く、学習が遅かった。
  • CVaRベース方策およびβ = -0.001方策はあまりに慎重であり、小さなβを用いた効用ベースのリスクセンシティブ性は、最適でない探索を引き起こす可能性があることを示唆した。
  • 本フレームワークは、下位のRLアルゴリズムを変更することなく、βによるリスク好みの調整が可能であり、認識的不確実性の処理における柔軟性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。