Skip to main content
QUICK REVIEW

[論文レビュー] Actor-Critic Algorithms for Risk-Sensitive Reinforcement Learning.

L. A. Prashanth, Mohammad Ghavamzadeh|arXiv (Cornell University)|Mar 25, 2014
Reinforcement Learning in Robotics参考文献 46被引用数 4
ひとこと要約

本稿では、割引報酬および平均報酬マーケット意思決定過程(MDP)における期待報酬と分散関連リスク指標の両方を最適化する、リスクセンシティブ強化学習のためのアクタ・クリティックアルゴリズムを提案する。三時間スケールの手法(TDクリティック、ポリシー勾配アクター、ラグランジュ乗数のデュアル昇上)を用いることで、局所的リスクセンシティブ最適ポリシーへの収束を実現し、交通信号制御における実証的検証も行っている。

ABSTRACT

In many sequential decision-making problems we may want to manage risk by minimizing some measure of variability in rewards in addition to maximizing a standard criterion. Variance related risk measures are among the most common risk-sensitive criteria in finance and operations research. However, optimizing many such criteria is known to be a hard problem. In this paper, we consider both discounted and average reward Markov decision processes. For each formulation, we first define a measure of variability for a policy, which in turn gives us a set of risk-sensitive criteria to optimize. For each of these criteria, we derive a formula for computing its gradient. We then devise actor-critic algorithms that operate on three timescales a TD critic on the fastest timescale, a policy gradient (actor) on the intermediate timescale, and a dual ascent for Lagrange multipliers on the slowest timescale. In the discounted setting, we point out the difficulty in estimating the gradient of the variance of the return and incorporate simultaneous perturbation approaches to alleviate this. The average setting, on the other hand, allows for an actor update using compatible features to estimate the gradient of the variance. We establish the convergence of our algorithms to locally risk-sensitive optimal policies. Finally, we demonstrate the usefulness of our algorithms in a traffic signal control application.

研究の動機と目的

  • 逐次意思決定における期待報酬と報酬のばらつきのバランスをとるリスクセンシティブ基準を最適化する課題に対処すること。
  • 割引報酬および平均報酬MDPの両方における分散ベースのリスク指標の統一フレームワークを構築すること。
  • 報酬の分散または長期的報酬の分散を含むリスクセンシティブ目的関数の勾配式を導出すること。
  • 複雑なリスクセンシティブ最適化においても収束保証を持つ安定な学習アルゴリズムを設計すること。
  • リスク認識交通信号制御を含む実世界の応用において、その手法を検証すること。

提案手法

  • 割引報酬および平均報酬MDPの両方において、報酬のばらつき(例:分散)を用いたリスクセンシティブ基準を定式化する。
  • 両方の定式化下で報酬の分散に対する解析的勾配を導出し、ポリシー最適化を可能にする。
  • 三時間スケールのアルゴリズムを採用:最速のスケールでTD学習、中間スケールでポリシー勾配更新、最遅のスケールでラグランジュ乗数のデュアル昇上。
  • 割引報酬設定において、計算的に不変な分散勾配を推定するために、同時摂動確率的近似(SPSA)を用いる。
  • 平均報酬設定では、効率的かつ一貫性のある分散勾配推定を可能にするために、適合関数特徴を適用する。
  • リスク指標の制約を満たすためにラグランジュ緩和を統合し、デュアル昇上による最適化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1分散ベースのリスク指標を、割引報酬および平均報酬MDPの両方における強化学習の目的関数に効果的に統合する方法は何か?
  • RQ2報酬分散を含むリスクセンシティブ基準を最適化するための安定かつ収束保証のあるアルゴリズムフレームワークは何か?
  • RQ3計算的に不変なため推定が困難な報酬分散の勾配を、割引報酬設定で信頼性高く推定する方法は何か?
  • RQ4平均報酬設定における適合関数特徴は、ポリシー更新に向けた正確で効率的な分散勾配推定を可能にするか?
  • RQ5提案されたアルゴリズムは、交通信号制御のような実世界の応用において、リスク認識意思決定をどの程度向上させるか?

主な発見

  • 提案された三時間スケールアクタ・クリティックアルゴリズムは、割引報酬および平均報酬の両定式化において、局所的リスクセンシティブ最適ポリシーに収束することが確認された。
  • 同時摂動確率的近似(SPSA)により、割引報酬設定における報酬分散の勾配推定が効果的に行われ、不変性の問題を克服した。
  • 平均報酬設定では、適合関数特徴のおかげで分散勾配の推定が一貫的かつ効率的に行われ、ポリシー更新が簡素化された。
  • 交通信号制御の応用において、報酬のばらつきを低減しながら高い期待報酬を維持することができた。
  • 実証結果から、リスクセンシティブポリシーが、さまざまな交通状況下でも安定性と頑健性において、標準のリスクニュートラルポリシーを上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。