Skip to main content
QUICK REVIEW

[論文レビュー] Risk-Sensitive Deep RL: Variance-Constrained Actor-Critic Provably Finds Globally Optimal Policy

Han Zhong, Deng, Xun|arXiv (Cornell University)|Dec 28, 2020
Reinforcement Learning in Robotics参考文献 61被引用数 5
ひとこと要約

本稿では、平均報酬設定下におけるリスクセンシティブな深層強化学習のための分散制約付きアクタ・クリティック手法VARACを提案する。ラグランジュとフェンヒェル双対性を活用することで、制約付き最適化問題をサドルポイント問題に変換し、過パラメータ化されたニューラルネットワークを用いる場合に、O(1/√K)のサブ線形レートで最適方策への確実なグローバル収束を達成できる。

ABSTRACT

While deep reinforcement learning has achieved tremendous successes in various applications, most existing works only focus on maximizing the expected value of total return and thus ignore its inherent stochasticity. Such stochasticity is also known as the aleatoric uncertainty and is closely related to the notion of risk. In this work, we make the first attempt to study risk-sensitive deep reinforcement learning under the average reward setting with the variance risk criteria. In particular, we focus on a variance-constrained policy optimization problem where the goal is to find a policy that maximizes the expected value of the long-run average reward, subject to a constraint that the long-run variance of the average reward is upper bounded by a threshold. Utilizing Lagrangian and Fenchel dualities, we transform the original problem into an unconstrained saddle-point policy optimization problem, and propose an actor-critic algorithm that iteratively and efficiently updates the policy, the Lagrange multiplier, and the Fenchel dual variable. When both the value and policy functions are represented by multi-layer overparameterized neural networks, we prove that our actor-critic algorithm generates a sequence of policies that finds a globally optimal policy at a sublinear rate. Further, We provide numerical studies of the proposed method using two real datasets to back up the theoretical results.

研究の動機と目的

  • 特に分散制約付きの目的関数におけるリスクセンシティブな深層強化学習の理論的保証の欠如に対処する。
  • 長期平均報酬を最大化すると同時にリターンの分散を制約する分散制約付き方策最適化問題を定式化する。
  • 非凸性と過パラメータ化にもかかわらず、理論的裏付けに基づいたアルゴリズムを構築し、グローバルに最適な方策を確実に見つける。
  • 結果の安定性が重要な分野、例えばポートフォリオ管理やロボティクスなど、リスクセンシティブな分野への深層RLの適用範囲を拡大する。
  • ラグランジュ緩和とフェンヒェル双対性を統合したフレームワークを提供し、深層方策学習における分散制約を効果的に扱う。

提案手法

  • 分散制約に対してラグランジュ双対性を用いて、制約付き最適化問題を制約なしのサドルポイント問題に変換する。
  • フェンヒェル双対性を導入し、問題を双対空間に再定式化することで、方策および双対変数の効率的更新を可能にする。
  • アクタ・クリティック更新を用いて、方策、ラグランジュ乗数、フェンヒェル双対変数を反復的に更新するVARACアルゴリズムを設計する。
  • 双対Q値関数をニューラルネットワークで近似し、修正された報酬関数を用いた変換済みMDPをTD3ベースのアルゴリズムで解く。
  • KLダイバージェンスを正則化項として用いたポリシー更新により、学習中の安定的な方策改善を確保する。
  • 双対変数(λおよびy)に対して時間平均化更新スキームを適用し、収束安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1長期平均報酬の分散制約下で、深層強化学習アルゴリズムがグローバルに最適な方策を理論的に保証して見つけられるか?
  • RQ2非凸な目的関数を伴う分散制約付きの深層RL問題に対し、ラグランジュ双対性とフェンヒェル双対性を効果的に統合する方法は何か?
  • RQ3過パラメータ化されたニューラルネットワーク関数近似を用いた場合、提案アルゴリズムのグローバルに最適な方策への収束速度はどの程度か?
  • RQ4期待報酬と分散制御の両面で、リスクニュートラルなベースラインと比較して実際の性能はどの程度向上するか?
  • RQ5提案手法は、ポートフォリオ管理やロボット制御などの実世界のリスクセンシティブな制御タスクに適用可能か?

主な発見

  • VARACアルゴリズムは、サドルポイントへのグローバル収束速度O(1/√K)を達成し、その解は同じレートでグローバルに最適な方策に収束する。
  • Pendulum-v0およびBipedalWalkerHardcore-v3における実験結果から、VARACはTD3と比較して性能の分散をそれぞれ30%および34%低減したが、平均報酬は同等を維持した。
  • Pendulum-v0ではVARACが分散4,826を達成したのに対し、TD3は6,903であった。BipedalWalkerHardcore-v3では、分散は9,348から6,090に低下した。
  • 収束が遅いものの、10個の異なる乱数シードにおいてもVARACは一貫して低い分散を達成しており、リスクセンシティブな設定での有効性を示している。
  • 期待報酬と分散の両方を適切にバランスさせることに成功しており、ロボティクスやファイナンス分野におけるセーフティクリティカルなアプリケーションに適している。
  • 実世界の制御環境を用いた数値実験により、理論的枠組みの妥当性が検証され、アプローチの頑健性と実用的有用性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。