Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Risk-Averse Reinforcement Learning

Ido Greenberg, Yinlam Chow|arXiv (Cornell University)|May 10, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、環境状態のサンプリングと方策最適化を分離することで、リスク回避的強化学習における「成功への無知」問題を克服する新規なクロスエントロピー・ソフトリスク最適化アルゴリズム、CeSoRを提案する。ソフトリスクスケジューリングと動的ターゲット・クロスエントロピー・サンプラーを用いることで、標準的なリスク回避的PG法が失敗する状況でも、高い報酬・低リスク戦略の効率的学習が可能となり、迷路走破、自動運転、リソース割り当てのベンチマークにおいて優れたCVaR性能を達成する。

ABSTRACT

In risk-averse reinforcement learning (RL), the goal is to optimize some risk measure of the returns. A risk measure often focuses on the worst returns out of the agent's experience. As a result, standard methods for risk-averse RL often ignore high-return strategies. We prove that under certain conditions this inevitably leads to a local-optimum barrier, and propose a soft risk mechanism to bypass it. We also devise a novel Cross Entropy module for risk sampling, which (1) preserves risk aversion despite the soft risk; (2) independently improves sample efficiency. By separating the risk aversion of the sampler and the optimizer, we can sample episodes with poor conditions, yet optimize with respect to successful strategies. We combine these two concepts in CeSoR - Cross-entropy Soft-Risk optimization algorithm - which can be applied on top of any risk-averse policy gradient (PG) method. We demonstrate improved risk aversion in maze navigation, autonomous driving, and resource allocation benchmarks, including in scenarios where standard risk-averse PG completely fails.

研究の動機と目的

  • リスク回避的強化学習における「成功への無知」問題に対処すること。これは、標準的手法が最悪ケースの報酬に過剰に注目することで、高い報酬を得る戦略を無視してしまうためである。
  • 標準的なCVaR-PG法で破棄される高い報酬を得る軌道の浪費を減らすことで、リスク回避的RLにおけるサンプル効率を向上させること。
  • 高いエピステミック的不確実性(例:迷路におけるランダムなガードの存在)とアレアトリックな不確実性(例:確率的アクション)を伴う環境において、強固でリスク回避的な方策の学習を可能にすること。
  • 任意のリスク回避的方策勾配法にアーキテクチャの変更なしに適用可能な汎用フレームワークを開発すること。
  • リスク回避的サンプリングとリスク回避的最適化を分離することで、CVaR性能が向上し、実世界のベンチマークにおけるロバストネスが向上することを実証的に検証すること。

提案手法

  • ソフトリスクスケジューリングを導入:リスク中立($\alpha' = 1$)からターゲットのリスクレベル($\alpha$)へ段階的にリスク回避度を高める。これにより、初期段階で高い報酬戦略の探索が可能になる。
  • 動的ターゲット・クロスエントロピー法(CEM)を提案:エージェントのパフォーマンスとは独立して、最も困難な環境条件(例:迷路内のガード)をもつ軌道をサンプリングする。
  • サンプラー(ハードな状態に注目)と最適化器(低い報酬に注目)を分離することで、高い報酬戦略と高いリスクシナリオの両方にさらなる機会が得られる。
  • CEMを用いて、低報酬の結果を生じさせる可能性が最も高い環境状態の分布を生成し、CVaR最適化のための訓練データの質を向上させる。
  • ソフトリスクスケジューリングと動的CEMサンプリングを統合し、任意の微分可能なリスク回避的方策勾配法と互換性を持つプラグイン型アルゴリズム、CeSoRを構築する。
  • 微分可能なニューラルネットワーク方策を用い、ソフトリスク調整報酬分布上で方策勾配法により訓練することで、エンドツーエンドの微分可能性と収束性を保証する。

実験結果

リサーチクエスチョン

  • RQ1リスク回避的RL手法は、高リスク環境状態のサンプリングと低報酬軌道の最適化を分離することで改善可能か?
  • RQ2ソフトリスクスケジューリングは、最悪ケースのエピソードに注目することで、高報酬戦略が一切観測されない「成功への無知」問題を緩和できるか?
  • RQ3クロスエントロピー法を動的ターゲットの最も困難な環境状態に適応させることで、リスク回避的訓練におけるサンプル効率が向上するか?
  • RQ4多様なベンチマークにおいて、CeSoRは標準的なリスク回避的PGおよびDRL手法に比べ、CVaRおよび平均報酬の点でどの程度優れているか?
  • RQ5ソフトリスクスケジューリングと動的CEMサンプリングの組み合わせは、優れた性能を達成するために不可欠であるか、それともそれぞれが独立して寄与しているか?

主な発見

  • ガード付き迷路ベンチマークにおいて、CeSoRはCVaR(0.05)報酬として-7を達成し、GCVaR(-32)とPG(4)を大きく上回り、長距離戦略の有効な学習を示している。
  • 自動運転ベンチマークでは、CeSoRはリーダーとの安全な距離を維持し、リスク中立的PGが事故を起こすのを回避するとともに、GCVaRのあまりに慎重な行動を避けている。
  • リソース割り当てタスクでは、CeSoRは平均で5台のサーバーのみを割り当てており、ピーク負荷に対応できないPGや、事前に8台を割り当ててコストを増やすGCVaRを上回っている。
  • アブレーションスタディでは、ソフトリスクとCEサンプラーの両方が不可欠であることが示された。CeRとSoRは、それぞれCeSoRよりCVaRおよび平均報酬で劣り、2つのコンponentの相乗効果が確認された。
  • ガード付き迷路では、GCVaRは訓練バッチ内で高い報酬・低リスクの軌道を一度も観測できず、完全に失敗するのに対し、CeSoRは最適な長距離戦略を正常に学習している。
  • 分布的RLの実験では、CeSoRはリスク中立的QR-DQNおよびリスク回避的CVaR-DRLの両方を上回り、CVaR(0.05)として-7を達成した(GCVaRは-32)。これは、PG法に限らず、CeSoRの優位性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。