Skip to main content
QUICK REVIEW

[論文レビュー] Distributional Multivariate Policy Evaluation and Exploration with the Bellman GAN

Dror Freirich, Ron Meir|arXiv (Cornell University)|Aug 6, 2018
Forecasting Techniques and Applications被引用数 7
ひとこと要約

本稿では、分布的ベルマン方程式と生成的対抗ネットワーク(GAN)の間の同値性を確立することで、多変量報酬設定における効果的な方策評価と探索を可能にする、GANベースの分布的強化学習(DiRL)手法を提案する。この手法は高次元の価値分布を学習し、状態とリターンの分布モデリングを統合することで、新たな差分に基づく内生的探索戦略を駆動する。

ABSTRACT

The recently proposed distributional approach to reinforcement learning (DiRL) is centered on learning the distribution of the reward-to-go, often referred to as the value distribution. In this work, we show that the distributional Bellman equation, which drives DiRL methods, is equivalent to a generative adversarial network (GAN) model. In this formulation, DiRL can be seen as learning a deep generative model of the value distribution, driven by the discrepancy between the distribution of the current value, and the distribution of the sum of current reward and next value. We use this insight to propose a GAN-based approach to DiRL, which leverages the strengths of GANs in learning distributions of high-dimensional data. In particular, we show that our GAN approach can be used for DiRL with multivariate rewards, an important setting which cannot be tackled with prior methods. The multivariate setting also allows us to unify learning the distribution of values and state transitions, and we exploit this idea to devise a novel exploration method that is driven by the discrepancy in estimating both values and states.

研究の動機と目的

  • 実世界の制御タスクにおいて一般的な複数のパフォーマンス指標を伴う多変量報酬を扱う際、従来のDiRL手法に見られる離散化制約の限界を解消すること。
  • サンプル効率と探索の向上を目的として、一つのフレームワーク内で価値分布と状態遷移分布の学習を統合すること。
  • 価値分布および状態分布の予測誤差を活用して探索を誘導する、新たな内生的探索手法の開発。
  • 従来のDiRL手法が離散化制約により失敗する高次元で相関のある報酬空間において、効果的な方策評価と探索を可能にすること。

提案手法

  • 分布的ベルマン方程式とワサースタインGANの定式化との間の同値性を確立し、分布的距離測度としてワサースタイン-1距離を用いる。
  • 状態-行動ペアを条件とする価値分布(リターン)を生成するジェネレータネットワークを訓練し、識別器は実際のリターン分布と生成されたリターン分布を区別する。
  • リターンをベクトル値の確率変数としてモデル化することで、報酬成分の相関を同時に学習可能な多変量報酬へのベルマン方程式の拡張。
  • 共有された潜在空間を用いて、リターン分布と次状態分布の両方の学習をGANフレームワークに統合し、状態遷移モデリングを統合。
  • リターンと次状態の予測分布と実際の分布との差異に基づく、新たな内生的報酬信号を設計し、探索を誘導する。
  • 真の価値分布と生成された価値分布の間のワサースタイン距離を最小化するGAN損失関数を用い、訓練の安定性とサンプル品質を向上。

実験結果

リサーチクエスチョン

  • RQ1分布的ベルマン方程式をGANフレームワークに正式にマッピングできるか。その場合、訓練の安定性と分布モデリングにどのような影響があるか。
  • RQ2提案手法のGANベースのDiRLアプローチが、離散化制約により失敗する既存手法が困難な多変量・高次元報酬関数を効果的に処理できるか。
  • RQ3価値分布と状態分布の共同モデリングが、強化学習環境における探索をどのように改善できるか。
  • RQ4分布予測誤差に基づく差分に基づく内生的報酬が、より効率的な探索と高速な収束をもたらすか。

主な発見

  • 分布的ベルマン方程式は数学的にワサースタインGANと同値であり、価値分布のための深層生成モデルの安定した訓練を可能にする。
  • 提案されたベルマンGANは、迷路環境において8次元のリターン分布を効果的にモデル化し、従来のDiRL手法が捉えられないマルチモーダルで構造的な特徴を示した。
  • 本手法は、複数の報酬タイプにわたり異なる報酬パターンを示す状態を持つ多報酬迷路など、多変量報酬設定において、効果的な方策評価を可能にした。
  • 分布差異に基づく内生的報酬を用いたW-1ME探索アルゴリズムは、高報酬・高リスクルート(例:2-Face Climberの北面)への訪問頻度を顕著に増加させ、平均報酬を向上させた。
  • W-1MEにおける探索ハイパーパrameter ηの値が高くなるほど、より困難だが高報酬の北面への状態訪問が増加した。これは、本手法が最適方策への探索を効果的に誘導できることを確認した。
  • 価値分布と状態分布の学習を統合するフレームワークは、サンプル効率を向上させ、合成的および高次元ベンチマークにおいて、より情報に基づいた探索を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。