Skip to main content
QUICK REVIEW

[論文レビュー] Distributional Reinforcement Learning for Multi-Dimensional Reward Functions

Pushi Zhang, Xiaoyu Chen|arXiv (Cornell University)|Oct 26, 2021
Reinforcement Learning in Robotics参考文献 21被引用数 4
ひとこと要約

本稿では、複数の報酬源における結合リターン分布をモデル化し、個々の報酬のランダムネスと複数源間の相関を捉える、分布強化学習手法であるMulti-Dimensional Distributional DQN(MD3QN)を提案する。予測された分布とベルマンターゲットの結合分布との間の最大平均差分(MMD)を最小化することで、MD3QNはワサーレンシュタイン距離の下で収束し、HRAなどの先行手法よりも優れた性能を示し、より高いサンプル効率を達成する。

ABSTRACT

A growing trend for value-based reinforcement learning (RL) algorithms is to capture more information than scalar value functions in the value network. One of the most well-known methods in this branch is distributional RL, which models return distribution instead of scalar value. In another line of work, hybrid reward architectures (HRA) in RL have studied to model source-specific value functions for each source of reward, which is also shown to be beneficial in performance. To fully inherit the benefits of distributional RL and hybrid reward architectures, we introduce Multi-Dimensional Distributional DQN (MD3QN), which extends distributional RL to model the joint return distribution from multiple reward sources. As a by-product of joint distribution modeling, MD3QN can capture not only the randomness in returns for each source of reward, but also the rich reward correlation between the randomness of different sources. We prove the convergence for the joint distributional Bellman operator and build our empirical algorithm by minimizing the Maximum Mean Discrepancy between joint return distribution and its Bellman target. In experiments, our method accurately models the joint return distribution in environments with richly correlated reward functions, and outperforms previous RL methods utilizing multi-dimensional reward functions in the control setting.

研究の動機と目的

  • 複数報酬強化学習におけるスカラー値および周辺価値関数学習の限界を克服するため、結合リターン分布をモデル化すること。
  • 個々の報酬源におけるランダムネスに加え、それらの間の相関を捉えることで、環境理解を豊かにする。
  • 分布強化学習をスカラー報酬にとどまらず、理論的裏付けのあるベルマン作用素を用いて多変量リターン分布へと拡張すること。
  • MMD損失を用いて結合分布ベルマン作用素を正確に近似する実用的アルゴリズムを開発すること。

提案手法

  • ワサーレンシュタイン距離の下で、結合リターン分布をそのターゲットに写像する結合分布ベルマン作用素を導入する。
  • ワサーレンシュタイン距離の下で、結合分布ベルマン作用素の収束を証明し、理論的安定性を保証する。
  • 予測された結合分布とそのベルマンターゲットとの間の最大平均差分(MMD)を最小化することで、ベルマン作用素を近似するMD3QNを提案する。
  • 不偏MMD推定を用いたミニバッチ勾配降下法により結合分布を最適化し、スケーラブルな学習を可能にする。
  • 各報酬源ごとに出力ヘッドを備えた深層ニューラルネットワークを用いて、複数報酬源におけるリターンの結合分布を回帰する。
  • ピクセル観測とエンドツーエンド学習を用いて、報酬が分解された環境(例:アーケードゲーム、迷路タスク)に本手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1多変量リターンの結合分布をモデル化することで、価値ベース強化学習におけるサンプル効率と性能が向上するか?
  • RQ2複数報酬環境における報酬源間の相関を捉えることで、ポリシー学習と表現品質にどのような影響が生じるか?
  • RQ3標準的な距離計測基準の下で、結合分布ベルマン作用素は収束するのか?実用的に効果的に近似可能か?
  • RQ4密度推定を明示的に行わず、MMDに基づく学習が、結合リターン分布を安定的かつ正確に学習する有効な方法であるか?
  • RQ5MMDQN や HRA といった既存手法と比較して、MD3QN は相関のある報酬をどのようにモデル化し、最終的な性能を達成しているか?

主な発見

  • 迷路環境およびアーケードゲームの両方において、MD3QNは複数報酬源における結合リターン分布を成功裏にモデル化しており、可視化結果から真の分布と密接に一致していることが示された。
  • 排他的・同一・多報酬源を有する迷路環境において、MD3QNは報酬相関を正確に捉えており、サンプル分布が真のパターンと一致していることから裏付けられている。
  • 報酬が分解された6種類のアーケードゲームにおいて、MD3QNはすべての環境でHRAと同等または優れた性能を示し、学習効率の向上が確認された。
  • MMDQN に劣るゲームもあるが、MD3QN は HRA よりも優れたまたは同等の性能を達成しており、周辺分布モデル化に比べて結合分布モデル化の利点が示された。
  • 付録A.3.3のアブレーションスタディでは、相関のある制約を持つ環境では周辺分布のみをモデル化する手法が失敗することが判明し、結合分布学習の必要性が裏付けられた。
  • MD3QN がモデル化する結合分布は、実際の報酬相関やスケール(例:MsPacmanにおけるモンスター撃破とポイント収集の正の相関)を反映しており、本手法の表現能力が妥当であることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。