Skip to main content
QUICK REVIEW

[論文レビュー] Average-reward model-free reinforcement learning: a systematic review and literature mapping

Vektor Dewanto, George Dunn|arXiv (Cornell University)|Oct 18, 2020
Reinforcement Learning in Robotics参考文献 106被引用数 17
ひとこと要約

本稿は、表形式の価値反復にとどまらず、ポリシー反復および関数近似手法を含む平均報酬モデルフリー強化学習について、体系的レビューと文献マッピングを提示している。先行研究を拡張し、主な研究ギャップを特定しており、特に関数近似設定におけるポリシー反復の未開発状態や、探索および価値関数近似の課題に焦点を当て、分野全体の包括的分類と今後の研究方向性を提示している。

ABSTRACT

Reinforcement learning is important part of artificial intelligence. In this paper, we review model-free reinforcement learning that utilizes the average reward optimality criterion in the infinite horizon setting. Motivated by the solo survey by Mahadevan (1996a), we provide an updated review of work in this area and extend it to cover policy-iteration and function approximation methods (in addition to the value-iteration and tabular counterparts). We present a comprehensive literature mapping. We also identify and discuss opportunities for future work.

研究の動機と目的

  • 1996年のMahadevanによるサーベイを過ぎて、平均報酬モデルフリー強化学習についての最新で包括的なレビューを提供すること。
  • 価値反復と表形式手法にとどまらず、ポリシー反復および関数近似手法を含む範囲にスコープを拡大すること。
  • 分類図および表を用いた体系的な文献マッピングにより、手法間の関係を明確にすること。
  • 特に探索、価値関数近似、非定常マルコフ決定過程(MDP)への適用性に関する、未解決の研究問題を特定・議論すること。
  • バッチ学習、分布的視点、マルチチェーンMDPなど、未だ十分に検討されていない分野を強調することで、今後の研究を導くこと。

提案手法

  • 本稿は、有限状態・行動空間、無限時間枠、モデルフリーな平均報酬強化学習に焦点を当てた体系的文献レビューを実施している。
  • 既存の研究を価値反復およびポリシー反復の枠組みに分類し、それぞれ表形式と関数近似設定について別々に分析している。
  • 本稿は、報酬の推定、価値関数の近似、行動価値の近似に基づいて、手法間の関係を示す4つの文献マップ(分類図)を提示している。
  • 平均報酬Q学習、RVIに類似したアルゴリズム、エリギビリティトレースを用いたアクタ・クリティック手法のための主要な方程式を導入・分析している。
  • 本手法には、ポリシーグラデント法における3つのアドバンテージ近似選択肢の比較分析が含まれており、エリギビリティトレースがアクタ・クリティック学習における役割についても議論している。
  • 動的プログラミングおよびマルコフ決定過程の理論的基盤を活用し、強化学習手法を文脈づけて解釈している。

実験結果

リサーチクエスチョン

  • RQ1なぜ平均報酬モデルフリー強化学習において、関数近似設定においても価値反復に比べてポリシー反復スキームの研究が著しく少ないのか?
  • RQ2アクタ・クリティック法におけるバックワードビューのエリギビリティトレースは、勾配ベースの更新におけるモーメンタムとどのように意味的に結びつけることができるか?
  • RQ3平均報酬強化学習における価値関数近似に最も効果的な基底関数は何か?また、その選択は性能にどのように影響するか?
  • RQ4ポリシーグラデントアルゴリズムで利用可能な3つのアドバンテージ近似法のうち、どれがサンプル効率性および収束性において最も有益か?
  • RQ5平均報酬強化学習はマルチチェーンMDPや連続状態空間へと拡張可能か?そのような拡張を支える理論的基盤は何か?

主な発見

  • 平均報酬強化学習におけるポリシー反復手法は、特に関数近似設定において、価値反復に比べて著しく未開拓である。
  • 価値反復に基づく手法、例えば平均報酬Q学習は、探索に敏感であり、学習の安定化のためには最適なゲインオフセットの適切な取り扱いが不可欠である。
  • アクタ・クリティック法におけるエリギビリティトレースは、SGDにおけるモーメンタムに類似しており、時間的信用配分と最適化ダイナミクスの間のより深い関係を示唆している。
  • アドバンテージ近似法の選択は、ポリシーグラデントの性能に顕著な影響を与えるが、あらゆる環境において一意に優れた方法は存在しない。
  • マルチチェーンMDP用の既存のモデルフリー平均報酬強化学習手法は存在せず、連続状態空間に対しても限定的な研究しか存在しないため、大きな未解決課題が残っている。
  • 本稿は、割引報酬法が平均報酬強化学習の代理として頻繁に使用されているが、これには現在の文献で取り上げられていない近似誤差が伴うことを特定している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。