Skip to main content
QUICK REVIEW

[論文レビュー] Control Frequency Adaptation via Action Persistence in Batch Reinforcement Learning

Alberto Maria Metelli, Flavio Mazzolini|arXiv (Cornell University)|Feb 17, 2020
Reinforcement Learning in Robotics参考文献 53被引用数 6
ひとこと要約

本稿では、バッチ強化学習における制御周波数の適応を可能にするために、複数の意思決定ステップにわたり同じ行動を繰り返す「行動持続性(action persistence)」を導入し、さまざまな持続性レベルで最適方策を学習可能なPersistent Fitted Q-Iteration(PFQI)を提案する。性能損失の理論的境界を確立し、最適な持続性を特定するためのヒューリスティックを提案。CartPole や Mountain Car といったベンチマーク環境において、より高いデータ利用効率と性能向上を実証した。

ABSTRACT

The choice of the control frequency of a system has a relevant impact on the ability of reinforcement learning algorithms to learn a highly performing policy. In this paper, we introduce the notion of action persistence that consists in the repetition of an action for a fixed number of decision steps, having the effect of modifying the control frequency. We start analyzing how action persistence affects the performance of the optimal policy, and then we present a novel algorithm, Persistent Fitted Q-Iteration (PFQI), that extends FQI, with the goal of learning the optimal value function at a given persistence. After having provided a theoretical study of PFQI and a heuristic approach to identify the optimal persistence, we present an experimental campaign on benchmark domains to show the advantages of action persistence and proving the effectiveness of our persistence selection method.

研究の動機と目的

  • 強化学習、特にバッチRL設定において、制御周波数とデータ複雑性のトレードオフを扱う。
  • 複数ステップにわたり同じ行動を繰り返す「行動持続性」が、方策性能および価値関数推定に与える影響を調査する。
  • 環境との相互作用を必要とせず、最適な持続性レベルを自動的に選択する手法を開発し、バッチ学習における方策性能を向上させる。
  • Fitted Q-Iterationを拡張し、一連のデータセットから異なる制御周波数での最適方策を学習可能にする。
  • 学習時に高い持続性を使用し、実行時に低い持続性で実行する方が、学習と実行の持続性が同一の場合よりも優れた性能を発揮するかを検証し、その仮定に疑問を呈する。

提案手法

  • 行動持続性を、1つの行動をk個の連続した意思決定ステップにわたって繰り返すことで定義し、制御周波数をk分の1に低下させる。
  • 理論的分析により、持続的ベルマン作用素が収縮性を保つことが示され、Lipschitz連続な条件下で正しい価値関数への収束が保証される。
  • FQIの拡張として、ベースのMDPから∆t₀時間ステップで収集されたデータセットを用い、目的の持続性kにおける最適Q関数を学習するPersistent Fitted Q-Iteration(PFQI)を提案する。
  • 価値関数の差分と状態訪問頻度に基づくヒューリスティックインデックスを導入し、環境との相互作用を必要とせず最適な持続性を推定する。
  • データ収集時にサンプリング用の持続性(ksampling)を用い、より高い持続性のMDPをシミュレートすることで、低周波動的ダイナミクス上で学習しつつも、データ効率を維持する。
  • さまざまな持続性で学習した方策を評価し、複数の実行用持続性k₁で性能をテストすることで、最良の一般化性能を特定する。

実験結果

リサーチクエスチョン

  • RQ1行動持続性がマルコフ決定過程における最適方策の性能にどのように影響を与えるか?
  • RQ2Lipschitz連続な環境において、行動持続性を増加させること(すなわち制御周波数を低下させること)によって生じる性能損失を理論的に境界づけることは可能か?
  • RQ3訓練と実行の周波数が異なる状況においても、良好に一般化する1つの方策を学習することは可能か?
  • RQ4追加の環境相互作用を必要とせず、ヒューリスティックな選択法によって最適な実行用持続性レベルを特定することは可能か?
  • RQ5学習時に高い持続性を使用し、実行時に低い持続性で実行する方が、訓練と実行の持続性が同一の場合よりも優れた性能を発揮するか?

主な発見

  • PFQIは、ベース周波数∆t₀で収集された1つのバッチデータセットから、さまざまな持続性レベルkにおける最適Q関数を効果的に学習できた。
  • CartPole環境では、k=4およびk=8で学習した方策が、それぞれ284.3±1.6および285.9±1.1の近似的に最適な報酬を達成し、低いk値や高いk値のものよりも顕著に優れた性能を示した。
  • ある持続性kで学習した方策の性能は、より低い持続性k₁ < kで実行した場合に向上し、特にk₁がkより小さい場合に最も高い性能が得られた。これは、高い持続性で学習することで、より良い一般化性能が得られることを示唆している。
  • Mountain Car環境では、均一な方策がゴールに到達するためには、ksampling=8のサンプリング持続性が必要だった。これは、報酬が疎なタスクにおいて持続性の重要性を強調している。
  • ヒューリスティックな持続性選択法は、CartPoleおよびMountain Carの両環境で、最良のk値に近い値を成功裏に特定した。
  • kで学習した方策を複数のk₁で評価した結果、常にk₁ < kのときが最良の性能を示した。これは、高い持続性で学習することで、より高い実行の柔軟性が得られることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。