Skip to main content
QUICK REVIEW

[論文レビュー] Kalman meets Bellman: Improving Policy Evaluation through Value Tracking

Shirli Di-Castro Shashua, Shie Mannor|arXiv (Cornell University)|Feb 17, 2020
Reinforcement Learning in Robotics参考文献 63被引用数 9
ひとこと要約

本稿では、パラメータと観測の不確実性を同時にモデル化することで、深層強化学習における方策評価を向上させる、拡張カルマンフィルタに基づくフレームワークKOVA(Kalman Optimization for Value Approximation)を提案する。正則化された目的関数を用いて両方の不確実性を最小化することで、より頑健な価値関数近似と向上した探索が可能となり、連続的制御タスクにおいてAdam や GPTD と比較して優れた性能を示す。また、オンポリシーおよびオフポリシー学習の両方をサポートする。

ABSTRACT

Policy evaluation is a key process in Reinforcement Learning (RL). It assesses a given policy by estimating the corresponding value function. When using parameterized value functions, common approaches minimize the sum of squared Bellman temporal-difference errors and receive a point-estimate for the parameters. Kalman-based and Gaussian-processes based frameworks were suggested to evaluate the policy by treating the value as a random variable. These frameworks can learn uncertainties over the value parameters and exploit them for policy exploration. When adopting these frameworks to solve deep RL tasks, several limitations are revealed: excessive computations in each optimization step, difficulty with handling batches of samples which slows training and the effect of memory in stochastic environments which prevents off-policy learning. In this work, we discuss these limitations and propose to overcome them by an alternative general framework, based on the extended Kalman filter. We devise an optimization method, called Kalman Optimization for Value Approximation (KOVA) that can be incorporated as a policy evaluation component in policy optimization algorithms. KOVA minimizes a regularized objective function that concerns both parameter and noisy return uncertainties. We analyze the properties of KOVA and present its performance on deep RL control tasks.

研究の動機と目的

  • 深層強化学習における方策評価のための既存のカルマンベースおよびガウス過程手法の限界、例えばスケーラビリティの低さ、バッチ処理の非効率性、確率的環境におけるメモリ効果への感受性を解消すること。
  • 深層ニューラルネットワークを用いたオンポリシーおよびオフポリシー学習を両立できる、スケーラブルで汎用性の高い価値関数近似フレームワークを構築すること。
  • 価値関数最適化に不確実性推定を統合することで、方策の探索性と学習の安定性を向上させること。
  • ミニバッチサンプリングによる効率的な学習を可能にし、無香カルマンフィルタベースの手法と比較して計算オーバーヘッドを低減すること。

提案手法

  • KOVAは、拡張カルマンフィルタ(EKF)を用いて、価値関数パラメータを時変する平均と分散を持つ確率的変数としてモデル化し、オンラインでの不確実性追跡を可能にする。
  • パラメータ誤差とノイズの多いリターンの不確実性の両方を最小化する正則化された目的関数を定式化し、予測誤差と観測誤差を整合的に統合する。
  • 状態空間モデルを用い、観測関数 h(u;θt) は価値ネットワークの出力を表し、ターゲットラベル y(u) はベルマン更新のターゲットに対応する。
  • KOVAはハイパーパrameter η を用いて、プロセスノイズの共分散を動的に調整し、追跡性と収束性のトレードオフを制御する。
  • 価値関数最適化と方策更新フェーズを分離することで、オンポリシーおよびオフポリシー学習を両立する。
  • KOVAはPPO、TRPO、SAC、ACKTR といった標準的な方策最適化アルゴリズムと互換性があり、プラグインとしての価値関数最適化器として機能する。

実験結果

リサーチクエスチョン

  • RQ1EKFベースのフレームワークが、パラメータと観測の不確実性を同時にモデル化することで、深層強化学習における価値関数近似を改善できるか?
  • RQ2KOVAの不確実性を考慮した最適化は、標準的なAdamやGPTDと比較して、サンプル効率および方策性能において優れているか?
  • RQ3KOVAによる不確実性追跡の統合は、方策の探索性の向上とより高い累積報酬をもたらすか?
  • RQ4ハイパーパrameter η および P_nt が、さまざまな環境における学習の安定性と性能に与える影響は何か?
  • RQ5KOVAはAdamに比べて計算コストが高くなるが、その理由は何か?今後の研究でこれを軽減できるか?

主な発見

  • KOVAはSwimmer、Hopper、HalfCheetah、Ant、Walker2d といったMuJoCo環境において、Adam や GPTD よりも高い平均エピソード報酬を達成し、方策性能を顕著に向上させた。
  • PPOおよびTRPOでは、Adamと比較して学習時間を44–60%延長したが、SACでは最大482%の延長が見られ、精度と速度のトレードオフが顕在化した。
  • 計算コストが高額であるにもかかわらず、KOVAは一貫して方策エントロピーを増加させ、これがサンプル効率の向上とより高い累積報酬と相関していた。
  • 観測ノイズ共分散 P_nt の設定として、最大比(max-ratio)とバッチサイズの両方の設定が性能向上に寄与し、特に最大比設定が優れたロバスト性を示した。
  • KOVAは、ミニバッチ処理を可能とし、オフポリシー学習をサポートし、高次元のDNNにスケーリング可能な点で、GPTD や KTD よりも優れた性能を示した。
  • プロセスノイズを制御するハイパーパrameter η は性能に強く影響し、Swimmer や HalfCheetah では低い値(例:0.001)がより良い結果をもたらした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。