Skip to main content
QUICK REVIEW

[論文レビュー] Trust Region Value Optimization using Kalman Filtering

Shirli Di-Castro Shashua, Shie Mannor|arXiv (Cornell University)|Jan 23, 2019
Reinforcement Learning in Robotics参考文献 43被引用数 5
ひとこと要約

本稿では、深層強化学習における価値関数近似のための信頼領域最適化手法であるKOVA(Kalman Optimization for Value Approximation)を提案する。KOVAは拡張カルマンフィルタを用いてパラメータの不確実性をモデル化し、政策評価の性能を向上させる。価値パラメータとリターンをベイズ分布を持つ確率変数として扱うことで、KOVAは予測に加えて信頼性の推定値を提供し、大規模な状態空間と行動空間を有する連続的制御タスクにおいて、Adamなどの標準的最適化手法を上回る性能を発揮する。

ABSTRACT

Policy evaluation is a key process in reinforcement learning. It assesses a given policy using estimation of the corresponding value function. When using a parameterized function to approximate the value, it is common to optimize the set of parameters by minimizing the sum of squared Bellman Temporal Differences errors. However, this approach ignores certain distributional properties of both the errors and value parameters. Taking these distributions into account in the optimization process can provide useful information on the amount of confidence in value estimation. In this work we propose to optimize the value by minimizing a regularized objective function which forms a trust region over its parameters. We present a novel optimization method, the Kalman Optimization for Value Approximation (KOVA), based on the Extended Kalman Filter. KOVA minimizes the regularized objective function by adopting a Bayesian perspective over both the value parameters and noisy observed returns. This distributional property provides information on parameter uncertainty in addition to value estimates. We provide theoretical results of our approach and analyze the performance of our proposed optimizer on domains with large state and action spaces.

研究の動機と目的

  • 標準的なTD学習の価値関数近似における限界を、パラメータと観測の不確実性を組み込むことで克服すること。
  • 不確実性に応じて各パラメータごとに学習率を動的に調整する信頼領域最適化フレームワークを構築すること。
  • 従来のベイズ手法のように1ステップあたり複数のサンプルを必要とせずに、逐次的かつオンラインでのパラメータ更新を可能にすること。
  • 大規模な状態空間と行動空間を有する強化学習における政策評価性能を、カルマンフィルタの原理を活用することで向上させること。

提案手法

  • 予測誤差とパラメータの不確実性を組み合わせた正則化された目的関数を定式化し、価値パラメータ上に信頼領域を形成する。
  • 拡張カルマンフィルタ(EKF)を用いて、価値関数パラメータとその不確実性共分散行列のオンラインで逐次的な更新を実行する。
  • 価値パラメータとノイズのあるリターンを、共通のガウス分布を持つ確率変数としてモデル化し、パラメータ上でのベイズ推論を可能にする。
  • カルマンゲインを用いて各パラメータの学習率を適応的にスケーリングし、安定的かつ効率的な更新を実現する。
  • EKFと信頼領域手法との間の関係を導出し、目的関数がKullback-Leibler距離に基づく信頼領域を近似的に最小化することを示す。
  • KOVAをPPOやTRPOなどの既存の政策最適化アルゴリズムに統合するため、標準的な価値関数最適化器をKOVAに置き換える。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習における価値関数近似の際、パラメータの不確実性を効果的にモデル化し、政策評価に活用する方法は何か?
  • RQ2大規模な強化学習環境において、計算効率を維持したまま、拡張カルマンフィルタを用いて価値パラメータ上に信頼領域を形成できるか?
  • RQ3EKFに基づく最適化とTRPO や自然勾配降下法といった確立された信頼領域手法との関係は何か?
  • RQ4KOVAは、連続的制御ベンチマークにおいて、Adamなどの標準的最適化手法と比較して、サンプル効率や性能で優れているか?
  • RQ5カルマンフィルタフレームワークは、追加のサンプリングや複雑な推論手順を必要とせずに、価値予測の信頼性推定を提供できるか?

主な発見

  • KOVAは、PPO や TRPO に組み込むことで、Adam などの標準的最適化手法と比較して、MuJoCo制御ベンチマークにおけるサンプル効率と最終的性能を顕著に向上させる。
  • Hopper、Ant、HalfCheetahなどのタスクにおいて、漸近的性能が向上し、収束が早くかつばらつきが小さい学習曲線が得られる。
  • KOVAは、価値予測のための校正された不確実性推定値を提供し、探索や政策改善に有用である。
  • バッチサンプリングや複数回のパラメータ抽出を回避することで、計算効率を維持し、深層ニューラルネットワークに適した。
  • 理論的分析により、KOVAがKullback-Leibler距離による信頼領域を近似的に最小化する正則化目的関数を最小化していることが確認された。
  • 実験的結果から、KOVAは学習率0.1または1.0(タスクに応じて)と最大比ノイズ共分散を用いることで、多様な環境で一貫した改善を達成することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。