Skip to main content
QUICK REVIEW

[論文レビュー] Accelerated Gradient Temporal Difference Learning

Yangchen Pan, Adam White|arXiv (Cornell University)|Nov 28, 2016
Optimal Power Flow Distribution参考文献 23被引用数 14
ひとこと要約

本稿では、データ効率が最小二乗TD(LSTD)と同等である一方で、線形の計算および記憶コストを維持する、新規の部分二次のTD学習アルゴリズムである加速勾配時系列差分(ATD)を導入する。ATDは、収束を加速する準ニュートン条件付け行列を用い、線形TD手法と比較してハイパーパramータへの感受性が著しく低くなるように設計されており、漸近的に不偏性を保証する。

ABSTRACT

The family of temporal difference (TD) methods span a spectrum from computationally frugal linear methods like TD(λ) to data efficient least squares methods. Least square methods make the best use of available data directly computing the TD solution and thus do not require tuning a typically highly sensitive learning rate parameter, but require quadratic computation and storage. Recent algorithmic developments have yielded several sub-quadratic methods that use an approximation to the least squares TD solution, but incur bias. In this paper, we propose a new family of accelerated gradient TD (ATD) methods that (1) provide similar data efficiency benefits to least-squares methods, at a fraction of the computation and storage (2) significantly reduce parameter sensitivity compared to linear TD methods, and (3) are asymptotically unbiased. We illustrate these claims with a proof of convergence in expectation and experiments on several benchmark domains and a large-scale industrial energy allocation domain.

研究の動機と目的

  • 時系列差分学習における計算効率とデータ効率のトレードオフを解消すること。
  • 最小二乗TD(LSTD)と同等のデータ効率を達成するが、二次の計算または記憶コストを必要としない手法の開発。
  • 線形TD手法で一般的に見られる、学習率などへの感受性の高いパラメータ感度の低減。
  • 多くの先行部分二次手法とは異なり、部分二次近似において漸近的に不偏性を保証すること。
  • 大規模かつ高次元の問題における実用的で完全にインクリメンタルな方策評価の実現。

提案手法

  • 平均二乗投影ベルヌーイ誤差(MSPBE)のヘッセ行列の近似を用いてTD更新を条件付けする、準ニュートンスタイルの確率的勾配降下法である加速勾配TD(ATD)を提案する。
  • 条件付け行列の低ランク近似を用いることで、部分二次の計算および記憶複雑性を維持する。
  • 条件付け行列がTD固定点への収束を加速するように変更された勾配降下ステップとして更新を定式化する。
  • 低ランク近似が存在する場合でも、期待値における収束が真のTD解へ保証されることを証明する。
  • オンラインでリアルタイムに学習可能なインクリメンタル更新ルールに条件付け行列を統合する。
  • 近似のランクに関わらず、方法が一貫性と不偏性を保つこと、特にランク1の場合でも同様であることを示す。

実験結果

リサーチクエスチョン

  • RQ1部分二次のTD手法は、計算および記憶コストを低く保ちつつ、LSTDと同等のデータ効率を達成できるか?
  • RQ2標準的な線形TD手法と比較して、条件付け勾配更新の使用が、学習率などのハイパーパramータへの感受性を低減するか?
  • RQ3条件付け行列の低ランク近似が、価値関数推定における漸近的不偏性を保持できるか?
  • RQ4tLSTD、iLSTD、およびランダム射影LSTDといった既存の部分二次手法と比較して、ATDの性能およびロバスト性はどの程度か?
  • RQ5高次元またはノイズの多い特徴空間において、ATDは高速な収束と低誤差を維持できるか?

主な発見

  • ATDは、LSTDと同等のデータ効率を達成しながら、著しく少ない計算および記憶コストを要し、ベンチマークドメインでは初期学習が著しく速い。
  • 線形TD手法とは異なり、正則化パラメータへの感受性が極めて低く、ハイパーパramータのチューニングが最小限で済む。
  • tLSTDや他の部分二次手法とは異なり、条件付け行列のランクが1であっても、ATDは漸近的に不偏性を保つ。
  • 8192次元の特徴を持つ大規模な産業的エネルギー割り当てドメインにおいて、ATDは低ランク設定(r=40)でtLSTDを上回り、優れたロバスト性と効率性を示した。
  • ノイズの多い特徴空間、例えば追加の100個のランダム特徴を含むマウンテンカーにおいて、ATDは低ランク近似により信頼性の低い特徴を効果的に無視し、強力な性能を維持した。
  • 線形手法が高用量のチューニングを要するのに対し、ATDは真のオンラインTD(λ)およびETD(λ)と同等の性能を達成し、広範なパラメータスイープを必要としなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。