Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Difference Updating without a Learning Rate

Marcus Hütter, Shane Legg|ArXiv.org|Oct 31, 2008
Reinforcement Learning in Robotics参考文献 9被引用数 16
ひとこと要約

本稿では、統計的原則に基づき変分的手法を用いて学習率αの手動チューニングを不要にする、HL(λ)と呼ばれる時系列差分学習アルゴリズムを提案する。この手法は、エリギビリティトレースと実測報酬統計に基づいた状態固有の学習率を用いる。複数の環境で標準的なTD(λ)、Sarsa(λ)、Q(λ)を上回る性能を示し、ハイパーパrameterチューニングなしで実現する。

ABSTRACT

We derive an equation for temporal difference learning from statistical principles. Specifically, we start with the variational principle and then bootstrap to produce an updating rule for discounted state value estimates. The resulting equation is similar to the standard equation for temporal difference learning with eligibility traces, so called TD(lambda), however it lacks the parameter alpha that specifies the learning rate. In the place of this free parameter there is now an equation for the learning rate that is specific to each state transition. We experimentally test this new learning rule against TD(lambda) and find that it offers superior performance in various settings. Finally, we make some preliminary investigations into how to extend our new temporal difference algorithm to reinforcement learning. To do this we combine our update equation with both Watkins' Q(lambda) and Sarsa(lambda) and find that it again offers superior performance without a learning rate parameter.

研究の動機と目的

  • 時系列差分学習における手動学習率チューニングの必要性を排除すること。
  • ヒューリスティック設計ではなく統計的推論から原理的でデータ駆動の学習率を導出すること。
  • 価値推定および方策学習タスクの両方における学習の安定性と性能を向上させること。
  • 新しい学習ルールをSarsa(λ) や Q(λ) といった完全な強化学習アルゴリズムへと拡張すること。
  • 定常的・非定常的・エピソード的環境のすべてにおいて手法を検証すること。

提案手法

  • 推定された未来割引報酬と実測未来割引報酬の二乗誤差の重み付き和を最小化する変分的原理から学習率を導出する。
  • パラメータλを用いて過去の状態遷移を時間的に重み付けする損失関数を用い、非定常的環境への適応を可能にする。
  • TD(λ)における固定学習率αの代わりに、正規化されたトレース重み付き回数の逆数とエリギビリティトレースから導出される状態遷移固有の学習率βを導入する。
  • 導出された学習率を用いたインクリメンタル更新ルールを適用する:V(s) ← V(s) + β × E(s) × δ、ここでδは時系列差分誤差である。
  • Sarsa(λ)とウォーキンズのQ(λ)にβに基づく更新を統合することで、HL(λ)をQ学習へと拡張し、HLS(λ)とHLQ(λ)を構築する。
  • 訪問頻度と時間的信用配分を追跡するために、動的カウントN(s,a)とエリギビリティトレースE(s,a)を用い、λを両者を減衰させるために使用する。

実験結果

リサーチクエスチョン

  • RQ1統計的推論から導出された原理的でデータ駆動の学習率を、TD(λ)におけるヒューリスティックな学習率αの代わりに導出できるか?
  • RQ2得られたHL(λ)アルゴリズムは、さまざまなマルコフ連鎖環境において、標準的なTD(λ)よりも価値関数推定で優れた性能を示すか?
  • RQ3HL(λ)における学習率の適応機構は、固定α法と比較して非定常的環境での性能向上をもたらすか?
  • RQ4学習率ハイパーパrameterの排除が、Sarsa(λ) や Q(λ) といった完全な強化学習アルゴリズムにおいて優れた性能をもたらすか?
  • RQ5HL(λ)フレームワークは、性能の低下や複雑性の増加を伴わずに、他の時系列差分アルゴリズムへ一般化可能か?

主な発見

  • HL(λ)は定常的および非定常的マルコフ連鎖の両方で標準的なTD(λ)を上回り、価値関数推定の誤差が低かった。
  • 風が吹くグリッドワールド環境では、HLS(λ)は5.0を超える最終的な実測未来割引報酬を達成したが、最適にチューニングされたSarsa(λ)は5.0未満で飽和した。
  • λ=0.99であっても、Sarsa(λ)はHLS(λ)の最終的性能に到達できず、データ駆動の学習率の優位性を示した。
  • HLQ(λ)(HL(λ)をQ学習に拡張したもの)は、学習率のチューニングなしでQ(λ)を上回る性能を達成した。これは、広範なハイパーパrameterサーチにもかかわらず同様であった。
  • 複数回の実験と複数の環境で一貫した優位性を示し、性能向上は状態遷移ごとの適応的学習率に起因する。
  • 手動によるαチューニングの必要性を排除しながらも、競争力ある学習速度を維持したため、実世界の強化学習応用において実用的利点があると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。