Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Predict Independent of Span

Hado van Hasselt, Richard S. Sutton|arXiv (Cornell University)|Aug 19, 2015
Reinforcement Learning in Robotics参考文献 21被引用数 12
ひとこと要約

本稿では、予測スパンに依存しない一般化された時系列差分学習アルゴリズムを提案する。このアルゴリズムは、予測スパンに関係なく、定数時間の1ステップ計算で正確な予測を達成する。目的関数の性質——例えば、オフライン/オンライン更新、中間的目標の信頼性、収束性——を体系的に導出することで、エリギビリティトレース、TD誤差、平均化といった主要な構成要素が自然に導かれる。これらは、強化学習および長時間スパン予測のための単一で効率的なフレームワークに統合される。

ABSTRACT

We consider how to learn multi-step predictions efficiently. Conventional algorithms wait until observing actual outcomes before performing the computations to update their predictions. If predictions are made at a high rate or span over a large amount of time, substantial computation can be required to store all relevant observations and to update all predictions when the outcome is finally observed. We show that the exact same predictions can be learned in a much more computationally congenial way, with uniform per-step computation that does not depend on the span of the predictions. We apply this idea to various settings of increasing generality, repeatedly adding desired properties and each time deriving an equivalent span-independent algorithm for the conventional algorithm that satisfies these desiderata. Interestingly, along the way several known algorithmic constructs emerge spontaneously from our derivations, including dutch eligibility traces, temporal difference errors, and averaging. This allows us to link these constructs one-to-one to the corresponding desiderata, unambiguously connecting the `how' to the `why'. Each step, we make sure that the derived algorithm subsumes the previous algorithms, thereby retaining their properties. Ultimately we arrive at a single general temporal-difference algorithm that is applicable to the full setting of reinforcement learning.

研究の動機と目的

  • 予測スパンに比例して計算量が増加する従来のマルチステップ予測アルゴリズムの計算非効率性を是正すること。
  • 予測が正確に保たれる一方で、1ステップあたりの計算量がスパンに依存しないアルゴリズムを導出すること。
  • エリギビリティトレースやTD誤差といった異なるアルゴリズム的構成要素を、それらが満たすべき望ましい性質に直接結びつけることによって統一すること。
  • オフライン、オンライン、ハイブリッドな予測設定に適用可能な、単一の汎用的時系列差分アルゴリズムを開発すること。
  • 無限時間スパン、特にエピソード的および非エピソード的設定においても、価値関数の学習が収束し、頑健であることを保証すること。

提案手法

  • アルゴリズム導出を支援するため、スパン独立性、オンライン更新、中間的目標への信頼性といった望ましい性質を形式化する。
  • エリギビリティトレースの再重み付けにより、スパン独立の更新を導出し、事前の仮定なしに「オランダ式エリギビリティトレース」が自然に出現することを示す。
  • オンライン学習と中間的目標の利用を望むことから、時系列差分(TD)誤差が自然に導かれる。
  • オンライン重みの平均化を別個の信頼できるベクトルに適用することで、収束性と頑健性を向上させ、既知の手法にインspiredされた。
  • 2時定数スケールの確率的近似フレームワークを用いる:局所的予測のための高速更新、グローバル重みのための遅い更新。
  • すべての先行バージョンを包含し、標準的条件下で収束を保証する一般アルゴリズム(式44)を導出する。

実験結果

リサーチクエスチョン

  • RQ1予測スパンに依存しない定数時間の1ステップ計算で、マルチステップ予測をどのように学習できるか?
  • RQ2特定の望ましい性質からスパン独立の予測アルゴリズムを導出する際、どのようなアルゴリズム的構成要素が自然に出現するか?
  • RQ3オンライン学習とオフライン学習を、正確性と効率性を保持したまま、単一のフレームワークに統合できるか?
  • RQ4エリギビリティトレースやTD誤差といった既存の構成要素が、根本的な設計要件からどのように生じるか?
  • RQ5収束が保証される単一の汎用アルゴリズムを導出でき、オフライン、オンライン、恒久的、ソフト終了設定をすべてカバーできるか?

主な発見

  • スパン独立のアルゴリズムを導出する過程で、オランダ式エリギビリティトレース、TD誤差、重みの平均化といったよく知られた構成要素が自然に出現し、それぞれがその背後にある望ましい性質と結びつけられる。
  • 最終的なアルゴリズムは、すべての先行バージョンを包含する単一の汎用的時系列差分手法であり、すべての設定で正確な予測を維持する。
  • 標準的な確率的近似条件 ∑βₜ = ∞ および ∑βₜ² < ∞ を満たす限り、平均二乗投影ベルヌーイ誤差を最小化する固定点への収束が保証される。
  • 線形関数近似設定では、最適解への正確な収束が達成され、固定点は E[ϕₜϕₜᵀ]⁻¹E[ϕₜZₜ∞(θ*)] = θ* を満たす。
  • 本手法はハード終了およびソフト終了の両方をサポートし、エピソード的および非エピソード的設定においても一貫した計算効率を維持する。
  • 本フレームワークは線形モデルを超えて一般化可能であり、ディープニューラルネットワークを含む非線形関数近似器へも拡張可能であるが、同値性が常に保たれるとは限らない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。