Skip to main content
QUICK REVIEW

[論文レビュー] Temporal-difference learning for nonlinear value function approximation in the lazy training regime.

Andréa Agazzi, Jianfeng Lu|arXiv (Cornell University)|Sep 25, 2019
Neural Networks and Applications参考文献 27被引用数 6
ひとこと要約

この論文は、モデルのパラメータが最適化中にわずかにしか変化しない『ラージトレーニング制御』の下で、無限時間割引マルコフ決定過程における非線形価値関数近似を時系列差分(TD)学習を用いて研究する。非線形関数近似の下で、パラメータの変化が小さい場合に、局所的または大域的最小化点への指数的収束を、過小パラメータ化および過大パラメータ化の両設定において証明する。この結果は、非ラージトレーニング制御下で失敗するモデルやニューラルネットワークへの応用を含む。

ABSTRACT

We discuss the approximation of the value function for infinite-horizon discounted Markov Decision Processes (MDP) with nonlinear functions trained with Temporal-Difference (TD) learning algorithm. We consider this problem under a certain scaling of the approximating function, leading to a regime called lazy training. In this regime the parameters of the model vary only slightly during the learning process, a feature that has recently been observed in the training of neural networks, where the scaling we study arises naturally, implicit in the initialization of their parameters. Both in the under- and over-parametrized frameworks, we prove exponential convergence to local, respectively global minimizers of the above algorithm in the lazy training regime. We then give examples of such convergence results in the case of models that diverge if trained with non-lazy TD learning, and in the case of neural networks.

研究の動機と目的

  • 無限時間割引MDPにおける非線形価値関数近似を、ラージトレーニング制御下のTD学習を用いて分析すること。
  • トレーニング中にモデルパラメータがわずかにしか変化しない場合のTD学習の収束保証を確立すること。
  • 過小パラメータ化および過大パラメータ化の両設定において、局所的または大域的最小化点への指数的収束を示すこと。
  • 非ラージトレーニング制御下で発散するが、ラージトレーニング制御下では収束するモデルの成功の理論的裏付けを提供すること。
  • 実践的なディープ強化学習のトレーニングと、非線形関数近似における理論的収束のギャップを埋めること。

提案手法

  • 特定のスケーリングを用いることで、ラージトレーニング制御を誘発する非線形関数近似器を用いたTD学習を分析する。
  • 過小パラメータ化および過大パラメータ化の両モデルにラージトレーニング制御を適用し、トレーニング中にパラメータの変更が小さいことを保証する。
  • 理論的分析を用いて、過小パラメータ化の場合は局所的最小化点への指数的収束、過大パラメータ化の場合は大域的最小化点への指数的収束を証明する。
  • ラージトレーニングスケーリング下での損失関数の幾何的性質に基づいて収束速度を導出する。
  • 標準的なTD学習で発散するモデルおよびニューラルネットワークに対しても、このフレームワークを適用する。
  • モデル初期化からの暗黙のスケーリングに依存し、自然にラージトレーニング制御を誘発する。

実験結果

リサーチクエスチョン

  • RQ1非線形関数近似を用いたTD学習は、ラージトレーニング制御下で指数的収束を達成できるか?
  • RQ2ラージトレーニング制御は、過小パラメータ化および過大パラメータ化のモデルにおける収束にどのように影響するか?
  • RQ3ラージトレーニング制御下でのMDPにおける価値関数近似に対して、どのような理論的保証を提供できるか?
  • RQ4なぜ一部のモデルは非ラージトレーニング制御下のTD学習では発散するが、ラージトレーニング制御下では収束するのか?
  • RQ5実際のニューラルネットワーク初期化から、どのようにしてラージトレーニング制御が自然に生じるのか?

主な発見

  • 過小パラメータ化のラージトレーニング制御下で、局所的最小化点への指数的収束が証明された。
  • 過大パラメータ化のラージトレーニング制御下で、大域的最小化点への指数的収束が確立された。
  • ラージトレーニング制御は、標準的なTD学習で発散するモデルに対しても収束を可能にする。
  • ラージトレーニング制御下でトレーニングされたニューラルネットワークは、小さなパラメータ更新のおかげで安定した収束を示す。
  • 理論的フレームワークは、標準的なニューラルネットワーク初期化から自然に導かれるため、理論と実践を結ぶ。
  • 本研究の結果は、ディープ強化学習におけるラージトレーニング制御の成功を理論的に裏付ける基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。