Skip to main content
QUICK REVIEW

[論文レビュー] Sample Complexity and Overparameterization Bounds for Projection-Free Neural TD Learning.

Semih Çaycı, Siddhartha Satpathi|arXiv (Cornell University)|Mar 2, 2021
Stochastic Gradient Optimization Techniques参考文献 17被引用数 4
ひとこと要約

本稿では、2層ReLUネットワークを用いたニューラルTD学習のプロジェクションフリーな収束解析を提示する。幅が poly(ū, 1/ε) を超える場合、反復数またはサンプル数が poly(ū, 1/ε) 以内で真の価値関数への誤差ε以内に収束することを示している。解析は、ラージトレーニング領域におけるネットワークパラメータのドリフト解析に依拠し、プロジェクションステップの必要性を排除する。

ABSTRACT

We study the dynamics of temporal-difference learning with neural network-based value function approximation over a general state space, namely, \emph{Neural TD learning}. Existing analysis of neural TD learning relies on either infinite width-analysis or constraining the network parameters in a (random) compact set; as a result, an extra projection step is required at each iteration. This paper establishes a new convergence analysis of neural TD learning \emph{without any projection}. We show that the projection-free TD learning equipped with a two-layer ReLU network of any width exceeding $poly(\overline{ u},1/\epsilon)$ converges to the true value function with error $\epsilon$ given $poly(\overline{ u},1/\epsilon)$ iterations or samples, where $\overline{ u}$ is an upper bound on the RKHS norm of the value function induced by the neural tangent kernel. Our sample complexity and overparameterization bounds are based on a drift analysis of the network parameters as a stopped random process in the lazy training regime.

研究の動機と目的

  • プロジェクションステップの必要性をなくすために、プロジェクションなしでの収束解析を実施すること。
  • ニューラルTD学習における2層ReLUネットワークのサンプル複雑度と過パラメータ化の境界を確立すること。
  • ラージトレーニング領域におけるネットワークパラメータのダイナミクスを、停止した確率過程として分析すること。
  • 最小限の幅と反復回数要件で、真の価値関数への収束保証(誤差ε)を提供すること。

提案手法

  • 解析は、ラージトレーニング領域における停止した確率過程としてモデル化されたネットワークパラメータのドリフト解析を採用する。
  • この手法は、ニューラル接線カーネル(NTK)を用いて、価値関数のRKHSノルムを ū で上限付ける。
  • 確率的勾配更新の下でのパラメータドリフトを分析することで、プロジェクションなしでの収束を確立する。
  • ネットワークの幅が poly(ū, 1/ε) を超える場合に十分であることが示され、ε-精度への収束が保証される。
  • 一般の状態空間において、ニューラル関数近似を用いた時系列差分学習を用いて収束を証明する。
  • 制限されたコンパクトなパrameter集合や無限大の幅の仮定を回避することで、実用的応用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1現実的な過パラメータ化のもとで、ニューラルTD学習がプロジェクションステップなしに収束可能か?
  • RQ2プロジェクションなしでニューラルTD学習においてε-精度に達するための必要なネットワーク幅は何か?
  • RQ3サンプル複雑度は、RKHSノルムの上限 ū および目標誤差εに対してどのようにスケーリングされるか?
  • RQ4ニューラル接線カーネルは、プロジェクションフリーな収束を可能にする役割を果たすか?
  • RQ5ラージ領域におけるネットワークパラメータのドリフト解析は、真の価値関数への収束を保証できるか?

主な発見

  • 2層ReLUネットワークを用いたニューラルTD学習は、いかなるプロジェクションステップなしに真の価値関数へ誤差εで収束する。
  • 必要なネットワーク幅は、poly(ū, 1/ε) で上限付けられ、ここで ū はNTKによる価値関数のRKHSノルムの上限である。
  • 必要な反復数またはサンプル数は poly(ū, 1/ε) であり、効率的なサンプル複雑度が確立される。
  • 収束は、ラージ領域における停止した確率過程としてのネットワークパラメータのドリフト解析により達成される。
  • 無限大の幅やコンパクトなパrameter集合の仮定を回避することで、実用的妥当性が向上する。
  • 本手法は、明示的なサンプル数および幅の境界を伴い、ニューラルTD学習におけるプロジェクションフリーな収束保証を初めて提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。