Skip to main content
QUICK REVIEW

[論文レビュー] Can Temporal-Difference and Q-Learning Learn Representation? A Mean-Field Theory

Yufeng Zhang, Qi Cai|arXiv (Cornell University)|Jun 8, 2020
Reinforcement Learning in Robotics参考文献 71被引用数 5
ひとこと要約

この論文は、時系列差分(TD)およびQ学習に用いられる過パラメータ化された2層ニューラルネットワークが、データに依存する最適な特徴表現を学習しながら、平均二乗投影ベルヌーイ誤差(MSPBE)を部分線形レートでグローバルに最小化できることを確立している。Wasserstein空間上の平均場解析を用いて、特徴表現が初期化からグローバル最適解へと進化することを証明しており、表現が固定されたままとなるニューラル接線カーネル(NTK)領域を超えて一般化されている。

ABSTRACT

Temporal-difference and Q-learning play a key role in deep reinforcement learning, where they are empowered by expressive nonlinear function approximators such as neural networks. At the core of their empirical successes is the learned feature representation, which embeds rich observations, e.g., images and texts, into the latent space that encodes semantic structures. Meanwhile, the evolution of such a feature representation is crucial to the convergence of temporal-difference and Q-learning. In particular, temporal-difference learning converges when the function approximator is linear in a feature representation, which is fixed throughout learning, and possibly diverges otherwise. We aim to answer the following questions: When the function approximator is a neural network, how does the associated feature representation evolve? If it converges, does it converge to the optimal one? We prove that, utilizing an overparameterized two-layer neural network, temporal-difference and Q-learning globally minimize the mean-squared projected Bellman error at a sublinear rate. Moreover, the associated feature representation converges to the optimal one, generalizing the previous analysis of Cai et al. (2019) in the neural tangent kernel regime, where the associated feature representation stabilizes at the initial one. The key to our analysis is a mean-field perspective, which connects the evolution of a finite-dimensional parameter to its limiting counterpart over an infinite-dimensional Wasserstein space. Our analysis generalizes to soft Q-learning, which is further connected to policy gradient.

研究の動機と目的

  • 過パラメータ化された2層ニューラルネットワークを用いたTDおよびQ学習における特徴表現の進化を理解すること。
  • このような学習がグローバルに収束し、特にニューラル接線カーネル(NTK)領域を超えて最適解に収束するかどうかを特定すること。
  • 非線形関数近似における誘導される特徴表現の収束速度と最適性を分析すること。
  • 分析をソフトQ学習に拡張し、ポリシー勾配法との関連を明らかにすること。
  • 有限幅のニューラルネットワークの進化をWasserstein空間上の流れとしてモデル化する平均場フレームワークの構築

提案手法

  • 論文は平均場的視点を採用し、ニューラルネットワークのパラメータを無限幅極限における集団分布への収束を示す経験的分布としてモデル化する。
  • 学習アルゴリズムのダイナミクスから導かれる連続の方程式を用いて、集団分布の進化をWasserstein空間で特徴付ける。
  • 集団分布の進化を記述するPDEの解析に、一般化された1点単調性の概念を導入する。
  • Wasserstein空間における第一変分公式を活用し、特徴表現の収束を定量的に評価する。
  • 集中不等式(例:補題B.8およびB.9)を用いて、有限幅と無限幅のダイナミクスの乖離をバインドする。
  • フレームワークはソフトQ学習へと拡張され、ソフトQ学習ダイナミクスとの同値性を通じてポリシー勾配法と結びつけられる。

実験結果

リサーチクエスチョン

  • RQ1過パラメータ化された2層ニューラルネットワークを用いたTDおよびQ学習は、平均二乗投影ベルヌーイ誤差(MSPBE)をグローバルに最小化できるか?
  • RQ2このようなネットワークが誘導する特徴表現は、初期化からグローバル最適表現へと進化するのか。NTK領域では表現が固定されたままとなるのとは対照的である。
  • RQ3この平均場フレームワーク下でのTDおよびQ学習の収束速度は何か?
  • RQ4Wasserstein空間上の平均場解析は、非線形関数近似における表現学習の研究をどのように可能にするか?
  • RQ5この分析をソフトQ学習に拡張でき、ポリシー勾配法との関連を明らかにできるか?

主な発見

  • 過パラメータ化された2層ニューラルネットワークを用いたTDおよびQ学習は、特徴表現が初期化から進化する場合でも、MSPBEを部分線形レートでグローバルに最小化する。
  • 誘導される特徴表現はグローバル最適表現に収束し、表現が初期化時に固定されたままとなる従来のNTKベースの結果を一般化する。
  • 平均場解析により、集団分布がWasserstein空間における連続の方程式に従って進化することが示され、有限幅ネットワークの収束解析が可能になる。
  • 一般化された1点単調性条件によりPDE解の収束が保証され、離散化を通じて有限幅ネットワークの特徴表現の進化が定量的に評価可能となる。
  • フレームワークはソフトQ学習へと拡張され、MSPBEをグローバルに最小化することが示され、ソフトQ学習との同値性を通じてポリシー勾配法と接続される。
  • 本分析は、表現が初期化に近いままに保たれないNTK領域を超えた深層強化学習における表現学習の理論的基盤を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。