Skip to main content
QUICK REVIEW

[논문 리뷰] Temporal-difference learning with nonlinear function approximation: lazy training and mean field regimes

Andréa Agazzi, Jianfeng Lu|arXiv (Cornell University)|2019. 05. 27.
Reinforcement Learning in Robotics참고 문헌 62인용 수 4
한 줄 요약

이 논문은 마르코프 보상 과정에서 가치 함수 근사에 넓은 신경망을 사용한 시간차분(TD) 학습을 분석하며, 네트워크 가중치가 거의 변화하지 않는 라즈티 학습 제도와 평균장 제도를 비교한다. 라즈티 제도에서는 전역 최소화자나 국소 최소화자로의 지수 수렴을 증명하고, 평균장 제도에서는 모든 고정점이 전역 최소화자임을 보여, 최적의 근사가 보장된다.

ABSTRACT

We discuss the approximation of the value function for infinite-horizon discounted Markov Reward Processes (MRP) with nonlinear functions trained with the Temporal-Difference (TD) learning algorithm. We first consider this problem under a certain scaling of the approximating function, leading to a regime called lazy training. In this regime, the parameters of the model vary only slightly during the learning process, a feature that has recently been observed in the training of neural networks, where the scaling we study arises naturally, implicit in the initialization of their parameters. Both in the under- and over-parametrized frameworks, we prove exponential convergence to local, respectively global minimizers of the above algorithm in the lazy training regime. We then compare this scaling of the parameters to the mean-field regime, where the approximately linear behavior of the model is lost. Under this alternative scaling we prove that all fixed points of the dynamics in parameter space are global minimizers. We finally give examples of our convergence results in the case of models that diverge if trained with non-lazy TD learning, and in the case of neural networks.

연구 동기 및 목표

  • 넓은 신경망을 사용한 가치 함수 근사에 대해 TD 학습의 수렴성과 최적성 분석하기.
  • 가중치 갱신이 작고 모델이 약간 선형적으로 행동하는 라즈티 학습 제도에서 TD 학습에 대한 이론적 보장을 확립하기.
  • 비선형 동역학이 지배하는 평균장 제도와 라즈티 제도를 비교하고, 각각의 수렴성 및 근사 성질을 평가하기.
  • 실제 스케일링 가정 하에 깊은 강화학습의 이론과 실천 간 격차를 메우기 위해 척도가 적용된 수렴 결과 제공하기.
  • 기존의 지식 기반 초과 학습에서의 수렴 결과를 TD 학습에서 일반적인 비강하, 회전 벡터장에 적용하기

제안 방법

  • TD 학습 동역학에 대해 선형 함수 근사에서 비선형, 미분기하학적 설정으로의 수축 조건을 일반화한다.
  • 매개변수 초기화를 스케일링하여 라즈티 학습 제도를 유도하며, 이는 훈련 중 신경망 매개변수가 느리게 변화함을 의미한다.
  • 평균장 이론 기법을 적용하여 넓은 신경망의 비선형 동역학을 평균장 스케일링 제도에서 분석한다.
  • 모든 고정점이 매개변수 동역학의 전역 최소화자임을 보여 평균장 제도에서 전역 최소화자로의 수렴을 증명한다.
  • 기존의 기울기 기반 초과 학습에서의 수렴 결과를 비기울기 기반 TD 학습 프레임워크로 확장하여, 회전 벡터장을 다룬다.
  • 목적 함수로 투영된 TD 오차를 사용하고, 과도한 및 과소 매개변수화 설정 모두에서 수렴성을 분석한다.

실험 결과

연구 질문

  • RQ1넓은 신경망을 사용한 TD 학습이 라즈티 학습 제도에서 수렴하는가, 그리고 어느 정도까지 수렴하는가?
  • RQ2수렴 속도와 근사 품질 측면에서 라즈티 학습 제도는 평균장 제도와 어떻게 비교되는가?
  • RQ3평균장 제도에서 TD 학습 동역학의 모든 고정점이 전역 최소화자인가?
  • RQ4선형 함수 근사의 이론적 수렴 보장 결과를 강화학습에서의 비선형, 넓은 신경망으로 확장할 수 있는가?
  • RQ5초기화 스케일링이 비선형 함수 근사에서 안정적이고 수렴 가능한 훈련을 보장하는 데 어떤 역할을 하는가?

주요 결과

  • 라즈티 학습 제도에서는 과소 매개변수화 케이스에서 국소 최소화자로 지수 수렴하고, 과다 매개변수화 케이스에서는 전역 최소화자로 수렴한다.
  • 라즈티 학습 제도는 기저 마르코프 과정의 가역성과 무관하게 수렴함을 보장하며, 이는 일부 이전 결과와 다름.
  • 평균장 제도에서는 TD 학습 동역학의 모든 고정점이 전역 최소화자이므로, 진정한 가치 함수를 완벽하게 근사함을 의미한다.
  • 모든 정적점이 최적임을 보여 평균장 제도는 라즈티 제도보다 더 강력한 근사 능력을 지닌다.
  • 비기울기 기반 벡터장으로 일반화된 수축 기반 분석을 통해 초과 학습의 수렴 결과를 TD 학습으로 확장하는 이론적 프레임워크를 제공한다.
  • 수치 예제를 통해 수렴 성질을 시연하고, 표준 TD 학습이 발산하는 경우에도 라즈티 제도는 안정적임을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.