Skip to main content
QUICK REVIEW

[논문 리뷰] Sample Complexity and Overparameterization Bounds for Projection-Free Neural TD Learning.

Semih Çaycı, Siddhartha Satpathi|arXiv (Cornell University)|2021. 03. 02.
Stochastic Gradient Optimization Techniques참고 문헌 17인용 수 4
한 줄 요약

이 논문은 두 층의 ReLU 네트워크를 사용한 신경 TD 학습의 투영 없는 수렴 분석을 제시한다. 네트워크의 너비가 다항식(ū, 1/ε)을 초과할 경우, 이 방법은 다항식(ū, 1/ε) 반복 또는 샘플 이내에 진짜 가치 함수로 ε 오차 이내로 수렴함을 보여준다. 분석은 레이지 학습 영역에서 네트워크 파라미터의 드리프트 분석에 기반하며, 투영 단계가 필요 없음을 보장한다.

ABSTRACT

We study the dynamics of temporal-difference learning with neural network-based value function approximation over a general state space, namely, \emph{Neural TD learning}. Existing analysis of neural TD learning relies on either infinite width-analysis or constraining the network parameters in a (random) compact set; as a result, an extra projection step is required at each iteration. This paper establishes a new convergence analysis of neural TD learning \emph{without any projection}. We show that the projection-free TD learning equipped with a two-layer ReLU network of any width exceeding $poly(\overline{ u},1/\epsilon)$ converges to the true value function with error $\epsilon$ given $poly(\overline{ u},1/\epsilon)$ iterations or samples, where $\overline{ u}$ is an upper bound on the RKHS norm of the value function induced by the neural tangent kernel. Our sample complexity and overparameterization bounds are based on a drift analysis of the network parameters as a stopped random process in the lazy training regime.

연구 동기 및 목표

  • 투영 단계가 필요 없도록 신경 TD 학습의 수렴성을 투영 없이 분석함으로써 투영 단계의 필요성을 제거하는 것.
  • 두 층의 ReLU 네트워크를 사용한 신경 TD 학습에서 샘플 복잡도 및 과다 매개변수화 한계를 설정하는 것.
  • 레이지 학습 영역에서 네트워크 파라미터의 역동성을 정지된 랜덤 과정으로 분석하는 것.
  • 최소한의 넓이 및 반복 요구 조건을 사용하여 진짜 가치 함수로 ε 오차 이내로 수렴 보장을 제공하는 것.

제안 방법

  • 분석은 레이지 학습 영역에서 정지된 랜덤 과정으로 모델링된 네트워크 파라미터의 드리프트 분석을 활용한다.
  • 이 방법은 신경 접선 커널(NTK)을 활용하여 가치 함수의 RKHS 노름을 ū로 유 bounds 한다.
  • 스토케스틱 경량 하강 업데이트 하에 파라미터 드리프트를 분석함으로써 투영 없이 수렴을 확립한다.
  • 네트워크의 너비가 다항식(ū, 1/ε)을 초과할 경우 충분히 크며, 이는 ε 정확도로의 수렴을 보장한다.
  • 일반적인 상태 공간에서 시간 차분 학습과 신경 함수 근사법을 사용하여 수렴을 증명한다.
  • 제한적인 컴팩트 매개변수 집합이나 무한한 넓이 가정을 피함으로써 실용적 적용 가능성을 높인다.

실험 결과

연구 질문

  • RQ1실제 과다 매개변수화 조건 하에서 신경 TD 학습이 투영 단계 없이 수렴할 수 있는가?
  • RQ2투영 없이 신경 TD 학습에서 ε 정확도를 달성하기 위해 필요한 네트워크 너비는 얼마인가?
  • RQ3샘플 복잡도가 RKHS 노름 한계 ū 및 목표 오차 ε에 대해 어떻게 스케일링되는가?
  • RQ4신경 접선 커널은 어떻게 투영 없는 수렴을 가능하게 하는가?
  • RQ5레이지 영역에서 네트워크 파라미터의 드리프트 분석이 진짜 가치 함수로의 수렴을 보장할 수 있는가?

주요 결과

  • 두 층의 ReLU 네트워크를 사용한 신경 TD 학습은 어떤 투영 단계 없이도 진짜 가치 함수로 ε 오차 이내로 수렴한다.
  • 필요한 네트워크 너비는 다항식(ū, 1/ε)으로 유 bounds 되며, 여기서 ū는 NTK를 통한 가치 함수의 RKHS 노름 상한이다.
  • 필요한 반복 수 또는 샘플 수는 다항식(ū, 1/ε)이며, 이는 효율적인 샘플 복잡도를 입증한다.
  • 수렴은 레이지 영역에서 정지된 랜덤 과정으로 모델링된 네트워크 파라미터의 드리프트 분석을 통해 달성된다.
  • 무한한 넓이 또는 컴팩트 매개변수 집합 가정을 피함으로써 실용적 관련성을 향상시킨다.
  • 이 방법은 명시적인 샘플 및 너비 한계를 제공하며, 신경 TD 학습에 대해 투영 없는 수렴 보장을 처음으로 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.