Skip to main content
QUICK REVIEW

[논문 리뷰] Nonlinear Distributional Gradient Temporal-Difference Learning

Chao Qu, Shie Mannor|arXiv (Cornell University)|2018. 05. 20.
Model Reduction and Neural Networks참고 문헌 25인용 수 10
한 줄 요약

이 논문은 Cramér 거리(Cramér distance)를 활용하여 가치 기대값이 아닌 가치 분포를 최적화하는 비선형 분포형 보정 시간-차분 학습(gradient temporal-difference learning)의 변종인 분포형 GTD2, TDC, 그리고 Greedy-GQ를 제안한다. 이 알고리즘들은 일반적인 매끄러운 함수 근사기(예: 신경망 포함)를 사용하는 상황에서도 점점 더 거의 확실히 국소 최적점으로 수렴함을 보장하며, 온-폴리시 및 오프-폴리시 설정 모두에서 기존의 비분포형 대응체들보다 뛰어난 안정성과 성능을 보인다.

ABSTRACT

We devise a distributional variant of gradient temporal-difference (TD) learning. Distributional reinforcement learning has been demonstrated to outperform the regular one in the recent study \citep{bellemare2017distributional}. In the policy evaluation setting, we design two new algorithms called distributional GTD2 and distributional TDC using the Cram{é}r distance on the distributional version of the Bellman error objective function, which inherits advantages of both the nonlinear gradient TD algorithms and the distributional RL approach. In the control setting, we propose the distributional Greedy-GQ using the similar derivation. We prove the asymptotic almost-sure convergence of distributional GTD2 and TDC to a local optimal solution for general smooth function approximators, which includes neural networks that have been widely used in recent study to solve the real-life RL problems. In each step, the computational complexities of above three algorithms are linear w.r.t.\ the number of the parameters of the function approximator, thus can be implemented efficiently for neural networks.

연구 동기 및 목표

  • 오프-폴리시 설정에서 비선형 함수 근사기로 확장된 분포형 강화학습을 제안한다.
  • 비선형 함수 근사기를 사용할 경우 오프-폴리시 상황에서 표준 TD 학습의 불안정성을 해결한다.
  • 가치 기대값이 아닌 가치 분포를 학습하는 이론적으로 타당하고 안정적인 알고리즘을 개발한다.
  • 실제 딥 강화학습과 분포형 강화학습의 이론적 수렴 보장 간 격차를 메운다.
  • 수익의 분포 표현을 통해 표본 효율성과 학습 안정성을 향상시킨다.

제안 방법

  • 예측된 가치 분포와 목표 가치 분포 간의 이질성 측정을 위해 Cramér 거리를 사용하는 분포형 벨만 오차 목표를 수립한다.
  • 프로젝션된 Cramér 거리를 최소화할 수 있도록 기울기 시간-차분 프레임워크를 적응시켜 비선형 함수 근사기와의 수렴을 가능하게 한다.
  • Cramér 기반 목표 함수에 대해 확률적 경사 하강법을 적용하여 분포형 GTD2와 TDC를 정의하고 정책 평가를 수행한다.
  • 동일한 Cramér 거리 척도를 사용하여 Greedy-GQ 목표를 분포형 설정으로 확장함으로써 분포형 Greedy-GQ를 제안한다.
  • 신경망을 매끄러운 함수 근사기로 사용하고, 네트워크 파라미터에 대해 선형 계산 복잡도를 확보한다.
  • 실험에서 경험 재생과 오프-폴리시 데이터 수집을 사용하며, 가치 분포를 이산 원자와 소프트맥스 출력층을 통해 표현한다.

실험 결과

연구 질문

  • RQ1이론적 수렴 보장이 있는 비선형 함수 근사기로 분포형 강화학습을 확장할 수 있는가?
  • RQ2비선형 설정에서 분포형 벨만 오차에 Cramér 거리를 최소화하는 것이 평균 제곱 오차보다 더 안정적이고 정확한 학습을 이끌어내는가?
  • RQ3일반적인 매끄러운 함수 근사기 하에서 분포형 GTD2와 TDC가 점점 더 거의 확실히 국소 최적점으로 수렴하는가?
  • RQ4표준 DQN과 C51에 비해 분포형 Greedy-GQ는 표본 효율성과 성능 안정성 측면에서 어떻게 비교되는가?
  • RQ5전체 가치 분포를 학습하는 것이 오프-폴리시 딥 강화학습에서 탐색을 향상시키고 분산을 줄이는가?

주요 결과

  • 비선형 함수 근사기(예: 신경망 포함)를 사용하는 상황에서도 분포형 GTD2와 TDC는 온화한 조건 하에서 거의 확실히 국소 최적점으로 수렴한다.
  • 온-폴리시 및 오프-폴리시 환경 모두에서 비분포형 대응체들에 비해 분포형 변종이 훨씬 낮은 분산과 더 안정적인 학습 곡선을 보인다.
  • CartPole와 LunarLander 환경에서 분포형 Greedy-GQ는 DQN을 초월하고, C51와 동등하거나 略적으로 뛰어난 누적 수익과 안정성을 확보한다.
  • VizDoom 환경에서 분포형 Greedy-GQ는 7,000개의 학습 에피소드 이후 C51를 초월하여 장기적 학습 능력이 뛰어나다는 것을 보여준다.
  • MSPBE 지표를 통해 오프-폴리시 설정에서 분포형 알고리즘은 더 적은 진동과 더 빠른 수렴을 보이며 일관된 성능 향상을 보였다.
  • 이산 원자와 소프트맥스 출력층을 사용한 가치 분포 표현은 다중모달 수익 분포를 효과적으로 모델링하여 학습 안정성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.