Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning

Yang Long, Minhao Shi|arXiv (Cornell University)|2018. 02. 09.
Reinforcement Learning in Robotics참고 문헌 12인용 수 5
한 줄 요약

이 논문은 다단계 시간차분 학습과 임계 추적을 결합한 통합 알고리즘 Q(σ,λ)를 제안한다. 이는 완전 샘플링(σ=1, Sarsa(λ))과 순수 기대값(σ=0, Qπ(λ)) 방법 사이의 연속적인 트레이드오프를 가능하게 한다. 극단적인 σ 값보다 최적의 σ 값에서 더 빠른 수렴을 이룩하며, 이론적 수렴 보장과 실험적 검증을 통해 중간 σ 값에서 뛰어난 성능을 보였다.

ABSTRACT

Recently, a new multi-step temporal learning algorithm, called $Q(σ)$, unifies $n$-step Tree-Backup (when $σ=0$) and $n$-step Sarsa (when $σ=1$) by introducing a sampling parameter $σ$. However, similar to other multi-step temporal-difference learning algorithms, $Q(σ)$ needs much memory consumption and computation time. Eligibility trace is an important mechanism to transform the off-line updates into efficient on-line ones which consume less memory and computation time. In this paper, we further develop the original $Q(σ)$, combine it with eligibility traces and propose a new algorithm, called $Q(σ,λ)$, in which $λ$ is trace-decay parameter. This idea unifies Sarsa$(λ)$ (when $σ=1$) and $Q^π(λ)$ (when $σ=0$). Furthermore, we give an upper error bound of $Q(σ,λ)$ policy evaluation algorithm. We prove that $Q(σ,λ)$ control algorithm can converge to the optimal value function exponentially. We also empirically compare it with conventional temporal-difference learning methods. Results show that, with an intermediate value of $σ$, $Q(σ,λ)$ creates a mixture of the existing algorithms that can learn the optimal value significantly faster than the extreme end ($σ=0$, or $1$).

연구 동기 및 목표

  • Sarsa(λ)와 Qπ(λ)를 연속적인 샘플링 파라미터 σ를 사용한 단일 프레임워크로 통합하기 위해.
  • 다단계 TD 학습의 메모리 및 계산 비용을 임계 추적을 통합함으로써 감소시키기 위해.
  • 새로운 알고리즘 하에서 정책 평가에 대한 이론적 수렴성과 오차 한계를 확립하기 위해.
  • 중간 σ 값이 σ=0 또는 σ=1보다 학습 속도와 최종 성능에서 뛰어나다는 것을 실험적으로 검증하기 위해.

제안 방법

  • 다단계 TD 학습에서 완전 샘플링(σ=1)과 순수 기대값(σ=0) 접근 방식을 통합하기 위해 혼합 샘플링 연산자를 도입한다.
  • σ에 따라 확장된 Q(σ)를 λ 감쇠 파라미터를 포함한 임계 추적을 통합함으로써 Q(σ,λ)라는 새로운 알고리즘을 제안한다.
  • 임계 추적을 사용해 효율적인 온라인 업데이트를 가능하게 하여 오프라인 다단계 방법 대비 메모리 및 계산 오버헤드를 감소시킨다.
  • 약한 가정 하에서 Q(σ,λ) 정책 평가 변형에 대한 상한 오차 한계를 유도한다.
  • 표준 학습 조건 하에서 Q(σ,λ) 제어 버전이 최적의 가치 함수 q*로 지수 수렴함을 증명한다.
  • 연속 상태 공간에서 함수 근사에 타일 코딩을 사용하고, 실험에서 성능 곡선을 부드럽게 하기 위해 이동 평균을 적용한다.

실험 결과

연구 질문

  • RQ1임계 추적은 Q(σ) 프레임워크와 효과적으로 통합되어 계산 비용을 줄이면서도 성능 유지를 할 수 있는가?
  • RQ2통합된 Q(σ,λ) 알고리즘이 극단적인 σ 값(σ=0 또는 σ=1)보다 더 빠른 학습 속도와 더 나은 최종 성능을 달성하는가?
  • RQ3Q(σ,λ) 프레임워크에서 정책 평가의 이론적 오차 한계는 무엇인가?
  • RQ4Q(σ,λ) 제어 알고리즘이 표준 학습 조건 하에서 최적의 가치 함수 q*로 수렴하는가?

주요 결과

  • 마운틴 카 제어 과제에서 중간 σ 값(예: σ=0.5)을 사용한 Q(σ,λ)가 σ=0과 σ=1보다 유의미하게 더 빠른 학습을 보였다.
  • 50 에피소드 후, Q(σ=0.5,λ)의 평균 수익은 -195.99였으며, Qπ(λ)의 -193.56과 Sarsa(λ)의 -196.84를 모두 뛰어넘었다.
  • 200 에피소드 후, Q(σ=0.5,λ)는 평균 수익 -143.71을 달성하여 Qπ(λ)의 -144.04와 Sarsa(λ)의 -145.72를 모두 초월했다.
  • 동적 σ 변형(σ가 0에서 1로 변하는 경우)은 200 에피소드 후 평균 수익 -142.62로 최고의 최종 성능을 기록했다.
  • Q(σ,λ) 정책 평가의 상한 오차 한계가 도출되었고, 실험적으로 검증되어 σ가 1에서 0으로 감소할수록 오차가 감소하는 것으로 나타났다.
  • 이론적 분석을 통해 온라인 및 오프라인 Q(σ,λ) 제어 알고리즘이 확률 1로 최적의 가치 함수 q*로 수렴함을 증명했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.