Skip to main content
QUICK REVIEW

[논문 리뷰] Predecessor Features

Duncan Bailey, Marcelo G. Mattar|arXiv (Cornell University)|2022. 06. 01.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 예측 특징(Predecessor Features)을 도입하며, 최근 상태에만 한정되지 않고 과거 상태의 기대 할인 특징의 합을 학습함으로써 신용 할당을 확장하는 부트스트랩된 시간차분 학습 방법을 제안한다. 후속자기 표현을 활용해 TD 오차를 관련된 이전 상태로 전파함으로써, 표본화된 환경과 함수 근사 설정 모두에서 학습 속도를 향상시키고 가치 함수 근사 성능을 향상시킨다. 이는 격자 세계 및 딥 강화 학습 과제에서 표준 TD(λ) 및 관련 방법들을 능가한다.

ABSTRACT

Any reinforcement learning system must be able to identify which past events contributed to observed outcomes, a problem known as credit assignment. A common solution to this problem is to use an eligibility trace to assign credit to recency-weighted set of experienced events. However, in many realistic tasks, the set of recently experienced events are only one of the many possible action events that could have preceded the current outcome. This suggests that reinforcement learning can be made more efficient by allowing credit assignment to any viable preceding state, rather than only those most recently experienced. Accordingly, we examine ``Predecessor Features'', the fully bootstrapped version of van Hasselt's ``Expected Trace'', an algorithm that achieves this richer form of credit assignment. By maintaining a representation that approximates the expected sum of past occupancies, this algorithm allows temporal difference (TD) errors to be propagated accurately to a larger number of predecessor states than conventional methods, greatly improving learning speed. The algorithm can also be naturally extended from tabular state representation to feature representations allowing for increased performance on a wide range of environments. We demonstrate several use cases for Predecessor Features and compare its performance with other approaches.

연구 동기 및 목표

  • 표준 TD 학습에서의 유효 기간 추적의 한계를 해결하기 위해, 최근 사건 뿐 아니라 타당한 이전 상태에도 신용 할당을 가능하게 하기 위해.
  • 후속자기 표현과 유효 기간 추적 간의 관계를 체계화함으로써 더 풍부한 신용 할당 메커니즘을 도출하기 위해.
  • 직접 예측된 할인된 이전 상태 특징의 합을 학습하는 완전히 부트스트랩된 알고리즘인 예측 특징(Predecessor Features)을 개발하기 위해.
  • 표본화된 환경과 딥 강화 학습 환경에서 가치 함수 근사 성능 향상에 기여하는 학습 효율성과 정확도 향상을 입증하기 위해.
  • 예측 특징을 반-하스텔트의 기대 추적(Expected Trace) 알고리즘의 특수 케이스로 설정함으로써 더 넓은 적용 가능성을 확보하기 위해.

제안 방법

  • 이 방법은 후속자기 표현(SR)을 사용하여 주어진 상태에서 향후 상태의 기대 할인 점유율을 계산함으로써, 관련된 과거 상태로 TD 오차를 뒤로 전파할 수 있도록 한다.
  • 표본화된 알고리즘인 TD-PR을 도입하며, 이는 SR을 근사하는 행렬 Ψ를 유지하고, 이를 통해 이전 상태의 유효 기간 추적을 통해 TD 오차를 전파한다.
  • 함수 근사의 경우, 별도의 가중치 행렬 Ψ를 통해 이전 상태의 특징 기반 표현을 학습하는 선형 TD-PF를 제안한다. 이는 경사 하강법을 사용해 업데이트된다.
  • 예측된 이전 상태 특징 zθ(S_t) = Ψx(S_t)를 유효 기간 추적으로 사용함으로써, 업데이트를 부트스트랩화하고, 최근 상태가 아니더라도 관련된 상태로 오차 전파를 가능하게 한다.
  • 두 가지 학습률을 사용한다: 가치 함수 가중치 w에 대한 α와 이전 상태 특징 행렬 Ψ에 대한 β로, 가치와 이전 상태 표현의 독립적 최적화를 가능하게 한다.
  • 이 방법은 수학적으로 범-하스텔트의 기대 추적(ET) 알고리즘의 특수 케이스이며, η=1일 때 성립함을 증명함으로써 완전히 부트스트랩되고 효율적인 알고리즘이다.

실험 결과

연구 질문

  • RQ1최근 상태 외의 타당한 이전 상태로도 TD 오차를 전파함으로써 시간차분 학습의 신용 할당을 향상시킬 수 있는가?
  • RQ2후속자기 표현을 어떻게 수정하여 할인된 이전 상태의 기대 합을 표현함으로써 더 효과적인 신용 할당을 달성할 수 있는가?
  • RQ3표본화된 환경과 딥 강화 학습 환경 모두에서 예측 특징이 표준 TD(λ) 및 기대 추적 방법보다 성능 향상을 보이는가?
  • RQ4예측 특징의 부트스트랩 특성은 비부트스트랩 대비 학습 안정성과 수렴 속도에 어떤 영향을 미치는가?
  • RQ5함수 근사와 함께 예측 특징을 효과적으로 구현할 수 있으며, 고차원 상태 공간에서도 성능 향상이 유지되는가?

주요 결과

  • 모든 테스트된 하이퍼파rameter 설정에서, 특히 α-m 값이 낮을 때, Plinko(Pachinko) 격자 세계 과제에서 TD-PR은 TD(λ)보다 수렴 속도와 정확도에서 뛰어나다.
  • 딥 네트워크 함수 근사를 사용하는 카트폴 환경에서, 예측 특징 알고리즘은 비부트스트랩 기대 추적(ET) 방법보다 약간 뛰어난 성능을 보이며, 더 높은 샘플 효율성을 입증한다.
  • 학습률이 중간 수준(0.1)일 때, 예측 특징 알고리즘은 TD(λ)보다 진짜 가치 함수에 더 빨리 수렴한다.
  • 표본화된 경우에 이 방법은 SR 행렬을 성공적으로 학습하며, Ψ 행렬이 진짜 후속자기 표현을 근사하고 관련된 이전 상태로 정확한 신용 할당을 가능하게 한다.
  • 예측 특징 알고리즘은 반-하스텔트의 기대 추적 알고리즘과 η=1일 때 정확히 동일하므로, 이론적 기반을 확인하고 완전히 부트스트랩된 신용 할당에 대한 적용 가능성을 확장한다.
  • 예측 특징은 몬테카를로 방법보다 가치 함수 근사에서 분산을 줄이며, 낮은 분산 업데이트를 유지함으로써 더 안정적인 학습을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.