Skip to main content
QUICK REVIEW

[논문 리뷰] TIDBD: Adapting Temporal-difference Step-sizes Through Stochastic Meta-descent

Alexandra Kearney, Vivek Veeriah|arXiv (Cornell University)|2018. 04. 10.
Model Reduction and Neural Networks참고 문헌 11인용 수 6
한 줄 요약

TIDBD는 임의의 특성별로 동적으로 학습률을 조정할 수 있는 벡터화된, 적응형 단계 크기 방법을 제안하며, 이는 확률적 메타강하를 통해 시간차(TD) 학습의 단계 크기를 동적으로 조정함으로써 증가 및 감소하는 단계 크기를 모두 가능하게 한다. 이는 정적 또는 스칼라 적응형 방법인 AlphaBound 및 RMSprop와 비교해도 뛰어난 성능을 보이며, 정적 및 비정적 예측 과제에서 하이퍼파rameter 선택에 대한 강건성을 입증한다. 이는 실제 로봇 제어 과제도 포함된다.

ABSTRACT

In this paper, we introduce a method for adapting the step-sizes of temporal difference (TD) learning. The performance of TD methods often depends on well chosen step-sizes, yet few algorithms have been developed for setting the step-size automatically for TD learning. An important limitation of current methods is that they adapt a single step-size shared by all the weights of the learning system. A vector step-size enables greater optimization by specifying parameters on a per-feature basis. Furthermore, adapting parameters at different rates has the added benefit of being a simple form of representation learning. We generalize Incremental Delta Bar Delta (IDBD)---a vectorized adaptive step-size method for supervised learning---to TD learning, which we name TIDBD. We demonstrate that TIDBD is able to find appropriate step-sizes in both stationary and non-stationary prediction tasks, outperforming ordinary TD methods and TD methods with scalar step-size adaptation; we demonstrate that it can differentiate between features which are relevant and irrelevant for a given task, performing representation learning; and we show on a real-world robot prediction task that TIDBD is able to outperform ordinary TD methods and TD methods augmented with AlphaBound and RMSprop.

연구 동기 및 목표

  • TD 학습에서 수동적인 단계 크기 조정 문제를 해결함으로써 성능과 일반화에 미치는 영향을 최소화하고자 한다.
  • 비정적 특성에 내재된 비정적 특성을 다룰 수 있도록 동적으로 단계 크기를 조정할 수 있는 방법을 개발하고자 한다. 이는 증가 및 감소하는 단계 크기를 모두 허용한다.
  • 이전에 지도학습에서 IDBD를 통해 사용된 벡터화된 단계 크기 적응 기법을 TD 학습으로 확장함으로써 특성별 학습률 최적화를 가능하게 하고자 한다.
  • 다른 특성들에 비해 관련성이 있는 특성과 없는 특성들을 구분함으로써 암묵적 표현 학습이 가능한지 평가하고자 한다.
  • 실제 로봇 예측 과제에서 TIDBD가 표준 TD 및 기존의 적응형 방법보다 뛰어난 성능을 보임을 입증하고자 한다.

제안 방법

  • IDBD(증분 델타 바 데이타)를 TD 학습으로 일반화하여 TIDBD(Temporal-difference IDBD)를 개발하였으며, 단계 크기의 확률적 메타강하를 사용한다.
  • 각 특성별로 하나씩 할당된 단계 크기의 벡터를 사용함으로써 특성별 적응이 가능하며, 이는 차별화된 학습률을 통해 표현 학습을 가능하게 한다.
  • 최근의 가중치 갱신 간 상관관계를 기반으로 한 메타기울기 갱신 규칙을 사용하여 각 특성의 단계 크기를 조정함으로써 동적 적응을 실현한다.
  • 유인도트레이스(누적형 및 교체형)를 통합하여 상태 간에 책임을 전파하면서도, 갱신의 시간적 상관관계를 기반으로 단계 크기를 적응적으로 조정한다.
  • 단계 크기 적응 속도를 제어하는 메타파rameter θ를 도입하였으며, λ 및 θ 값에 따른 민감도 분석을 수행하였다.
  • 가중치 갱신이 높은 상관관계를 보일 경우를 감지하기 위한 상관관계 기반 메커니즘을 사용하여, 안정적인 갱신 패턴을 보이는 특성의 단계 크기를 감소시킨다.

실험 결과

연구 질문

  • RQ1TD 학습에 대해 벡터화된 적응형 단계 크기 방법이 정적 및 비정적 환경 모두에서 고정 또는 스칼라 적응형 단계 크기를 사용하는 표준 TD보다 뛰어난 성능을 보일 수 있는가?
  • RQ2TIDBD의 특성별 단계 크기 적응이 관련성이 있는 특성에 더 높은 학습률을 할당함으로써 암묵적 표현 학습을 가능하게 하는가?
  • RQ3TIDBD의 성능은 표준 TD가 학습률 α에 민감한 것과 비교해 메타파rameter θ의 선택에 얼마나 민감한가?
  • RQ4TIDBD는 표준 기반 방법인 TD, AlphaBound, RMSprop와 비교해 실제 로봇 예측 과제에서 뛰어난 성능을 달성할 수 있는가?
  • RQ5누적형 대비 교체형 유인도트레이스 방법을 사용할 경우, TIDBD의 안정성 및 수렴 특성은 어떻게 되는가?

주요 결과

  • TIDBD는 모든 테스트 환경에서 최적화된 정적 단계 크기를 사용한 일반 TD보다 뛰어난 성능을 보였다. 이는 정적 예측 과제도 포함된다.
  • 비정적 과제에서는 TIDBD가 변화하는 동역학을 보완하기 위해 단계 크기를 성공적으로 적응시켰으며, 비정적 특성에 대한 강건성을 입증하였다.
  • TIDBD는 관련 있는 특성과 관련이 없는 특성 간을 구분하여 관련 있는 특성에 더 높은 학습률을 할당함으로써 암묵적 표현 학습을 수행하였다.
  • 실제 로봇 예측 과제에서는 TIDBD가 표준 TD 및 스칼라 적응형 방법인 AlphaBound 모두의 모든 파라미터 설정에서 뛰어난 성능을 보였다.
  • TIDBD는 평균 오차의 분산이 현저히 낮고, 표준 TD가 학습률 α에 민감한 것과 비교해 메타파라미터 θ에 대한 민감도가 감소하였다.
  • 교체형 트레이스를 사용할 경우, 최적의 메타단계 크기가 아니더라도 최적화된 TD 방법과 비교해 유사하거나 더 뛰어난 성능을 달성하였다. 다만, 누적형 트레이스에서는 λ 값이 높을 경우 불안정성이 발생할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.