Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Exponentially Discounted Sum: Automatic Learning of Return Function

Yufei Wang, Qiwei Ye|arXiv (Cornell University)|2019. 05. 28.
Reinforcement Learning in Robotics참고 문헌 36인용 수 4
한 줄 요약

이 논문은 강화학습에서 표준 지수 감소 합을 넘어서 최적의 수익 함수를 자동으로 발견하기 위한 메타학습 접근법을 제안한다. 트랜스포머 기반 계수 예측기로 궤적 보상의 학습 가능한 선형 조합으로 수익을 모델링함으로써, 미로 및 아케이드 게임과 같은 희박한 보상 환경에서 학습 속도를 향상시킨다. 실험 결과는 지연 보상 설정에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

In reinforcement learning, Return, which is the weighted accumulated future rewards, and Value, which is the expected return, serve as the objective that guides the learning of the policy. In classic RL, return is defined as the exponentially discounted sum of future rewards. One key insight is that there could be many feasible ways to define the form of the return function (and thus the value), from which the same optimal policy can be derived, yet these different forms might render dramatically different speeds of learning this policy. In this paper, we research how to modify the form of the return function to enhance the learning towards the optimal policy. We propose to use a general mathematical form for return function, and employ meta-learning to learn the optimal return function in an end-to-end manner. We test our methods on a specially designed maze environment and several Atari games, and our experimental results clearly indicate the advantages of automatically learning optimal return functions in reinforcement learning.

연구 동기 및 목표

  • 희박한 보상 상황에서 지수 감소에 기반한 고정된 수익 함수의 한계를 해결하기 위해.
  • 지수 감소를 넘어서 더 효과적인 수익 함수 형태를 학습함으로써 정책 학습 속도를 높일 수 있는지 조사하기 위해.
  • 메타기울기 최적화를 사용해 수익 함수의 구조를 종합적으로 학습하는, 엔드 투 엔드로 구현 가능한 미분 가능한 방법을 개발하기 위해.
  • 궤적 인식 수익 함수가 보다 효과적으로 신용을 재분배함으로써 어려운 강화학습 환경에서 수렴 속도를 높이는지 확인하기 위해.

제안 방법

  • 일반적인 수익 함수 형태를 제안: $ G^{g}(s_t, a_t) = \sum_{t=0}^{T} \beta_t r_t $, 여기서 계수 $ \beta_t $ 는 전체 궤적에서 동적으로 예측된다.
  • 트랜스포머 기반 네트워크를 사용해 계수 $ \beta_t $ 를 계산함으로써 궤적 내 상태와 보상 간의 관계적 추론을 가능하게 한다.
  • 메타학습(특히 메타기울기 하강법)을 사용해 수익 함수의 파라미터를 최적화함으로써 후속 정책이 더 빨리 학습하도록 한다.
  • 학습된 수익 함수를 액터-크리틱 프레임워크(A2C)에 통합하며, 가치 함수는 메타학습된 수익을 예측하도록 훈련된다.
  • 수익 함수를 미분 가능한 모듈로 간주해 수익 계산 과정을 통해 역전파를 수행하고 계수 네트워크를 업데이트할 수 있도록 한다.
  • 각 환경에 최적의 설정을 찾기 위해 하이퍼파rameter(학습률 및 궤적 길이)를 탐색한다.

실험 결과

연구 질문

  • RQ1지수 감소보다 더 효과적으로 신용을 재분배하는 수익 함수가 강화학습에서 정책 학습 속도를 높일 수 있는가?
  • RQ2메타학습을 사용해 엔드 투 엔드 방식으로 최적의 수익 함수 형태를 자동으로 학습할 수 있는가?
  • RQ3궤적 인식형 비지수 수익 함수는 희박하거나 지연된 보상을 가진 환경에서 학습 속도에 어떤 영향을 미치는가?
  • RQ4제안된 방법은 보상 희박성 수준이 다른 환경(예: 미로 및 아케이드 게임) 간에 일반화 가능한가?

주요 결과

  • 특별히 설계된 미로 환경에서 제안된 RGM 방법은 기존 A2C와 표준 지수 감소 방식보다 뚜렷하게 빠른 학습 속도를 보였으며, 특히 초기 학습 단계에서 두각을 나타냈다.
  • 미로 환경에서 학습된 수익 함수는 거의 모든 가중치를 최종 지연 보상에 집중시켜 이전 상태로 학습 신호를 거의 손실 없이 전달할 수 있었다.
  • 지연 보상을 가진 아케이드 게임(Frostbite, Bowling 등)에서 A2C + RGM은 기존 A2C와 LIRPG보다 뚜렷한 성능 향상을 보이며 더 빠른 수렴을 보였다.
  • 즉각적인 밀도 높은 보상이 존재하는 게임(Space Invaders, Breakout 등)에서는 메서드가 경쟁력 있는 성능 유지를 보이며 보상 희박성 수준에 관계없이 안정성을 확보했다.
  • 시험한 10개의 아케이드 게임 중 7개에서 기준 A2C보다 뛰어난 성능를 보였으며, 원래 수익 함수가 지연된 신용 할당 문제로 어려움을 겪는 환경에서 성능 향상이 가장 두드러졌다.
  • 시각화 결과는 RGM이 정확한 경로의 최종 보상에 높은 계수를 할당하는 것을 확인했고, 지수 기반 기준 대비 이 신호가 시간이 지남에 따라 기하급수적으로 감쇠되는 것을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.