Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Long-Term Reward Redistribution via Randomized Return Decomposition

Zhizhou Ren, Ruihan Guo|arXiv (Cornell University)|2021. 11. 26.
Reinforcement Learning in Robotics인용 수 9
한 줄 요약

이 논문은 희박하고 지연된 보상이 있는 에피소드 기반 강화 학습에서 조밀한 프록시 보상 학습을 위한 확장 가능한 방법인 랜덤라이즈드 리턴 분해(RRD)를 제안한다. 무작위 부분 시퀀스 세그먼트로부터 궤적의 리턴을 재구성하도록 보상 모델을 훈련시킴으로써 RRD는 미니배치 최적화를 가능하게 하고, MuJoCo 벤치마크에서 기존 방법들에 비해 뚜렷한 성능 향상을 이룬다. 이는 이론적으로 탄탄한, 효율적인 기존 리턴 분해 방법의 대안을 제공한다.

ABSTRACT

Many practical applications of reinforcement learning require agents to learn from sparse and delayed rewards. It challenges the ability of agents to attribute their actions to future outcomes. In this paper, we consider the problem formulation of episodic reinforcement learning with trajectory feedback. It refers to an extreme delay of reward signals, in which the agent can only obtain one reward signal at the end of each trajectory. A popular paradigm for this problem setting is learning with a designed auxiliary dense reward function, namely proxy reward, instead of sparse environmental signals. Based on this framework, this paper proposes a novel reward redistribution algorithm, randomized return decomposition (RRD), to learn a proxy reward function for episodic reinforcement learning. We establish a surrogate problem by Monte-Carlo sampling that scales up least-squares-based reward redistribution to long-horizon problems. We analyze our surrogate loss function by connection with existing methods in the literature, which illustrates the algorithmic properties of our approach. In experiments, we extensively evaluate our proposed method on a variety of benchmark tasks with episodic rewards and demonstrate substantial improvement over baseline algorithms.

연구 동기 및 목표

  • 에피소드 기반 강화 학습에서 한 번의 궤적당 하나의 리턴 신호만 수신하는 희박하고 지연된 보상 환경에서의 학습 과제를 해결한다.
  • 보상 설계가 잘못되었을 경우 예상치 못한 행동을 유도할 수 있는 수동적 보상 형태의 한계를 극복한다.
  • 진정한 환경 리턴을 근사하는 조밀한 프록시 보상을 학습하기 위한 확장 가능하고 샘플 효율적인 방법을 개발한다.
  • 리턴 분해를 서브스트레이트 최적화 문제로 재정의함으로써 장거리 환경에서 효과적인 신용 할당을 가능하게 한다.
  • 랜덤라이즈드 구현의 이론적 근거와 기존 방법들인 균일 보상 재분배와의 연결 고리를 제공한다.

제안 방법

  • 무작위 부분 시퀀스에서 상태-행동 쌍의 부분 집합으로부터 전체 궤적 리턴을 예측하는 보상 모델을 학습하는 서브스트레이트 최적화 문제를 제안한다.
  • 장거리 환경 작업에 대해 최소 제곱 기반 리턴 분해를 확장하기 위해 몬테카를로 샘플링을 사용한다.
  • 프록시 보상이 작은 무작위 궤적 단계 집합으로부터 총 리턴을 약간씩 재구성해야 한다는 구조적 제약 조건을 설정한다.
  • 미니배치 최적화를 통해 보상 모델을 훈련시켜 효율적이고 확장 가능한 학습을 가능하게 한다.
  • 이론적 분석을 통해 서브스트레이트 손실이 원래의 결정론적 리턴 분해 손실의 상한임을 보여준다.
  • RRD와 균일 보상 재분배 간의 연결 고리를 확립하고, 서브스트레이트 갭을 제어할 수 있음을 보여준다.

실험 결과

연구 질문

  • RQ1리턴 분해에 대해 부분 시퀀스 기반의 랜덤라이즈드 접근 방식은 장거리 에피소드 기반 강화 학습에서 확장성 향상에 기여할 수 있는가?
  • RQ2RRD의 서브스트레이트 손실은 원래의 결정론적 리턴 분해 목표와 어떻게 관련이 있는가?
  • RQ3보상 모델 훈련에서 랜덤 부분 시퀀스 샘플링을 사용하는 데 이론적 근거는 무엇인가?
  • RQ4장거리 환경 벤치마크에서 기존의 프록시 보상 학습 방법들에 비해 RRD의 성능과 샘플 효율성은 어떻게 비교되는가?
  • RQ5RRD는 전문가가 설계한 보상 함수에 의존도를 줄이며 성능을 유지하거나 향상시킬 수 있는가?

주요 결과

  • RRD는 희박한 보상이 주어지는 MuJoCo 벤치마크 작업 세트에서 기존 알고리즘들에 비해 뚜렷한 성능 향상을 이룬다.
  • 제안된 방법은 리턴 분해를 위한 효과적인 미니배치 훈련을 가능하게 하여 장거리 문제에 대한 확장성을 크게 향상시킨다.
  • 서브스트레이트 손실 함수가 원래의 결정론적 리턴 분해 손실의 상한임을 이론적으로 입증하여 탄탄한 최적화 기반을 제공한다.
  • RRD는 균일 보상 재분배와 연결되며, 서브스트레이트 갭을 제어할 수 있어 더 높은 강인성을 확보할 수 있다.
  • 경험적 결과는 RRD가 장거리 제어 작업에서 기존 방법들보다 학습 효율성과 최종 성능 모두에서 뛰어나다는 것을 보여준다.
  • 이 방법은 희박한 보상을 효과적으로 조밀하고 정보가 풍부한 프록시 보상으로 재분배하여 보다 효과적인 정책 최적화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.