Skip to main content
QUICK REVIEW

[논문 리뷰] Sequence Modeling of Temporal Credit Assignment for Episodic Reinforcement Learning

Yang Liu, Yunan Luo|arXiv (Cornell University)|2019. 05. 31.
Reinforcement Learning in Robotics참고 문헌 40인용 수 17
한 줄 요약

이 논문은 종료 보상 이외의 보상 신호가 없을 때, 에피소드 기반 강화학습에서 시간에 따라 분포된 밀도 높은 신호로 에피소드 보상을 분해하기 위해 트랜스포머 기반 시퀀스 모델을 사용하는 새로운 딥 강화학습 방법을 제안한다. 자기주의적 주의 기반의 해석 가능한 보상 분해를 통해, 단지 종료 보상만 제공되는 환경에서 무도코 로봇 운동 과제에서 학습 효율성과 샘플 효율성을 크게 향상시킨다.

ABSTRACT

Recent advances in deep reinforcement learning algorithms have shown great potential and success for solving many challenging real-world problems, including Go game and robotic applications. Usually, these algorithms need a carefully designed reward function to guide training in each time step. However, in real world, it is non-trivial to design such a reward function, and the only signal available is usually obtained at the end of a trajectory, also known as the episodic reward or return. In this work, we introduce a new algorithm for temporal credit assignment, which learns to decompose the episodic return back to each time-step in the trajectory using deep neural networks. With this learned reward signal, the learning efficiency can be substantially improved for episodic reinforcement learning. In particular, we find that expressive language models such as the Transformer can be adopted for learning the importance and the dependency of states in the trajectory, therefore providing high-quality and interpretable learned reward signals. We have performed extensive experiments on a set of MuJoCo continuous locomotive control tasks with only episodic returns and demonstrated the effectiveness of our algorithm.

연구 동기 및 목표

  • 에피소드 기반 강화학습에서 유일하게 이용 가능한 최종 수익만 제공되는 지연되거나 희박한 보상 문제를 해결하기 위해.
  • 희박한 보상 신호가 존재하는 환경에서 학습 효율성과 샘플 복잡도를 향상시키기 위해.
  • 딥 시퀀스 모델을 사용하여 시간에 따른 책임 할당을 위한 일반화 가능한 프레임워크를 개발하기 위해.
  • 트랜스포머의 자기주의적 주의 메커니즘을 통해 해석 가능한 보상 분해를 가능하게 하기 위해.
  • 보상 분해된 신호를 사용하여 원인 관계를 위반하지 않으면서도 정확하고 확장 가능한 정책 그래디언트 업데이트를 제공하기 위해.

제안 방법

  • 전체 역사를 기반으로 각 타임스텝에 대한 조밀한 보상 신호를 예측하는 트랜스포머 기반 신경망을 훈련한다.
  • 다중 헤드 자기주의 주의를 사용하여 장거리 의존성을 모델링하고, 인과적(자기회귀적) 마스크를 적용함으로써 과거 상태와 행동에 대해 책임을 할당한다.
  • 보상 분해된 신호를 사용하여 편향 없는 정책 업데이트를 보장하는 일반화된 정책 그래디언트를 계산한다.
  • 보상 회귀가 완벽하지 않을 경우를 대비해 정책 그래디언트에 편향 보정 항을 적용하여 학습 안정성을 향상시킨다.
  • 보상 함수 학습을 향상시키기 위해 후회 경험 재현 및 과거의 고품질 트레이젝터리 사용.
  • 학습된 조밀한 보상 신호를 사용하여 표준 강화학습 알고리즘을 적용하고, 종료 수익만 제공되는 무도코 연속 제어 과제에서 방법을 검증한다.

실험 결과

연구 질문

  • RQ1트랜스포머와 같은 딥 시퀀스 모델이 각 타임스텝에 대해 의미 있는 조밀한 보상 신호로 에피소드 수익을 효과적으로 분해할 수 있는가?
  • RQ2보상 분해에 자기주의 주의 메커니즘을 사용할 경우, 해석 가능성과 책임 할당 정확도가 향상되는가?
  • RQ3희박한 보상 조건에서 표준 강화학습 기준선 대비 학습 속도와 샘플 효율성 측면에서 제안된 방법의 성능은 어떠한가?
  • RQ4다양한 네트워크 아키텍처와 데이터 수집 전략이 보상 분해 모델 성능에 어떤 영향을 미치는가?
  • RQ5보상 회귀가 불완전할 경우 정책 최적화의 안정성을 확보하기 위해 편향 보정이 필수적인가?

주요 결과

  • 무도코 과제에서 학습 효율성과 최종 성능 측면에서 LSTM 및 피드포워드 네트워크보다 트랜스포머 기반 보상 분해가 뛰어난 성능을 보였다.
  • 데이터 수집 과정에서 과거의 고품질 트레이젝터리(HO 전략)를 사용할 경우 보상 학습 성능이 가장 우수했다.
  • 편향 보정은 보상 회귀가 잘 맞지 않을 경우 특히 정책 그래디언트 업데이트의 안정성을 크게 향상시켰다.
  • 트랜스포머의 주의 무게는 어떤 상태-행동 쌍이 최종 수익에 가장 큰 기여를 했는지에 대한 해석 가능한 통찰을 제공했다.
  • 단지 종료 보상만 제공되는 여러 무도코 이동 과제에서 샘플 효율성과 최종 수익 모두에서 상당한 향상을 달성했다.
  • 분해된 보상 신호를 사용한 일반화된 정책 그래디언트가 이론적으로 정확했고, 희박한 지도 신호 조건에서도 안정적인 학습을 가능케 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.