Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Guidance Rewards with Trajectory-space Smoothing

Tanmay Gangwani, Yuan Zhou|arXiv (Cornell University)|2020. 10. 23.
Reinforcement Learning in Robotics참고 문헌 36인용 수 4
한 줄 요약

이 논문은 흐름 공간 스무딩을 통한 조건부 보상 학습 방법을 제안하여, 환경 보상이 희박하거나 지연될 경우에도 딥 강화학습에서 효율적인 시간적 신용 할당을 가능하게 한다. 전체 궤적 수익을 각 상태-행동 쌍에 균일하게 재분배함으로써, 보조 네트워크를 학습시키지 않고도 조밀한 지도 학습을 제공하며, 단일 및 다중 에이전트 강화학습 알고리즘 전반에서 샘플 효율성이 크게 향상된다.

ABSTRACT

Long-term temporal credit assignment is an important challenge in deep reinforcement learning (RL). It refers to the ability of the agent to attribute actions to consequences that may occur after a long time interval. Existing policy-gradient and Q-learning algorithms typically rely on dense environmental rewards that provide rich short-term supervision and help with credit assignment. However, they struggle to solve tasks with delays between an action and the corresponding rewarding feedback. To make credit assignment easier, recent works have proposed algorithms to learn dense "guidance" rewards that could be used in place of the sparse or delayed environmental rewards. This paper is in the same vein -- starting with a surrogate RL objective that involves smoothing in the trajectory-space, we arrive at a new algorithm for learning guidance rewards. We show that the guidance rewards have an intuitive interpretation, and can be obtained without training any additional neural networks. Due to the ease of integration, we use the guidance rewards in a few popular algorithms (Q-learning, Actor-Critic, Distributional-RL) and present results in single-agent and multi-agent tasks that elucidate the benefit of our approach when the environmental rewards are sparse or delayed.

연구 동기 및 목표

  • 환경 보상이 희박하거나 지연될 경우 딥 강화학습에서 장기적인 시간적 신용 할당 문제를 해결한다.
  • 기존 강화학습 알고리즘과 원활하게 통합되어 샘플 효율성을 향상시키는 방법을 개발한다.
  • 궤적 수익에서 쉽게 계산할 수 있는 지도 보상으로 조밀한 지도 학습을 제공한다.
  • 보상 지연에 대해 불변성을 확보하면서 보조 신경망이나 복잡한 보상 모델링을 요구하지 않는다.
  • 궤적 내 모든 상태-행동 쌍에 총 수익을 균일하게 재분배하여 효과적인 신용 할당을 가능하게 한다.

제안 방법

  • 궤적 공간에서의 스무딩을 포함하는 대체 강화학습 목표를 수립하여 지도 보상을 유도한다.
  • 지난 궤적에 포함된 각 상태-행동 쌍의 기대 수익으로서 지도 보상을 정의함으로써 균일한 신용 할당을 가능하게 한다.
  • 보조 신경망 학습 없이 궤적 수익과 전이 동역학만을 사용하여 지도 보상을 계산한다.
  • Q-러닝, SAC, TD3, 분포 기반-RL과 같은 표준 강화학습 알고리즘에 지도 보상을 통합한다.
  • 지시 보상 함수 하에서 표준 강화학습과 동일한 성질을 유지하여 수렴 성질을 보존한다.
  • 궤적 공간 스무딩을 적용하여 가치 추정을 안정화하고 지연된 보상 환경에서의 신용 할당을 향상시킨다.

실험 결과

연구 질문

  • RQ1궤적 공간 스무딩이 지연된 보상 강화학습에서 효과적인 지도 보상을 생성하여 신용 할당을 향상시킬 수 있는가?
  • RQ2학습된 보상 모델이나 보조 네트워크를 사용하는 기존 방법과 비교해 볼 때 제안된 방법은 어떻게 성능을 내는가?
  • RQ3희박하거나 지연된 환경 보상이 존재하는 환경에서 지도 보상이 학습을 얼마나 빠르게 가속화할 수 있는가?
  • RQ4이 방법은 오프-폴리시 및 분포 기반 방법을 포함한 다양한 표준 강화학습 알고리즘과 호환되는가?
  • RQ5추가 모델 학습 없이도 효율적으로 계산 가능한 지도 보상이 샘플 효율적인 학습을 가능하게 할 수 있는가?

주요 결과

  • 지도 보상은 전체 궤적 수익을 모든 상태-행동 쌍에 균일하게 재분배함으로써 조밀한 지도 학습을 제공하며, 더 나은 가치 추정을 가능하게 한다.
  • 보상 지연이 있는 MuJoCo 이동 작업에서 이 방법은 표준 SAC 및 Q-러닝보다 학습 속도와 샘플 효율성이 크게 향상된다.
  • SAC, TD3, 분포 기반-RL과의 통합은 희박하거나 지연된 보상을 가진 단일 및 다중 에이전트 작업에서 더 빠른 수렴을 이끌어낸다.
  • 학습된 보상 모델을 사용하는 이전 방법들과 비교해 성능이 유사하거나 뛰어나지만, 추가 신경망 학습이 필요하지 않다.
  • 실험 결과 지도 보상은 보상 지연에 대해 강건하며 다양한 환경에서 안정적인 학습을 유지함을 보였다.
  • 이 방법은 기존 강화학습 알고리즘의 아키텍처 변경 없이 쉽게 통합 가능하며, 오프-폴리시 및 온-폴리시 프레임워크와 모두 호환된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.