Skip to main content
QUICK REVIEW

[논문 리뷰] Monte Carlo Augmented Actor-Critic for Sparse Reward Deep Reinforcement Learning from Suboptimal Demonstrations

Albert Wilcox, Ashwin Balakrishna|arXiv (Cornell University)|2022. 10. 14.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 몽테카를로 보정 강화학습 기반의 액터-크리틱 알고리즘인 MCAC를 제안한다. MCAC는 하이퍼파rameter가 없는 개선 방식으로, 보상이 희박한 환경에서 샘플 효율성을 높이기 위해 하위 최적의 시연 데이터로 경험 재생 버퍼를 초기화하고, 표준 시간 차분 목표값과 몽테카를로 보상-도착( reward-to-go) 추정치의 최댓값을 이용해 수정된 Q-값을 계산한다. MCAC는 다섯 개의 연속 제어 과제에서 여섯 가지 표준 및 이뮬레이션 학습 강화학습 알고리즘에 대해 학습 속도를 크게 향상시키며, 기존 기준 방법이 실패하는 상황에서도 신뢰할 수 있는 과제 완수를 가능하게 한다.

ABSTRACT

Providing densely shaped reward functions for RL algorithms is often exceedingly challenging, motivating the development of RL algorithms that can learn from easier-to-specify sparse reward functions. This sparsity poses new exploration challenges. One common way to address this problem is using demonstrations to provide initial signal about regions of the state space with high rewards. However, prior RL from demonstrations algorithms introduce significant complexity and many hyperparameters, making them hard to implement and tune. We introduce Monte Carlo Augmented Actor Critic (MCAC), a parameter free modification to standard actor-critic algorithms which initializes the replay buffer with demonstrations and computes a modified $Q$-value by taking the maximum of the standard temporal distance (TD) target and a Monte Carlo estimate of the reward-to-go. This encourages exploration in the neighborhood of high-performing trajectories by encouraging high $Q$-values in corresponding regions of the state space. Experiments across $5$ continuous control domains suggest that MCAC can be used to significantly increase learning efficiency across $6$ commonly used RL and RL-from-demonstrations algorithms. See https://sites.google.com/view/mcac-rl for code and supplementary material.

연구 동기 및 목표

  • 희박한 보상 함수를 가진 딥 강화학습에서 샘플 비효율성 문제를 해결하기 위해.
  • 복잡한 알고리즘 구성 요소를 추가하지 않고도 희박한 보상 환경에서의 탐색 및 학습 효율성을 향상시키기 위해.
  • 기존 액터-크리틱 알고리즘을 보완하기 위해 추가 하이퍼파rameter가 필요 없는 단순하고 즉시 적용 가능한 방법을 개발하기 위해.
  • 보상이 희박한 상황에서 표준 강화학습 및 이뮬레이션 학습 강화학습 알고리즘의 수렴 속도 향상과 성능 향상을 달성하기 위해.

제안 방법

  • 하위 최적의 전문가 시연 데이터 세트로 경험 재생 버퍼를 초기화하여, 초기 정책 및 가치 함수 신호를 제공한다.
  • 크리틱 업데이트 중 표준 시간 차분(TD) 목표값과 보상-도착의 몽테카를로 추정치 중 최댓값을 취해 Q-값 목표를 수정한다.
  • 성공적인 트레이젝터리에서 유도되는 장기적 밀도 보상의 효과를 이전 상태로 더 잘 전파하기 위해 몽테카를로 추정치를 활용하여 가치 과소평가를 줄인다.
  • SAC, TD3, GQE와 같은 표준 액터-크리틱 알고리즘뿐 아니라, OEFD, CQL, AWAC와 같은 이뮬레이션 학습 알고리즘에 수정된 Q-목표를 적용한다.
  • 추가 손실 항목, 하이퍼파ram터 또는 아키텍처 변경 없이도 하이퍼파rameter가 없는 방법을 유지한다.
  • 초기 학습 단계에서 고성능 트레이젝터리 주변의 낙관적 성향을 활용하여 탐색을 장려하면서도, 시간이 지남에 따라 정교화가 가능하도록 한다.

실험 결과

연구 질문

  • RQ1Q-값 목표에 대한 단순하고 하이퍼파rameter가 없는 수정이 희박한 보상 강화학습에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2SAC 및 TD3와 같은 표준 액터-크리틱 알고리즘에 MCAC를 적용했을 때, 희박한 보상 환경에서 어떻게 성능을 발휘하는가?
  • RQ3CQL, AWAC, OEFD와 같은 이뮬레이션 학습 알고리즘에 대해 MCAC는 어느 정도 성능 향상을 이끌어내는가?
  • RQ4기본 방법이 성능 붕괴를 보이는 온라인 파라미터 보정 단계에서 MCAC는 학습을 안정화시키는가?
  • RQ5희박한 보상 환경 외의 조건에서 MCAC는 실패하거나 학습을 저해하는 경우가 있는가?

주요 결과

  • MCAC는 Pointmass Navigation 및 Block Lifting 과제에서 기준 방법이 아무런 진전이 없는 상황에서도 SAC와 TD3가 과제 완수를 달성하도록 한다.
  • Sequential Pushing 및 Block Extraction 과제에서는 MCAC가 OEFD 및 AWAC의 학습 속도를 가속화하고 최종 성능을 향상시키며, 기준 버전이 실패하는 상황에서도 학습을 안정화시킨다.
  • CQL에 대해 MCAC는 Pointmass Navigation, Block Extraction, Sequential Pushing 과제에서 신뢰할 수 있는 학습을 가능하게 하여 원래 CQL 모델이 거의 진전이 없는 과제들에서 성능 향상을 이룬다.
  • MCAC는 테스트한 다섯 개의 연속 제어 도메인 전반에서 성능을 향상시키며, SAC, TD3, GQE, OEFD, CQL, AWAC 등 여러 알고리즘에 걸쳐 일관된 성과 향상을 보인다.
  • 밀도 높은 보상 환경에서는 Q-값 과대평가로 인해 학습이 저해될 수 있어, MCAC는 주로 희박한 보상 환경에서 가장 효과적임을 나타낸다.
  • 기본 알고리즘이 이미 빠르게 수렴하는 과제에서는 MCAC가 성능에 부정적 영향을 미치지 않아, 안전성과 적응 가능성 확인됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.