Skip to main content
QUICK REVIEW

[논문 리뷰] ARCHER: Aggressive Rewards to Counter bias in Hindsight Experience Replay

Sameera Lanka, Tianfu Wu|arXiv (Cornell University)|2018. 09. 06.
Reinforcement Learning in Robotics참고 문헌 29인용 수 21
한 줄 요약

ARCHER는 후회 심리적 편향(Hindsight Experience Replay, HER)을 보완하기 위해 뒤늦게 얻은 경험에 대해 더 공격적인(수치적으로 높은) 보상을 부여함으로써 강화학습에서 샘플 효율성을 크게 향상시킨다. 희박하거나 이진 보상이 주어지는 딥 강화학습 환경에서 효과를 발휘한다. 딥마인드 컨트롤 스위트의 Reacher 및 Finger 환경에서의 실험 결과, 다양한 보상 함수와 작업 복잡도에서 ARCHER는 일반 HER보다 일관되게 뛰어난 성능을 보였다.

ABSTRACT

Experience replay is an important technique for addressing sample-inefficiency in deep reinforcement learning (RL), but faces difficulty in learning from binary and sparse rewards due to disproportionately few successful experiences in the replay buffer. Hindsight experience replay (HER) was recently proposed to tackle this difficulty by manipulating unsuccessful transitions, but in doing so, HER introduces a significant bias in the replay buffer experiences and therefore achieves a suboptimal improvement in sample-efficiency. In this paper, we present an analysis on the source of bias in HER, and propose a simple and effective method to counter the bias, to most effectively harness the sample-efficiency provided by HER. Our method, motivated by counter-factual reasoning and called ARCHER, extends HER with a trade-off to make rewards calculated for hindsight experiences numerically greater than real rewards. We validate our algorithm on two continuous control environments from DeepMind Control Suite - Reacher and Finger, which simulate manipulation tasks with a robotic arm - in combination with various reward functions, task complexities and goal sampling strategies. Our experiments consistently demonstrate that countering bias using more aggressive hindsight rewards increases sample efficiency, thus establishing the greater benefit of ARCHER in RL applications with limited computing budget.

연구 동기 및 목표

  • 후회 경험 재생(HER)에서 발생하는 본질적 편향을 해결하기 위해, 후회 경험을 실제 경험과 동일하게 간주하는 것에 기인한 과도한 가능성 추정 문제를 해결한다.
  • 희박하거나 이진 보상이 주어지는 고차원 연속 제어 작업에서 딥 강화학습의 샘플 효율성을 향상시키기 위해 노력한다.
  • 실제 보상보다 후회 보상의 수치적 값을 높임으로써 더 나은 학습 성능을 달성할 수 있음을 경험적으로 검증한다.
  • 기본 알고리즘 아키텍처를 수정하지 않고도 간편하고 효과적이며 강건한 HER 향상 방법을 제공한다.

제안 방법

  • ARCHER는 실제 보상(λʳ)과 후회 보상(λʰ) 간의 가중 조합을 도입하며, 이때 λʳ < λʰ를 통해 후회 보상을 수치적으로 더 크게 설정한다.
  • 역사적 편향을 보정하기 위해 가짜 조건 기반 추론을 적용하여, 성공적인 목표 재표기로 이어지는 후회 경험을 더 유용한 정보로 간주한다.
  • 재플레이 중에 조정된 보상 값을 사용하여 손실 함수를 재가중함으로써 기존의 오프-폴리시 알고리즘(DDPG 등)을 확장한다.
  • 학습 중 실제 경험과 후회 경험의 기여도를 균형 있게 조절하기 위해 선형 가중 조합 파rameterization을 사용한다.
  • 기본 강화학습 알고리즘에 종속되지 않도록 설계되어 있어, DDPG, DQN 등 다양한 오프-폴리시 방법과 쉽게 통합할 수 있다.
  • 실험에서는 에이전트의 궤적에서 미래 목표를 샘플링하여 후회 경험을 생성하고, 보상은 λʳ/λʰ 비율에 따라 스케일링한다.

실험 결과

연구 질문

  • RQ1후회 경험 재생(HER)은 재생된 후회 궤적의 가능성에 대해 과도하게 추정함으로써 체계적인 편향을 유발하는가?
  • RQ2실제 보상보다 후회 보상의 수치적 값을 높임으로써 이 편향을 줄이고 샘플 효율성을 향상시킬 수 있는가?
  • RQ3제안된 방법 ARCHER는 이진 양/음성 보상 및 형태화된 보상과 같은 다양한 보상 함수에 대해 강건한가?
  • RQ4연속 제어 환경에서 다양한 작업 복잡도와 목표 샘플링 전략에 대해 ARCHER는 여전히 뛰어난 성능을 유지하는가?
  • RQ5ARCHER의 성능 향상 효과가 시간이 지남에 따라 감소하는가? 이는 적응형 보상 스케줄링의 필요성을 시사하는가?

주요 결과

  • 딥마인드 컨트롤 스위트의 Reacher 및 Finger 환경에서 ARCHER는 샘플 효율성 측면에서 일반 HER를 일관되게 능가한다.
  • 희박한 이진 음성 보상 환경에서, λʳ < λʰ 조건을 적용한 ARCHER는 일반 HER보다 더 빠른 수렴 속도와 높은 최종 성능를 기록한다.
  • 양성 이진 보상 함수를 사용할 경우에도 ARCHER의 성능은 여전히 뛰어나며, 이는 보상의 부호에 대해 강건함을 확인한다.
  • Finger와 같은 고차원 제어 작업에서는 수천 번의 학습 스텝이 지난 후에도 ARCHER가 뚜렷한 성능 우위를 유지한다.
  • 밀도 높은 음성 보상과 더 큰 목표 영역 조건에서도 ARCHER는 일반 HER를 능가하며, 이는 복잡하고 희박한 환경에서의 효과성을 입증한다.
  • 형태화된 보상 조건에서도 ARCHER는 효과적이며, 이는 기존에 일반 HER가 성능이 열등하다고 보고된 바와는 다름을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.