Skip to main content
QUICK REVIEW

[논문 리뷰] Regret Minimization Experience Replay in Off-Policy Reinforcement Learning

Xuhui Liu, Zhenghai Xue|arXiv (Cornell University)|2021. 05. 15.
Reinforcement Learning in Robotics참고 문헌 22인용 수 8
한 줄 요약

이 논문은 정책 회귀를 최소화하는 데 기반한 샘플링 가중치를 최적화하는 두 가지 새로운 우선순위 경험 재생 방법인 ReMERN과 ReMERT를 제안한다. 이론적으로 정책 회귀를 최소화함으로써 유도된 최적의 우선순위 전략은 후행 TD 오차가 높고, 더 나은 온-폴리시 성격을 가지며, 더 정확한 Q-값을 갖는 경험을 우선적으로 처리한다. 이는 MuJoCo, Atari, Meta-World 벤치마크에서 기존 방법들을 능가하는 성능을 보인다.

ABSTRACT

In reinforcement learning, experience replay stores past samples for further reuse. Prioritized sampling is a promising technique to better utilize these samples. Previous criteria of prioritization include TD error, recentness and corrective feedback, which are mostly heuristically designed. In this work, we start from the regret minimization objective, and obtain an optimal prioritization strategy for Bellman update that can directly maximize the return of the policy. The theory suggests that data with higher hindsight TD error, better on-policiness and more accurate Q value should be assigned with higher weights during sampling. Thus most previous criteria only consider this strategy partially. We not only provide theoretical justifications for previous criteria, but also propose two new methods to compute the prioritization weight, namely ReMERN and ReMERT. ReMERN learns an error network, while ReMERT exploits the temporal ordering of states. Both methods outperform previous prioritized sampling algorithms in challenging RL benchmarks, including MuJoCo, Atari and Meta-World.

연구 동기 및 목표

  • 기존의 우선순위 경험 재생 방법들이 TD 오차나 최신성 등의 대체 목적함수를 최적화하는 데서 비롯하는 목표 불일치 문제를 해결하기 위해.
  • 오프-폴리시 강화학습에서 정책 회귀를 직접 최소화하는 데 기반한 이론적으로 최적의 우선순위 전략을 유도하기 위해.
  • 오차 네트워크(ReMERN)와 시간 거리(ReMERT)를 사용하여 이론적 최적 가중치에 대한 실용적이고 안정적인 근사치를 제공하기 위해.
  • 높은 확률성 또는 복잡한 동역학을 가진 어려운 환경에서 샘플 효율성과 학습 성능을 향상시키기 위해.
  • 아키텍처 변경 없이 기존 오프-폴리시 RL 알고리즘(DQN, SAC 등)에 즉시 통합 가능한 플러그인 모듈로 설계하기 위해.

제안 방법

  • 정책 회귀를 최소화하는 데 기반한 정책 회귀 최소화 프레임워크를 제안하여 우선순위 전략을 최적화 문제로 공식화한다.
  • 후행 TD 오차, 온-폴리시 성격(전이 연령에 대한 분류기로 추정), Q-값 정확도의 세 가지 요소를 기반으로 이론적 최적 우선순위 가중치를 유도한다.
  • ReMERN을 도입하여 약간의 동적 프로그래밍을 통해 Q-값의 비최적성 정도를 추정하는 학습된 오차 네트워크를 사용한다.
  • ReMERT를 도입하여 종료 상태까지의 시간 거리를 활용하여 Q-정확도를 추정하며, 종료 상태에서 백워드로 누적되는 벨먼 오차의 성격을 활용한다.
  • 훈련 안정화와 극단적인 우선순위 가중치 방지를 위해 가중치 정규화와 잘라낸 TCE(Temporal Correctness Estimation)를 적용한다.
  • 표준 오프-폴리시 RL 알고리즘과 호환되는 플러그인 모듈로 설계하여, 오직 경험 재생 버퍼 샘플링 방식의 수정만 필요로 한다.

실험 결과

연구 질문

  • RQ1정책 회귀 최소화에서 유도된 이론적 최적 우선순위 전략이 TD 오차나 최신성과 같은 히우리스틱 기준보다 우수한 성능을 내는가?
  • RQ2최적 Q-값에 접근할 수 없을 때도 온-폴리시 성격과 Q-값 정확도를 효과적으로 추정하고 우선순위에 통합할 수 있는가?
  • RQ3특히 종료 상태까지의 거리로 표현되는 궤적의 시간적 구조가 오프-폴리시 학습에서 Q-값 정확도의 신뢰할 수 있는 대체 지표가 될 수 있는가?
  • RQ4정책 회귀 최소화 기반 우선순위 전략이 다양한 RL 벤치마크에서 일관되게 샘플 효율성과 최종 성능을 향상시키는가?
  • RQ5확률적 보상이나 랜덤 타겟 위치를 가진 환경에서 ReMERN과 ReMERT는 PER 및 DisCor와 같은 기존 방법보다 우수한 성능을 보이는가?

주요 결과

  • ReMERT는 Atari 환경에서 최고 성능을 기록하며, 기준 DQN, PER 및 기타 기준보다 뛰어난 성능을 보였다. UpNDown에서 평균 점수는 145,235±94,643을 기록했고, 기준은 134,502±68,727이었다.
  • MuJoCo Ant-v2 환경에서 Q-손실과 종료 상태까지의 거리 사이에 높은 상관관계가 있는 환경에서는 ReMERT가 뛰어난 성능을 보였다. 이는 이론적 직관을 뒷받침한다.
  • ReMERN은 노이즈가 많은 보상이나 랜덤 타겟 위치를 가진 확률적 환경에서 기존 방법이 어려움을 겪는 상황에서 성능을 크게 향상시켰다.
  • Ant-v2와 Hopper-v2 환경에서 Q-값 오차와 종료 상태까지의 거리 사이에 음의 상관관계가 실험적으로 검증되었으며, Ant-v2에서 상관관계가 더 강했다.
  • Q-손실이 균일하게 낮은 환경인 Hopper-v2와 달리, 강한 시간적 오차 누적 현상이 있는 환경에서는 ReMERT가 다른 알고리즘보다 뛰어난 성능을 보였다.
  • 제거 실험을 통해 후행 TD 오차, 온-폴리시 성격, Q-정확도의 세 가지 요소 모두 성능 향상에 기여했으며, 특히 ReMERT의 TCE 기반 추정 방식이 복잡한 제어 과제에서 뛰어난 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.