Skip to main content
QUICK REVIEW

[논문 리뷰] Decoupled Prioritized Resampling for Offline RL

Yue Yang, Bingyi Kang|arXiv (Cornell University)|2023. 06. 08.
Mental Health Research TopicsPsychology인용 수 3
한 줄 요약

이 논문은 행동 정책을 동작 품질 기반 우선순위 재표본화를 통해 반복적으로 개선함으로써 오프라인 강화학습을 향상시키는 플러그 앤 플레이 방법인 Offline Decoupled Prioritized Resampling (ODPR)을 제안한다. 높은 이점(advantage)을 가진 동작에 더 높은 가중치를 할당함으로써, ODPR는 제약 조건이 좋은 동작와 나쁜 동작를 동일하게 취급하는 것과는 달리, 더 우수한 행동 정책을 생성하여 제약 조건이 있는 오프라인 RL 알고리즘에서 더 뛰어난 성능을 달성한다. D4RL 벤치마크에서 궤도 정보가 없는 설정을 포함한 다섯 가지 최신 알고리즘에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

Offline reinforcement learning (RL) is challenged by the distributional shift problem. To address this problem, existing works mainly focus on designing sophisticated policy constraints between the learned policy and the behavior policy. However, these constraints are applied equally to well-performing and inferior actions through uniform sampling, which might negatively affect the learned policy. To alleviate this issue, we propose Offline Prioritized Experience Replay (OPER), featuring a class of priority functions designed to prioritize highly-rewarding transitions, making them more frequently visited during training. Through theoretical analysis, we show that this class of priority functions induce an improved behavior policy, and when constrained to this improved policy, a policy-constrained offline RL algorithm is likely to yield a better solution. We develop two practical strategies to obtain priority weights by estimating advantages based on a fitted value network (OPER-A) or utilizing trajectory returns (OPER-R) for quick computation. OPER is a plug-and-play component for offline RL algorithms. As case studies, we evaluate OPER on five different algorithms, including BC, TD3+BC, Onestep RL, CQL, and IQL. Extensive experiments demonstrate that both OPER-A and OPER-R significantly improve the performance for all baseline methods. Codes and priority weights are availiable at https://github.com/sail-sg/OPER.

연구 동기 및 목표

  • 좋은 동작와 나쁜 동작를 동일하게 취급하는 비최적의 정책 제약 조건으로 인해 발생하는 오프라인 RL 성능 저하 문제를 해결하기 위해.
  • 균일한 제약 조건에 의존하는 대신, 데이터 재표본화를 통해 고품질 동작을 우선순위화하여 오프라인 RL에서 행동 정책을 향상시키기 위해.
  • 기존 오프라인 RL 알고리즘과 호환되며 궤도 정보가 없을 경우에도 효과적인 방법을 설계하기 위해.
  • 우선순위 재표본화가 증명 가능하게 개선된 행동 정책과 더 나은 후속 정책 학습을 이끌어내는지 이론적이고 경험적으로 검증하기 위해.
  • 성능과 계산 효율성의 균형을 고려한 두 가지 실용적 구현 — ODPR-A (이점 기반)와 ODPR-R (수익 기반) — 을 제공하기 위해.

제안 방법

  • ODPR는 정규화된 동작 이점 기반으로 전이를 재가중하는 탈중앙화된 재표본 전략을 도입하여 고품질 동작을 우선시한다.
  • 우선순위 함수는 일단 타임스텝 TD 오차(ODPR-A) 또는 궤도 수익(ODPR-R)을 사용하여 정의되며, 이는 민첩하고 효율적인 구현을 가능하게 한다.
  • 우선순위 가중치를 사용하여 데이터셋을 반복적으로 재표본화함으로써 행동 정책를 반복적으로 개선하고, 훈련을 위한 향상된 데이터셋 $\mathcal{D}^K$ 를 생성한다.
  • 다듬어진 데이터셋은 BC, TD3+BC, CQL, IQL, Onestep RL과 같은 표준 정책 제약 조건이 있는 오프라인 RL 알고리즘의 입력으로 사용된다.
  • 재표본화와 재가중 모두 제공되며, 기대 손실에서 이론적으로 동치이므로 구현 선택에 대한 강건성을 확보한다.
  • ODPR-A에 대해 스케일링 하이퍼파ram터 $\sigma$ 를 도입하여 우선순위 가중치의 분산을 증가시켜 효과적인 우선순위 할당을 보장한다.
Figure 1: (a) Prioritized resampling . Given a state, possible actions are ranked by quality in x-axis. A behavior policy (in blue) usually follows a multi-modal distribution. A prioritized policy (in red) is acquired by prioritized resampling which assigns higher weights to better actions. (b) Offl
Figure 1: (a) Prioritized resampling . Given a state, possible actions are ranked by quality in x-axis. A behavior policy (in blue) usually follows a multi-modal distribution. A prioritized policy (in red) is acquired by prioritized resampling which assigns higher weights to better actions. (b) Offl

실험 결과

연구 질문

  • RQ1행동 품질 기반 우선순위 재표본화를 통해 행동 정책를 개선함으로써 오프라인 RL 성능을 향상시킬 수 있는가?
  • RQ2탈중앙화된 우선순위 재표본화는 원본 데이터셋보다 증명 가능하게 더 나은 행동 정책를 도출하는가?
  • RQ3아키텍처 변경 없이 다양한 오프라인 RL 알고리즘에서 ODPR이 성능 향상에 기여할 수 있는가?
  • RQ4궤도 정보가 없는 데이터셋에서 ODPR은 이전 궤도 기반 방법이 실패하는 상황에서도 효과적인가?
  • RQ5재표본화와 재가중 구현 방식의 선택이 ODPR의 성능에 영향을 미치는가?

주요 결과

  • ODPR-A와 ODPR-R는 D4RL 벤치마크에서 다섯 가지 오프라인 RL 알고리즘(BC, TD3+BC, Onestep RL, CQL, IQL)에서 성능을 크게 향상시켰으며, 이동 작업에서 평균 10-20%의 성능 향상을 기록했다.
  • ODPR-A는 Mujoco-v2에서 총 점수 734.1 ± 10.4를 기록하여 베이직한 TD3+BC(689.5 ± 11.2)를 초월했으며, 궤도 데이터가 없는 환경에서도 성능 향상을 보였다.
  • 저행동 다양성의 랜덤 데이터셋에서는 ODPR의 성능 향상이 미미하여, 그 성과가 기존 행동 분산을 활용하는 데 기인함을 확인했다.
  • ODPR-A의 하이퍼파라미터 $\sigma$ 는 매우 중요하다: $\sigma = 2.0$ 일 때 총 점수는 229.5에서 284.2로 향상되었고, 스케일링 없이 사용할 경우 최적의 성능을 내지 못했다.
  • 대부분의 작업에서 재표본화와 재가중 모두 유사한 성능을 보였지만, 펜 작업에서는 극단적인 우선순위 가중치로 인해 재가중 방식이 실패하여 고분산 수익 분포에서의 구현 민감도를 시사했다.
  • ODPR-R는 주방 작업에서 평균 10.5% 향상, 어드로이트 작업에서 평균 12.5% 향상하여 복잡하고 고차원적인 환경에서의 효과성을 입증했다.
Figure 2: A subset of tasks pertinent to real-world applications from the D4RL benchmark [ 29 ] , including Mujoco locmotion tasks with bipeds or quadrupeds, Maze navigation tasks with an 8-DoF Ant quadruped robot, Kitchen tasks with a 9-DoF Franka robot, and Adroit tasks with a 24-DoF Hand robot 2
Figure 2: A subset of tasks pertinent to real-world applications from the D4RL benchmark [ 29 ] , including Mujoco locmotion tasks with bipeds or quadrupeds, Maze navigation tasks with an 8-DoF Ant quadruped robot, Kitchen tasks with a 9-DoF Franka robot, and Adroit tasks with a 24-DoF Hand robot 2

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.