[논문 리뷰] On-Policy Trust Region Policy Optimisation with Replay Buffers
이 논문은 복수의 과거 정책으로부터의 데이터 재사용을 위한 리PLAY 버퍼를 통합한 새로운 온정책 트러스트 영역 강화학습 알고리즘을 제안한다. 이는 샘플 효율성을 향상시킨다. 허수적 트러스트 영역 파라미터를 고정된 하이퍼파라미터로 대체하고, 학습 가능한 대각 행렬 공분산을 사용함으로써, MuJoCo 환경에서 최신 기술(SOTA) 온정책(PPO, TRPO, ACKTR) 및 오프정책(DDPG) 방법보다 뛰어난 성능을 달성한다.
Building upon the recent success of deep reinforcement learning methods, we investigate the possibility of on-policy reinforcement learning improvement by reusing the data from several consecutive policies. On-policy methods bring many benefits, such as ability to evaluate each resulting policy. However, they usually discard all the information about the policies which existed before. In this work, we propose adaptation of the replay buffer concept, borrowed from the off-policy learning setting, to create the method, combining advantages of on- and off-policy learning. To achieve this, the proposed algorithm generalises the $Q$-, value and advantage functions for data from multiple policies. The method uses trust region optimisation, while avoiding some of the common problems of the algorithms such as TRPO or ACKTR: it uses hyperparameters to replace the trust region selection heuristics, as well as the trainable covariance matrix instead of the fixed one. In many cases, the method not only improves the results comparing to the state-of-the-art trust region on-policy learning algorithms such as PPO, ACKTR and TRPO, but also with respect to their off-policy counterpart DDPG.
연구 동기 및 목표
- 각 업데이트 후 이전 정책 데이터를 폐기하는 온정책 방법의 한계를 해결하기 위해, 복수의 과거 정책으로부터의 데이터 재사용을 통해 온정책 강화학습의 샘플 효율성을 향상시키는 것.
- 각 업데이트 후 이전 정책 데이터를 폐기하는 온정책 방법의 한계를 해결하기 위해, 복수의 과거 정책으로부터의 데이터 재사용을 통해 온정책 강화학습의 샘플 효율성을 향상시키는 것.
- TRPO 및 ACKTR에서 사용하는 허수적 트러스트 영역 파라미터 선택 방식을 고정된 하이퍼파라미터로 대체함으로써, 허수적 트러스트 영역 파라미터 조정을 제거하는 것.
- 정책 최적화 과정에서 학습 가능한 대각 공분산 행렬을 도입함으로써 안정성과 성능을 향상시키는 것.
- 리PLAY 버퍼를 통한 오프정책 데이터 재사용의 이점을 온정책 평가와 융합하는 것.
제안 방법
- 오프정책 학습에서의 리PLAY 버퍼 개념을 온정책 설정에 적응시켜, 최근 복수의 정책으로부터의 전이 데이터를 저장한다.
- 가중치 조합을 사용하여 복수의 정책 데이터를 통합함으로써 Q-, 가치 및 이점 함수를 일반화한다.
- 고정된 트러스트 영역 반경을 사용하여 트러스트 영역 최적화를 수행함으로써, TRPO 및 ACKTR에서 사용하는 허수적 선택 방법을 대체한다.
- 고정된 공분산 대신 학습 가능한 대각 공분산 행렬을 정책 네트워크에 사용함으로써, 적응형 정책 탐색을 가능하게 한다.
- K-FAC 유사 곡률 근사법을 사용한 자연 경사 최적화를 적용하여 안정적인 정책 업데이트를 수행한다.
- 과거 정책의 유행 버퍼를 유지하며, 각 전이 데이터는 해당 정책의 가치 및 이점 추정치와 연결된다.
실험 결과
연구 질문
- RQ1오프정책 학습에서의 리PLAY 버퍼가 온정책 강화학습에 효과적으로 적응되어 샘플 효율성을 향상시킬 수 있는가?
- RQ2허수적 트러스트 영역 파라미터를 고정된 하이퍼파라미터로 대체함으로써 학습 안정성과 성능 향상이 이루어지는가?
- RQ3정책 네트워크에 학습 가능한 대각 공분산 행렬이 고정된 공분산 행렬보다 온정책 트러스트 영역 최적화에서 더 우수한 성능을 내는가?
- RQ4제안된 방법이 연속 제어 작업에서 최신 기술 온정책(PPO, TRPO, ACKTR) 및 오프정책(DDPG) 알고리즘과 비교해 어떻게 성능을 내는가?
- RQ5온정책 학습에서 데이터 재사용과 정책 일관성의 균형을 고려할 때, 최적의 리PLAY 버퍼 깊이는 얼마인가?
주요 결과
- 제안된 방법은 MuJoCo 환경 10개 중 8개에서 PPO, TRPO, ACKTR를 능가하며, HumanoidStandup 및 Striker에서 뚜렷한 성능 향상을 보였다.
- HalfCheetah를 제외한 모든 작업에서 DDPG보다 더 뛰어난 샘플 효율성을 달성했다.
- HumanoidStandup, Pusher, Striker, Thrower에서 DDPG가 실패한 작업들에서도 안정적인 학습을 달성했다.
- 학습 가능한 공분산 행렬과 함께 고정된 트러스트 영역 반경을 사용함으로써 하이퍼파라미터 민감도가 감소하고 수렴 안정성이 향상되었다.
- 대부분의 작업에서 리PLAY 버퍼 깊이 3이 최적의 성능을 보였으며, HumanoidStandup에서 뚜렷한 성능 향상이 있었다.
- 다양한 랜덤 시드에서 일관된 성능을 보이며, 학습의 강인성과 분산 감소를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.